Podcast Interview · Global LLM Quarterly · Productization

广密大模型季报 #112 深读:模型差距收敛之后,竞争进入 L4 体验

#112 是一场 1 小时 09 分钟的大模型产品化季报。广密从模型公司的能力差异、Anthropic 的 Coding 聚焦、Google 的垂直整合,讲到“全家桶”对单点应用的挤压,再把 L4 体验定义成端到端的惊喜、完成和可验证。它解释了为什么应用窗口越来越短:模型厂商不只提供 API,也开始拥有分发、算力、产品和 Agent。

完整覆盖 1:09:12 · 8 个阅读章节 · 广密/张小珺逐句映射 · 嘉宾估算、事实与本文推断分层

原文讲解:1:09:12 内容地图:从模型分化到全家桶战争

以下先按节目自身的推进讲清楚原文:主持人问了什么,嘉宾怎样回答,哪些经历、案例和转折把后面的结论串起来。这里先不替嘉宾下判断。

时间章节关键问题
00:00–03:54季报开场为什么模型发布速度已经改变产品规划周期?
03:54–21:37模型分化与收敛Anthropic、Thinking Machines、Google、OpenAI 的重点差异是什么?
21:37–33:35全家桶与垂直整合ChatGPT 与 Google 如何把聊天、搜索、代码、办公和设备串起来?
33:35–38:52模型 + 产品为什么模型分数不能直接变成品牌、留存和收入?
38:52–44:21AI 是挖矿窗口产品窗口为何从两年压缩到几个月,API 成本又怎样反噬应用?
44:21–52:43L4 体验Coding、Deep Research、Office 为什么更容易先形成可验证闭环?
52:43–55:53Google 回归规模、广告和垂直整合能否把模型优势转成产品优势?
55:53–1:09:12泡沫、资本与中国团队如何区分真正的前端价值与只增加的资本开支?

下面按节目自己的推进,把上表中的主题展开成连续讲解;其中的判断、数字和经历先按嘉宾/作者在节目中的说法呈现,尚未进入本文的独立审计。

一、模型在分化,模型公司却在收敛

广密给不同公司的定位是观察窗口,不是严格分类:Anthropic 更聚焦 Coding 与 Agentic,Google 把通用模型放进搜索、办公、浏览器和 Android,OpenAI 借助 ChatGPT 品牌把聊天、搜索、代码和工作空间连成统一入口,Thinking Machines 押注多模态交互。分化发生在数据、团队和产品焦点,收敛发生在最终都要提供通用能力、工具调用和持续使用。

这解释了一个看似矛盾的现象:模型排行榜的差距变小,公司的战略差距却变大。因为决定商业价值的不是一次回答,而是模型能否被用户记住、被工作流调用、被组织购买,并在失败时给出可追责的解释。

模型层护城河

训练数据、算力、研究人才、推理效率与安全工程形成动态优势,但很难静态锁定。

产品层护城河

品牌、入口、用户历史、私有 context、工作流与结果评价形成迁移成本。

二、“全家桶”挤压单点应用:垂直产品必须拥有模型之外的资产

ChatGPT 的聊天、搜索、代码、Agent 和工作空间,Google 的 TPU—模型—Agent—Docs—Chrome—Android—YouTube,代表两种全家桶路径:一个从产品入口向上扩张,一个从基础设施向下贯通。单点产品如果只提供一个 UI 和一层 API,很容易被平台用更低成本复制。

应用资产为什么能抵御平台吸收应当怎样验收
私有上下文模型厂商无法直接拥有客户的历史、权限和隐性规则。换模型后任务完成率是否保持,数据边界是否清晰。
深工作流复杂审批、多人协作、异常处理和领域工具不是一条 prompt。端到端成功率、人工接管率和返工时长。
独特分发特定行业、社区或设备入口带来模型外的触达。获客成本、留存与真实付费,而非注册量。
模型无关评价用自己的 verifier 判断结果,而不是追随单一榜单。跨模型、跨版本、跨环境的稳定性。

三、窗口越来越短:应用公司的第一项能力是预测模型的下一步

节目把 Perplexity、Cursor 到 Claude Code、Manus 的产品窗口压缩为数年、数月乃至更短的例子。具体时间线和估算属于嘉宾口径,但趋势值得重视:模型厂商正在亲自进入最有价值的应用层,API 价格下降会同时扩大市场和压缩中间层毛利。

因此产品经理不能只问“现在的模型能做什么”,还要问“模型厂商下一次会把什么功能原生化”。值得做的方向通常满足至少一项:拥有独特数据,深入一个有复杂状态的工作流,有用户信任/分发优势,或者能够把模型变化吸收进自己的评价和环境。

成本边界“API 便宜”并不等于“任务便宜”。长上下文、重复规划、浏览器操作、人工审核和失败重试都可能把 token 价格之外的成本放大。

四、L4 体验:惊喜只是入口,完成与验证才是产品

广密把 Deep Research 与 Claude Code 视为较早的 L4 样本,因为它们同时拥有文本/代码数据、较短的反馈路径和相对明确的评价方式。Coding 的优势不是“模型天然更聪明”,而是代码可以执行、测试、回归,错误可以被快速标记。Office、PPT、Excel 的下一步价值更大,但奖励更难定义:好看、正确、符合业务语境和无需返工是不同指标。

用户目标
上下文收集
规划与行动
结果生成
自动/人工验证
可交付成品

可把 L4 验收写成一个最小实验:同一任务、相同输入材料和预算,比较人工基线、普通 AI 功能与 Agent 的完成率、返工分钟数、引用/测试通过率、错误严重度、接管次数和单位成本。没有这张账,任何“体验很惊艳”都只是一次 demo。

五、Google 与中国团队:规模优势必须经过产品接口

Google 的潜在回归不只是模型变强,而是它拥有广告、搜索、办公、浏览器、移动系统和芯片的组合。模型能力如果能在这些入口中降低用户的切换成本,就会形成比单一 API 更稳的优势。反过来,规模也会制造组织惯性,真正的考验仍是能否把研究突破快速变成可用体验。

节目对中国团队的建议偏向全球化:国内供应链、工程和场景是优势,全球市场、人才与资本是更大的反馈面。这个判断是战略观点,不是普遍适用的投资建议;需要用海外用户留存、跨地区合规、算力获取与收入结构来验收。

规模

算力与分发提供低边际成本,但不能替代产品聚焦。

聚焦

在窗口期选择一项结果,避免同时追逐所有模型能力。

全球

跨市场反馈能检验产品是本地技巧还是可迁移系统。

原文讲解到这里。接下来才进入本文的结构化抽象、证据分层和独立判断。

核心判断:当模型差距收敛,真正的竞争是“谁先把能力变成不用返工的结果”

大模型的领先会轮换,产品的窗口却在缩短。单点应用一旦找到一个模型能力的空档,模型厂商可能在几个月内用更强的模型、原生工具和分发入口把它吸收。于是,产品的护城河不再是“我能调用哪个模型”,而是能否拥有私有上下文、深工作流、独特分发、结果评价和不被单一模型绑死的系统能力。

L4 体验 ≈ 惊喜 × 任务完成 × 可验证 × 可接受成本 × 长期留存

模型差异

Coding、通用推理、多模态和长上下文仍有侧重,但前三名的差距可能很快被追平。

产品差异

品牌、入口、上下文、工作流和结果验收决定用户是否愿意把任务交出去。

时间差异

从 Perplexity 到 Cursor/Claude Code、Manus 的窗口越来越短,试错成本必须同步下降。

本文的中心推论“L4”不应理解为模型等级,也不等于无人值守。它是一次端到端结果跨过用户阈值:用户能看到价值、拿到成品、知道如何核验,并愿意在成本与风险可接受时再次使用。

二次拆解:窗口不是倒计时,而是平台博弈的四种状态

“窗口还有多久”容易变成创业者的焦虑计时器,但原文实际给出的是动态博弈:模型厂商可能暂时没做、做得不够好、做了但不愿承担脏活累活,也可能因为第三方已经做得足够好而选择留在平台层。应用的策略不是猜一个日期,而是让每一种状态都能产生资产。

平台状态应用的合理动作需要积累的资产退出/转向信号
原生能力缺位快速验证需求,先抓住用户任务起点。真实任务、分发渠道、失败样本。用户只因新鲜感来,复用率不升。
原生能力出现但不稳定用上下文、工作流和评价器补齐结果。私有数据、领域 verifier、异常处理。平台功能已覆盖核心路径且成本更低。
平台能力追平把产品从功能转成环境或服务,或主动成为生态插件。身份、权限、历史状态、行业分发。迁移后留存、毛利与任务质量同时下降。
平台能力明显领先保留可迁移数据与评价,选择合作、并购或转向未覆盖任务。模型无关接口、客户关系、可审计结果。继续补功能的边际收益低于转向成本。

这套四状态模型也解释了为什么“模型公司会做这个功能”既不是放弃理由,也不是安全承诺。真正应该测的是从模型切换到原生功能时,产品是否保留了任务历史、评价标准与责任边界;若这些资产全部归平台,应用只是暂时的 UI;若它们能迁移,窗口结束反而可能变成合作或升级的起点。

二次拆解:把 L4 从形容词改成可重复的验收等级

节目使用 L4 是为了描述“端到端、惊喜、像实习生一样交付”的体验,但它不是行业统一标准。为了避免把不同公司口中的 L4 混在一起,本文给出一个只用于分析的操作化分层:它按人类接管的位置和结果责任分级,而不是按模型参数或产品名分级。

等级系统行为人类仍承担什么最低证据
L0 建议给出答案、草稿或下一步提示。规划、执行、核验全部由人完成。单次质量与事实准确率。
L1 协作完成一段可逆操作,等待人确认。选择方案、处理异常和最终交付。节省时间、编辑率、接管原因。
L2 工作流能串联多个工具,遇到边界主动停下。定义目标、授权、处理高风险分支。端到端成功率、重试、权限审计。
L3 有界闭环在固定环境中独立完成一项可验收任务。设定约束、抽查和承担后果。跨版本稳定性、回滚、单位成本。
L4 可复用交付在不同但相似的任务上重复交付,并把失败转成下一轮改进。目标、审美、例外与最终责任。留存、返工率、迁移能力、严重错误率。

这个定义带来一个重要修正:嘉宾所说“90% 靠模型、10% 靠产品”只适用于能力刚刚跨过阈值的 demo;一旦进入 L3/L4,产品侧对上下文压缩、任务切分、评价器、权限和恢复的贡献会快速上升。模型决定能不能做,系统决定能不能稳定交付。

二次拆解:Google 与 ChatGPT 争的是“生活时段里的任务起点”

节目用关键词搜索与长段落对话的差异,解释为什么 ChatGPT 更像生活助手、Gemini 更像工作日生产力工具。这里的重点不是某个 DAU/MAU 比值,而是用户提交给系统的上下文密度和使用时段:从两三个关键词变成几十个词,意味着模型获得了更完整的任务规格,也更容易形成个性化反馈。

维度传统搜索习惯对话/Agent 习惯真正的产品问题
输入短关键词,用户自己补齐意图。长描述、文件、语音和连续追问。谁拥有这些上下文,能否让用户删除或迁移。
时间需要时打开,完成一次检索。生活/工作持续使用,任务可异步执行。频率提升是否带来可靠结果,而不是更多闲聊。
商业化广告围绕查询与点击归因。订阅、工具调用、交易与结果收费。结果推荐是否可解释,利益冲突如何披露。

所以“Google 会不会被颠覆”不是二元判断:若 Google 能把规模资产转成更低切换成本、更高质量的上下文与可归因结果,它仍可能赢;若用户习惯已迁移而平台只复制聊天外壳,规模就会变成历史优势。验证这点应看同一任务的首选入口、重复使用、结果采纳和广告/交易的真实归因,节目中的比例仅作嘉宾估算。

进一步推演:这期访谈留下的八条 Insight

  1. 模型差距收敛会提高产品差异的价值。 当权重轮换领先,品牌、上下文、工作流和评价器成为更长期的资产。
  2. 全家桶不是功能列表,而是状态连续性。 搜索、代码、办公和聊天共享身份、历史与权限,平台因此能减少切换损耗。
  3. 应用的护城河应写成四个可审计资产。 私有 context、深工作流、独特分发、模型无关评价,缺一项都可能被吸收。
  4. 窗口缩短会奖励“可逆产品”。 模型换代时能快速替换组件、保留数据与评价,才有时间跟上基础设施。
  5. L4 的核心是反返工。 生成速度是前端指标,后编辑率、接管率和结果错误才是生产力指标。
  6. Coding 的先发不等于所有知识工作的先发。 代码拥有执行器和测试器,法律、财务、管理等任务要先建立自己的 verifier。
  7. 泡沫风险在前端价值缺席时出现。 资本开支只有在真实任务、现金流和单位成本上留下痕迹,才不是内部循环。
  8. 预测产品窗口必须同时预测模型原生化。 创业机会不是静态空白,而是与平台路线的动态博弈。

二次阅读新增的四条 Insight

  1. L4 的门槛会随任务后果移动。 低风险写作可以容忍较高编辑率;财务、医疗和生产发布则要求更低的严重错误率与更强的审计,不能用同一“惊喜”标准。
  2. 模型窗口越短,稳定层越值钱。 能保存授权上下文、任务历史和评价器的产品,换模型时会变成用户的迁移层;只保存 prompt 的产品,换代时几乎没有议价权。
  3. 全家桶的核心不是功能数量,而是状态连续性。 搜索、聊天、办公与设备共享身份、历史和权限,才能把“规模”变成低切换成本;否则只是功能堆叠。
  4. 把模型能力放入容器,本质是在设计反馈。 Coding 的测试、Research 的引用、PPT 的审美和企业审批,决定模型错误能否快速显形;没有 verifier,产品增长只会扩大不可见返工。

“窗口短”并不意味着所有应用都要追逐下一个模型发布。更稳妥的做法是把产品拆成稳定层与可替换层:稳定层保存用户授权的 context、工作流状态、评价器和结果历史;可替换层承接不同模型、工具和推理预算。这样,模型进步会降低成本、扩大边界,而不是让产品每次重写。对用户而言,真正的 L4 也不是系统偶尔完成一次复杂任务,而是它能在相同约束下重复交付,并能把失败解释成下一次更好的输入。这个区分也能避免把“模型厂商推出相似功能”误判成应用已经失去价值:关键要看谁掌握长期状态、谁能证明结果、谁愿意承担错误。最终应以真实任务的交付账本,而不是发布会上的功能清单,决定产品是否跨过了体验阈值。

二次证据账本:对节目数字与判断的分层

主张证据状态核验指标本文边界
模型差距收敛、Anthropic 聚焦 Coding/Agentic节目战略观察;部分产品方向可由官方页面核对。跨版本任务完成、API/产品收入、客户留存、单位成本。不把嘉宾 ARR 与模型排名当成审计事实。
L4 最早在 Coding 与 Deep Research 出现机制上较可信,因存在执行器/引用等 verifier;仍需跨用户复现。后编辑率、事实/测试通过率、接管率、严重错误、墙钟时间。不把一次魔法时刻等同于可规模化生产力。
全家桶会压缩单点应用窗口结构性风险;原生化速度和应用护城河因场景而异。平台跟进时间、功能重叠率、迁移后留存与毛利。不假设平台一定会做,也不假设平台永远不做。
Google 规模可反超 ChatGPT嘉宾推演;生态资产真实,但用户习惯迁移尚未闭合。生活/工作时段使用、首选入口、跨产品状态、结果采纳与归因。不将 DAU/MAU 比例当作用户价值的充分统计量。

怎样证伪或修正这套判断

证据边界与资料索引

正文以 #112 的完整逐句材料为主,保留广密与张小珺说话人映射。模型排名、ARR、产品窗口、泡沫规模和中美资本结构均属于嘉宾观察、估算或推演;本文用官方资料核对技术/产品公开边界,不把节目数字写成审计事实。

证据顺序:节目原始材料 → 官方产品/研究资料 → 本文分析。完整精确文字、章节阅读版、SRT 与审计结果保存在私有材料区;公开页提供结构化深读,不复刻整期逐字稿。

返回顶部 ↑