Podcast Interview · Global LLM Quarterly · Productization

广密大模型季报 #112 深读:模型差距收敛之后,竞争进入 L4 体验

#112 是一场 1 小时 09 分钟的大模型产品化季报。广密从模型公司的能力差异、Anthropic 的 Coding 聚焦、Google 的垂直整合,讲到“全家桶”对单点应用的挤压,再把 L4 体验定义成端到端的惊喜、完成和可验证。它解释了为什么应用窗口越来越短:模型厂商不只提供 API,也开始拥有分发、算力、产品和 Agent。

完整覆盖 1:09:12 · 8 个阅读章节 · 广密/张小珺逐句映射 · 嘉宾估算、事实与本文推断分层

核心判断:当模型差距收敛,真正的竞争是“谁先把能力变成不用返工的结果”

大模型的领先会轮换,产品的窗口却在缩短。单点应用一旦找到一个模型能力的空档,模型厂商可能在几个月内用更强的模型、原生工具和分发入口把它吸收。于是,产品的护城河不再是“我能调用哪个模型”,而是能否拥有私有上下文、深工作流、独特分发、结果评价和不被单一模型绑死的系统能力。

L4 体验 ≈ 惊喜 × 任务完成 × 可验证 × 可接受成本 × 长期留存

模型差异

Coding、通用推理、多模态和长上下文仍有侧重,但前三名的差距可能很快被追平。

产品差异

品牌、入口、上下文、工作流和结果验收决定用户是否愿意把任务交出去。

时间差异

从 Perplexity 到 Cursor/Claude Code、Manus 的窗口越来越短,试错成本必须同步下降。

本文的中心推论“L4”不应理解为模型等级,也不等于无人值守。它是一次端到端结果跨过用户阈值:用户能看到价值、拿到成品、知道如何核验,并愿意在成本与风险可接受时再次使用。

1:09:12 内容地图:从模型分化到全家桶战争

时间章节关键问题
00:00–03:54季报开场为什么模型发布速度已经改变产品规划周期?
03:54–21:37模型分化与收敛Anthropic、Thinking Machines、Google、OpenAI 的重点差异是什么?
21:37–33:35全家桶与垂直整合ChatGPT 与 Google 如何把聊天、搜索、代码、办公和设备串起来?
33:35–38:52模型 + 产品为什么模型分数不能直接变成品牌、留存和收入?
38:52–44:21AI 是挖矿窗口产品窗口为何从两年压缩到几个月,API 成本又怎样反噬应用?
44:21–52:43L4 体验Coding、Deep Research、Office 为什么更容易先形成可验证闭环?
52:43–55:53Google 回归规模、广告和垂直整合能否把模型优势转成产品优势?
55:53–1:09:12泡沫、资本与中国团队如何区分真正的前端价值与只增加的资本开支?

一、模型在分化,模型公司却在收敛

广密给不同公司的定位是观察窗口,不是严格分类:Anthropic 更聚焦 Coding 与 Agentic,Google 把通用模型放进搜索、办公、浏览器和 Android,OpenAI 借助 ChatGPT 品牌把聊天、搜索、代码和工作空间连成统一入口,Thinking Machines 押注多模态交互。分化发生在数据、团队和产品焦点,收敛发生在最终都要提供通用能力、工具调用和持续使用。

这解释了一个看似矛盾的现象:模型排行榜的差距变小,公司的战略差距却变大。因为决定商业价值的不是一次回答,而是模型能否被用户记住、被工作流调用、被组织购买,并在失败时给出可追责的解释。

模型层护城河

训练数据、算力、研究人才、推理效率与安全工程形成动态优势,但很难静态锁定。

产品层护城河

品牌、入口、用户历史、私有 context、工作流与结果评价形成迁移成本。

二、“全家桶”挤压单点应用:垂直产品必须拥有模型之外的资产

ChatGPT 的聊天、搜索、代码、Agent 和工作空间,Google 的 TPU—模型—Agent—Docs—Chrome—Android—YouTube,代表两种全家桶路径:一个从产品入口向上扩张,一个从基础设施向下贯通。单点产品如果只提供一个 UI 和一层 API,很容易被平台用更低成本复制。

应用资产为什么能抵御平台吸收应当怎样验收
私有上下文模型厂商无法直接拥有客户的历史、权限和隐性规则。换模型后任务完成率是否保持,数据边界是否清晰。
深工作流复杂审批、多人协作、异常处理和领域工具不是一条 prompt。端到端成功率、人工接管率和返工时长。
独特分发特定行业、社区或设备入口带来模型外的触达。获客成本、留存与真实付费,而非注册量。
模型无关评价用自己的 verifier 判断结果,而不是追随单一榜单。跨模型、跨版本、跨环境的稳定性。

三、窗口越来越短:应用公司的第一项能力是预测模型的下一步

节目把 Perplexity、Cursor 到 Claude Code、Manus 的产品窗口压缩为数年、数月乃至更短的例子。具体时间线和估算属于嘉宾口径,但趋势值得重视:模型厂商正在亲自进入最有价值的应用层,API 价格下降会同时扩大市场和压缩中间层毛利。

因此产品经理不能只问“现在的模型能做什么”,还要问“模型厂商下一次会把什么功能原生化”。值得做的方向通常满足至少一项:拥有独特数据,深入一个有复杂状态的工作流,有用户信任/分发优势,或者能够把模型变化吸收进自己的评价和环境。

成本边界“API 便宜”并不等于“任务便宜”。长上下文、重复规划、浏览器操作、人工审核和失败重试都可能把 token 价格之外的成本放大。

四、L4 体验:惊喜只是入口,完成与验证才是产品

广密把 Deep Research 与 Claude Code 视为较早的 L4 样本,因为它们同时拥有文本/代码数据、较短的反馈路径和相对明确的评价方式。Coding 的优势不是“模型天然更聪明”,而是代码可以执行、测试、回归,错误可以被快速标记。Office、PPT、Excel 的下一步价值更大,但奖励更难定义:好看、正确、符合业务语境和无需返工是不同指标。

用户目标
上下文收集
规划与行动
结果生成
自动/人工验证
可交付成品

可把 L4 验收写成一个最小实验:同一任务、相同输入材料和预算,比较人工基线、普通 AI 功能与 Agent 的完成率、返工分钟数、引用/测试通过率、错误严重度、接管次数和单位成本。没有这张账,任何“体验很惊艳”都只是一次 demo。

五、Google 与中国团队:规模优势必须经过产品接口

Google 的潜在回归不只是模型变强,而是它拥有广告、搜索、办公、浏览器、移动系统和芯片的组合。模型能力如果能在这些入口中降低用户的切换成本,就会形成比单一 API 更稳的优势。反过来,规模也会制造组织惯性,真正的考验仍是能否把研究突破快速变成可用体验。

节目对中国团队的建议偏向全球化:国内供应链、工程和场景是优势,全球市场、人才与资本是更大的反馈面。这个判断是战略观点,不是普遍适用的投资建议;需要用海外用户留存、跨地区合规、算力获取与收入结构来验收。

规模

算力与分发提供低边际成本,但不能替代产品聚焦。

聚焦

在窗口期选择一项结果,避免同时追逐所有模型能力。

全球

跨市场反馈能检验产品是本地技巧还是可迁移系统。

进一步推演:这期访谈留下的八条 Insight

  1. 模型差距收敛会提高产品差异的价值。 当权重轮换领先,品牌、上下文、工作流和评价器成为更长期的资产。
  2. 全家桶不是功能列表,而是状态连续性。 搜索、代码、办公和聊天共享身份、历史与权限,平台因此能减少切换损耗。
  3. 应用的护城河应写成四个可审计资产。 私有 context、深工作流、独特分发、模型无关评价,缺一项都可能被吸收。
  4. 窗口缩短会奖励“可逆产品”。 模型换代时能快速替换组件、保留数据与评价,才有时间跟上基础设施。
  5. L4 的核心是反返工。 生成速度是前端指标,后编辑率、接管率和结果错误才是生产力指标。
  6. Coding 的先发不等于所有知识工作的先发。 代码拥有执行器和测试器,法律、财务、管理等任务要先建立自己的 verifier。
  7. 泡沫风险在前端价值缺席时出现。 资本开支只有在真实任务、现金流和单位成本上留下痕迹,才不是内部循环。
  8. 预测产品窗口必须同时预测模型原生化。 创业机会不是静态空白,而是与平台路线的动态博弈。

“窗口短”并不意味着所有应用都要追逐下一个模型发布。更稳妥的做法是把产品拆成稳定层与可替换层:稳定层保存用户授权的 context、工作流状态、评价器和结果历史;可替换层承接不同模型、工具和推理预算。这样,模型进步会降低成本、扩大边界,而不是让产品每次重写。对用户而言,真正的 L4 也不是系统偶尔完成一次复杂任务,而是它能在相同约束下重复交付,并能把失败解释成下一次更好的输入。这个区分也能避免把“模型厂商推出相似功能”误判成应用已经失去价值:关键要看谁掌握长期状态、谁能证明结果、谁愿意承担错误。最终应以真实任务的交付账本,而不是发布会上的功能清单,决定产品是否跨过了体验阈值。

怎样证伪或修正这套判断

证据边界与资料索引

正文以 #112 的完整逐句材料为主,保留广密与张小珺说话人映射。模型排名、ARR、产品窗口、泡沫规模和中美资本结构均属于嘉宾观察、估算或推演;本文用官方资料核对技术/产品公开边界,不把节目数字写成审计事实。

证据顺序:节目原始材料 → 官方产品/研究资料 → 本文分析。完整精确文字、章节阅读版、SRT 与审计结果保存在私有材料区;公开页提供结构化深读,不复刻整期逐字稿。

返回顶部 ↑