模型差异
Coding、通用推理、多模态和长上下文仍有侧重,但前三名的差距可能很快被追平。
#112 是一场 1 小时 09 分钟的大模型产品化季报。广密从模型公司的能力差异、Anthropic 的 Coding 聚焦、Google 的垂直整合,讲到“全家桶”对单点应用的挤压,再把 L4 体验定义成端到端的惊喜、完成和可验证。它解释了为什么应用窗口越来越短:模型厂商不只提供 API,也开始拥有分发、算力、产品和 Agent。
大模型的领先会轮换,产品的窗口却在缩短。单点应用一旦找到一个模型能力的空档,模型厂商可能在几个月内用更强的模型、原生工具和分发入口把它吸收。于是,产品的护城河不再是“我能调用哪个模型”,而是能否拥有私有上下文、深工作流、独特分发、结果评价和不被单一模型绑死的系统能力。
Coding、通用推理、多模态和长上下文仍有侧重,但前三名的差距可能很快被追平。
品牌、入口、上下文、工作流和结果验收决定用户是否愿意把任务交出去。
从 Perplexity 到 Cursor/Claude Code、Manus 的窗口越来越短,试错成本必须同步下降。
| 时间 | 章节 | 关键问题 |
|---|---|---|
| 00:00–03:54 | 季报开场 | 为什么模型发布速度已经改变产品规划周期? |
| 03:54–21:37 | 模型分化与收敛 | Anthropic、Thinking Machines、Google、OpenAI 的重点差异是什么? |
| 21:37–33:35 | 全家桶与垂直整合 | ChatGPT 与 Google 如何把聊天、搜索、代码、办公和设备串起来? |
| 33:35–38:52 | 模型 + 产品 | 为什么模型分数不能直接变成品牌、留存和收入? |
| 38:52–44:21 | AI 是挖矿窗口 | 产品窗口为何从两年压缩到几个月,API 成本又怎样反噬应用? |
| 44:21–52:43 | L4 体验 | Coding、Deep Research、Office 为什么更容易先形成可验证闭环? |
| 52:43–55:53 | Google 回归 | 规模、广告和垂直整合能否把模型优势转成产品优势? |
| 55:53–1:09:12 | 泡沫、资本与中国团队 | 如何区分真正的前端价值与只增加的资本开支? |
广密给不同公司的定位是观察窗口,不是严格分类:Anthropic 更聚焦 Coding 与 Agentic,Google 把通用模型放进搜索、办公、浏览器和 Android,OpenAI 借助 ChatGPT 品牌把聊天、搜索、代码和工作空间连成统一入口,Thinking Machines 押注多模态交互。分化发生在数据、团队和产品焦点,收敛发生在最终都要提供通用能力、工具调用和持续使用。
这解释了一个看似矛盾的现象:模型排行榜的差距变小,公司的战略差距却变大。因为决定商业价值的不是一次回答,而是模型能否被用户记住、被工作流调用、被组织购买,并在失败时给出可追责的解释。
训练数据、算力、研究人才、推理效率与安全工程形成动态优势,但很难静态锁定。
品牌、入口、用户历史、私有 context、工作流与结果评价形成迁移成本。
ChatGPT 的聊天、搜索、代码、Agent 和工作空间,Google 的 TPU—模型—Agent—Docs—Chrome—Android—YouTube,代表两种全家桶路径:一个从产品入口向上扩张,一个从基础设施向下贯通。单点产品如果只提供一个 UI 和一层 API,很容易被平台用更低成本复制。
| 应用资产 | 为什么能抵御平台吸收 | 应当怎样验收 |
|---|---|---|
| 私有上下文 | 模型厂商无法直接拥有客户的历史、权限和隐性规则。 | 换模型后任务完成率是否保持,数据边界是否清晰。 |
| 深工作流 | 复杂审批、多人协作、异常处理和领域工具不是一条 prompt。 | 端到端成功率、人工接管率和返工时长。 |
| 独特分发 | 特定行业、社区或设备入口带来模型外的触达。 | 获客成本、留存与真实付费,而非注册量。 |
| 模型无关评价 | 用自己的 verifier 判断结果,而不是追随单一榜单。 | 跨模型、跨版本、跨环境的稳定性。 |
节目把 Perplexity、Cursor 到 Claude Code、Manus 的产品窗口压缩为数年、数月乃至更短的例子。具体时间线和估算属于嘉宾口径,但趋势值得重视:模型厂商正在亲自进入最有价值的应用层,API 价格下降会同时扩大市场和压缩中间层毛利。
因此产品经理不能只问“现在的模型能做什么”,还要问“模型厂商下一次会把什么功能原生化”。值得做的方向通常满足至少一项:拥有独特数据,深入一个有复杂状态的工作流,有用户信任/分发优势,或者能够把模型变化吸收进自己的评价和环境。
广密把 Deep Research 与 Claude Code 视为较早的 L4 样本,因为它们同时拥有文本/代码数据、较短的反馈路径和相对明确的评价方式。Coding 的优势不是“模型天然更聪明”,而是代码可以执行、测试、回归,错误可以被快速标记。Office、PPT、Excel 的下一步价值更大,但奖励更难定义:好看、正确、符合业务语境和无需返工是不同指标。
可把 L4 验收写成一个最小实验:同一任务、相同输入材料和预算,比较人工基线、普通 AI 功能与 Agent 的完成率、返工分钟数、引用/测试通过率、错误严重度、接管次数和单位成本。没有这张账,任何“体验很惊艳”都只是一次 demo。
Google 的潜在回归不只是模型变强,而是它拥有广告、搜索、办公、浏览器、移动系统和芯片的组合。模型能力如果能在这些入口中降低用户的切换成本,就会形成比单一 API 更稳的优势。反过来,规模也会制造组织惯性,真正的考验仍是能否把研究突破快速变成可用体验。
节目对中国团队的建议偏向全球化:国内供应链、工程和场景是优势,全球市场、人才与资本是更大的反馈面。这个判断是战略观点,不是普遍适用的投资建议;需要用海外用户留存、跨地区合规、算力获取与收入结构来验收。
算力与分发提供低边际成本,但不能替代产品聚焦。
在窗口期选择一项结果,避免同时追逐所有模型能力。
跨市场反馈能检验产品是本地技巧还是可迁移系统。
“窗口短”并不意味着所有应用都要追逐下一个模型发布。更稳妥的做法是把产品拆成稳定层与可替换层:稳定层保存用户授权的 context、工作流状态、评价器和结果历史;可替换层承接不同模型、工具和推理预算。这样,模型进步会降低成本、扩大边界,而不是让产品每次重写。对用户而言,真正的 L4 也不是系统偶尔完成一次复杂任务,而是它能在相同约束下重复交付,并能把失败解释成下一次更好的输入。这个区分也能避免把“模型厂商推出相似功能”误判成应用已经失去价值:关键要看谁掌握长期状态、谁能证明结果、谁愿意承担错误。最终应以真实任务的交付账本,而不是发布会上的功能清单,决定产品是否跨过了体验阈值。
正文以 #112 的完整逐句材料为主,保留广密与张小珺说话人映射。模型排名、ARR、产品窗口、泡沫规模和中美资本结构均属于嘉宾观察、估算或推演;本文用官方资料核对技术/产品公开边界,不把节目数字写成审计事实。
证据顺序:节目原始材料 → 官方产品/研究资料 → 本文分析。完整精确文字、章节阅读版、SRT 与审计结果保存在私有材料区;公开页提供结构化深读,不复刻整期逐字稿。