能力侧
预训练与后训练仍决定先验和推理上限,但前三家在当前范式内会轮换领先。
#127 是一场 1 小时 18 分钟的跨年对谈。广密把模型竞争放进更大的坐标系:OpenAI、Anthropic、Google 的轮换领先,Nvidia 与 TPU 的联盟,ChatGPT 对搜索和广告的潜在重排,以及预训练之后“在线学习”这座尚未开挖的矿。这里最值得保留的不是“战争”修辞,而是对资本、算力、流量和反馈闭环如何互相放大的观察。
访谈开头把大模型竞争称为 AI War,容易被读成军事预言;放回全文,它更像一种产业协调论:谁能持续买到算力、训练出足够强的模型、把模型接到高频入口,再把真实使用反馈回写,谁就能在下一轮竞争中获得更多现金流与数据。战争隐喻放大了紧迫感,却不能替代对任务、收入和风险的逐项验证。
预训练与后训练仍决定先验和推理上限,但前三家在当前范式内会轮换领先。
聊天、搜索、办公、代码和设备入口决定模型能否转成持续的使用频率。
真实工作环境产生的纠错、偏好和结果数据,才可能支持下一种在线学习。
| 时间 | 章节 | 本章要回答的问题 |
|---|---|---|
| 00:00–07:38 | AI War 与 OpenAI 账本 | 为什么模型竞争会同时改变流量分配与收入结构? |
| 07:38–15:04 | 收入与未知上行 | 订阅、广告、API、劳动力替代和科学发现如何被放进同一张估算表? |
| 15:04–25:40 | 两大联盟与三家轮换 | Nvidia/GPU 与 Google/TPU 的生态差异,能否形成长期优势? |
| 25:40–36:01 | 模型公司的边界 | 基础模型为何像通用电商,模型公司又会如何侵入应用层? |
| 36:01–44:45 | 预训练的尽头与在线学习 | 数据、RL 专家轨迹和真实环境分别扮演什么角色? |
| 44:45–56:45 | L3/L4、投资与 Agentic Web | 知识工作、Coding、研究与办公自动化的近期边界是什么? |
| 56:45–1:05:55 | 新公司与机器人 | NeoLabs、世界模型和机器人数据是否构成下一轮机会? |
| 1:05:55–1:18:03 | ARR、全球竞争与中国团队 | 哪些数字是判断,哪些只是节目现场的估算与押注? |
广密把 AI 的影响描述为平台级的流量重分配:用户如果直接在对话框里完成搜索、写作、代码和办公,传统搜索、广告和 SaaS 的入口就会被重新定价。这个判断有现实基础,但“会吃掉广告”仍是嘉宾推演,不能当作已发生的市场事实。更稳健的读法是:模型产品正在争夺用户的任务起点。
节目中的 OpenAI 收入算术把订阅、广告、电商、API、劳动力替代和科学发现放在同一张潜在价值表里。后两项不是当期收入,而是把模型当作劳动力与研究基础设施之后的长期上行。数字本身均为嘉宾估算,真正可验证的指标应换成付费用户、留存、单位推理成本、任务完成率和客户新增产出。
访谈把 GPT、Claude、Gemini 放在轮换领先的位置:预训练加 RL 的共同范式使顶尖团队很难长期拉开数量级差距,人才流动和论文/工程扩散又会进一步缩短差距。这并不意味着模型没有壁垒,而是壁垒从单次权重转向资本、算力、人才、数据、分发和组织执行的联合配置。
Nvidia 的优势是广泛的开发者生态、软件栈与供应链协同;生态越大,迁移成本越高。
Google 的优势是芯片、模型、搜索、浏览器、Android 和办公产品的垂直整合;控制面更集中。
“Google 像 Apple、Nvidia 像 Android”的比喻有助于理解组织与生态,但不应被当成完整的产业预测。真正的观察点是:算力供给是否稳定、同等预算下的训练/推理效率、模型能否进入高频入口,以及组织是否能把研究速度传到产品。
“基础模型等于通用电商”的比喻,指模型提供一个巨大的能力 SKU 池,应用再把它们组合成面向场景的结果。模型公司若拥有聊天、搜索、代码、办公和身份入口,就会自然地从底座向上吃掉一部分应用;单点应用只有在私有上下文、工作流深度、独特分发或评价器上形成差异,才不容易被平台吸收。
这条链也修正“模型会越来越便宜,所以应用没有价值”的过度结论:模型便宜会扩大可试验空间,但任务的隐性约束、组织责任和失败成本并不会同步消失。应用的价值不在于把 API 再包一层,而在于把一项工作变成可交付、可验收、可复用的结果。
广密把预训练数据比作石油/化石能源,把 RL 专家轨迹比作稀缺的新能源,再把在线学习比作尚未大规模实现的聚变。比喻背后的技术主张是:静态数据只能给模型先验,专家反馈能教会模型在已知任务上怎样行动,而在线学习要让系统在真实环境里持续获得新状态。
| 阶段 | 主要信号 | 真实瓶颈 | 可观测指标 |
|---|---|---|---|
| 预训练 | 海量文本/代码/图像 | 质量、版权、重复、算力 | 跨任务先验与单位训练成本 |
| 后训练 / RL | 专家示范、可验证奖励、偏好 | 评价器错配、探索成本、分布窄 | 错误修正与陌生任务迁移 |
| 在线学习 | 交互状态、结果、失败恢复 | 安全、记忆污染、回滚、责任 | 下一次行动是否因反馈而改善 |
节目对知识工作给出相对务实的近景:Coding、研究、Office、财务等任务可能先出现局部 L3/L4,即系统能独立完成一段可验收工作,但仍需要人在边界处确认。整份白领工作被替代则是另一种命题,涉及现金流、组织重排、监管和责任,不能从一个 demo 外推。
机器人部分强调数据与本体:美国更容易形成软件、模型和研究实验室,中国更容易形成硬件与实际场景;两者的交汇处才是可规模化的反馈。机器人如果只有演示而没有跨本体迁移、连续运行和维护账本,不能简单称作“GPT 时刻”。
代码测试、研究引用、表格核对、文档交付等具有明确验收器的工作。
跨部门协调、隐性政治、开放式创意和高后果决策需要更强的上下文与责任。
机器人在陌生家庭/工厂环境中的长程可靠性、维修成本与事故责任。
读这期时最好把“模型、产品、资本”拆成三本账:模型账记录等预算能力、推理延迟和错误类型;产品账记录任务完成、返工、留存和人工接管;资本账记录算力投入、现金流与组织承诺。三本账只有在同一任务上相互对齐,才足以支撑路线判断。否则,ARR 可能只是补贴,模型分数可能只是考试,在线学习也可能只是把偶然反馈写进长期记忆。本文因此把嘉宾的宏观预测保留为方向信号,把能复查的判断尽量改写成里程碑。
正文以 #127 的完整逐句材料为主,并按章节通读;本期 ASR 没有可靠分离两位说话人,因此公开笔记不伪造逐句身份。收入、ARR、公司名单、机器人能力和“中国/美国概率”等数字与判断均标为嘉宾口径、节目现场估算或推断。原始文字中的 ASR 错字只在分析层做谨慎归一化,不冒充原文修订版。
证据顺序:节目原始材料 → 官方技术/产品资料 → 本文分析。完整精确文字、章节阅读版、SRT 与审计结果保存在私有材料区;公开页提供结构化深读,不复刻整期逐字稿。