原文讲解:1:18:03 内容地图:从 AI War 到第三个范式
以下先按节目自身的推进讲清楚原文:主持人问了什么,嘉宾怎样回答,哪些经历、案例和转折把后面的结论串起来。这里先不替嘉宾下判断。
| 时间 | 章节 | 本章要回答的问题 |
| 00:00–07:38 | AI War 与 OpenAI 账本 | 为什么模型竞争会同时改变流量分配与收入结构? |
| 07:38–15:04 | 收入与未知上行 | 订阅、广告、API、劳动力替代和科学发现如何被放进同一张估算表? |
| 15:04–25:40 | 两大联盟与三家轮换 | Nvidia/GPU 与 Google/TPU 的生态差异,能否形成长期优势? |
| 25:40–36:01 | 模型公司的边界 | 基础模型为何像通用电商,模型公司又会如何侵入应用层? |
| 36:01–44:45 | 预训练的尽头与在线学习 | 数据、RL 专家轨迹和真实环境分别扮演什么角色? |
| 44:45–56:45 | L3/L4、投资与 Agentic Web | 知识工作、Coding、研究与办公自动化的近期边界是什么? |
| 56:45–1:05:55 | 新公司与机器人 | NeoLabs、世界模型和机器人数据是否构成下一轮机会? |
| 1:05:55–1:18:03 | ARR、全球竞争与中国团队 | 哪些数字是判断,哪些只是节目现场的估算与押注? |
下面按节目自己的推进,把上表中的主题展开成连续讲解;其中的判断、数字和经历先按嘉宾/作者在节目中的说法呈现,尚未进入本文的独立审计。
一、“战争”真正解释的是流量迁移,而不是必然的军事冲突
广密把 AI 的影响描述为平台级的流量重分配:用户如果直接在对话框里完成搜索、写作、代码和办公,传统搜索、广告和 SaaS 的入口就会被重新定价。这个判断有现实基础,但“会吃掉广告”仍是嘉宾推演,不能当作已发生的市场事实。更稳健的读法是:模型产品正在争夺用户的任务起点。
节目中的 OpenAI 收入算术把订阅、广告、电商、API、劳动力替代和科学发现放在同一张潜在价值表里。后两项不是当期收入,而是把模型当作劳动力与研究基础设施之后的长期上行。数字本身均为嘉宾估算,真正可验证的指标应换成付费用户、留存、单位推理成本、任务完成率和客户新增产出。
边界“几十亿美元 ARR”“广告份额”“科学发现价值”等表达均保留为节目现场口径;公开页面不把它们改写成公司财务或行业统计。
二、三家模型轮换领先:当前范式的优势与脆弱性同时存在
访谈把 GPT、Claude、Gemini 放在轮换领先的位置:预训练加 RL 的共同范式使顶尖团队很难长期拉开数量级差距,人才流动和论文/工程扩散又会进一步缩短差距。这并不意味着模型没有壁垒,而是壁垒从单次权重转向资本、算力、人才、数据、分发和组织执行的联合配置。
GPU 联盟
Nvidia 的优势是广泛的开发者生态、软件栈与供应链协同;生态越大,迁移成本越高。
TPU 联盟
Google 的优势是芯片、模型、搜索、浏览器、Android 和办公产品的垂直整合;控制面更集中。
“Google 像 Apple、Nvidia 像 Android”的比喻有助于理解组织与生态,但不应被当成完整的产业预测。真正的观察点是:算力供给是否稳定、同等预算下的训练/推理效率、模型能否进入高频入口,以及组织是否能把研究速度传到产品。
三、基础模型像通用电商:价值会沿着任务链向应用层迁移
“基础模型等于通用电商”的比喻,指模型提供一个巨大的能力 SKU 池,应用再把它们组合成面向场景的结果。模型公司若拥有聊天、搜索、代码、办公和身份入口,就会自然地从底座向上吃掉一部分应用;单点应用只有在私有上下文、工作流深度、独特分发或评价器上形成差异,才不容易被平台吸收。
通用模型
上下文
工具与权限
任务完成
结果反馈
下一轮模型
这条链也修正“模型会越来越便宜,所以应用没有价值”的过度结论:模型便宜会扩大可试验空间,但任务的隐性约束、组织责任和失败成本并不会同步消失。应用的价值不在于把 API 再包一层,而在于把一项工作变成可交付、可验收、可复用的结果。
四、在线学习:从“数据是燃料”走向“数据是闭环状态”
广密把预训练数据比作石油/化石能源,把 RL 专家轨迹比作稀缺的新能源,再把在线学习比作尚未大规模实现的聚变。比喻背后的技术主张是:静态数据只能给模型先验,专家反馈能教会模型在已知任务上怎样行动,而在线学习要让系统在真实环境里持续获得新状态。
| 阶段 | 主要信号 | 真实瓶颈 | 可观测指标 |
|---|
| 预训练 | 海量文本/代码/图像 | 质量、版权、重复、算力 | 跨任务先验与单位训练成本 |
| 后训练 / RL | 专家示范、可验证奖励、偏好 | 评价器错配、探索成本、分布窄 | 错误修正与陌生任务迁移 |
| 在线学习 | 交互状态、结果、失败恢复 | 安全、记忆污染、回滚、责任 | 下一次行动是否因反馈而改善 |
二次拆解:在线学习其实包含三种不同的“更新”
节目把 continual learning、memory、always-on 和边推理边学习放在同一段里,但工程上必须拆开,否则会把“记住了用户”误说成“模型学会了”。第一层是参数更新:把新轨迹写回权重,收益可能跨任务迁移,代价是训练成本、遗忘、污染与审核。第二层是记忆/上下文更新:不改权重,只改变下一次可见的事实、偏好和任务状态,速度快但要处理来源、过期、删除和权限。第三层是策略/环境更新:改工具路由、提示模板、评价器、沙盒或数据采集规则,模型不变,系统的行动分布却会变。
| 更新层 | 反馈写在哪里 | 它真正带来的收益 | 最容易被忽略的失败 | 最低验收 |
|---|
| 参数 | 模型权重/适配器 | 跨任务复用、减少重复提示 | 错误反馈永久化、灾难性遗忘、责任难追溯 | 回放旧任务、隔离新任务、版本可回滚 |
| 记忆 | 用户档案、工作状态、检索索引 | 个性化、连续任务、减少重新解释 | 把猜测当事实、越权读取、过期信息污染 | 逐条来源、TTL、删除测试、权限测试 |
| 策略/环境 | 工具、harness、verifier、沙盒 | 更快探索、更低失败成本、可执行反馈 | 评价器漏洞、工具漂移、回滚只恢复表面状态 | 同一任务的冷启动/热启动对照与事故演练 |
因此,“边推理边学习”只有在反馈改变了未来行动、并且这种改变能在新任务上复现时才算学习。否则它可能只是更长的上下文,或一次性的缓存。这个区分也让节目里的“模型即产品、数据即模型”更精确:数据不只是训练燃料,而是决定哪一层状态会被更新、谁有权更新以及如何证明更新有效的控制面。
隐藏瓶颈:信用分配与污染控制在线系统最难回答的不是“有没有新数据”,而是长链行动中哪一步导致了结果、反馈应该归因给哪个策略、错误是否来自工具而非模型,以及一次错误更新影响了多少后续用户。没有时间信用分配、数据血缘和紧急冻结按钮,在线学习的速度越快,事故半径越大。
二次拆解:Agentic Web 争夺的是控制面,不只是流量
“Agent 成为入口”并不等于另一个聊天 App 获得更多 DAU。它争夺的是任务从哪里开始、身份和预算由谁持有、工具调用由谁排序、结果由谁确认,以及交易完成后反馈回到谁的系统。搜索、超级应用和手机厂商今天拥有的是分发与归因;Agent 若能跨平台执行,就可能把这些能力拆成一个新的控制面。
入口指标
用户从哪个界面发起任务、授权了哪些身份与预算,而非只看打开次数。
执行指标
任务路由份额、工具成功率、转人工率、取消率和跨平台完成率。
价值指标
可归因的交易/工作产出、分成、错误责任和反馈是否回到入口。
这也修正“Agent 会短路所有信息中介”的强叙事:只有当 Agent 能可靠地替用户比较、执行、追踪和处理异常,信息分发才会真正改变;若它仍需用户逐个确认,旧平台的品牌、支付和责任接口仍然有价值。最有信息量的验证不是 MAU,而是同一任务在不同入口的完成率、总成本和归因权。
五、近期现实:知识工作 L3/L4 先于通用 AGI,机器人仍在数据前夜
节目对知识工作给出相对务实的近景:Coding、研究、Office、财务等任务可能先出现局部 L3/L4,即系统能独立完成一段可验收工作,但仍需要人在边界处确认。整份白领工作被替代则是另一种命题,涉及现金流、组织重排、监管和责任,不能从一个 demo 外推。
机器人部分强调数据与本体:美国更容易形成软件、模型和研究实验室,中国更容易形成硬件与实际场景;两者的交汇处才是可规模化的反馈。机器人如果只有演示而没有跨本体迁移、连续运行和维护账本,不能简单称作“GPT 时刻”。
可先验证
代码测试、研究引用、表格核对、文档交付等具有明确验收器的工作。
难度上升
跨部门协调、隐性政治、开放式创意和高后果决策需要更强的上下文与责任。
仍待闭合
机器人在陌生家庭/工厂环境中的长程可靠性、维修成本与事故责任。
原文讲解到这里。接下来才进入本文的结构化抽象、证据分层和独立判断。
核心判断:AI War 首先是一条资本—算力—流量的协调论
访谈开头把大模型竞争称为 AI War,容易被读成军事预言;放回全文,它更像一种产业协调论:谁能持续买到算力、训练出足够强的模型、把模型接到高频入口,再把真实使用反馈回写,谁就能在下一轮竞争中获得更多现金流与数据。战争隐喻放大了紧迫感,却不能替代对任务、收入和风险的逐项验证。
可持续优势 ≈ 模型能力 × 分发流量 × 反馈速度 ÷(算力成本 + 组织复杂度 + 尾部风险)
能力侧
预训练与后训练仍决定先验和推理上限,但前三家在当前范式内会轮换领先。
分发侧
聊天、搜索、办公、代码和设备入口决定模型能否转成持续的使用频率。
反馈侧
真实工作环境产生的纠错、偏好和结果数据,才可能支持下一种在线学习。
本文的中心推论“在线学习”不是把模型接上一个永不停止的训练按钮,而是让系统在受控环境中完成交互、记录状态、获得反馈、更新策略并能回滚。它必须同时解决记忆、评价、权限和安全,才称得上新的 scaling 方向。
从原文切换到独立分析以下卡片是本笔记此前整理出的独立洞察,现统一放在核心判断之后,避免与嘉宾/作者原文混读。
Insight:在线学习是控制回路,不是标签最小闭环是“观察环境 → 选择行动 → 记录结果 → 评价偏差 → 更新策略/记忆 → 在相似任务上验证”。没有版本化状态、反事实评估和停止权,持续更新很可能只是把噪声写进模型。
读这期时最好把“模型、产品、资本”拆成三本账:模型账记录等预算能力、推理延迟和错误类型;产品账记录任务完成、返工、留存和人工接管;资本账记录算力投入、现金流与组织承诺。三本账只有在同一任务上相互对齐,才足以支撑路线判断。否则,ARR 可能只是补贴,模型分数可能只是考试,在线学习也可能只是把偶然反馈写进长期记忆。本文因此把嘉宾的宏观预测保留为方向信号,把能复查的判断尽量改写成里程碑。