Episode Deep Read · Return, Research, Memory & AI Applications

#124 戴雨森:Year of R——回报、研究、记忆与现实检验

戴雨森把 2026 年称为 The Year of R:Return、Research、Remember,并在后半段补充 Reasoning、multimodal 等 R。这个框架的价值不在于预测一个日历年份,而在于提醒 AI 行业从“能力会不会继续变强”转向三个可检验的问题:收入能否兑现,研究范式是否需要突破,产品能否拥有连续的上下文和记忆。

#124 · YouTube 约 3:23:04 · 小宇宙长版略长 · 完整公开转录阅读 · 戴雨森 / 张小珺

原文讲解:戴雨森如何把模型进步、应用回报和人的 Agency 放进 Year of R

这期节目从一次“被模型进步打脸”的投资回忆开始,之后依次谈 Scaling、Context、Harness、Agent、Return 和 Research。下面先解释每条线如何接上下一条,所有预测仍保留在嘉宾当时的语境。

原文阶段主持人追问戴雨森的回答方向
模型进步2025 年的推理、编程和 Computer Use 改变了什么?能力从 benchmark 进入 Coding Agent,但陌生长程任务仍需要真实验证。
应用护城河为什么不能只在模型外面包一层 UI?用户 context、memory、工具、环境和工作流必须共同产生结果。
Agent 与时间表Agent 是一次产品浪潮还是长期迁移?拆目标、规划、执行、反馈、恢复和承担责任,可能是十年级工程。
Year of RResearch 与 Return 怎样同时成立?研究带来新能力,产品和组织把能力变成收入、生产率和长期复利。

一、从“被打脸”开始:模型进步让投资人必须更新判断

戴雨森先回顾自己此前对 AI 发展速度的谨慎判断,以及后来被模型在推理、编程和 Computer Use 上的进步冲击。主持人用这个反差追问:如果技术会在较短时间内跨过能力阈值,投资人和创业者应该怎样更新框架?戴雨森的回答不是把旧预测换成新口号,而是承认预测应该写成带时间、证据和可更新条件的假设。

他仍然对单纯“继续堆卡”的线性 Scaling 保持怀疑:如果第一梯队模型没有形成长期差距,下一次研究范式或 breakthrough 仍可能重排竞争。benchmark 高分也不等于真实生产力,模型还要在陌生、长程、带工具的任务里接受开发者和用户检验。

二、应用的增量来自 Context、Memory、工具和环境

话题从模型转到应用时,戴雨森用“从生鱼片到满汉全席”的比喻说明裸模型与完整服务的差别。一个早期 AI 应用可能只是模型外面包一层 UI;更复杂的产品要理解用户的专有数据、偏好、历史 memory、当前任务和权限,还要能调用工具、改变环境并把结果交付回来。

这也是他与王冠、Tristan 的观点连接处:context 让任务具体,memory 保存连续性,工具让系统行动,环境和评价让结果可检查。应用的护城河不只是有一个更好的 prompt,而是拥有一段用户愿意反复交给系统的任务状态。若模型替换时状态、评价和失败轨迹全部丢失,产品就仍然只是模型租赁。

三、Agent 不是“元年终点”,而是一段十年级别的迁移

戴雨森把 agent 里的 agency 解释成行动能力:拆解目标、规划路径、调用工具、获得反馈、修正动作并完成任务。一个 demo 能在一次演示中成功,不代表普通白领可以稳定地把工作交给它。权限、异常处理、跨软件使用、预算、结果责任和失败恢复,都会在真实任务里出现。

Coding Agent 可能更早,因为代码既是表达语言,又有执行器、测试、版本控制和相对清晰的反馈;物理世界与人形机器人更难,因为数据贵、反馈慢、环境复杂且错误有后果。把 Agent 看成十年过程,不是说十年内没有产品,而是说从个人生产力、企业权限到大规模自主决策会有多个阶段。

四、Year of R:Research、Return 和 Remember 互相牵制

节目把 Year of R 讲成一组相互牵制的检查题。Research 负责产生下一次能力跃迁;Return 要求基础设施和产品投入最终形成收入、现金流或生产率;Remember 则提醒应用不能丢掉用户上下文和任务状态。推理、多模态、Coding Agent 和通用 Agent 只有在这几条线接起来时,才不只是新闻热点。

戴雨森把泡沫分成两种:一种是相信未来会变得不同,可能产生基础设施和创业外部性;另一种是把未来误认为和现在完全一样,把价格上涨当成永恒。前者并不自动保证投资回报,后者则会把短期热度误认为长期价值。创业者需要同时检查增长质量、毛利、留存、现金 runway 和回调中的生存能力。

五、Model、Context、Harness、Runtime:为什么模型外面的系统开始决定结果

在后半段,戴雨森把 Agent 拆成四层:Model 提供通用能力,Context 提供当前任务和组织记忆,Harness 负责工具、提示、权限、评价和流程,Runtime 承担延迟、状态、失败和恢复。Coding Agent 先出现,不只是因为程序员是早期用户,而是代码仓库、测试和版本控制提供了高密度反馈。

组织也必须变化。AI-native 不是简单地少招几个人,而是重新定义任务、权限、协作和责任。执行动作可以被外包,但目标选择、审美、教育、 agency 和对后果负责不能直接外包给模型。小团队可以反馈快、重写流程,却也更容易把判断集中在少数人身上,因此要保留用户结果、独立评价和失败复盘。

六、结尾建议:允许模型和工具替换,但把状态和反馈留下

这期没有给出一个确定的模型赢家。戴雨森更可操作的建议是选择反馈密集的真实任务,允许模型和工具替换,但不要丢掉用户状态、评价记录和失败轨迹;把创业判断写成可以被新证据推翻的假设。这样 Year of R 就不是一个年份标签,而是一种持续更新、让研究和回报彼此校正的工作方法。原文讲解到这里,下面才进入结构化判断。

七、最后的落点不是模型赢家,而是可逆的创业选择

节目结尾把所有 R 重新放回创业动作。可以选择一个真实任务,先用当前模型完成低级版本;可以接受未来更强的模型和工具替换;但不能把用户状态、评价记录和失败轨迹一起丢掉。这样,下一次研究突破到来时,产品不是从零开始,而是拥有可以迁移的任务和反馈。

戴雨森也提醒,AI-native 不是把人简单替换掉。执行动作会越来越便宜,人的 agency、目标、品味、教育、关系承诺和对后果负责的能力仍然决定系统往哪里走。原文因此从“Year of R”收束到一条方法:把判断写成可更新的假设,把结果写成可验证的任务,把研究和回报放在同一张桌子上。

总判断:AI 已经跨过“能不能做”的门槛,正在进入“能不能回报”的鸿沟

戴雨森的叙事不是对 AI 失去信心,而是把应用商业化、模型研究、记忆、声音和多模态放到同一条兑现链中。他认为 2025 年已经证明“模型进步 → 产品落地 → 商业化”能够发生,但 2026 年要回答的是:这种链条能否持续扩大,能否覆盖更广的主流用户,能否让高额基础设施投入产生看得见的 return。

本文的独立抽象“Year of R”更像一份投资组合审计表:Return 看现金流和生产力,Research 看下一次能力跃迁,Remember 看产品是否保有用户上下文,Reasoning/多模态看能力能否进入更长、更复杂的任务。任何一个 R 都不能替代其他 R。

模型侧

推理时扩展、多模态和中国模型追赶推动能力上升,但 benchmark 饱和后,真实使用与开发者体验更重要。

应用侧

Coding Agent、通用 Agent、视频/图片生成和行业应用出现,但 Agent 更像十年过程,而非一年完成的产品类别。

资本侧

泡沫可以是改变未来的“好泡沫”,但高投入仍需要收入、毛利、留存和风险准备来承担。

证据账本:节目里的时间点与证据边界

时间段主张证据等级不应过度推出的结论
00:02:00–00:28:13推理时 Scaling、编程、Computer Use、Agent 和中国模型追赶。访谈回顾与嘉宾判断不能把节目中的 benchmark 分数、ARR 或模型排名当作独立统计。
00:28:13–00:52:31应用由 context、memory、工具和环境形成护城河;应用天然全球化。投资人与产品观察“天然全球化”仍需要本地合规、支付、分发与服务数据验证。
01:03:15–01:30:292026 是 Return、Research、Remember、Reasoning/多模态受到检验的一年。框架与预测R 是分析框架,不是已经发生的行业事实。
01:30:29–01:47:38存在泡沫但未必是疯狂泡沫;token 使用不等于回报;可能有市场回调。投资判断回调时间、OpenAI 收入和市场方向均属预测。
01:47:38–02:18:31创业者要提前判断技术 6–12 个月后的能力、面向全球、持续翻牌。经验方法不能把个案成功倒推为普遍创业公式。
02:25:49–03:23:04智能充沛后,人需要 Agency、Taste、并行思考与独特性;模型公司要解决 return。访谈总结与非正式延伸这些是价值判断和长期推演,不是可直接量化的结论。

#124 的 YouTube 版和 RSS 音频存在秒级时长差异,结尾还有较长的公司闲谈。本文把正式访谈与后置闲谈都纳入内容地图,但不把二者的证据强度混为一谈。

深度分析:R 框架最强的地方与三个盲点

最强之处:把“模型进步”拆成收入链条

从模型能力到收入之间至少有四个接口:用户是否有真实任务,产品是否能提供上下文和工具,结果是否足够可靠,企业是否愿意付费并改变流程。戴雨森把 Coding Agent 视为一个更早跨鸿沟的例子,因为代码任务有较清晰的可执行反馈;他把情感陪伴和人形机器人放在更慢的时间线上,因为人性、责任和物理世界带来更复杂的评价。

盲点一:投资口述中的数字不能取代财务审计

节目中出现了许多 ARR、模型能力、投资规模和市场估算。它们可以帮助我们重建嘉宾当时的观察,但不能脱离来源直接作为事实。尤其是“收入增长很快”需要进一步拆成订阅、API、企业合同、毛利、推理成本和现金流;“模型接近”需要说明评测版本、污染风险、真实任务和价格。

盲点二:context 是护城河,但也可能成为负债

记忆能提升个性化,却同时带来隐私、删除、迁移、权限、错误记忆和模型供应商依赖。真正的产品能力不是“记得越多越好”,而是知道什么应当保存、谁能读取、如何纠正、如何在切换模型时带走,以及发生事故时如何回滚。#135 的主体性讨论特别提醒了 context 的伦理与身份成本。

盲点三:回调之后的优秀公司不一定只靠“坚持”

戴雨森强调高质量增长和在低谷中继续创业,这对早期投资有启发;但回调中的生存还取决于现金 runway、合同结构、单位经济、数据迁移能力和团队组织。把韧性写成个人品格会掩盖资源约束。更好的判断是:团队是否能在较低融资、较低 token 价格和模型替换的条件下继续交付结果。

把 Year of R 变成一张运营检查表

Return。 先问收入来自哪里,再问收入是否伴随真实成本下降。订阅、API、企业合同、广告、平台佣金和被替代的人工成本不能混成一类;每一类都要对应客户、续费、毛利和现金回收。对于早期公司,暂时没有利润并不致命,但必须知道最小的付费证据是什么,以及推理价格下降或模型替换后,经济模型是否会更好而不是更差。

Research。 研究突破的价值不应只以 benchmark 增长表达,还要看它解锁了什么任务。推理时计算、Computer Use、长程 Agent 和多模态都可能扩大应用空间,但每种能力都有延迟、成本、错误和验证问题。研究年不是等待奇迹,而是把最可能改变产品边界的实验做出来,并把实验结果与产品需求连接起来。

Remember。 记忆不是把聊天记录堆在数据库里。产品需要区分短期工作状态、长期偏好、敏感信息、组织知识和可删除的临时上下文;需要让用户知道系统记住了什么、如何纠正、能否导出和能否迁移到新的模型。记忆只有在减少重复说明、提高结果质量并保持用户控制时才是资产,否则会变成隐私和错误的负债。

Reasoning 与多模态。 复杂任务越来越依赖视觉、语音、文档、代码和外部工具的联合状态。真正的进步不是让模型在更多模态上生成漂亮演示,而是让它在跨模态任务中保持目标、引用证据、处理异常并知道何时交给人。这里的评价应该更接近任务闭环,而不是单一榜单。

为什么“Agent 十年”是一个工程判断

Agent 的长期性来自异常组合的数量:现实任务不是固定流程,权限会变化,工具会失败,用户意图会反复,结果还要承担后果。模型能力提升可以减少一部分错误,但不能自动解决身份、预算、回滚、审计和责任。把 Agent 看成十年过程并不是悲观,而是把未来的工作拆成可逐年交付的层级:先是个人/小团队的生产力,再是企业权限和数据,最后才是大规模自主决策。

给投资与创业者的时间表纪律

戴雨森反复强调要在技术成熟前下注,但这需要和“不要过早”同时成立。一个好的时间表是:能力在六到十二个月内可能到达,产品现在就能用低级版本收集反馈,团队有足够 runway 跨过模型迭代,且即使下一次研究突破延迟,现有产品也能创造某种结果。这样才能把前瞻判断变成期权,而不是把用户当成等待未来模型的实验材料。

后续如何证伪或修正

证据边界与资料索引

本文以 #124 的官方 YouTube、RSS 节目说明与 Scripod 公开转录为主。Scripod 说明该期自动转录无法可靠区分说话人,因此本文只按“节目主张”归纳,不把句子强行归给某位说话者。公司收入、模型分数、市场预测和投资判断均保留为访谈口径。

本文完成于 2026-07-31。#124 的后置公司闲谈是节目的补充语境,不应替代公开财务、技术和市场资料。

返回顶部 ↑