表征
图像、视频、音频与文字如何进入同一可组合空间。
这场 2 小时 28 分钟的访谈从 ResNet 与视觉 scaling 讲到 Step 系列模型、o1、视觉生成、长上下文和在线学习。张祥雨给出的核心诊断是:多模态目前把“看懂”和“生成”拼在一起,却还没有获得像语言推理那样可迁移的视觉思考模式。下一次 GPT-4 moment 不会只来自更大的视觉编码器,而要让模型在视觉空间里拥有可验证的动作、反思、回退和世界模型。
给语言模型接一个视觉编码器,可以让它识别图片、回答问题;给扩散模型接文本条件,可以让它生成符合描述的图像。但这两条路径仍然像两个瞬间:理解是一次表示匹配,生成是一次整体采样。复杂任务需要在视觉状态中逐步选择、检查、修改和撤销动作,例如定位、裁剪、放大、擦除、重画、比较和回看。没有这些中间动作,视觉模型缺少把错误暴露出来的机会。
图像、视频、音频与文字如何进入同一可组合空间。
模型如何展开视觉 CoT、选择操作并保留中间证据。
模型如何以局部、可控、多步方式改变视觉世界,而非只输出一张图。
| 时间段 | 主要内容 | 核心问题 |
|---|---|---|
| 00:00–00:28 | CV 经历、ResNet、数据/模型 scaling 与 2022 年的悲观判断。 | 静态图像是否缺少统一生成、理解和人类对齐所需的信息? |
| 00:28–00:56 | Step 1、Step 2 的统一多模态尝试与规模实验。 | 为什么语言/知识随规模增长,数学/局部推理可能先升后降? |
| 00:56–01:22 | o1、RL、reasoning pattern、Meta-CoT 与视觉动作空间。 | 推理能力来自新算法、预训练模式,还是能被 RL 激活的行为结构? |
| 01:22–01:56 | 视觉生成、扩散、合成数据、统一模型与多模态训练冲突。 | 静态生成的一步决策为什么不足以支撑可迁移视觉推理? |
| 01:56–02:28 | 长上下文、层级记忆、在线学习、Agent 与世界模型。 | 把所有上下文存起来,是否等于真正会使用经验? |
张祥雨回顾从 ResNet 到视觉自监督的经历,指出视觉与语言的关键差别:语言天然有 token、序列和下一词预测,互联网上的文本还带着过程、解释和社会互动;静态图片则更像一组手工定义的空间信号。对比学习和掩码图像建模可以学到表示,却常常把不变性写死,难以像语言那样通过海量自然数据持续扩张。
因此他把短期路径放在视觉—语言对齐,把长期路径放到视频和具身数据:视频提供时间、动作、因果和结果,机器人/驾驶数据提供感知—行动—后果。这个判断不是说图片没有价值,而是说静态图片很难单独提供“我做了什么、世界如何反应、我应如何修正”的完整学习信号。
访谈重构了一段研发史:Step 1 尝试把文本、图像理解与生成放进统一系统,理解能力有进展,但图像生成的可控性、物理一致性和训练信号不足;把生成分支去掉后,理解能力没有明显损失,反而暴露出“生成与理解仍像两个模型”。随后 Step 2 在模型和数据规模上做了更大的投入,却发现语言/领域知识随规模提升,数学和局部推理不一定同步。
这部分主要是嘉宾对内部实验的回顾,公开一手资料不足以重建所有模型配置、数据配方和对照实验,因此不能把“1B→7B→30B→70B 的先升后降曲线”当作普遍 scaling law。它的研究价值在于提出了一个可检验假设:最大化 next-token compression 可能让大模型跳过中间算术步骤,直接输出高概率答案;短链条看起来更聪明,长链条中的罕见错误却会累积。
| 观测 | 可能机制 | 需要怎样验证 |
|---|---|---|
| 知识、对话、EQ 随规模提升 | 更多数据和参数提高表示容量与先验。 | 控制数据质量、训练 token、提示和采样,做跨分布任务。 |
| 数学/局部推理先升后降 | 模型倾向跳过可见步骤,缺少过程监督。 | 比较逐步答案、最终答案、验证器和长链错误率。 |
| 小模型更愿意展开步骤 | 能力不足时依赖显式过程;大模型更快走捷径。 | 测推理 token、反思、重算、回退和错误相关性。 |
张祥雨对 o1 的解读不是“RL 算法突然变强”,而是模型学会了一种可迁移的推理模式:停下来、拆问题、尝试路径、检查、反思、必要时回退。数学和代码中的 verifiable reward 让这些行为可以被强化;真正可贵的是这种模式能从数学迁移到诗歌、图像编辑或其他任务,而不是只在某个游戏中记住一套动作。
他把“Meta-CoT”描述为对推理路径本身再推理:不只生成答案,还比较多个路径、判断哪条值得继续。对视觉而言,这意味着模型需要一个视觉动作空间,而不是只产生一段文字说明。点、框、裁剪、放大、擦除、重绘、对照和回退都可能成为视觉 token 之外的动作。纯合成数据若只覆盖固定任务,会教会模型完成那一题,却未必教会它迁移“反思—验证”模式;自然多模态语料中存在的图像编辑和人类纠错过程,可能更有助于泛化。
GAN、Diffusion、Latent Diffusion 与 DiT 解决了不同层面的生成问题:对抗训练把判别信号变成生成器的目标;扩散通过逐步去噪换取稳定性;潜空间降低高分辨率成本并通过 cross-attention 接收文字条件;DiT 则把扩散骨干接到 Transformer 的 scaling 生态。官方论文支持这些机制,但它们仍主要把一张图或一段视频作为整体样本生成。
“一张图一次生成”不等于模型没有内部计算,而是训练目标没有显式要求它在视觉空间里做可检查的多步规划。要让生成反过来服务推理,可以从低复杂度指令开始:把 A 连到 B、去掉一个人、把局部放大、修改颜色、恢复遮挡。每一步都有局部验证器,模型才能学会动作后果,而不是只学到风格。
细节完整但计算昂贵,长序列和高分辨率压力大。
压缩并过滤噪声,降低成本,也可能丢失几何和物理约束。
把生成拆成可验证操作,才可能接上反思、回退和世界模型。
访谈把传统长上下文比作把所有经历堆在一个人的工作记忆里:模型可以接受更多 token,却没有短期、工作和长期记忆的层级,也没有自然的遗忘、压缩和上下文切换。干扰会让模型在检索 benchmark 上看起来“不忘”,在真实任务中却因为无关历史、冲突计划和错误摘要而变笨。
一个可行的系统方向是多层记忆:小上下文模型负责眼前推理,无限/线性状态模型负责压缩全局经验,检索模型负责精确找回,规划器负责把信息转成行动。不同模型或 Agent 之间传递摘要、证据和状态,而不是无条件转发整段对话。这样可以把上下文清理当成决策,而非简单的窗口扩容。
张祥雨把训练演进描述为:next-token prediction 先学语言,RL 再学目标,下一阶段可能是模型在环境中自主探索、获得内在奖励并持续更新。今天的 Agent 多数仍是“推理模型 + 工具编排”,它会调用工具,却不一定从长期经历中改变自己。真正的 Agent 里程碑应是能设定子目标、设计实验、解释反馈、压缩经验并在新任务上变好。
难点在于环境昂贵且不稳定:真实网页会变化,机器人试错有物理成本,企业系统有权限和隐私,天然语言反馈丰富却难以量化。内在奖励可能鼓励探索,也可能奖励新奇而非价值。所谓在线学习时间表只是嘉宾预测;更可靠的观察指标是单位环境成本带来的跨任务提升、错误恢复、灾难性遗忘和人类接管。
访谈区分了“模型能够生成视觉样本”和“模型拥有可用于行动的世界模型”。人类并不需要随时生成高清图像,仍能预测物体、动作和后果;现阶段研究可能先用生成模型作为方便的训练接口,但在机器人和自动驾驶里,真实目标是可用的状态、动作和后果预测。
机器人在受限场景里可能先以模块化、规则和专用系统抢跑;长期若要进入开放世界,视觉推理、动作生成、在线学习和安全回退必须相互闭环。它与多模态语言模型的关系不是简单替代:语言提供抽象任务和知识,视觉/动作提供物理反馈,环境负责把错误变成不可忽略的信号。
本笔记以 Zhang Xiaojun Podcast #102 的完整访谈为主材料,连续覆盖 2:28:58。字幕的说话人分离不可靠:可确认嘉宾是张祥雨、主持人为张小珺,另有李广密参与,但正文不把每句观点强行归给某个说话人。Step 1/Step 2 的内部实验曲线、团队判断、模型训练细节、未来一年/两年的时间表均按访谈重构或预测处理;公开官方资料只用于核验机构公开模型、论文机制和已发布技术路线。
公开页面不能替代内部训练日志和严格的等预算实验;本文把嘉宾预测、官方技术事实和我的系统推断分开写,避免以“GPT-4 moment”“两年内”等时间表达制造确定性。