第一遍:原帖到底讲了什么
原帖是一篇七项近期工作的速览,而不是论文式长论证。作者先给出总判断:多模态 on-policy distillation(OPD)不应只被理解为“teacher 教 student”,更关键的是监督信号是否稳定、视觉证据能否由学生在推理时恢复,以及推理过程能否被模型内化。随后把七篇工作分成四组。
视觉证据与细粒度推理
Vision-OPD 用局部裁剪教师教全图学生;Imagine-OPD 让教师看放大证据,学生把“看哪里、看到什么”写进文本推理;ViCuR 用源自原图的 cue 替代答案提示。
机制与稳定
参数几何论文解释 dense token supervision 最终为何仍形成小而稀疏的权重变化;GNDPO 用 batch 级归一化抑制极端 token KL 引起的梯度尖峰。
推理监督
PTD-PO 不把答案交给学生,而由带空间提示和中间推理提示的冻结参考模型,给失败 rollout 提供 token 级纠偏。
多模态搜索 Agent
HyperEyes 把视觉定位与检索合为可并发动作,用轨迹级效率奖励约束工具成本,再用 OPD 修正失败轨迹。
原帖最终把七篇归纳为一句话:多模态 OPD 正从“蒸馏答案”走向“蒸馏可恢复证据、稳定信号和推理过程”。这句话抓住了研究潮流,但它是主题归纳,不是已经被七篇共同证明的统一机制。
共同底座:OPD 为什么介于 SFT 与 RLVR 之间
普通监督微调或离线蒸馏在固定的教师轨迹上训练。模型部署后却会读取自己刚生成的前缀;一旦早期出错,它会进入训练数据没覆盖的状态。OPD 让学生先生成 \(y\sim\pi_\theta(\cdot\mid x)\),再让教师在这些真实学生前缀上给每个 token 分布,从而同时获得“学生状态分布”与“稠密教师信号”。
关键变量不是式子里的 \(D\) 一项。真正改变监督语义的是 \(x_T\) 与 \(x_S\) 的差:教师可能看同一输入但模型更强,也可能额外看 crop、标注框、visual cue、hint、参考答案或外部搜索结果。教师多看的信息能否由学生输入恢复,决定了它是在提示学生“重新发现证据”,还是要求学生模仿一个推理时不可达到的知情状态。
七篇工作的完整机制地图
| 工作 | 学生推理时看什么 | 教师额外看什么 | 核心操作 | 它真正解决的问题 |
|---|---|---|---|---|
| Vision-OPD | 带目标框的全图 | 目标区域裁剪并放大 2× | 同一模型、不同视觉条件的 top-100 JSD;6.2K 合成样本 | 局部能认、全图找不到的 regional-to-global gap |
| Imagine-OPD | 原图与问题,输出文字化“心理放大”轨迹 | GT 标注框裁剪、答案 | 冻结教师对学生 rollout 做 reverse KL;19K V* 样本 | 把显式 crop 工具的收益吸收到单次图像推理 |
| ViCuR | 原图、问题、额外 sink cross-attention 模块 | 由图像和问题导出的 visual cue 文本 | 每五层用 sink token 聚合视觉 token;sampled-token OPD | 减少答案型 privilege 的 train-test mismatch |
| Dense Supervision, Sparse Updates | 不是新推理器 | 分析多组已训练 checkpoint | 测 delta 稀疏度、谱能量、源权重主方向与 mask 干预 | OPD 的 dense 监督究竟在参数空间写了什么 |
| GNDPO | InternVL 学生 rollout | InternVL3.5-8B 教师 logits | 把 raw token KL 在整个 batch 上转成相对 advantage | 极端 teacher/student log-ratio 支配梯度的问题 |
| PTD-PO | 原问题,无 hint | 答案无关的空间提示与高层推理提示 | 只对失败轨迹启用 top-100 JSD,并与 GRPO 合并 | 全错/困难组缺少可用 credit assignment |
| HyperEyes | 多实体图文搜索环境 | 效率对齐的 235B 冻结教师 | 并行 UGS 动作 + TRACE 成本奖励 + 失败 rollout OPD | 串行 crop/search 的轮次冗余与失败轨迹纠偏 |
Vision-OPD:把“看得见但找不到”变成自蒸馏信号
论文先测同一模型在全图与证据 crop 上的差距,ZoomBench 上局部输入比全图高 18–22 个点。训练时学生看带红框的全图,教师看对应 crop;二者其实是同一 Qwen3.5 模型在不同视觉上下文下的两个条件分布。4B 平均分从 70.68 升到 77.07,9B 从 73.37 升到 79.68。最扎实的因果证据不是与闭源模型横比,而是相同数据和 backbone 下胜过 SFT、GRPO、DAPO 与 answer-based OPSD。
边界也很清楚:训练问题由 397B 模型围绕已定位的小区域生成,学生提示里还有显式 bounding box。它证明的是“把已知候选区域的局部识别能力迁回全图条件”,并没有证明模型能在无框、开放世界图片中自主发现任意关键区域。
Imagine-OPD:内化的是受监督的区域描述,不是可验证的隐式图像
Imagine-OPD 更进一步:学生不仅直接回答,还输出“我要看哪里、靠近看会看到什么”的 textual imagination。冻结教师额外读取 GT evidence boxes 形成的 crops 与答案,在学生自己写出的前缀上给 reverse-KL 监督。4B 平均分 70.4→76.7,8B 72.6→77.1;报告推理速度比显式图像工具方法快 1.5–2.7×。注意力落在证据框内的比例也从 23.6→27.4、26.0→29.6。
但论文自己给出了重要失败信号:把教师改成随学生同步更新,三个基准准确率全部降到 0.0;说明稳定的冻结教师不是实现细节,而是方法成立条件。它还依赖 GT 框与答案,且注意力覆盖仍不到 30%。文本里声称“心理放大后看到了什么”不等于模型真的重建了局部像素;更准确的说法是,它学会生成与局部证据统计一致的语言化检查过程。
ViCuR:可恢复 privilege 是更好的目标,但不是数学上自动成立
ViCuR 反对把 gold answer 或 rationale 交给教师:这些信息在测试时不由原始输入唯一决定,学生可能学习答案条件下的说话模式。它改用描述图中相关证据的 cue,并让专用 sink-token cross-attention 在 prefill 阶段聚合视觉 token。平均来看,ViCuR 相对 answer-based OPSD 提升 1.19/1.24,相对更强教师 OPD 提升 0.64/1.08。
这组成绩值得正反两面一起读。正面是同一 teacher 配置下的对照比较清楚;负面是普通 OPSD 本身低于 base model,ViCuR 在 8B 同骨干设置只把 58.15 拉到 59.39,仍低于 base 的 60.76,更远低于 GRPO 的 65.35。部分单项也下降,如 8B 强教师的 MathVista 为 −1.4。论文把 cue 理想化成 \(S=f(X)\),于是 \(I(Y_t;S\mid X,Y_{\lt t})=0\);现实里 cue 来自外部模型或标注者,包含选择偏好与描述噪声,所以作者也承认这是“缩小”而非消除 privilege gap。
参数几何论文:稀疏是结果,不能直接当训练配方
六组 OPD checkpoint 的相对 Frobenius delta 只有 0.036%–0.142%,在 \(10^{-5}\) 阈值下有 66.72%–89.50% 坐标没有可见变化;更新通常 FFN-heavy、数值上满秩但谱能量集中,并避开源权重主奇异方向,偏向原权重幅值较小的坐标。用事后发现的约 17.5% OPD mask 重训,AIME24/25 峰值 35.10%,接近全量 35.52%;随机同密度 mask 只有 32.92%。
这证明特定子网具有功能意义,却还不是可直接省算力的算法:mask 是看完完整 OPD checkpoint 后才定义的“未来信息”,训练前并不知道要选哪些坐标。论文也发现 SGD 明显弱于 AdamW,说明“最终 delta 稀疏”不能推出“优化过程无需自适应缩放”。
GNDPO:稳定器有效,但收益比叙事克制
普通 sampled-token OPD 用 \(\log \pi_T(y_t)-\log \pi_\theta(y_t)\) 作为 token 信号。当学生走到教师几乎不接受的状态时,极端 log-ratio 会放大梯度。GNDPO 在整个 mini-batch 上标准化:
65 个优化 step 中,标准 OPD 在约第 15 步出现大于 2.5 的梯度范数尖峰,GNDPO 将其压住;七项平均分相对 OPD,1B 为 31.6→32.0,2B 为 42.9→43.7,4B 为 53.9→54.5。这支持“更稳且小幅更好”,不支持把归一化称为新的能力来源。它只测试 Geometry3K 训练、InternVL3.5 家族、单一 8B 教师,batch 统计在小 batch 与跨难度混合时是否扭曲信号仍未充分回答。
PTD-PO:失败轨迹路由比“不给答案”更关键
PTD-PO 先用外部大模型生成结构化 hint,包含空间关注点和中间推理方向,但要求不泄露最终答案;学生照常在原问题上 rollout。若一组轨迹的成功率低于阈值,冻结 reference model 在 hint 上下文中重评失败前缀,用 top-100 JSD 给 dense correction;成功轨迹仍由 RLVR 学习。主表中总体平均分:2B 的 GRPO 50.63→PTD-PO 61.21,4B 为 68.06→71.23,8B 为 68.78→71.86。
“不给答案”并不等于没有答案信息:hint 由 Qwen3-VL-235B 与 Gemini-3-Pro 参考训练样本生成,本身可能编码接近答案的路径。更重要的实验证据是选择性路由:2B/4B/8B 在阈值 1.0 时收益最大,而低阈值在 8B 甚至负收益。这说明方法更像一个对能力匹配困难样本启用的纠偏器;当强模型失败样本太少或 hint 不够强时,收益会收缩。
HyperEyes:OPD 是最后一段增益,不是整套系统的代名词
HyperEyes 先把 “crop → search” 两步动作合成统一 grounded search,一轮可对多个实体并发检索;再从 271K 问题池筛成 30K 最短成功轨迹做 SFT。RL 阶段的 TRACE 同时看工具调用轮数 \(t_c\) 与总调用数 \(t_s\),并逐轮收紧成功参考,防止模型把所有请求塞进一轮来刷“低轮数”。只有失败轨迹再由效率对齐的 235B 教师提供 OPD。
30B 从 SFT 平均 58.8/2.9 轮,到 TRACE 62.7/2.2,再到 TRACE+OPD 64.0/2.2;所以 OPD 的可归因增益约 1.3 点。完整系统相对 VDR 的 +9.9 点与 5.3× 更少轮次,主要来自新动作空间、数据过滤和效率奖励共同作用。另一个关键反例是换成普通 Qwen3-VL-235B 教师后平均分从 64.0 掉到 46.3:teacher 更大不够,teacher 的行为策略必须与目标动作空间一致。
第二遍:证据审计与独立判断
原帖哪些判断最可靠
- OPD 的价值不只是 teacher 大小。七篇一致说明 teacher context、学生访问状态、token 信号尺度、失败路由和动作空间都会改变结果。
- 可恢复的视觉 privilege 通常优于答案侧 privilege。Vision-OPD 的同骨干对照、Imagine-OPD 的 evidence-view 消融、ViCuR 的同 teacher 对照都支持这一方向。
- 稠密信号仍需要稳定器和选择器。Imagine-OPD 在线教师直接崩溃、GNDPO 的梯度尖峰、PTD-PO 的阈值曲线与 HyperEyes 的 teacher 对齐反例都表明,dense 不代表安全。
原帖最需要收紧的地方
证据理论上存在于原图,不表示当前学生有分辨率、注意力带宽和表示能力把它恢复出来。Vision-OPD 预先给框,Imagine-OPD 训练用 GT 框,ViCuR 加新 cross-attention 模块;三篇都在工程上额外提供了“哪里值得看”的偏置。
七篇也没有共同证明“推理过程已被内化”。目前更强的证据是 benchmark 改善、局部注意力覆盖增加和工具轮次下降;但文本 CoT 是否忠实反映视觉计算、cue 是否带入答案捷径、模型是否在分布外还能自主找到新证据,仍缺因果干预。尤其 Imagine-OPD 的“想象视觉细节”可能是对训练分布的语言化预测,而不是内部生成可检验的高分辨率表征。
此外,跨论文 headline 不可直接排序。Vision/Imagine 使用的 backbone、数据、版本和基准不同;ViCuR 主要在数学/几何推理上训练;GNDPO 只做 InternVL/Geometry3K;HyperEyes 又处于有检索环境和 LLM judge 的 Agent 任务。平均分只是各自实验内的指标,不是七种方法的统一排行榜。
独立 insight:OPD 的真正设计对象是“教师优势的来源”
把这七篇放在一起,最有用的统一坐标不是 loss 名称,而是教师优势来自哪里:
可达证据优势
教师把原输入中难找的局部证据隔离出来。目标是让学生自己恢复同一证据,如 Vision-OPD、ViCuR。
过程提示优势
教师知道该走哪条推理路线,但不直接给终点,如 PTD-PO。风险是 hint 暗含答案与风格捷径。
策略/系统优势
教师已掌握目标动作协议和效率约束,如 HyperEyes。普通强模型未必是合适教师。
这带来一个比“选 KL 还是 JSD”更实用的设计规则:先证明教师优势可以由学生在部署输入和动作空间中重建,再决定如何蒸馏。若优势来自答案、不可访问工具、不同 tokenizer、不同动作语法或学生容量之外,token-level 对齐会把不可达目标变成高方差甚至误导性梯度;GNDPO 只能缩放这种信号,不能让它变正确。
工程上应如何使用这组工作
- 先做同一模型的“弱条件/强条件”成对诊断:全图 vs crop、无 hint vs hint、串行 vs 并行动作;没有可重复 gap,就不要急着上 OPD。
- 把 teacher privilege 分成可恢复证据、过程建议和答案信息,并分别做移除/替换消融;不要只报告完整 teacher。
- 默认只在失败或低置信轨迹启用昂贵 teacher,保留成功探索;同时跟踪 entropy、梯度范数、token KL 尾部和 teacher/student support overlap。
- 同时计算训练成本与推理成本。Vision/Imagine 降低了推理时工具调用,却把 crop 标注、教师重评和双 forward 成本移到训练期;HyperEyes 还依赖真实搜索服务。
- 验证必须包含“去掉显式区域提示”“错框/噪声 cue”“新视觉域”“teacher 行为不对齐”“更小 batch”这些反例,才能判断学到的是证据恢复还是训练协议记忆。
开放状态与可复现性
| 工作 | 当前公开状态 | 仍缺什么 |
|---|---|---|
| Vision-OPD | 训练/评测代码、6K 数据与模型集合已公开 | 完整数据合成上游与跨数据集独立复现 |
| Imagine-OPD | 论文给出项目地址 | 该地址当前不可公开访问;GT 区域数据与 checkpoint 未形成可核对闭环 |
| ViCuR | 训练代码与 Qwen3-VL 修改公开 | 需替换本地模型实现;数据 cue 构造与完整 checkpoint 复现成本较高 |
| 参数几何 | 公开 checkpoint delta 与 mask overlap 分析脚本 | 不是端到端训练复现包;关键 mask 是事后获得 |
| GNDPO | 基于训练框架的实现与 1B/2B/4B 脚本公开 | checkpoint、完整重复实验和更多 teacher/domain 验证 |
| PTD-PO | 训练实现与 recipe 公开 | README 仍将 hint 数据集列为待发布,脚本保留内部数据路径 |
| HyperEyes | SFT/RL 框架与少量 benchmark demo 已公开 | README 仍把完整 IMEB 与 30B/235B 权重列为待发布 |
因此目前最适合独立复验的是 Vision-OPD 的已发布数据/模型与 GNDPO 的窄设置;最难闭环的是 Imagine-OPD 和完整 HyperEyes。所有论文性能均属于发布方报告,本笔记没有重新训练 2B–235B 模型,也没有复跑在线搜索 benchmark。
证据边界与资料索引
主材料为 2026-07-16 发布的知乎想法及七张论文首页;逐篇核对截至 2026-07-30 可见的 arXiv 版本、正文/附录与官方项目。论文表格数字、训练稳定性和速度均按发布方报告;公式、公开仓库文件、发布清单与文内算术属于直接核验。没有独立复训大型模型或复跑需要在线搜索服务的评测。