Tech Analysis · Multimodal OPD

多模态 OPD 七篇工作:不是“蒸馏答案”,但也不能都叫“蒸馏证据”

这组工作共同把监督放到学生自己生成的轨迹上,却分别处理视觉聚焦、不可达特权、失败轨迹纠偏、梯度尺度、参数几何和搜索成本。把它们视作同一个趋势有启发性;把七篇的机制、证据和成绩混成一种 OPD,则会掩盖真正决定成败的变量。

第一遍:原帖到底讲了什么

原帖是一篇七项近期工作的速览,而不是论文式长论证。作者先给出总判断:多模态 on-policy distillation(OPD)不应只被理解为“teacher 教 student”,更关键的是监督信号是否稳定、视觉证据能否由学生在推理时恢复,以及推理过程能否被模型内化。随后把七篇工作分成四组。

视觉证据与细粒度推理

Vision-OPD 用局部裁剪教师教全图学生;Imagine-OPD 让教师看放大证据,学生把“看哪里、看到什么”写进文本推理;ViCuR 用源自原图的 cue 替代答案提示。

机制与稳定

参数几何论文解释 dense token supervision 最终为何仍形成小而稀疏的权重变化;GNDPO 用 batch 级归一化抑制极端 token KL 引起的梯度尖峰。

推理监督

PTD-PO 不把答案交给学生,而由带空间提示和中间推理提示的冻结参考模型,给失败 rollout 提供 token 级纠偏。

多模态搜索 Agent

HyperEyes 把视觉定位与检索合为可并发动作,用轨迹级效率奖励约束工具成本,再用 OPD 修正失败轨迹。

原帖最终把七篇归纳为一句话:多模态 OPD 正从“蒸馏答案”走向“蒸馏可恢复证据、稳定信号和推理过程”。这句话抓住了研究潮流,但它是主题归纳,不是已经被七篇共同证明的统一机制。

共同底座:OPD 为什么介于 SFT 与 RLVR 之间

普通监督微调或离线蒸馏在固定的教师轨迹上训练。模型部署后却会读取自己刚生成的前缀;一旦早期出错,它会进入训练数据没覆盖的状态。OPD 让学生先生成 \(y\sim\pi_\theta(\cdot\mid x)\),再让教师在这些真实学生前缀上给每个 token 分布,从而同时获得“学生状态分布”与“稠密教师信号”。

\[ \mathcal{L}_{\mathrm{OPD}} =\mathbb{E}_{x,\;y\sim\pi_\theta(\cdot\mid x)} \left[\frac{1}{|y|}\sum_t D\!\left(\pi_T(\cdot\mid x_T,y_{\lt t})\;\Vert\;\pi_\theta(\cdot\mid x_S,y_{\lt t})\right)\right]. \]

关键变量不是式子里的 \(D\) 一项。真正改变监督语义的是 \(x_T\) 与 \(x_S\) 的差:教师可能看同一输入但模型更强,也可能额外看 crop、标注框、visual cue、hint、参考答案或外部搜索结果。教师多看的信息能否由学生输入恢复,决定了它是在提示学生“重新发现证据”,还是要求学生模仿一个推理时不可达到的知情状态。

On-policy训练前缀来自当前学生,而不是预先固定的教师回答;它减少状态分布错配,但要持续生成 rollout。
Privileged teacher教师训练时获得学生推理时没有的额外上下文。额外信息可以是可恢复证据,也可以是答案泄漏,二者不能混称。
Dense signal每个生成位置都能获得教师—学生分布差,而不是只在最终答案处收到 0/1 reward;“稠密”不自动意味着“正确”或“稳定”。

七篇工作的完整机制地图

工作学生推理时看什么教师额外看什么核心操作它真正解决的问题
Vision-OPD带目标框的全图目标区域裁剪并放大 2×同一模型、不同视觉条件的 top-100 JSD;6.2K 合成样本局部能认、全图找不到的 regional-to-global gap
Imagine-OPD原图与问题,输出文字化“心理放大”轨迹GT 标注框裁剪、答案冻结教师对学生 rollout 做 reverse KL;19K V* 样本把显式 crop 工具的收益吸收到单次图像推理
ViCuR原图、问题、额外 sink cross-attention 模块由图像和问题导出的 visual cue 文本每五层用 sink token 聚合视觉 token;sampled-token OPD减少答案型 privilege 的 train-test mismatch
Dense Supervision, Sparse Updates不是新推理器分析多组已训练 checkpoint测 delta 稀疏度、谱能量、源权重主方向与 mask 干预OPD 的 dense 监督究竟在参数空间写了什么
GNDPOInternVL 学生 rolloutInternVL3.5-8B 教师 logits把 raw token KL 在整个 batch 上转成相对 advantage极端 teacher/student log-ratio 支配梯度的问题
PTD-PO原问题,无 hint答案无关的空间提示与高层推理提示只对失败轨迹启用 top-100 JSD,并与 GRPO 合并全错/困难组缺少可用 credit assignment
HyperEyes多实体图文搜索环境效率对齐的 235B 冻结教师并行 UGS 动作 + TRACE 成本奖励 + 失败 rollout OPD串行 crop/search 的轮次冗余与失败轨迹纠偏

Vision-OPD:把“看得见但找不到”变成自蒸馏信号

论文先测同一模型在全图与证据 crop 上的差距,ZoomBench 上局部输入比全图高 18–22 个点。训练时学生看带红框的全图,教师看对应 crop;二者其实是同一 Qwen3.5 模型在不同视觉上下文下的两个条件分布。4B 平均分从 70.68 升到 77.07,9B 从 73.37 升到 79.68。最扎实的因果证据不是与闭源模型横比,而是相同数据和 backbone 下胜过 SFT、GRPO、DAPO 与 answer-based OPSD。

边界也很清楚:训练问题由 397B 模型围绕已定位的小区域生成,学生提示里还有显式 bounding box。它证明的是“把已知候选区域的局部识别能力迁回全图条件”,并没有证明模型能在无框、开放世界图片中自主发现任意关键区域。

Imagine-OPD:内化的是受监督的区域描述,不是可验证的隐式图像

Imagine-OPD 更进一步:学生不仅直接回答,还输出“我要看哪里、靠近看会看到什么”的 textual imagination。冻结教师额外读取 GT evidence boxes 形成的 crops 与答案,在学生自己写出的前缀上给 reverse-KL 监督。4B 平均分 70.4→76.7,8B 72.6→77.1;报告推理速度比显式图像工具方法快 1.5–2.7×。注意力落在证据框内的比例也从 23.6→27.4、26.0→29.6。

但论文自己给出了重要失败信号:把教师改成随学生同步更新,三个基准准确率全部降到 0.0;说明稳定的冻结教师不是实现细节,而是方法成立条件。它还依赖 GT 框与答案,且注意力覆盖仍不到 30%。文本里声称“心理放大后看到了什么”不等于模型真的重建了局部像素;更准确的说法是,它学会生成与局部证据统计一致的语言化检查过程。

ViCuR:可恢复 privilege 是更好的目标,但不是数学上自动成立

ViCuR 反对把 gold answer 或 rationale 交给教师:这些信息在测试时不由原始输入唯一决定,学生可能学习答案条件下的说话模式。它改用描述图中相关证据的 cue,并让专用 sink-token cross-attention 在 prefill 阶段聚合视觉 token。平均来看,ViCuR 相对 answer-based OPSD 提升 1.19/1.24,相对更强教师 OPD 提升 0.64/1.08。

这组成绩值得正反两面一起读。正面是同一 teacher 配置下的对照比较清楚;负面是普通 OPSD 本身低于 base model,ViCuR 在 8B 同骨干设置只把 58.15 拉到 59.39,仍低于 base 的 60.76,更远低于 GRPO 的 65.35。部分单项也下降,如 8B 强教师的 MathVista 为 −1.4。论文把 cue 理想化成 \(S=f(X)\),于是 \(I(Y_t;S\mid X,Y_{\lt t})=0\);现实里 cue 来自外部模型或标注者,包含选择偏好与描述噪声,所以作者也承认这是“缩小”而非消除 privilege gap。

参数几何论文:稀疏是结果,不能直接当训练配方

六组 OPD checkpoint 的相对 Frobenius delta 只有 0.036%–0.142%,在 \(10^{-5}\) 阈值下有 66.72%–89.50% 坐标没有可见变化;更新通常 FFN-heavy、数值上满秩但谱能量集中,并避开源权重主奇异方向,偏向原权重幅值较小的坐标。用事后发现的约 17.5% OPD mask 重训,AIME24/25 峰值 35.10%,接近全量 35.52%;随机同密度 mask 只有 32.92%。

这证明特定子网具有功能意义,却还不是可直接省算力的算法:mask 是看完完整 OPD checkpoint 后才定义的“未来信息”,训练前并不知道要选哪些坐标。论文也发现 SGD 明显弱于 AdamW,说明“最终 delta 稀疏”不能推出“优化过程无需自适应缩放”。

GNDPO:稳定器有效,但收益比叙事克制

普通 sampled-token OPD 用 \(\log \pi_T(y_t)-\log \pi_\theta(y_t)\) 作为 token 信号。当学生走到教师几乎不接受的状态时,极端 log-ratio 会放大梯度。GNDPO 在整个 mini-batch 上标准化:

\[ \hat A^{\mathrm{norm}}_{i,t} =\frac{\hat A_{i,t}-\mu_{\mathcal B}}{\sigma_{\mathcal B}+\epsilon}. \]

65 个优化 step 中,标准 OPD 在约第 15 步出现大于 2.5 的梯度范数尖峰,GNDPO 将其压住;七项平均分相对 OPD,1B 为 31.6→32.0,2B 为 42.9→43.7,4B 为 53.9→54.5。这支持“更稳且小幅更好”,不支持把归一化称为新的能力来源。它只测试 Geometry3K 训练、InternVL3.5 家族、单一 8B 教师,batch 统计在小 batch 与跨难度混合时是否扭曲信号仍未充分回答。

PTD-PO:失败轨迹路由比“不给答案”更关键

PTD-PO 先用外部大模型生成结构化 hint,包含空间关注点和中间推理方向,但要求不泄露最终答案;学生照常在原问题上 rollout。若一组轨迹的成功率低于阈值,冻结 reference model 在 hint 上下文中重评失败前缀,用 top-100 JSD 给 dense correction;成功轨迹仍由 RLVR 学习。主表中总体平均分:2B 的 GRPO 50.63→PTD-PO 61.21,4B 为 68.06→71.23,8B 为 68.78→71.86。

“不给答案”并不等于没有答案信息:hint 由 Qwen3-VL-235B 与 Gemini-3-Pro 参考训练样本生成,本身可能编码接近答案的路径。更重要的实验证据是选择性路由:2B/4B/8B 在阈值 1.0 时收益最大,而低阈值在 8B 甚至负收益。这说明方法更像一个对能力匹配困难样本启用的纠偏器;当强模型失败样本太少或 hint 不够强时,收益会收缩。

HyperEyes:OPD 是最后一段增益,不是整套系统的代名词

HyperEyes 先把 “crop → search” 两步动作合成统一 grounded search,一轮可对多个实体并发检索;再从 271K 问题池筛成 30K 最短成功轨迹做 SFT。RL 阶段的 TRACE 同时看工具调用轮数 \(t_c\) 与总调用数 \(t_s\),并逐轮收紧成功参考,防止模型把所有请求塞进一轮来刷“低轮数”。只有失败轨迹再由效率对齐的 235B 教师提供 OPD。

30B 从 SFT 平均 58.8/2.9 轮,到 TRACE 62.7/2.2,再到 TRACE+OPD 64.0/2.2;所以 OPD 的可归因增益约 1.3 点。完整系统相对 VDR 的 +9.9 点与 5.3× 更少轮次,主要来自新动作空间、数据过滤和效率奖励共同作用。另一个关键反例是换成普通 Qwen3-VL-235B 教师后平均分从 64.0 掉到 46.3:teacher 更大不够,teacher 的行为策略必须与目标动作空间一致。

第二遍:证据审计与独立判断

原帖哪些判断最可靠

原帖最需要收紧的地方

“可恢复”不能只按信息来源判定

证据理论上存在于原图,不表示当前学生有分辨率、注意力带宽和表示能力把它恢复出来。Vision-OPD 预先给框,Imagine-OPD 训练用 GT 框,ViCuR 加新 cross-attention 模块;三篇都在工程上额外提供了“哪里值得看”的偏置。

七篇也没有共同证明“推理过程已被内化”。目前更强的证据是 benchmark 改善、局部注意力覆盖增加和工具轮次下降;但文本 CoT 是否忠实反映视觉计算、cue 是否带入答案捷径、模型是否在分布外还能自主找到新证据,仍缺因果干预。尤其 Imagine-OPD 的“想象视觉细节”可能是对训练分布的语言化预测,而不是内部生成可检验的高分辨率表征。

此外,跨论文 headline 不可直接排序。Vision/Imagine 使用的 backbone、数据、版本和基准不同;ViCuR 主要在数学/几何推理上训练;GNDPO 只做 InternVL/Geometry3K;HyperEyes 又处于有检索环境和 LLM judge 的 Agent 任务。平均分只是各自实验内的指标,不是七种方法的统一排行榜。

独立 insight:OPD 的真正设计对象是“教师优势的来源”

把这七篇放在一起,最有用的统一坐标不是 loss 名称,而是教师优势来自哪里:

可达证据优势

教师把原输入中难找的局部证据隔离出来。目标是让学生自己恢复同一证据,如 Vision-OPD、ViCuR。

过程提示优势

教师知道该走哪条推理路线,但不直接给终点,如 PTD-PO。风险是 hint 暗含答案与风格捷径。

策略/系统优势

教师已掌握目标动作协议和效率约束,如 HyperEyes。普通强模型未必是合适教师。

这带来一个比“选 KL 还是 JSD”更实用的设计规则:先证明教师优势可以由学生在部署输入和动作空间中重建,再决定如何蒸馏。若优势来自答案、不可访问工具、不同 tokenizer、不同动作语法或学生容量之外,token-level 对齐会把不可达目标变成高方差甚至误导性梯度;GNDPO 只能缩放这种信号,不能让它变正确。

工程上应如何使用这组工作

  1. 先做同一模型的“弱条件/强条件”成对诊断:全图 vs crop、无 hint vs hint、串行 vs 并行动作;没有可重复 gap,就不要急着上 OPD。
  2. 把 teacher privilege 分成可恢复证据、过程建议和答案信息,并分别做移除/替换消融;不要只报告完整 teacher。
  3. 默认只在失败或低置信轨迹启用昂贵 teacher,保留成功探索;同时跟踪 entropy、梯度范数、token KL 尾部和 teacher/student support overlap。
  4. 同时计算训练成本与推理成本。Vision/Imagine 降低了推理时工具调用,却把 crop 标注、教师重评和双 forward 成本移到训练期;HyperEyes 还依赖真实搜索服务。
  5. 验证必须包含“去掉显式区域提示”“错框/噪声 cue”“新视觉域”“teacher 行为不对齐”“更小 batch”这些反例,才能判断学到的是证据恢复还是训练协议记忆。

开放状态与可复现性

工作当前公开状态仍缺什么
Vision-OPD训练/评测代码、6K 数据与模型集合已公开完整数据合成上游与跨数据集独立复现
Imagine-OPD论文给出项目地址该地址当前不可公开访问;GT 区域数据与 checkpoint 未形成可核对闭环
ViCuR训练代码与 Qwen3-VL 修改公开需替换本地模型实现;数据 cue 构造与完整 checkpoint 复现成本较高
参数几何公开 checkpoint delta 与 mask overlap 分析脚本不是端到端训练复现包;关键 mask 是事后获得
GNDPO基于训练框架的实现与 1B/2B/4B 脚本公开checkpoint、完整重复实验和更多 teacher/domain 验证
PTD-PO训练实现与 recipe 公开README 仍将 hint 数据集列为待发布,脚本保留内部数据路径
HyperEyesSFT/RL 框架与少量 benchmark demo 已公开README 仍把完整 IMEB 与 30B/235B 权重列为待发布

因此目前最适合独立复验的是 Vision-OPD 的已发布数据/模型与 GNDPO 的窄设置;最难闭环的是 Imagine-OPD 和完整 HyperEyes。所有论文性能均属于发布方报告,本笔记没有重新训练 2B–235B 模型,也没有复跑在线搜索 benchmark。

证据边界与资料索引

主材料为 2026-07-16 发布的知乎想法及七张论文首页;逐篇核对截至 2026-07-30 可见的 arXiv 版本、正文/附录与官方项目。论文表格数字、训练稳定性和速度均按发布方报告;公式、公开仓库文件、发布清单与文内算术属于直接核验。没有独立复训大型模型或复跑需要在线搜索服务的评测。