核心判断
第一项工作抓到了 Agentic OPSD 的真问题,但把候选解答过早锁定成“补一条完整推理链”;第二项工作抓到了序列奖励的 token 归因缺口,但当前实现只是对错误 span 做负向 unlikelihood shaping,测试结果已经显示整体退化。两者最自然的组合不是把两种启发式直接相加,而是:先定位可能的因果分叉点,再让带最小特权信息的教师给出替代分布,最后用真实环境或独立评价验证替换后是否改善结果。
第一份报告:为什么 Agentic OPSD 比数学 OPSD 难
从 SFT、GRPO、OPD 到 OPSD
SFT 在固定参考轨迹上逐 token 模仿,信号密,但训练 prefix 与部署时模型自己生成的 prefix 不一致,容易出现 exposure bias。GRPO 直接在当前策略的 rollout 上学习,状态分布更贴近部署,却通常只有稀疏的最终奖励。OPD 让学生先 rollout,再请外部教师在学生真正访问到的 prefix 上给完整词表分布;OPSD 则用同一模型家族的冻结快照,通过额外答案、参考解或 rubric 构造临时教师。
OPSD 的抽象目标可写成:
其中 \(h_t\) 是学生 rollout 的当前前缀,\(z\) 是教师独有的 privileged information。原始 OPSD 论文的重要细节是:教师是冻结的初始策略快照,不是与学生同步更新的另一个角色;full-vocabulary forward KL 与 token clipping 对稳定性很关键。它的优势来自“当前策略状态 + 密集分布监督”,不是因为同一个模型凭空创造了新知识。
报告提出的具体假说
数学题的参考解通常同时给出最终答案和完整演算路径;Agent benchmark 的 privileged information 往往只包含正确动作、rubric 或最终状态,告诉教师“什么是对的”,却未必告诉它如何从学生已经走偏的 prefix 恢复。报告用航班人数和日期换算两个案例观察下一 token logit:只有补入完整解释后,教师才把正确 token 从明显劣势推到接近或超过错误 token。由此提出:先根据 rubric、错误定位与正确结果生成一条完整推理链,再把它作为 OPSD 的教师上下文。
第一份报告的证据边界:问题成立,处方尚未成立
两个精选案例只能证明“某些完整解释能翻转某个关键 token 的排序”,不能证明它在大规模训练中比原始 rubric 更稳。至少有四个反方向证据需要正面处理:
- RGSD 的直接反例:Rubric-Guided Self-Distillation 报告 raw rubric 比模型生成的 golden response 高约 2–3 个百分点;教师思维中还会大量出现 rubric 措辞,作者因此只蒸馏最终答案 token,而不是完整 thinking。
- Agent 动作本身可以是足够 PI:\(\pi\)-Distill 在 TravelPlanner、τ-Bench 与 GEM 上表明,正确 tool call、参数或 action frontier 就能让 OPSD 获益。Agent 的“WHAT”与“HOW”不是严格二分,动作序列与环境反馈本身已经携带程序性信息。
- 反馈增强可能制造 prompt mismatch:搜索 Agent 的 Feedback-Augmented Self-Distillation 发现,更丰富反馈会诱发输入无关的搜索模板与解码塌缩,最终仍显著落后 GRPO。
- 完整解释可能只是后见合理化:模型已经知道错误位置和正确终态后生成的链条可以很流畅,却未必忠实复原真实决策原因。将它放入教师 prompt 会把“解释得像”误当成“因果上对”。
更稳妥的研究问题不是“完整推理链能否提升 OPSD”,而是:什么是让教师在关键分叉处改判的最小充分 PI?可以把 PI 做成一条逐渐增量的信息阶梯,而不是 raw rubric 与 full CoT 的二选一。
| PI 层级 | 教师额外看到什么 | 主要收益假设 | 主要风险 |
|---|---|---|---|
| 0. 终局 | 最终成功/失败或正确终态 | 给方向,不泄露具体路径 | 过于稀疏 |
| 1. 定位 | 首个错误动作或违反约束的位置 | 减少无关 token KL | 定位可能只是症状 |
| 2. 规则 | 被违反的 rubric / constraint | 唤醒模型已有知识 | 规则措辞泄漏 |
| 3. 替代 | 正确下一动作、参数或短 span | 直接改变 pivot action margin | 可能过度 teacher-force |
| 4. 状态转移 | 正确动作及其真实环境返回 | 提供可验证的局部因果链 | 需要分支执行或环境 reset |
| 5. 完整解释 | 从起点到终局的自然语言 CoT | 最大化可读语义带宽 | 后见合理化、路径偏置与高 KL |
真正应该优化的是“关键 token 的有效信息 / 总 KL”比值,而不是 PI 的字数。对每个层级同时测正确动作 log-odds、无关 token KL、PI 泄漏率、最终成功率与未见模板迁移,才可能判断教师信息是在传知识,还是只在传风格与答案痕迹。
第二份报告:SpanRL 实际做了什么
方法先用 LLM-as-Judge 给整句翻译一个标量 reward,再读取 judge 的 reasoning,第二次调用模型抽取错误 span。对于第 \(i\) 条翻译、第 \(t\) 个 token,错误掩码记为 \(m_{i,t}\in\{0,1\}\),报告使用的修改是:
未被标错的 token 仍获得整句 advantage;错误 span 内 token 额外减 2。若整句表现较好、\(A_i\) 为正,这个操作可以把错误 token 的 advantage 翻成负数;若整句本来就差,错误 token 会被更强地压低。它本质上是序列级 GRPO + 局部负向 unlikelihood penalty,还不是完整的 token-level credit assignment,因为没有告诉模型应该提高哪个替代 token。
报告中的 span 抽取对 GPT-5.5 CoT→Span 参考标注达到 precision 0.878、recall 0.468、F1 0.610,高于 AutoMQM 与 xCOMET。高 precision 对负奖励是好事:错误惩罚的 false positive 通常比漏标更危险;但 recall 不到一半意味着参考错误中多数未被覆盖,而且这里的“金标准”仍是另一个模型生成的 span,不是人工 MQM/ESA。
第二份报告的结果审计:当前证据更像负结果
训练设置为 Qwen3-4B、WMT 英中 8K、每题 8 个 rollout、系数 2,整体 judge 与 CoT span 抽取都依赖 DeepSeek V4 Flash。训练早期挑选的 6 个术语案例中有 4 个在约 200 step 时优于基线,这可以作为 debug signal,但样本太少、两个 run 的训练长度又不同,不能推出总体错误 token 概率已经下降。
| 测试集 | 原始 LLM-as-Judge 基线胜 | SpanRL 胜 | 平局 | SpanRL 净差 |
|---|---|---|---|---|
| Flores(1012) | 35.0% | 23.8% | 41.2% | −11.2 pp |
| WMT24pp(960) | 39.1% | 29.1% | 31.8% | −10.0 pp |
| Challenge set(199) | 44.7% | 28.6% | 26.1% | −16.1 pp |
三个数据集方向完全一致:在排除平局后的 decisive cases 中,SpanRL 约只赢 39%–43%,而基线约赢 57%–61%。Challenge set 一行显示的三项比例只合计 99.4%,超出一位小数正常舍入能解释的范围,表格还需要核对原始计数。更重要的是,报告没有说明 pairwise 判胜由谁完成、是否与训练 judge 同源、是否随机交换 A/B 顺序、是否做人评或显著性检验。
案例也支持“奖励模型是瓶颈”而非“优化器还没训够”。HIV 自测例子里,基线出现中英混杂与不自然表达;“This movie is a W”例子里,两种模型都把 slang 误解为“W 级”。如果 judge 没有识别真正语义,span penalty 只能更有力地优化错误代理。
必须补上的 prior art:这条路线已有更强基线
2026 年 TACL 已发表 Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings。它同样从 xCOMET 取得错误 span,但进一步区分 correct、minor、major、critical,把字符级 span 与训练 tokenizer 的子词 offset 对齐,并把 REINFORCE/PPO 改造成真正的 token-level objective。论文在 NLLB、TOWER、GEMMA、多语言方向上与 sentence-level RL 对照,还加入两位专业译者的人评。
这意味着 SpanRL 当前不能把贡献写成“首次用错误 span 改善机器翻译 RL”。更有价值的重新定位是:研究噪声更大、但成本更低且适合开放式 LLM 翻译的 CoT-derived span,何时能在 group-relative RL 中提供净收益,何时会因为同源 judge 偏差而伤害泛化。
| 维度 | 当前 SpanRL | TACL token-level RL | 下一步应补 |
|---|---|---|---|
| 局部标签 | LLM CoT 二次抽取,二元 mask | xCOMET span + 错误严重度 | 人工 ESA/MQM 小样本校准 + 置信度/严重度 |
| token 对齐 | 报告未说明 | 字符 offset 与子词 overlap,冲突取最严重 | 公开中文分词、标点、跨 token span 的对齐规则 |
| 优化目标 | 在 GRPO advantage 上减固定常数 | token reward、value、GAE 与 PPO clipping | 比较负向、正向、双向与 severity-aware 目标 |
| 评价 | 模型 pairwise 表,协议未完整说明 | 多种独立自动指标 + 专业译者 | 训练 judge 之外的人评与异构 evaluator |
| 风险监控 | span 比例、平均 advantage | 长度、训练稳定性与多人评测 | 正确替代概率、熵、长度、风格与 reward gaming |
更早的 Reward Gaming in Conditional Text Generation 还给出直接警告:一个 token-level MT reward model 即使在静态测试集上表现很好,也可能把省略号或特定词误当成“无错误”捷径;RL 随后会把这些伪相关放大。Span 比例持续下降因此必须由独立质量指标解释,不能自证成功。
两项工作怎样真正合起来:诊断—干预—复验
一个简化的联合目标可以写成:
其中 \(q_t\) 是教师在最小 PI 下的替代分布,\(w_t\) 不只是二元 span mask,而应综合 span 置信度、错误严重度、PI 对正确候选 margin 的提升,以及替换后真实结果的增益。这样,第一份报告提供“应该把概率移到哪里”,第二份报告提供“值得在哪些位置计算昂贵教师分布”;全局 reward 则防止局部教师把模型带向看似合理、实际失败的路径。
最有信息量的下一轮实验
Agentic OPSD:先做规模化 logit probe,再训练
- 在数百到数千个已知错误 pivot 上比较:无 PI、终局、错误定位、raw rubric、正确动作、状态转移、full CoT。
- 主指标不要只看正确 token logit;同时看正确—错误 log-odds margin、有效动作集合概率质量、pivot KL、非 pivot KL 与教师熵。
- 做 chain shuffle、跨样本 PI swap、错误 CoT、等长度无关解释与语义等价改写。若 full CoT 在被打乱后仍有收益,说明模型可能学到格式或泄漏,而非因果推理。
- 训练时比较 raw rubric、最小 action PI、full CoT,以及“span/pivot 定位 + 局部 KL”;全都保留相同 outcome reward、teacher FLOPs 与 rollout budget。
SpanRL:先解释退化,再扩训练
- 把测试表还原为逐样本原始计数,明确 adjudicator、A/B 随机化、tie 定义与置信区间;先确认退化不是表格或评审协议错误。
- 记录错误 token 概率下降时,人工认可的正确替代概率是否上升、总正确候选质量是否上升,以及熵和 EOS 概率如何变化。
- 做五个最小消融:随机 span、位置匹配的 shuffled span、人类 span、独立模型 span、同源 judge span。它们能区分“局部信号有效”与“同源评价器自洽”。
- 把当前 binary negative-only 与 TACL severity map、正向替代蒸馏、正负双向目标并列;所有设置等 rollout、等 judge 调用、等 token 与多 seed。
- 评价至少拆成术语、否定、数字/实体、slang、长距离消歧、流畅性与风格;训练 judge 之外加入人工 ESA/MQM 或专业译者盲评。
组会上最值得追问的六个问题
术语边界
证据边界与资料索引
本文讨论的两份组会材料为未公开汇报,报告中的 logit 案例、训练曲线、表格和模型配置按其页面陈述还原;没有原始日志、代码、checkpoint、逐样本判胜记录或多 seed,因而不把这些结果写成独立复现。SpanRL 测试表的 challenge set 比例合计为 99.4%,判胜模型与协议也未在材料中完整给出,相关判断保留这一不确定性。
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
- Feedback-Augmented Self-Distillation Fails to Internalize Search-Agent Behavior
- Rubric-Guided Self-Distillation
- Privileged Information Distillation for Tool-Using Agents
- Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings
- xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection
- AutoMQM: The Devil Is in the Errors
- Reward Gaming in Conditional Text Generation
- MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
- 站内延伸:CriPO:Rubric RL 的局部信用路由;OPSD 中的 positive pressure 与 regretful teacher。
公开论文支持方法定义、已报告结果与已知失败模式;对两份组会方案的统一框架、因果审计和实验优先级属于本文分析推断。