Tech Analysis · Credit Assignment · Post-training

从完整推理链到错误 Span:Agentic OPSD 与 SpanRL 的信用分配审计

两项探索看似一个研究 Agent、一个研究机器翻译,实质上都在追问:当最终奖励只告诉模型“整条轨迹好不好”时,怎样把监督路由到真正改变结果的局部决策。最重要的判断是,完整解释不等于因果解释,错误位置也不等于错误原因;真正缺少的是“诊断—干预—复验”闭环。

核心判断

第一项工作抓到了 Agentic OPSD 的真问题,但把候选解答过早锁定成“补一条完整推理链”;第二项工作抓到了序列奖励的 token 归因缺口,但当前实现只是对错误 span 做负向 unlikelihood shaping,测试结果已经显示整体退化。两者最自然的组合不是把两种启发式直接相加,而是:先定位可能的因果分叉点,再让带最小特权信息的教师给出替代分布,最后用真实环境或独立评价验证替换后是否改善结果。

完整链 ≠ 最好 PI更长的后见解释会增加泄漏、教师—学生 KL 与路径偏置;已有 Agent/Rubric 蒸馏结果并不支持“信息越多越好”。
错误 Span ≠ 因果 Token被圈出的词可能只是早先错误决策的症状;直接降概率不能保证正确替代词的概率上升。
测试表已经反向SpanRL 在三个测试集的 pairwise 胜率都低于原始 LLM-as-Judge 基线,不能仅称为“泛化较弱”。
统一的风险 两项方法都使用完整 rollout 之后得到的后见信息,却把它写回生成过程中的局部 token。这个信号是 on-policy 的,但不自动是因果的:数据来自当前策略,只能保证“在自己访问过的状态上学习”,不能保证 evaluator 圈出的局部位置真正导致了最终成败。

共同母题:序列奖励把局部功过压成了一个数

在 GRPO 一类方法里,同一输入采样多条回答或轨迹,按组内奖励计算 advantage。简化地写,第 \(i\) 条轨迹的 advantage 为:

\[ A_i=\frac{R_i-\mu_R}{\sigma_R+\epsilon}. \]

随后 \(A_i\) 被广播给整条轨迹中的所有 token。翻译里,一条总体不错的句子可能仍含术语误译;Agent 里,一条最终失败的轨迹也可能包含正确的查询、约束检查或中间动作。序列级 advantage 会把这些局部差异抹平:好轨迹里的错误 token 被一起抬高,坏轨迹里的正确 token 被一起压低。

路线局部信号从哪里来能回答什么不能自动回答什么
GRPO / RLVR最终 reward 或 verifier整条轨迹相对同组更好还是更坏哪一步造成结果、正确替代是什么
Agentic OPSD带 privileged information 的教师分布教师在当前 prefix 更偏好哪些后续 token教师偏好是否来自真正因果知识,还是后见路径偏置
SpanRL评价模型圈出的错误文本片段哪些已生成 token 看起来有问题错误从何处开始、应该把概率转移给哪个候选

所以两份报告不是彼此独立的题目。第一份提供“正向目标分布”,却缺少可靠的局部路由;第二份提供“局部错误掩码”,却没有正向替代目标。它们恰好暴露了彼此缺少的半边。

第一份报告:为什么 Agentic OPSD 比数学 OPSD 难

从 SFT、GRPO、OPD 到 OPSD

SFT 在固定参考轨迹上逐 token 模仿,信号密,但训练 prefix 与部署时模型自己生成的 prefix 不一致,容易出现 exposure bias。GRPO 直接在当前策略的 rollout 上学习,状态分布更贴近部署,却通常只有稀疏的最终奖励。OPD 让学生先 rollout,再请外部教师在学生真正访问到的 prefix 上给完整词表分布;OPSD 则用同一模型家族的冻结快照,通过额外答案、参考解或 rubric 构造临时教师。

OPSD 的抽象目标可写成:

\[ \mathcal L_{\mathrm{OPSD}} =\sum_t D_{\mathrm{KL}}\!\left( \operatorname{sg}\!\left[q(\cdot\mid h_t,z)\right] \,\|\,p_\theta(\cdot\mid h_t) \right), \]

其中 \(h_t\) 是学生 rollout 的当前前缀,\(z\) 是教师独有的 privileged information。原始 OPSD 论文的重要细节是:教师是冻结的初始策略快照,不是与学生同步更新的另一个角色;full-vocabulary forward KL 与 token clipping 对稳定性很关键。它的优势来自“当前策略状态 + 密集分布监督”,不是因为同一个模型凭空创造了新知识。

报告提出的具体假说

数学题的参考解通常同时给出最终答案和完整演算路径;Agent benchmark 的 privileged information 往往只包含正确动作、rubric 或最终状态,告诉教师“什么是对的”,却未必告诉它如何从学生已经走偏的 prefix 恢复。报告用航班人数和日期换算两个案例观察下一 token logit:只有补入完整解释后,教师才把正确 token 从明显劣势推到接近或超过错误 token。由此提出:先根据 rubric、错误定位与正确结果生成一条完整推理链,再把它作为 OPSD 的教师上下文。

这一步最有价值的地方 两个 logit probe 不是训练结果,却是很好的机制诊断:它没有只问“加提示后答案对不对”,而是直接看 privileged context 是否真的改变关键分叉处的相对概率。这种局部 margin 测量值得扩大到成规模实验。

第一份报告的证据边界:问题成立,处方尚未成立

两个精选案例只能证明“某些完整解释能翻转某个关键 token 的排序”,不能证明它在大规模训练中比原始 rubric 更稳。至少有四个反方向证据需要正面处理:

更稳妥的研究问题不是“完整推理链能否提升 OPSD”,而是:什么是让教师在关键分叉处改判的最小充分 PI?可以把 PI 做成一条逐渐增量的信息阶梯,而不是 raw rubric 与 full CoT 的二选一。

PI 层级教师额外看到什么主要收益假设主要风险
0. 终局最终成功/失败或正确终态给方向,不泄露具体路径过于稀疏
1. 定位首个错误动作或违反约束的位置减少无关 token KL定位可能只是症状
2. 规则被违反的 rubric / constraint唤醒模型已有知识规则措辞泄漏
3. 替代正确下一动作、参数或短 span直接改变 pivot action margin可能过度 teacher-force
4. 状态转移正确动作及其真实环境返回提供可验证的局部因果链需要分支执行或环境 reset
5. 完整解释从起点到终局的自然语言 CoT最大化可读语义带宽后见合理化、路径偏置与高 KL

真正应该优化的是“关键 token 的有效信息 / 总 KL”比值,而不是 PI 的字数。对每个层级同时测正确动作 log-odds、无关 token KL、PI 泄漏率、最终成功率与未见模板迁移,才可能判断教师信息是在传知识,还是只在传风格与答案痕迹。

第二份报告:SpanRL 实际做了什么

方法先用 LLM-as-Judge 给整句翻译一个标量 reward,再读取 judge 的 reasoning,第二次调用模型抽取错误 span。对于第 \(i\) 条翻译、第 \(t\) 个 token,错误掩码记为 \(m_{i,t}\in\{0,1\}\),报告使用的修改是:

\[ \widetilde A_{i,t}=A_i-c\,m_{i,t}, \qquad c=2. \]

未被标错的 token 仍获得整句 advantage;错误 span 内 token 额外减 2。若整句表现较好、\(A_i\) 为正,这个操作可以把错误 token 的 advantage 翻成负数;若整句本来就差,错误 token 会被更强地压低。它本质上是序列级 GRPO + 局部负向 unlikelihood penalty,还不是完整的 token-level credit assignment,因为没有告诉模型应该提高哪个替代 token。

报告中的 span 抽取对 GPT-5.5 CoT→Span 参考标注达到 precision 0.878、recall 0.468、F1 0.610,高于 AutoMQM 与 xCOMET。高 precision 对负奖励是好事:错误惩罚的 false positive 通常比漏标更危险;但 recall 不到一半意味着参考错误中多数未被覆盖,而且这里的“金标准”仍是另一个模型生成的 span,不是人工 MQM/ESA。

一个容易被误读的日志 GRPO 的组内 advantage 均值设计上接近 0。减去非负 mask 后,自然有
\[ \mathbb E[\widetilde A] =\mathbb E[A]-c\,\mathbb E[m] \approx -c\,\mathbb E[m]. \]
因此训练日志中整体 advantage 降到约 −0.1,主要是目标函数的代数结果,不是“模型学会避开错误”的独立证据。错误 span 比例下降也有两种解释:翻译真的变好,或策略学会进入 span extractor 的盲区。

第二份报告的结果审计:当前证据更像负结果

训练设置为 Qwen3-4B、WMT 英中 8K、每题 8 个 rollout、系数 2,整体 judge 与 CoT span 抽取都依赖 DeepSeek V4 Flash。训练早期挑选的 6 个术语案例中有 4 个在约 200 step 时优于基线,这可以作为 debug signal,但样本太少、两个 run 的训练长度又不同,不能推出总体错误 token 概率已经下降。

测试集原始 LLM-as-Judge 基线胜SpanRL 胜平局SpanRL 净差
Flores(1012)35.0%23.8%41.2%−11.2 pp
WMT24pp(960)39.1%29.1%31.8%−10.0 pp
Challenge set(199)44.7%28.6%26.1%−16.1 pp

三个数据集方向完全一致:在排除平局后的 decisive cases 中,SpanRL 约只赢 39%–43%,而基线约赢 57%–61%。Challenge set 一行显示的三项比例只合计 99.4%,超出一位小数正常舍入能解释的范围,表格还需要核对原始计数。更重要的是,报告没有说明 pairwise 判胜由谁完成、是否与训练 judge 同源、是否随机交换 A/B 顺序、是否做人评或显著性检验。

案例也支持“奖励模型是瓶颈”而非“优化器还没训够”。HIV 自测例子里,基线出现中英混杂与不自然表达;“This movie is a W”例子里,两种模型都把 slang 误解为“W 级”。如果 judge 没有识别真正语义,span penalty 只能更有力地优化错误代理。

负向更新不指定去向降低错误 token 概率后,softmax 概率质量可能流向正确词,也可能流向另一个错误词、套话或更保守表达。
同源 judge 形成相关误差同一模型家族既决定整句 reward,又生成并抽取 span;系统性盲点会同时污染“这句多好”和“哪里错了”。
后见 span 未必是首因某个术语表面错误可能由更早的语境消歧失败造成;只惩罚可见字符串,模型学不到正确的语义分叉。
固定系数没有尺度校准\(c=2\) 与归一化 advantage、错误严重度、span 置信度和长度都无关,会破坏组内零均值并改变整体优化尺度。

必须补上的 prior art:这条路线已有更强基线

2026 年 TACL 已发表 Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings。它同样从 xCOMET 取得错误 span,但进一步区分 correct、minor、major、critical,把字符级 span 与训练 tokenizer 的子词 offset 对齐,并把 REINFORCE/PPO 改造成真正的 token-level objective。论文在 NLLB、TOWER、GEMMA、多语言方向上与 sentence-level RL 对照,还加入两位专业译者的人评。

这意味着 SpanRL 当前不能把贡献写成“首次用错误 span 改善机器翻译 RL”。更有价值的重新定位是:研究噪声更大、但成本更低且适合开放式 LLM 翻译的 CoT-derived span,何时能在 group-relative RL 中提供净收益,何时会因为同源 judge 偏差而伤害泛化。

维度当前 SpanRLTACL token-level RL下一步应补
局部标签LLM CoT 二次抽取,二元 maskxCOMET span + 错误严重度人工 ESA/MQM 小样本校准 + 置信度/严重度
token 对齐报告未说明字符 offset 与子词 overlap,冲突取最严重公开中文分词、标点、跨 token span 的对齐规则
优化目标在 GRPO advantage 上减固定常数token reward、value、GAE 与 PPO clipping比较负向、正向、双向与 severity-aware 目标
评价模型 pairwise 表,协议未完整说明多种独立自动指标 + 专业译者训练 judge 之外的人评与异构 evaluator
风险监控span 比例、平均 advantage长度、训练稳定性与多人评测正确替代概率、熵、长度、风格与 reward gaming

更早的 Reward Gaming in Conditional Text Generation 还给出直接警告:一个 token-level MT reward model 即使在静态测试集上表现很好,也可能把省略号或特定词误当成“无错误”捷径;RL 随后会把这些伪相关放大。Span 比例持续下降因此必须由独立质量指标解释,不能自证成功。

两项工作怎样真正合起来:诊断—干预—复验

1. 诊断用 rubric、span 模型或轨迹比较提出候选错误分叉,不把定位直接当真值。
2. 最小干预给教师最短必要 PI,只生成正确下一动作、替代词或局部状态转移。
3. 反事实复验替换候选 token/action 后继续 rollout,检查真实 reward 或独立质量是否提高。
4. 局部路由仅对通过复验的 pivot 做正向分布蒸馏,同时保留全局 outcome objective。

一个简化的联合目标可以写成:

\[ \mathcal L =\mathcal L_{\mathrm{GRPO}} +\lambda\sum_t w_t\, D_{\mathrm{KL}}\!\left( \operatorname{sg}[q_t]\,\|\,p_{\theta,t} \right), \]

其中 \(q_t\) 是教师在最小 PI 下的替代分布,\(w_t\) 不只是二元 span mask,而应综合 span 置信度、错误严重度、PI 对正确候选 margin 的提升,以及替换后真实结果的增益。这样,第一份报告提供“应该把概率移到哪里”,第二份报告提供“值得在哪些位置计算昂贵教师分布”;全局 reward 则防止局部教师把模型带向看似合理、实际失败的路径。

最关键的 insight 未来的单位不是“token-level reward”,而是经反事实验证的 decision pivot。语言 token 只是表面载体;真正需要分配信用的是一次语义选择、一次工具调用、一个约束检查或一个状态转移。

最有信息量的下一轮实验

Agentic OPSD:先做规模化 logit probe,再训练

  1. 在数百到数千个已知错误 pivot 上比较:无 PI、终局、错误定位、raw rubric、正确动作、状态转移、full CoT。
  2. 主指标不要只看正确 token logit;同时看正确—错误 log-odds margin、有效动作集合概率质量、pivot KL、非 pivot KL 与教师熵。
  3. 做 chain shuffle、跨样本 PI swap、错误 CoT、等长度无关解释与语义等价改写。若 full CoT 在被打乱后仍有收益,说明模型可能学到格式或泄漏,而非因果推理。
  4. 训练时比较 raw rubric、最小 action PI、full CoT,以及“span/pivot 定位 + 局部 KL”;全都保留相同 outcome reward、teacher FLOPs 与 rollout budget。

SpanRL:先解释退化,再扩训练

  1. 把测试表还原为逐样本原始计数,明确 adjudicator、A/B 随机化、tie 定义与置信区间;先确认退化不是表格或评审协议错误。
  2. 记录错误 token 概率下降时,人工认可的正确替代概率是否上升、总正确候选质量是否上升,以及熵和 EOS 概率如何变化。
  3. 做五个最小消融:随机 span、位置匹配的 shuffled span、人类 span、独立模型 span、同源 judge span。它们能区分“局部信号有效”与“同源评价器自洽”。
  4. 把当前 binary negative-only 与 TACL severity map、正向替代蒸馏、正负双向目标并列;所有设置等 rollout、等 judge 调用、等 token 与多 seed。
  5. 评价至少拆成术语、否定、数字/实体、slang、长距离消歧、流畅性与风格;训练 judge 之外加入人工 ESA/MQM 或专业译者盲评。

组会上最值得追问的六个问题

PI 的最小充分性为什么一定需要完整 CoT?正确动作、错误位置或环境 state delta 是否已经足够改变 pivot margin?
后见解释的忠实性生成链条是否经过真实环境 replay?如果只是根据正确答案编出的合理故事,怎样证明它不是泄漏?
Span 金标准GPT-5.5 CoT→Span 为什么可以当 reference?在人类 MQM/ESA 标注上 precision、recall 和严重度校准是多少?
评价器独立性训练 reward、错误 span、测试 pairwise winner 是否由同一模型家族决定?若是,怎样排除 correlated blind spot?
概率质量去向被惩罚 token 的概率下降后,正确替代、其他错误替代、熵和 EOS 各变化多少?
prior-art 差异相对 TACL 2026 的 xCOMET severity token-level PPO,SpanRL 的不可替代贡献究竟是 CoT span、更低调用成本,还是对 LLM-GRPO 的适配?

术语边界

On-policy训练 prefix 来自当前策略自己的 rollout;它减少状态分布错位,但不保证局部监督无偏或因果正确。
Privileged Information只在训练教师侧可见的答案、rubric、动作、状态或解释;其价值取决于任务效用与教师—学生分布差距的共同作用。
Credit Assignment判断序列结果应归因给哪些局部决策。给每个 token 一个数只是实现形式,不等于归因已经正确。
Hindsight Attribution在看完整输出和终局后定位局部位置;适合诊断,但若不做反事实复验,不能直接解释该位置对结果的因果贡献。
Unlikelihood Shaping降低已生成错误 token 的概率;它回答“不要这个”,不回答“应该要哪个”。
Decision Pivot替换后会实质改变后续状态或最终结果的语义分叉点,可能对应一个 token、一个 span、一个工具调用或一组参数。

证据边界与资料索引

本文讨论的两份组会材料为未公开汇报,报告中的 logit 案例、训练曲线、表格和模型配置按其页面陈述还原;没有原始日志、代码、checkpoint、逐样本判胜记录或多 seed,因而不把这些结果写成独立复现。SpanRL 测试表的 challenge set 比例合计为 99.4%,判胜模型与协议也未在材料中完整给出,相关判断保留这一不确定性。

公开论文支持方法定义、已报告结果与已知失败模式;对两份组会方案的统一框架、因果审计和实验优先级属于本文分析推断。