核心判断
这篇文章值得读,因为它用一条清楚的演化线串起 Diffusion-DPO、Flow-DPO、Flow-GRPO、DanceGRPO、RewardDance,以及 Epipolar-DPO、VideoGPA、VGGRPO:先把人类偏好变成成对排序,再让生成器在线探索,最后尝试用几何约束代替昂贵且主观的人类标注。文章的方向判断是对的,但“RLHF / RLVR”这组二分仍然过粗。
优化器正在商品化
DPO、GRPO、ODE→SDE、少步采样等训练接口逐渐复用;真正稀缺的是能稳定排序视频轨迹的奖励与评测。
可验证是一条光谱
文字 OCR、目标计数较接近规则验证;极线误差和 4D 重建仍依赖估计器,只是比人类审美更客观,不是真值。
世界一致性不能只靠一项指标
几何稳定、主体运动、语义遵循、视觉质量可能相互冲突;单一奖励容易把复杂世界压扁成可投机的分数。
视频模型后训练的核心竞争会从“谁把 LLM 的 RL 算法搬得更快”,转向“谁能构造覆盖时间因果与三维世界、可审计且难被利用的奖励组合”。
原文的研究地图基本正确,但把“奖励”“探索”和“验证”各自压缩成了一个词。实现审计显示:奖励常把质量、安全、运动幅度混在同一分数里;ODE→SDE 的探索可能把轨迹推离视频流形;而同一个 reward model 同时参与训练与验收,会制造闭环自证。真正的分析单位应是完整的测量—探索—更新—独立验收系统。
为什么预训练之后还需要后训练
视频生成器的预训练目标通常要求模型预测噪声、速度场或干净样本,它回答的是“真实视频分布大致长什么样”。产品真正关心的却是另一组问题:是否严格遵循提示词、人物是否在运动中保持身份、镜头是否平滑、空间结构是否随视角变化仍自洽、动作是否符合物理规律。训练数据里这些属性既没有被显式标注,也未必同时出现,因此扩大预训练并不能保证它们被可靠提取出来。
Majumdar 用一个 KL 正则化的期望奖励目标概括后训练:
其中 \(c\) 是文本、首帧等条件,\(v\) 是生成视频,\(r(v,c)\) 是奖励,\(p_{\mathrm{ref}}\) 是预训练参考模型。第一项鼓励更高分的输出,第二项限制新模型离原模型过远。这个目标揭示了所有方法共同的三角关系:提高目标属性、保留基础能力、控制探索成本。
KL 约束能减缓模式坍塌和奖励投机,却不能证明奖励本身正确。若奖励错误地偏好某种伪影,贴近参考模型只会限制模型钻空子的幅度,不会把错误代理变成真实质量。
机制拆解:视频怎样变成一条可优化的策略
DPO:不显式训练奖励模型,也不等于没有奖励假设
DPO 接收同一条件下的优选视频 \(v_w\) 与劣选视频 \(v_l\),直接提高优选样本相对参考模型的概率优势。其理论桥梁是 KL 正则化最优策略的隐式奖励:
成对比较时,与条件有关的 \(\log Z(c)\) 抵消,于是可以直接优化策略概率比。它避开了“先训练标量奖励模型、再跑在线 RL”的两阶段流程;但 flow / diffusion 没有自回归模型那样可直接求和的序列似然,Diffusion-DPO 借助 ELBO,Flow-DPO 则以随机时间步上的速度预测误差差值代理整段视频的 log-ratio。这里优化的是可计算代理,不是精确视频似然。
DPO 常被放进 RLHF 家族讨论,但它本质上是离线偏好优化:模型不会在训练时持续生成新视频并探索奖励函数。它的优势是稳定、工程成本较低;代价是受离线偏好对覆盖范围约束,超出数据分布后仍可能错误外推。
GRPO:同题多采样,用组内相对分数替代 critic
GRPO 对同一提示生成一组样本,用组内标准化奖励估计 advantage:
高于组均值的轨迹被提升,低于组均值的轨迹被压低,不再额外训练一个高维视频 critic。与 DPO 相比,它能跟随当前模型的真实输出分布在线探索;但视频采样极贵,且同一提示下奖励方差太小时,组内相对优势会变得噪声化。
还有一个常被公式掩盖的信用分配问题:这些工作通常只在最终成片上计算一次奖励,再把同一个终局 advantage 广播给整条去噪轨迹。算法知道“这条轨迹整体好”,却不知道哪一个时间步修复了手指、哪一步破坏了遮挡。PPO clipping 能限制更新幅度,不能凭空产生细粒度时间归因。
Flow-GRPO:为什么要把 ODE 改写成 SDE
现代 flow matching 常用确定性 ODE 采样。只有初始噪声而没有逐步随机动作时,条件转移概率和逐步重要性比难以直接使用,探索也受限。Flow-GRPO 构造与原 ODE 在各时刻保持相同边缘分布的 SDE,引入可记录的随机转移;同时在训练采样时把 40 步降到 10 步,推理时恢复完整步数。论文报告这使数据采集得到超过 4 倍加速,而最终奖励没有明显下降。
实现中每一步的策略与参考策略都是共享方差的高斯转移,因此所谓 KL 可以化成条件均值偏移的平方:
这不是对最终视频分布做精确 KL,而是对离散 SDE 转移的局部、同方差近似。噪声越小,分母越小,同样的均值偏移惩罚越强;所以噪声日程、步长和 KL 系数共同定义了实际 trust region,不能只看论文写出的 \(\beta\)。
Flow-GRPO 原论文的主要实证是文本生成图像:GenEval 从 63% 到 95%,视觉文字准确率从 59% 到 92%。它提供了可迁移到视频 flow 模型的方法接口,但原论文并没有用同等规模的视频实验直接证明这些 headline 数字在视频上成立。视频验证主要来自同期 DanceGRPO。
| 公开训练协议 | 组大小 / 采样 | 算力 | 解读 |
|---|---|---|---|
| Flow-GRPO(SD3.5-M) | 每题 \(G=24\);训练 10 步,评测 40 步;噪声系数 0.7 | 24×A800;LoRA \(r=32\) | 组降到 12 或 6 时论文报告训练不稳;“省 critic”不等于低成本 |
| DanceGRPO(HunyuanVideo T2V) | 25 步;超过 10K prompts;曲线使用移动平均 | 64×H800 | 56% / 181% 是训练 reward 的相对提升,不能换算成人评幅度 |
| Epipolar-DPO(Wan2.1 1.3B) | 24K T2V + 30K I2V 三元组;LoRA,10K iterations | 生成数据约 1,980 A6000 GPU 小时;训练 4×A6000 两天 | 自动奖励省了标注,不一定省总计算 |
| VideoGPA(CogVideoX 5B) | 每个变体过滤后约 2.5K preference pairs;10K steps | 8×A100 | 小数据有效依赖强几何教师、候选多采样与严格过滤 |
| VGGRPO | 潜空间 4D reward;训练/推理采用不同步数 | 论文报告总计约 1,536 GPU 小时 | reward 计算 54.73s→41.33s(−24.5%),并非端到端训练加速 24.5% |
证据链:哪些结果最有说服力
| 工作 | 训练信号与方式 | 最强证据 | 应该保留的边界 |
|---|---|---|---|
| Diffusion-DPO | 851K 图像偏好对;离线 DPO | 把 DPO 的似然比目标适配到扩散过程,并用大规模众包偏好验证 | 是图像而非视频;ELBO 是似然近似 |
| Flow-DPO / VideoReward | 182K 人工视频偏好,覆盖 12 个生成模型;离线 DPO | 同时标注视觉质量、运动质量和文本对齐;Flow-DPO 优于论文内 SFT、Flow-RWR | 标注与评测共享质量轴;绝对泛化和商业模型可迁移性仍有限 |
| Flow-GRPO | 规则或模型奖励;在线 GRPO | ODE→SDE 与少步训练采样有清楚消融;10 步相对 40 步超过 4× 加速 | headline 实验是 T2I,不是 T2V;规则检测器本身仍可能被利用 |
| DanceGRPO | 图像/视频美学、对齐、运动与二值奖励;在线 GRPO | 覆盖 diffusion / rectified flow、T2I / T2V / I2V;HunyuanVideo 的视觉与运动奖励相对提升 56% / 181% | 百分比是相对代理分数,不是人类偏好同幅度提升;人评样本分别约 240 / 200 / 200 |
| RewardDance | VLM 生成式 pairwise judge,以 “Yes” token 概率为分数 | 从 1B 扩到 26B,并加入任务指令、参考示例和推理上下文;覆盖图像和视频后训练 | “高 reward variance = 未 hacking”只是诊断性代理,不能单独证明真实质量未被利用 |
| Epipolar-DPO | Sampson 极线误差自动构造偏好对;离线 DPO | 论文报告极线误差降低约 31%,人评一致性从 54% 提至 72% | 依赖对应点与基础矩阵估计;训练聚焦静态场景和相机运动 |
| VideoGPA | 几何基础模型重建点云并回投影,构造稠密偏好;离线 DPO | 比单一极线约束覆盖更完整的场景级三维一致性;少量偏好对也能改善多项几何指标 | 仍在 RGB 空间重复解码;核心几何先验来自外部模型,且假设偏静态 |
| VGGRPO | 潜空间 4D 几何模型;相机平滑 + 回投影奖励;在线 GRPO | 支持动态场景,跳过反复 VAE 解码,并能做潜空间测试时奖励引导 | “4D reward”仍是学习到的估计器;分离静态区域、相机与物体运动本身会出错 |
Flow-DPO 的真正贡献更偏数据,而非全新优化器
文章对此判断准确。VideoAlign 工作最有长期价值的部分,是 182K 人工偏好、12 个视频模型、多维质量轴,以及 26.5K 三元组的 VideoGen-RewardBench。Flow-DPO、Flow-RWR 和 Flow-NRG 是把既有 KL 正则化对齐框架接到 flow 模型上;数据定义了什么叫“更好”,优化器负责把这一判断写回生成器。若偏好数据把大动作误当作好运动、把高饱和度误当作高质量,算法会高效地放大这种偏差。
公开实现把这个风险写得比论文摘要更具体:VideoReward 的 Motion Quality 提示明确规定“视频大体静止或运动很少时给低分”,Visual Quality 又把安全性并入画质,并要求政治、暴力或成人内容获得最低分。也就是说 MQ 同时测运动正确性与运动幅度,VQ 同时测视觉质量与内容政策。此外,推理代码把标准化后的 VQ、MQ、TA 直接相加得到 Overall。这个接口简单可用,却默认三轴等权、可加且量纲已充分校准;策略完全可能通过增加无关运动来抬高 MQ,或让一个轴的极端分数掩盖另一个轴的退化。
RewardDance 的创新是奖励接口,而不是“推理天然正确”
传统 VLM reward model 常在隐藏状态后接回归头,并用 Bradley–Terry loss 拟合成对偏好。RewardDance 改为询问“图 2 是否优于图 1”,把 “Yes” 的 token 概率当作奖励,让训练与 VLM 原生 next-token prediction 对齐。扩展模型规模、加入任务化指令、参考样例和理由文本,确实给 reward scaling 一条更自然的路径。
但推理链只是提供更多判别上下文,不会自动让裁判校准。论文把训练后期 reward variance 较高解释为模型仍保持探索、没有模式坍塌,这是有用信号,却不是充分证明:高方差也可能来自裁判不稳定、prompt 难度差异或策略在多个漏洞间切换。真正的防 hacking 证据仍需要保留集人评、跨奖励模型复核和对抗样本。
RewardDance 把较高 reward variance 当作持续探索、抗 hacking 的证据;后续 SoliReward 却显示,标准 Bradley–Terry reward 在一组质量相近的高分样本上产生过大的组内 advantage,反而会驱动 GRPO 追逐异常高分特征。前者观察策略输出分数的离散程度,后者分析 reward margin 如何进入更新;两者并不逻辑矛盾,但足以说明“方差高/低”都不能脱离独立质量评测单独解释。
从论文公式走到公开实现:五个容易漏掉的事实
- “KL”不是统一对象。 DPO 的参考比、Flow-GRPO 的逐步高斯均值距离、LoRA 隐式参考和论文叙述中的最终分布 KL,数学与工程含义并不相同。
- 同一终局奖励被复用到所有去噪步。 这是低成本 credit assignment,不是逐帧、逐动作的因果监督。
- 组相对优势依赖 prompt 内可排序性。 同题样本全对、全错或分数挤在一起时,标准化会放大裁判噪声;扩大 group 能缓解,却线性增加 rollout 成本。
- 训练裁判与报告指标常不独立。 DanceGRPO 用 VideoAlign 训练 HunyuanVideo,也用 VideoAlign 报告核心增长;VideoAlign 自己的 benchmark 又沿用 VQ/MQ/TA 标注轴。人评能补强,但不是每个消融都有独立人评。
- 开源程度不等于可复现程度。 Flow-GRPO、DanceGRPO、VideoAlign、Epipolar-DPO、VideoGPA 有公开实现或配置;RewardDance 与 VGGRPO 的关键训练资产截至核验时并未形成同等完整的公开复现链。公开代码也无法替代模型、偏好数据、精确 commit、seed 与完整训练日志。
“可验证奖励”到底有多可验证
LLM 的数学 RLVR 常能把最终答案交给符号系统或单元测试,判定与模型审美相对独立。视频没有统一的最终答案。文章主动承认这里的 verifiability 定义并不清楚,并把“客观、非人类偏好”作为工作定义。这个口径方便建立研究版图,却容易把三类不同强度的证据混在一起。
规则可判定
目标个数、颜色、空间关系、屏幕文字是否匹配。接近硬验证,但仍依赖检测器、OCR 与数据模板。
模型可测量
美学、运动自然度、提示对齐,由 VLM 或 reward model 评分。可自动化,但本质是学习到的偏好代理。
物理代理约束
极线误差、相机轨迹平滑、点云回投影一致性。数学形式明确,但输入量来自不完美的匹配与重建模型。
Epipolar-DPO 的 Sampson error 是典型例子。对应点 \((x,x')\) 与基础矩阵 \(F\) 理想情况下满足:
它比“这段视频是否好看”客观得多,却只约束两帧投影几何,不直接证明深度正确、物体刚性、遮挡合理或动力学真实。低纹理表面、快速运动、滚动快门、反射、粒子、形变主体都可能让对应点或 \(F\) 的估计失真。奖励可复算,不等于被测属性已被无误差地识别。
VideoGPA 把约束从帧对扩展到场景级:几何基础模型估计相机与点云,聚合后再投影回各帧,比较投影与原始观测。VGGRPO 再用 4D 重建模型只聚合静态区域,并训练一个 latent geometry model 直接从视频潜变量预测几何,减少 RGB 解码成本。这条路线体现的不是“奖励越来越真”,而是奖励的覆盖面、计算成本与估计偏差在重新平衡。
VGGRPO 段落写道为解决静态场景假设,“VideoGPA utilizes geometric foundation models that work with dynamic scenes”。结合 VGGRPO 论文可确认,这里应为 VGGRPO:支持动态场景的是其基于 4D reconstruction 的 Latent Geometry Model;VideoGPA 正是它试图超越的静态 / RGB-space 前序方案。
原文发表后的两项反证:探索与奖励都可能成为故障源
SAGE-GRPO:ODE→SDE 不是免费探索
原文把 ODE 改写为 SDE 主要描述为“获得随机策略与探索”。后续 SAGE-GRPO 针对视频指出更尖锐的问题:若直接套用通用 SDE,注入噪声形成的探索区域可能偏离视频数据流形,表现为时间抖动、伪影和低质量 rollout;此时 reward 看到的不是模型能力边界,而是人为制造的离流形样本。它提出更贴近 flow trajectory 的 manifold-aware SDE、梯度范数均衡和移动锚点 + 逐步约束的双 trust region。这里最重要的不是又一个算法名,而是把探索质量加入了因果链:
如果第二项接近零,提高噪声只会获得更差、更难判的样本;“探索更强”不能直接等价为“学习信号更多”。
SoliReward:reward accuracy 不是 reward utility
SoliReward(CVPR 2026)直接研究视频 reward 的标注噪声与 post-training hacking。论文报告,单视频 Pass/Fail 标注的五人一致性高于传统成对比较:Krippendorff’s \(\alpha\) 为 0.4939 对 0.3516,原始一致率为 77.33% 对 54.67%。更有启发的是,普通 BT 与加入 win-tie 约束的 BT-WT 在 reward accuracy 上只差 0.64 个百分点(77.63% 对 78.27%),后者引导 HunyuanVideo 后训练时的 VBench2 却从 0.8693 提到 0.8999、MQ 从 0.1719 提到 0.3302。
这说明 reward model 的离线排序准确率并不能充分预测它被策略主动优化后的效用。部署后的策略会寻找 reward landscape 的尖峰,因此还要审计高分区 margin、组内 advantage、OOD 校准和 on-policy 对抗样本。奖励模型不是静态 benchmark 分类器,而是闭环控制器的一部分。
视频 RL 不是“生成器 + 一个分数”,而是一套会改变自身输入分布的测量系统。策略更新后,reward model 面对的样本不再服从训练时的偏好数据;探索噪声又会进一步改变分布。因而真正需要验证的是闭环稳定性:奖励在 on-policy 样本上是否仍校准、更新是否保持在可感知流形附近、独立裁判是否确认目标属性真实改善。
术语对齐
文章没有证明什么
- 没有证明视频 RL 已像 LLM RLVR 一样成熟。 文章自己指出该方向仍稀疏。多项工作发布时间集中在 2025–2026,实验协议、基础模型、奖励和评测集差异很大。
- 没有证明 DPO 或 GRPO 普遍优于其他后训练方法。 每篇论文只在自己的数据、模型和预算上比较有限基线;跨论文 headline 数字不能直接排序。
- 没有证明几何更好就等于视频整体更好。 极线与回投影约束偏向相机和刚性结构;人物表演、流体、衣物、光照变化等重要内容可能不服从同一假设。
- 没有给出端到端成本曲线。 在线视频 RL 要同题多采样、保存去噪轨迹、计算视频奖励并反向传播。少步采样和潜空间奖励降低成本,却不能从论文数字直接推出商业部署价格。
- 没有证明 ODE→SDE 的探索轨迹仍是高质量视频。 保持理论边缘分布不等于有限步离散、近似 score 与实际高维潜变量下不发生 off-manifold drift。
- 没有证明 reward benchmark accuracy 能预测 RL 效用。 策略会主动搜索训练分布外的高分区域;同等离线准确率的裁判可能产生完全不同的 margin 和更新稳定性。
- 演示视频不是独立评测。 原文展示的 Flow-DPO、DanceGRPO、VGGRPO 前后对比能帮助理解失败模式,但属于作者挑选的定性样例,不能替代盲测、分桶结果和失败案例。
需要统一基础模型、统一提示集和等算力预算,同时比较人类偏好奖励、VLM 奖励、极线奖励、场景级几何奖励与多奖励组合;再用未参与训练的人工盲评和下游 3D / 机器人任务验证。没有这组对照,就无法判断增益来自优化器、奖励质量、数据覆盖还是额外算力。
独立 Insight:奖励正在变成视频模型的“可观测世界接口”
1. 后训练的瓶颈会从 policy optimization 转向 observability
DPO 与 GRPO 解决的是“已知一个分数后怎样更新生成器”;更难的问题是从像素序列中观测出身份、深度、相机、主体运动、接触、因果和审美。视频世界的状态大多不可直接见,奖励模型实际承担了状态估计器的角色。奖励看不见的属性,策略就无法稳定优化;奖励误判的属性,策略就会学会利用。二次核验进一步表明,这个接口还是闭环的:策略每次进步都会改变 reward 的输入分布,因此 observability 必须和 on-policy calibration 一起评估。
2. 最有前景的不是单一万能 reward,而是分层 reward stack
更可靠的系统应把奖励分层:底层用 OCR、目标计数、相机轨迹与几何约束提供局部硬信号;中层用身份、动作和语义模型覆盖任务属性;顶层用人类或强 VLM 处理风格、叙事与整体偏好。各层分别记录置信度和适用条件,而不是先加权成一个不可解释的总分。发生冲突时,系统应该知道是“几何更稳但动作更僵”,而非只看到总奖励下降 0.03。
3. 潜空间奖励既是效率优化,也是新的耦合风险
VGGRPO 直接把生成潜变量接到几何模型,省去反复 VAE 解码,也减少真实图像几何模型面对生成像素时的域偏移。但这让 generator latent 与 judge latent 更紧密耦合:策略可能找到只在潜空间令几何头满意、解码后却未必对应真实改善的方向。需要用独立 RGB 几何模型、人评和下游重建任务做外部校准。
4. 在线 RL 与离线 DPO 不是替代关系,而是数据飞轮的两段
离线 DPO 适合把昂贵的人类或几何偏好稳定写入模型;在线 GRPO 适合在当前策略分布上发现新失败和新高分轨迹。更合理的闭环是:在线探索发现边界样本 → 多裁判与人工复核 → 沉淀高质量 preference pairs → 离线稳定更新 → 再进入受控在线探索。只做在线 RL 容易追逐瞬时漏洞,只做离线 DPO 则会被固定数据覆盖上限锁住。
5. 对机器人世界模型而言,评测价值高于画面美学
Majumdar 的研究背景使几何路线格外重要:如果视频模型用于机器人策略评估或视觉规划,生成一段“看起来合理”的视频远远不够。奖励必须对动作条件、接触事件、物体持久性与不确定性敏感。几何后训练是必要起点,但在能把像素漂亮度、三维一致性与可行动因果分开校准之前,视频模型不应被当作高风险策略的可信模拟器。
研究与工程实践建议
- 先定义失败分类,再选优化器。 提示不遵循、身份漂移、镜头抖动、几何破碎和物理错误需要不同观测器,不应被一个美学分数统治。
- 为每个 reward 写适用域。 明确它对静态 / 动态、刚性 / 非刚性、纹理、遮挡、镜头类型和视频长度的假设。
- 至少保留一个独立裁判。 训练奖励、早停指标和最终验收不能完全共享同一 VLM 或几何模型。
- 报告 Pareto front,而非单一总分。 同时呈现提示遵循、视觉质量、运动、几何、身份、多样性、计算成本与人评。
- 把不确定性写进奖励。 当对应点、相机位姿或 VLM 判断不可靠时,降低权重或拒绝更新,而不是把低置信估计当作精确标签。
- 保留失败样本和训练轨迹。 Reward hacking 往往先出现在少数 prompt 或运动类型;只汇报均值会掩盖局部坍塌。
- 把 reward 当成受攻击接口做红队。 主动搜索高 reward / 低人评分歧样本,检查静止、过度运动、闪烁、文字贴片、重复纹理和潜空间对抗方向。
- 做闭环而非静态验收。 在多个训练 checkpoint 上重测 reward 的 OOD 准确率、校准、margin 与独立人评,确认裁判没有随着 policy shift 失效。
证据边界与资料索引
主材料为 2026-07-18 发布的 X Article,正文、公式、三段示例视频及关联媒体均已核对。二次深挖完整核对八篇核心论文的正文与附录,并审计 VideoAlign、Flow-GRPO、DanceGRPO、Epipolar-DPO、VideoGPA 的公开实现 / 配置;SAGE-GRPO 与 SoliReward 用作会改变核心判断的后续反证。本文未复跑数百至数千 GPU 小时的大型视频训练,实验数字均按发布方报告陈述;代码路径只证明公开实现的当前行为,不证明论文私有训练与之逐位一致。方法分类、证据强弱、笔误识别与工程判断属于基于一手资料的分析。平台文章、预印本与仓库仍可能继续修订。
- Anirudha Majumdar:Understanding Video Models: Part III - RL Post-Training
- Diffusion Model Alignment Using Direct Preference Optimization
- Improving Video Generation with Human Feedback(Flow-DPO / VideoReward);官方项目页;官方实现
- Flow-GRPO: Training Flow Matching Models via Online RL;官方实现
- DanceGRPO: Unleashing GRPO on Visual Generation;官方实现
- RewardDance: Reward Scaling in Visual Generation
- Epipolar Geometry Improves Video Generation Models;官方项目页
- VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation;官方实现
- VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
- SAGE-GRPO: Manifold-Aware Exploration for RL in Video Generation;官方实现
- SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Reward Models(CVPR 2026)