TECH ANALYSIS · VIDEO GENERATION · RL POST-TRAINING

视频模型 RL 后训练:真正的瓶颈不是优化器,而是奖励能否代表世界

Anirudha Majumdar 的综述准确抓住了视频生成后训练从人类偏好走向自动奖励的主线。本文进一步核对八篇论文的正文与附录、五个官方实现和训练配置,并纳入 SAGE-GRPO、SoliReward 两项后续反证。更完整的结论是:DPO、GRPO 只是把奖励写回生成器的管道;视频 RL 的能力上限,取决于奖励是否覆盖真实目标、探索是否仍贴着视频流形,以及评测是否独立于训练裁判。

核心判断

这篇文章值得读,因为它用一条清楚的演化线串起 Diffusion-DPO、Flow-DPO、Flow-GRPO、DanceGRPO、RewardDance,以及 Epipolar-DPO、VideoGPA、VGGRPO:先把人类偏好变成成对排序,再让生成器在线探索,最后尝试用几何约束代替昂贵且主观的人类标注。文章的方向判断是对的,但“RLHF / RLVR”这组二分仍然过粗。

优化器正在商品化

DPO、GRPO、ODE→SDE、少步采样等训练接口逐渐复用;真正稀缺的是能稳定排序视频轨迹的奖励与评测。

可验证是一条光谱

文字 OCR、目标计数较接近规则验证;极线误差和 4D 重建仍依赖估计器,只是比人类审美更客观,不是真值。

世界一致性不能只靠一项指标

几何稳定、主体运动、语义遵循、视觉质量可能相互冲突;单一奖励容易把复杂世界压扁成可投机的分数。

一句话结论

视频模型后训练的核心竞争会从“谁把 LLM 的 RL 算法搬得更快”,转向“谁能构造覆盖时间因果与三维世界、可审计且难被利用的奖励组合”。

二次深挖后的校准

原文的研究地图基本正确,但把“奖励”“探索”和“验证”各自压缩成了一个词。实现审计显示:奖励常把质量、安全、运动幅度混在同一分数里;ODE→SDE 的探索可能把轨迹推离视频流形;而同一个 reward model 同时参与训练与验收,会制造闭环自证。真正的分析单位应是完整的测量—探索—更新—独立验收系统。

为什么预训练之后还需要后训练

视频生成器的预训练目标通常要求模型预测噪声、速度场或干净样本,它回答的是“真实视频分布大致长什么样”。产品真正关心的却是另一组问题:是否严格遵循提示词、人物是否在运动中保持身份、镜头是否平滑、空间结构是否随视角变化仍自洽、动作是否符合物理规律。训练数据里这些属性既没有被显式标注,也未必同时出现,因此扩大预训练并不能保证它们被可靠提取出来。

Majumdar 用一个 KL 正则化的期望奖励目标概括后训练:

\[ \max_{p_\theta}\;\mathbb{E}_{c\sim\mathcal{D},\,v\sim p_\theta(\cdot\mid c)} \left[r(v,c)-\beta D_{\mathrm{KL}}\!\left(p_\theta(\cdot\mid c)\,\|\,p_{\mathrm{ref}}(\cdot\mid c)\right)\right]. \]

其中 \(c\) 是文本、首帧等条件,\(v\) 是生成视频,\(r(v,c)\) 是奖励,\(p_{\mathrm{ref}}\) 是预训练参考模型。第一项鼓励更高分的输出,第二项限制新模型离原模型过远。这个目标揭示了所有方法共同的三角关系:提高目标属性、保留基础能力、控制探索成本

KL 不是安全证明

KL 约束能减缓模式坍塌和奖励投机,却不能证明奖励本身正确。若奖励错误地偏好某种伪影,贴近参考模型只会限制模型钻空子的幅度,不会把错误代理变成真实质量。

机制拆解:视频怎样变成一条可优化的策略

1. 条件文本、首帧、参考图或镜头约束
2. 轨迹从噪声经过多步去噪或速度积分
3. 成片解码为像素视频,或保留在潜空间
4. 奖励人类偏好、VLM、规则或几何模型打分
5. 更新DPO 离线排序,或 GRPO 在线提升高分轨迹

DPO:不显式训练奖励模型,也不等于没有奖励假设

DPO 接收同一条件下的优选视频 \(v_w\) 与劣选视频 \(v_l\),直接提高优选样本相对参考模型的概率优势。其理论桥梁是 KL 正则化最优策略的隐式奖励:

\[ r^*(v,c)=\beta\log\frac{p^*(v\mid c)}{p_{\mathrm{ref}}(v\mid c)}+\beta\log Z(c). \]

成对比较时,与条件有关的 \(\log Z(c)\) 抵消,于是可以直接优化策略概率比。它避开了“先训练标量奖励模型、再跑在线 RL”的两阶段流程;但 flow / diffusion 没有自回归模型那样可直接求和的序列似然,Diffusion-DPO 借助 ELBO,Flow-DPO 则以随机时间步上的速度预测误差差值代理整段视频的 log-ratio。这里优化的是可计算代理,不是精确视频似然。

DPO 常被放进 RLHF 家族讨论,但它本质上是离线偏好优化:模型不会在训练时持续生成新视频并探索奖励函数。它的优势是稳定、工程成本较低;代价是受离线偏好对覆盖范围约束,超出数据分布后仍可能错误外推。

GRPO:同题多采样,用组内相对分数替代 critic

GRPO 对同一提示生成一组样本,用组内标准化奖励估计 advantage:

\[ A_i=\frac{r_i-\operatorname{mean}(r_1,\ldots,r_K)}{\operatorname{std}(r_1,\ldots,r_K)}. \]

高于组均值的轨迹被提升,低于组均值的轨迹被压低,不再额外训练一个高维视频 critic。与 DPO 相比,它能跟随当前模型的真实输出分布在线探索;但视频采样极贵,且同一提示下奖励方差太小时,组内相对优势会变得噪声化。

还有一个常被公式掩盖的信用分配问题:这些工作通常只在最终成片上计算一次奖励,再把同一个终局 advantage 广播给整条去噪轨迹。算法知道“这条轨迹整体好”,却不知道哪一个时间步修复了手指、哪一步破坏了遮挡。PPO clipping 能限制更新幅度,不能凭空产生细粒度时间归因。

Flow-GRPO:为什么要把 ODE 改写成 SDE

现代 flow matching 常用确定性 ODE 采样。只有初始噪声而没有逐步随机动作时,条件转移概率和逐步重要性比难以直接使用,探索也受限。Flow-GRPO 构造与原 ODE 在各时刻保持相同边缘分布的 SDE,引入可记录的随机转移;同时在训练采样时把 40 步降到 10 步,推理时恢复完整步数。论文报告这使数据采集得到超过 4 倍加速,而最终奖励没有明显下降。

实现中每一步的策略与参考策略都是共享方差的高斯转移,因此所谓 KL 可以化成条件均值偏移的平方:

\[ D_{\mathrm{KL}}\!\left(\pi_\theta(\cdot\mid x_t)\,\|\,\pi_{\mathrm{ref}}(\cdot\mid x_t)\right) =\frac{\|\mu_\theta(x_t,t)-\mu_{\mathrm{ref}}(x_t,t)\|_2^2}{2\sigma_t^2\Delta t}. \]

这不是对最终视频分布做精确 KL,而是对离散 SDE 转移的局部、同方差近似。噪声越小,分母越小,同样的均值偏移惩罚越强;所以噪声日程、步长和 KL 系数共同定义了实际 trust region,不能只看论文写出的 \(\beta\)。

不要把迁移性写得过头

Flow-GRPO 原论文的主要实证是文本生成图像:GenEval 从 63% 到 95%,视觉文字准确率从 59% 到 92%。它提供了可迁移到视频 flow 模型的方法接口,但原论文并没有用同等规模的视频实验直接证明这些 headline 数字在视频上成立。视频验证主要来自同期 DanceGRPO。

公开训练协议组大小 / 采样算力解读
Flow-GRPO(SD3.5-M)每题 \(G=24\);训练 10 步,评测 40 步;噪声系数 0.724×A800;LoRA \(r=32\)组降到 12 或 6 时论文报告训练不稳;“省 critic”不等于低成本
DanceGRPO(HunyuanVideo T2V)25 步;超过 10K prompts;曲线使用移动平均64×H80056% / 181% 是训练 reward 的相对提升,不能换算成人评幅度
Epipolar-DPO(Wan2.1 1.3B)24K T2V + 30K I2V 三元组;LoRA,10K iterations生成数据约 1,980 A6000 GPU 小时;训练 4×A6000 两天自动奖励省了标注,不一定省总计算
VideoGPA(CogVideoX 5B)每个变体过滤后约 2.5K preference pairs;10K steps8×A100小数据有效依赖强几何教师、候选多采样与严格过滤
VGGRPO潜空间 4D reward;训练/推理采用不同步数论文报告总计约 1,536 GPU 小时reward 计算 54.73s→41.33s(−24.5%),并非端到端训练加速 24.5%

证据链:哪些结果最有说服力

工作训练信号与方式最强证据应该保留的边界
Diffusion-DPO851K 图像偏好对;离线 DPO把 DPO 的似然比目标适配到扩散过程,并用大规模众包偏好验证是图像而非视频;ELBO 是似然近似
Flow-DPO / VideoReward182K 人工视频偏好,覆盖 12 个生成模型;离线 DPO同时标注视觉质量、运动质量和文本对齐;Flow-DPO 优于论文内 SFT、Flow-RWR标注与评测共享质量轴;绝对泛化和商业模型可迁移性仍有限
Flow-GRPO规则或模型奖励;在线 GRPOODE→SDE 与少步训练采样有清楚消融;10 步相对 40 步超过 4× 加速headline 实验是 T2I,不是 T2V;规则检测器本身仍可能被利用
DanceGRPO图像/视频美学、对齐、运动与二值奖励;在线 GRPO覆盖 diffusion / rectified flow、T2I / T2V / I2V;HunyuanVideo 的视觉与运动奖励相对提升 56% / 181%百分比是相对代理分数,不是人类偏好同幅度提升;人评样本分别约 240 / 200 / 200
RewardDanceVLM 生成式 pairwise judge,以 “Yes” token 概率为分数从 1B 扩到 26B,并加入任务指令、参考示例和推理上下文;覆盖图像和视频后训练“高 reward variance = 未 hacking”只是诊断性代理,不能单独证明真实质量未被利用
Epipolar-DPOSampson 极线误差自动构造偏好对;离线 DPO论文报告极线误差降低约 31%,人评一致性从 54% 提至 72%依赖对应点与基础矩阵估计;训练聚焦静态场景和相机运动
VideoGPA几何基础模型重建点云并回投影,构造稠密偏好;离线 DPO比单一极线约束覆盖更完整的场景级三维一致性;少量偏好对也能改善多项几何指标仍在 RGB 空间重复解码;核心几何先验来自外部模型,且假设偏静态
VGGRPO潜空间 4D 几何模型;相机平滑 + 回投影奖励;在线 GRPO支持动态场景,跳过反复 VAE 解码,并能做潜空间测试时奖励引导“4D reward”仍是学习到的估计器;分离静态区域、相机与物体运动本身会出错

Flow-DPO 的真正贡献更偏数据,而非全新优化器

文章对此判断准确。VideoAlign 工作最有长期价值的部分,是 182K 人工偏好、12 个视频模型、多维质量轴,以及 26.5K 三元组的 VideoGen-RewardBench。Flow-DPO、Flow-RWR 和 Flow-NRG 是把既有 KL 正则化对齐框架接到 flow 模型上;数据定义了什么叫“更好”,优化器负责把这一判断写回生成器。若偏好数据把大动作误当作好运动、把高饱和度误当作高质量,算法会高效地放大这种偏差。

公开实现把这个风险写得比论文摘要更具体:VideoReward 的 Motion Quality 提示明确规定“视频大体静止或运动很少时给低分”,Visual Quality 又把安全性并入画质,并要求政治、暴力或成人内容获得最低分。也就是说 MQ 同时测运动正确性与运动幅度,VQ 同时测视觉质量与内容政策。此外,推理代码把标准化后的 VQ、MQ、TA 直接相加得到 Overall。这个接口简单可用,却默认三轴等权、可加且量纲已充分校准;策略完全可能通过增加无关运动来抬高 MQ,或让一个轴的极端分数掩盖另一个轴的退化。

RewardDance 的创新是奖励接口,而不是“推理天然正确”

传统 VLM reward model 常在隐藏状态后接回归头,并用 Bradley–Terry loss 拟合成对偏好。RewardDance 改为询问“图 2 是否优于图 1”,把 “Yes” 的 token 概率当作奖励,让训练与 VLM 原生 next-token prediction 对齐。扩展模型规模、加入任务化指令、参考样例和理由文本,确实给 reward scaling 一条更自然的路径。

但推理链只是提供更多判别上下文,不会自动让裁判校准。论文把训练后期 reward variance 较高解释为模型仍保持探索、没有模式坍塌,这是有用信号,却不是充分证明:高方差也可能来自裁判不稳定、prompt 难度差异或策略在多个漏洞间切换。真正的防 hacking 证据仍需要保留集人评、跨奖励模型复核和对抗样本。

同一方差,可能有相反含义

RewardDance 把较高 reward variance 当作持续探索、抗 hacking 的证据;后续 SoliReward 却显示,标准 Bradley–Terry reward 在一组质量相近的高分样本上产生过大的组内 advantage,反而会驱动 GRPO 追逐异常高分特征。前者观察策略输出分数的离散程度,后者分析 reward margin 如何进入更新;两者并不逻辑矛盾,但足以说明“方差高/低”都不能脱离独立质量评测单独解释。

从论文公式走到公开实现:五个容易漏掉的事实

  1. “KL”不是统一对象。 DPO 的参考比、Flow-GRPO 的逐步高斯均值距离、LoRA 隐式参考和论文叙述中的最终分布 KL,数学与工程含义并不相同。
  2. 同一终局奖励被复用到所有去噪步。 这是低成本 credit assignment,不是逐帧、逐动作的因果监督。
  3. 组相对优势依赖 prompt 内可排序性。 同题样本全对、全错或分数挤在一起时,标准化会放大裁判噪声;扩大 group 能缓解,却线性增加 rollout 成本。
  4. 训练裁判与报告指标常不独立。 DanceGRPO 用 VideoAlign 训练 HunyuanVideo,也用 VideoAlign 报告核心增长;VideoAlign 自己的 benchmark 又沿用 VQ/MQ/TA 标注轴。人评能补强,但不是每个消融都有独立人评。
  5. 开源程度不等于可复现程度。 Flow-GRPO、DanceGRPO、VideoAlign、Epipolar-DPO、VideoGPA 有公开实现或配置;RewardDance 与 VGGRPO 的关键训练资产截至核验时并未形成同等完整的公开复现链。公开代码也无法替代模型、偏好数据、精确 commit、seed 与完整训练日志。

“可验证奖励”到底有多可验证

LLM 的数学 RLVR 常能把最终答案交给符号系统或单元测试,判定与模型审美相对独立。视频没有统一的最终答案。文章主动承认这里的 verifiability 定义并不清楚,并把“客观、非人类偏好”作为工作定义。这个口径方便建立研究版图,却容易把三类不同强度的证据混在一起。

规则可判定

目标个数、颜色、空间关系、屏幕文字是否匹配。接近硬验证,但仍依赖检测器、OCR 与数据模板。

模型可测量

美学、运动自然度、提示对齐,由 VLM 或 reward model 评分。可自动化,但本质是学习到的偏好代理。

物理代理约束

极线误差、相机轨迹平滑、点云回投影一致性。数学形式明确,但输入量来自不完美的匹配与重建模型。

Epipolar-DPO 的 Sampson error 是典型例子。对应点 \((x,x')\) 与基础矩阵 \(F\) 理想情况下满足:

\[ {x'}^{\!\top} F x = 0. \]

它比“这段视频是否好看”客观得多,却只约束两帧投影几何,不直接证明深度正确、物体刚性、遮挡合理或动力学真实。低纹理表面、快速运动、滚动快门、反射、粒子、形变主体都可能让对应点或 \(F\) 的估计失真。奖励可复算,不等于被测属性已被无误差地识别。

VideoGPA 把约束从帧对扩展到场景级:几何基础模型估计相机与点云,聚合后再投影回各帧,比较投影与原始观测。VGGRPO 再用 4D 重建模型只聚合静态区域,并训练一个 latent geometry model 直接从视频潜变量预测几何,减少 RGB 解码成本。这条路线体现的不是“奖励越来越真”,而是奖励的覆盖面、计算成本与估计偏差在重新平衡

原文的一处明确笔误

VGGRPO 段落写道为解决静态场景假设,“VideoGPA utilizes geometric foundation models that work with dynamic scenes”。结合 VGGRPO 论文可确认,这里应为 VGGRPO:支持动态场景的是其基于 4D reconstruction 的 Latent Geometry Model;VideoGPA 正是它试图超越的静态 / RGB-space 前序方案。

原文发表后的两项反证:探索与奖励都可能成为故障源

SAGE-GRPO:ODE→SDE 不是免费探索

原文把 ODE 改写为 SDE 主要描述为“获得随机策略与探索”。后续 SAGE-GRPO 针对视频指出更尖锐的问题:若直接套用通用 SDE,注入噪声形成的探索区域可能偏离视频数据流形,表现为时间抖动、伪影和低质量 rollout;此时 reward 看到的不是模型能力边界,而是人为制造的离流形样本。它提出更贴近 flow trajectory 的 manifold-aware SDE、梯度范数均衡和移动锚点 + 逐步约束的双 trust region。这里最重要的不是又一个算法名,而是把探索质量加入了因果链:

\[ \text{有效更新}=\text{奖励可信度}\times\text{rollout 在流形附近的程度}\times\text{信用分配质量}. \]

如果第二项接近零,提高噪声只会获得更差、更难判的样本;“探索更强”不能直接等价为“学习信号更多”。

SoliReward:reward accuracy 不是 reward utility

SoliReward(CVPR 2026)直接研究视频 reward 的标注噪声与 post-training hacking。论文报告,单视频 Pass/Fail 标注的五人一致性高于传统成对比较:Krippendorff’s \(\alpha\) 为 0.4939 对 0.3516,原始一致率为 77.33% 对 54.67%。更有启发的是,普通 BT 与加入 win-tie 约束的 BT-WT 在 reward accuracy 上只差 0.64 个百分点(77.63% 对 78.27%),后者引导 HunyuanVideo 后训练时的 VBench2 却从 0.8693 提到 0.8999、MQ 从 0.1719 提到 0.3302。

这说明 reward model 的离线排序准确率并不能充分预测它被策略主动优化后的效用。部署后的策略会寻找 reward landscape 的尖峰,因此还要审计高分区 margin、组内 advantage、OOD 校准和 on-policy 对抗样本。奖励模型不是静态 benchmark 分类器,而是闭环控制器的一部分。

二次深挖后的最强 Insight

视频 RL 不是“生成器 + 一个分数”,而是一套会改变自身输入分布的测量系统。策略更新后,reward model 面对的样本不再服从训练时的偏好数据;探索噪声又会进一步改变分布。因而真正需要验证的是闭环稳定性:奖励在 on-policy 样本上是否仍校准、更新是否保持在可感知流形附近、独立裁判是否确认目标属性真实改善。

术语对齐

Diffusion / 扩散模型从噪声出发,多步预测噪声或干净样本,逐渐还原图像或视频。
Flow matching学习把噪声分布连续搬运到数据分布的速度场;常用确定性 ODE 积分采样。
DPO直接偏好优化。用优选 / 劣选样本相对参考模型的概率差更新策略,不需要单独训练显式 reward model。
GRPO组相对策略优化。同一条件采样多个结果,用组内相对奖励估计 advantage,省去独立 critic。
ODE → SDE把确定性流改写为保持边缘分布的随机过程,以获得逐步转移概率和更强探索。
Preference pair同一条件下的一对生成结果,其中一个被标成更好;标签可来自人、VLM 或自动指标。
Sampson error点对应偏离极线约束的一阶近似几何误差,计算便宜,但依赖匹配点与基础矩阵质量。
Reward hacking生成器提高代理奖励,却没有提高甚至损害真实目标,例如牺牲多样性来迎合单一裁判。

文章没有证明什么

最关键的缺失实验

需要统一基础模型、统一提示集和等算力预算,同时比较人类偏好奖励、VLM 奖励、极线奖励、场景级几何奖励与多奖励组合;再用未参与训练的人工盲评和下游 3D / 机器人任务验证。没有这组对照,就无法判断增益来自优化器、奖励质量、数据覆盖还是额外算力。

独立 Insight:奖励正在变成视频模型的“可观测世界接口”

1. 后训练的瓶颈会从 policy optimization 转向 observability

DPO 与 GRPO 解决的是“已知一个分数后怎样更新生成器”;更难的问题是从像素序列中观测出身份、深度、相机、主体运动、接触、因果和审美。视频世界的状态大多不可直接见,奖励模型实际承担了状态估计器的角色。奖励看不见的属性,策略就无法稳定优化;奖励误判的属性,策略就会学会利用。二次核验进一步表明,这个接口还是闭环的:策略每次进步都会改变 reward 的输入分布,因此 observability 必须和 on-policy calibration 一起评估。

2. 最有前景的不是单一万能 reward,而是分层 reward stack

更可靠的系统应把奖励分层:底层用 OCR、目标计数、相机轨迹与几何约束提供局部硬信号;中层用身份、动作和语义模型覆盖任务属性;顶层用人类或强 VLM 处理风格、叙事与整体偏好。各层分别记录置信度和适用条件,而不是先加权成一个不可解释的总分。发生冲突时,系统应该知道是“几何更稳但动作更僵”,而非只看到总奖励下降 0.03。

3. 潜空间奖励既是效率优化,也是新的耦合风险

VGGRPO 直接把生成潜变量接到几何模型,省去反复 VAE 解码,也减少真实图像几何模型面对生成像素时的域偏移。但这让 generator latent 与 judge latent 更紧密耦合:策略可能找到只在潜空间令几何头满意、解码后却未必对应真实改善的方向。需要用独立 RGB 几何模型、人评和下游重建任务做外部校准。

4. 在线 RL 与离线 DPO 不是替代关系,而是数据飞轮的两段

离线 DPO 适合把昂贵的人类或几何偏好稳定写入模型;在线 GRPO 适合在当前策略分布上发现新失败和新高分轨迹。更合理的闭环是:在线探索发现边界样本 → 多裁判与人工复核 → 沉淀高质量 preference pairs → 离线稳定更新 → 再进入受控在线探索。只做在线 RL 容易追逐瞬时漏洞,只做离线 DPO 则会被固定数据覆盖上限锁住。

5. 对机器人世界模型而言,评测价值高于画面美学

Majumdar 的研究背景使几何路线格外重要:如果视频模型用于机器人策略评估或视觉规划,生成一段“看起来合理”的视频远远不够。奖励必须对动作条件、接触事件、物体持久性与不确定性敏感。几何后训练是必要起点,但在能把像素漂亮度、三维一致性与可行动因果分开校准之前,视频模型不应被当作高风险策略的可信模拟器。

研究与工程实践建议

  1. 先定义失败分类,再选优化器。 提示不遵循、身份漂移、镜头抖动、几何破碎和物理错误需要不同观测器,不应被一个美学分数统治。
  2. 为每个 reward 写适用域。 明确它对静态 / 动态、刚性 / 非刚性、纹理、遮挡、镜头类型和视频长度的假设。
  3. 至少保留一个独立裁判。 训练奖励、早停指标和最终验收不能完全共享同一 VLM 或几何模型。
  4. 报告 Pareto front,而非单一总分。 同时呈现提示遵循、视觉质量、运动、几何、身份、多样性、计算成本与人评。
  5. 把不确定性写进奖励。 当对应点、相机位姿或 VLM 判断不可靠时,降低权重或拒绝更新,而不是把低置信估计当作精确标签。
  6. 保留失败样本和训练轨迹。 Reward hacking 往往先出现在少数 prompt 或运动类型;只汇报均值会掩盖局部坍塌。
  7. 把 reward 当成受攻击接口做红队。 主动搜索高 reward / 低人评分歧样本,检查静止、过度运动、闪烁、文字贴片、重复纹理和潜空间对抗方向。
  8. 做闭环而非静态验收。 在多个训练 checkpoint 上重测 reward 的 OOD 准确率、校准、margin 与独立人评,确认裁判没有随着 policy shift 失效。

证据边界与资料索引

主材料为 2026-07-18 发布的 X Article,正文、公式、三段示例视频及关联媒体均已核对。二次深挖完整核对八篇核心论文的正文与附录,并审计 VideoAlign、Flow-GRPO、DanceGRPO、Epipolar-DPO、VideoGPA 的公开实现 / 配置;SAGE-GRPO 与 SoliReward 用作会改变核心判断的后续反证。本文未复跑数百至数千 GPU 小时的大型视频训练,实验数字均按发布方报告陈述;代码路径只证明公开实现的当前行为,不证明论文私有训练与之逐位一致。方法分类、证据强弱、笔误识别与工程判断属于基于一手资料的分析。平台文章、预印本与仓库仍可能继续修订。