核心判断
Shen 等人把十种棋类 Transformer、十一档预训练预算、四种 RL 模型规模和 36 条预训练—RL 组合曲线放进同一个受控试验台。最可信的新证据是:更低的预训练损失关联更高的 RL 后性能,而更多的预训练 token 又关联更陡的局部 RL 学习斜率。这让“先预训练多少、再强化多少”从静态预算切分,变成一个耦合优化问题。
起点由预训练决定
参考 RL 预算下的性能与预训练损失高度单调相关;随着参考预算增大,相关强度由约 0.93 上升到 0.99。
速度也由预训练决定
局部 RL 斜率与预训练 token 数的 Pearson \(r=0.84\),附录另报 Spearman \(\rho=0.839\)。相同 RL 算力,底座训练经历不同,回报并不相同。
发现伴随放错
RL 能把低概率正确棋步推入 top-3,也会把错误主模态进一步放大;困难题上后者明显多于前者。
它真正要回答的问题
常见 scaling law 把预训练写成模型规模 \(N\)、token 数 \(T\) 与损失 \(L\) 的关系;常见后训练论文则从一个固定底座出发,比较算法、奖励或推理预算。两类研究之间缺了一层:当底座本身变化时,RL 的学习曲线怎样变?
如果 RL 只是把既有分布统一锐化,那么更好的预训练主要提高初始性能,未必提高学习斜率;如果 RL 能可靠发现尾部正确行为,那么预训练覆盖、训练时长和题目难度都应改变它的收益。作者因此需要同时控制三种变量:
棋类是一个刻意选择的中间层:状态、合法动作和解题真值可由引擎验证,训练成本又远低于通用语言模型;但它仍包含组合搜索、多步承诺和失败恢复。因此它适合做机制实验,却不能自动代表开放域语言推理。
受控试验台:从 54B 棋谱 token 到可验证 RL
1. 预训练:规模与数据预算同时展开
每一步棋被编码为四个 token:棋子、起点、终点与特殊标志,词表仅 81。作者从 2022 年 Lichess Blitz / Rapid 棋谱构造 54B-token 语料,并按平均 Elo 800–3000 做平衡采样。十个稠密 Qwen3 风格模型覆盖 5M 到 1B 参数;十一档预算约从 \(6.5\times10^{16}\) 到 \(6.5\times10^{19}\) FLOPs,对应约 2 亿到 520 亿训练 token。
2. SFT:先生成搜索树,再训练模型提交答案
42K 道棋题不是只配最终答案。固定的 200M proposal model 从局面采样多个续着,把重合前缀合成树,再按深度优先顺序序列化为显式 reasoning trace;Stockfish 选择最佳延续,模型最后提交答案。这里的“思维链”因此更像候选生成与比较过程,而不是人类自然语言解释。消融显示,无轨迹 SFT 主要改善 pass@1;带轨迹 SFT 才同时改善 pass@8 与 pass@16。
3. RL:奖励极简,搜索困难真实存在
69.3K 道训练题中,70% 来自较容易的 B1/B2,30% 来自 B3–B5。GRPO 每组采样 8 个回答;只有完整走对目标序列才得 1 分,否则为 0。论文配置给出学习率 \(10^{-5}\)、KL 系数 0.001、clip 0.2、温度 1.0 与最长 3072 response tokens。这个奖励消除了模糊裁判,却没有消除探索失败:策略若从未采到正确路径,就没有梯度告诉它正确答案在哪里。
4. 测试:同时看精确率与覆盖
独立 benchmark 有 1,480 道题,按难度分为 B1–B5。聚合结果主要用 B1–B4,因为模型几乎解不出 B5;B5 被保留用来观察机制。pass@1 衡量单次成功率,pass@16 更接近多次采样后的覆盖。训练、测试和预训练棋局在标准化棋盘状态层面去重,降低了直接记忆泄漏的可能。
联合 scaling law:不是一条万能直线
作者先在每一条 RL 曲线的非饱和局部,把奖励近似为 log-RL-compute 的一次函数:
再用预训练损失 \(L_{\mathrm{pt}}(N,T)\) 预测参考预算下的性能,用规模和 token 数预测 RL 斜率:
主图给出的斜率拟合更具体:token-only 模型为 \(B=-0.1221+0.0156\log_{10}T\),\(R^2=0.701\);加入规模后为 \(B=-0.2083+0.0172\log_{10}T+0.0088\log_{10}N\),\(R^2=0.841\)。这说明 \(N\) 提供了额外解释力,但两项自变量沿同一批 checkpoint 网格共同变化,系数不应直接读成可干预的边际因果效应。
“统一”统一的是预测接口,不是训练动力学
合作者 Leon Li 的发布帖把问题压缩成“能否为完整预训练—RL 流程写出统一 scaling law”。论文给出的答案其实是函数拼接:先由预训练配置预测损失,再由损失预测固定 RL 预算下的性能,并用模型规模与训练 token 预测局部 RL 斜率。它把两个阶段接到同一张预算响应面上,却没有证明预训练梯度与策略梯度服从同一种动力学,也没有覆盖奖励设计、SFT 数据量、交错训练或在线数据分布变化。因此这里的 unified 应读成“跨阶段可联合预测”,而不是“一条跨任务、跨算法都不变的基础定律”。
| 验证方式 | RMSE | MAE | 中位 per-run \(R^2\) | 应如何理解 |
|---|---|---|---|---|
| 使用实测预训练损失,逐点留一 | 0.0102 | 0.0078 | 0.65 | 在已观察模型与预算附近,局部插值较准。 |
| 先用 Chinchilla 形式预测损失,再留一 | 0.0194 | 0.0153 | -0.86 | 误差翻近一倍;平坦曲线使 \(R^2\) 尤其不稳定。 |
| 整种模型规模留出 | 0.0242 | — | — | 跨规模外推更难;留出 680M 时 RMSE 达 0.048。 |
这组结果说明公式更像局部响应面,而不是跨域定律。它对“已有实验网格内怎样分配下一批算力”有用,对“另一个模型家族应该投多少 RL”证据不足。
证据强度审计:相关、预测与因果不是一回事
| 主张 | 直接证据 | 证据等级 | 仍成立的替代解释 |
|---|---|---|---|
| 预训练损失预测参考 RL 性能 | 36 条曲线;observed-loss LOO RMSE 0.0102;LMSO RMSE 0.0242 | 域内预测较强,跨规模中等 | 同一模型家族、数据与固定 SFT 管线内的共同因素 |
| 更多预训练 token 关联更陡局部 RL 斜率 | 四个规模、8–11 个 checkpoint;Pearson 0.84、Spearman 0.839 | 相关性中等偏强,因果性不足 | sigmoid 工作点、预训练损失、模型规模与 checkpoint 祖先相关性 |
| 更强预训练抬高 RL 最终上限 | 只有 20M 的 10 条曲线足够饱和;500 次参数 bootstrap | 探索性证据 | 更大模型尚未跑到可识别上限,误差区间较宽 |
| 最优 RL 份额随总算力增加 | 拟合响应面上的网格搜索与 \(\epsilon\)-近优区域 | 趋势比精确端点可靠 | 目标函数、奖励噪声、系统成本和模型族改变后前沿可能移动 |
“RL 无法补偿弱预训练”比实验多走了一步
Minty 的二次解读把问题概括成“RL 能否补偿弱预训练”,并据相同 RL 算力下弱底座增益较小,写成 RL 不能完全补偿不足的预训练。前半句符合观测:更强底座在参考预算下更好,局部学习斜率也通常更陡;后半句只能成立于论文实际跑过的有限算力窗口。除 20M 外,大模型曲线没有充分饱和,实验没有为每个弱底座一直增加 RL 直到确认其可达上限,也没有比较“弱底座 + 大量 RL”与“强底座 + 少量 RL”的等成本交叉点。因此现有证据支持“弱预训练降低有限预算内的 RL 杠杆”,不支持无条件的“RL 永远补不回来”。
局部斜率会被 sigmoid 所处位置机械性改变
附录自己指出,若真实 RL 曲线是从初值 \(R_0\) 向上限 \(A\) 饱和的 sigmoid,那么参考点附近的 log-compute 斜率近似满足:
它在刚起步和接近饱和时都小,在曲线中段最大。因此“token 更多时 \(B\) 更大”可能同时包含三件事:底座真的更可训练、底座拥有更高的可达上限,以及该 run 恰好落在 sigmoid 的陡峭区。作者用未饱和的 B3–B4 减弱后两者,却没有做“保持损失和参考性能相近、只改变预训练 token”的干预实验。最稳妥表述应是预训练经历携带了 loss 之外的 RL 斜率信息,而不是已经证明 token 本身因果地改善优化性。
交叉验证比标题暗示得更弱,也比普通拟合更认真
逐 run LOO 会在 35 条曲线上重拟合 \(f\) 与 \(g\),但 Chinchilla 损失面没有在每一折内重拟合,因此被留出的预训练损失行仍可能参与损失面估计。更严格的 LMSO 会删掉整个模型规模的预训练行并重拟合全部管线,不过只有四折,且留出 680M 时 RMSE 上升到 0.048。论文还存在一个可复算的小错误:表中 0.0194 与 0.0102 的差是 0.0092、占严格 LOO RMSE 的 47.4%,正文却写成 0.0099 和约 49%。这不推翻主趋势,但说明精确误差分解不宜照抄。
固定 SFT 不等于移除了所有中介变量
所有学生模型都使用固定的 200M proposal model 生成 reasoning traces,这提高了横向一致性;同时,教师轨迹与不同容量、不同预训练阶段学生的适配程度也可能不同。因而观测对象更准确地说是“pretrain → 同一轨迹生成流程的 SFT → RL”的总效应,而不是预训练对 RL 的纯直接效应。
20%–28%:一个条件化的预算答案
作者还拟合预训练损失面:
这里的“总算力”并非只把预训练和 RL 两项相加。论文把三阶段模型 FLOPs 写为:
RL 的 10 倍系数分别来自策略 rollout 前向、reference model 前向与策略反向训练。前沿实际求解的是 \(C_{\mathrm{RL}}=C_{\mathrm{total}}-6NT-C_{\mathrm{SFT}}\),所以 SFT 训练已经计入分母。按论文的 42K 样本、3 epochs 和固定 3072 长度复算,SFT 最多处理 3.871 亿 padded tokens,对 20.5M、47.3M、203.1M、678.6M 模型分别约为 \(4.76\times10^{16}\)、\(1.10\times10^{17}\)、\(4.72\times10^{17}\)、\(1.58\times10^{18}\) FLOPs;低总预算下它不是可忽略常数。但用于生成 SFT traces 的模型推理、Stockfish 标注、数据筛选、通信空转和推理吞吐没有全部进入这个 model-FLOP 口径。论文给出的系统侧锚点是 50M 模型跑 2,000 个 RL steps 约需 160 H200 GPU-hours;官方 README 后续补充的近似值则是 8×H200、每步约 30 秒,即每 1,000 步约 8 小时、64 H200 GPU-hours,线性推算 2,000 步约 128 H200 GPU-hours。两者相差约 20%,README 同时提醒 response 变长会拖慢 step,因此这些数字只适合做墙钟量级估计,不能当作精确换算常数。
把损失面与 RL 响应面合并,在固定总算力下搜索预训练和 RL 的最优切分。实验网格中的 20M 模型,经验最优 RL 份额随总预算由约 5% 上升到 32%;拟合后的全局 frontier 则从 50M 模型约 20% 上升到 680M 约 28%。
Francesco Bertolotti 的原帖把这组端点概括为“模型从 50M 增至 700M,最优 RL 份额从 20% 增至 30%”。方向没有错,但 700M 与 30% 都是对论文 Figure 4 中 680M 与 28% 的取整;而且这些端点来自拟合后的连续最优前沿,不是两个生产级大模型上直接测得的固定配方。
第一作者 Jingyan Shen 在发布串文里也主动收紧了这个结论:该定律只拟合未饱和区间,精确比例依赖当前实验 regime,算力前沿应被理解为“经验趋势 + 分配问题的量化框架”。她把后续问题写成何时从预训练切到 RL、数据分布与约束如何改变 scaling、以及两阶段能否交错。这进一步说明,真正可迁移的对象不是某个百分比,而是用短程测量持续更新阶段切换决策。
另一个容易被平均分掩盖的结果是 pass@1 与 pass@16 分叉:RL 明显提高 pass@1,却让较大模型的 pass@16 大致持平或略降。也就是说,策略更会把概率压到少数高回报答案上,但候选多样性未同步增加。若部署场景允许 best-of-N、搜索或多样本验证,仅优化 pass@1 可能牺牲后续搜索空间。
RL 到底改变了什么:锐化、尾部发现与错误锁定
作者对每道题采样 128 条 reasoning traces,估计第一步棋的边际策略:
先检验一个最简单假设:RL 只是对所有状态施加同一个温度,把 SFT 分布做幂次锐化。750 步时最佳全局指数约为 1.35,但统一锐化只能解释约 17% 的策略变化;即便改用中心化 logit 线性模型,整体 \(R^2\) 也只有约 0.56。不同状态的变化显著异质。
原帖说困难题上 RL 会从分布尾部浮现并强化“好的和坏的”动作。论文更精确的分类不是“好尾部 / 坏尾部”:tail discovery 专指低概率的正确动作进入 top-3;wrong-mode amplification 则是原本最受偏好的错误动作继续增强,它未必来自尾部。两者必须分开,否则会误判修复方向:前者需要更好的探索与覆盖,后者需要抑制错误锁定和过度锐化。
“发现”是概率意义,不是能力从无到有
这里的 tail discovery 有严格操作定义:正确动作在 SFT 分布中已有非零但低于 5% 的估计概率,后来进入 top-3。它证明 RL 能救回罕见正确行为,没有证明正确算法在底座中严格不存在。有限采样也无法区分极小概率与真零概率。与受控组合任务中“重组已学会的原子函数”、或在 pass@K=0 任务族上观察 grokking 的工作相比,本论文给出的命题更窄,但也更可量化。
不过 5% 不是天然分界线,而是研究者设定的阈值。若把单个动作简化成二项比例,在 \(p=0.05\)、\(K=128\) 时,朴素标准误约为 \(\sqrt{0.05\times0.95/128}=0.019\),95% 半宽约 0.038;真实估计项是连续条件概率,因此这只是量级提示,不是论文结果或严格置信区间。论文没有报告 \(K\)、5% 阈值或 top-3 选择的敏感性分析,边界附近的单题类别可能翻转。更可信的是跨难度的聚合方向,不是某道题被精确标成“发现”。
精确线路奖励也不是完全无歧义
公开奖励实现逐步比对整条目标 UCI 线路,长度和每一步都完全相同才得 1。Lichess 说明其 puzzle solution 中玩家着通常是唯一走法,但 mate-in-one 可能存在多个将杀着,任一将杀都应获胜;公开预处理脚本未见专门排除这类多解。于是极少数有效替代杀法可能被记为 0。这是奖励定义的边缘假阴性,而非足以推翻整体结果的大规模标签问题,却提醒我们“可验证”不等于“唯一规范答案”。
思维链变宽,不一定变深
训练后,reasoning tree 的分支数和宽度增加,最大深度大致持平或略降;候选棋步质量与最终承诺改善,但深度优先遍历的一致性下降、重复访问增多,长程恢复能力仍弱。它更像在学习“提出并选择更好的候选”,而不是稳定获得更深的规划算法。这项结构分析只来自 matched-compute 的 20M 与 50M 两条代表性 run,并非 36 条曲线的总体统计;附录最深只检查前 4 个 player plies,50M 到第 1,000 步时也只有少数 rollout 覆盖完整 4-ply 目标。因此“变宽不变深”应视为有解释力的机制切片,而不是跨规模定律。
数学迁移实验:方向一致,证据等级更低
作者用一条约 1B 非 embedding 参数的 OLMo-2 预训练轨迹做自然语言核验。从约 10.5B 到 200B token 取 15 个锚点,每个锚点再做固定 5B-token annealing、约 859K 条 NuminaMath-CoT SFT,然后在约 24.9K 道 GSM8K / MATH / DeepScaler 混合题上运行最多 3,000 步 GRPO。结果仍显示:更晚的预训练 checkpoint 有更好的 post-RL 水平与更快的局部收益。
因此它是跨域可迁移性的提示,不是独立 scaling law 复现。更晚 checkpoint 共享同一训练祖先,误差并不独立;固定规模也无法识别 \(N\) 与 \(T\) 的交互。模型架构约 1.48B 总参数、1.07B 非 embedding 参数;论文正文称 14 个 checkpoint,公开模型集合列出 15 个锚点。正文又把预训练数据写为 70% Nemotron-CC-Math-v1 + 30% Dolma3,而附录超参数表写 Dolma3 / Dolmino mix。
数学 GRPO 与棋类也不是同一配方的机械复制:数学实验不使用 KL,采用 0.2/0.26 双 clip 与 \(10^{-6}\) 学习率;棋类使用 KL 0.001、单 clip 0.2 与 \(10^{-5}\) 学习率。跨越这些差异仍出现同方向关联,提升了现象的可信度;但单 run、固定规模、无重复 seed 和文档口径差异,仍不足以给出数学域的数值定律。
开放与复现审计:构件齐全,整篇复现链不闭合
| 发布物 | 公开状态 | 能验证什么 | 仍缺什么 |
|---|---|---|---|
| 54B-token 棋谱数据 | 公开,约 215GB | 预训练语料结构与规模 | 大规模下载与训练成本高 |
| 棋题 benchmark / 训练数据 | 公开,但版本口径不完全一致 | 样本字段、难度、导出文件与逐题 ID | 公开 think benchmark 为 1,484 道而论文为 1,480;三个训练导出也不等于 156K 唯一候选池 |
| 预训练与 SFT 权重 | 公开 | 多个规模和 checkpoint 的基础行为 | 集合中未见棋类 RL 权重 |
| 棋类训练代码 | 公开 | tokenizer、SFT trace、二值奖励和 GRPO 构件 | 缺完整 36-run 配方、scaling/frontier 拟合脚本和对应测量表 |
| 数学模型权重 | 公开 15 条 pretrain→anneal→SFT→RL 链 | 检查 checkpoint 组织和最终权重 | 数学训练脚本、优化器状态与完整日志未发布 |
公开数据可以进一步拆开:训练仓库实际包含 69,367 行 rl_dataset.csv、68,000 行 easy-skewed RL 导出和 91,619 行 SFT 导出,平台合并后才得到 228,986 行;它们是不同用途且可能重叠的导出,不应与论文过滤后的 156K 唯一 puzzle pool 比较。公开 think benchmark 有 B1/B2/B3/B4/B5 = 310/299/267/288/320,共 1,484 个唯一 PuzzleId;论文表格则为 308/298/267/287/320,共 1,480,道数差 4。当前材料没有给出这 4 道题的版本变更记录。
当前公开启动配置与论文还存在几处实际偏差:SFT 示例使用 2048 context、学习率 \(5\times10^{-5}\),论文是 3072 与 \(3\times10^{-4}\);标为 8-GPU 的 RL 脚本只暴露四张 GPU,却配置每节点使用八张;默认 response 上限为 2560,而论文写 3072;公开 sweep 默认仅五个配置、500 步,论文联合分析则使用 36 个组合和 1,000–5,000 步。仓库也没有直接生成主 scaling law 与算力 frontier 的脚本和完整测量数据。因此代码发布适合核验方法组件,不是论文配方的逐项冻结快照。
数据去污染的论文定义很严格:重放每局预训练棋谱,只要任一中间状态与后训练或测试棋题重合,就删除整局;匹配键是“棋子布局 + 轮到哪方”的标准化 FEN,棋题之间再按根局面去重。这能强力抑制精确状态泄漏,但不会消除战术 motif 或棋形层面的语义重合。公开脚本可以接收任意 puzzle 文件,README 示例却只传 test 文件;要复现论文声称的“post-training + test”去污染,执行者必须自行把两类状态都传入。这是文档闭环问题,不是算法本身不支持。
论文的边界:哪些结论暂时不能外推
- 局部线性不等于全程规律。 RL 曲线只在未饱和区间近似线性,极低预算的探索冷启动和高预算的饱和都可能改变形状。
- 斜率关联尚未隔离因果。 四个规模共享模型家族和固定管线,没有 matched-loss / different-token 干预,也没有每个配置的多 RL seed;sigmoid 工作点能系统性改变局部斜率。
- 单一验证器任务偏向可判定推理。 棋题有精确答案和廉价引擎,开放式研究、写作、代码架构等任务的奖励噪声与多解性更强。
- 策略分类存在测量边界。 128 条 traces、5% tail 阈值与 top-3 都是有限采样下的操作定义,论文未报告这些超参数的敏感性。
- 错误模态风险没有被预算公式单独惩罚。 pass@1 提升可与 pass@16 覆盖下降并存;只优化均值可能得到更自信、但更窄的策略。
- 数学实验不足以识别跨规模规律。 它来自同一预训练 run 的 checkpoint,没有跨模型规模和多 seed。
- 算力只是成本的一部分。 SFT 训练 FLOPs 已计入,但 traces 生成、引擎验证、数据构造、通信空转、失败样本和推理时 best-of-N 仍会改变真实系统成本。
- 预训练损失并非普适充分统计量。 在同域棋谱内它预测力很强;换数据分布、任务覆盖或模型家族后,相同 loss 可能对应完全不同的高质量回答覆盖。
独立推论:把“能力”拆成覆盖、可训练性与选择
1. 预训练的后训练价值不只体现在最终 loss
两个底座即使 loss 接近,只要训练 token、数据顺序或覆盖不同,RL 斜率也可能不同。论文中 slope 与 \(T\) 的额外关系提示:模型可能在继续训练中形成更平滑、可被奖励优化的表示;但也可能只是处于更有利的 sigmoid 区间。实际评估不应只选“当前 benchmark 最强”的底座,还应做短程 RL probe,同时估计单位算力增益、离饱和程度和错误模态率。
2. Coverage 是必要条件,训练动力学决定能否取出
Coverage Principle 强调高质量回答需要在底座分布中有足够概率质量;本论文补上了动力学视角:覆盖存在并不意味着 RL 会稳定找到它。困难 B5 中 tail discovery 非零,但错误模态放大更多。覆盖决定“有没有可搜索对象”,奖励、采样与优化器决定“能否把它取出来”。
3. 最优预算应是带风险约束的 Pareto front
只最大化 pass@1 会遗漏覆盖、多样性和错误自信。更合理的预算前沿至少同时报告 pass@1、pass@K、错误模态放大率、每题采样成本与跨分布稳健性。对于能使用搜索或 verifier 的系统,保留候选覆盖可能比进一步锐化单次答案更值钱。
4. “RL 创造能力”需要更强的实验定义
要证明从无到有,至少需要预先定义原子技能或组合族,证明底座在大规模采样与诊断下对目标族无成功覆盖,再显示 RL 在控制数据泄漏后获得可泛化解法。本文的 5% tail 定义诚实且有用,但它回答的是低概率行为迁移,不是本体论上的能力创造。
研究者应记录
每条底座的 loss、token、数据来源、短程 RL slope、pass@K、策略熵与错误模态变化,而不是只保留最终 checkpoint。
工程团队应先做
在少量代表性底座上运行等预算 probe,拟合局部响应面;只在可观测区域内决策,并为分布外任务保留独立验收。
什么实验会真正改写结论
- 做 matched-loss 干预。 用不同 token 数、数据顺序或规模训练出 loss 和初始性能相近的底座,再比较多 seed RL 斜率,才能分离“训练经历”与“sigmoid 工作点”。
- 把 run 当成相关簇。 每个 pretraining checkpoint 重复多次 SFT 与 RL,报告 seed 方差;交叉验证按模型规模、预训练祖先和数据切分成组,而不只逐 run 留一。
- 压力测试策略分类。 系统扫描 \(K\in\{128,512,2048\}\)、tail 阈值和 top-k,给每类转移报告区间;若 tail discovery 方向稳定,机制证据才更硬。
- 让大模型真正跑到饱和。 20M 上限关系需要在 50M–680M 上用约一个数量级更多 RL 算力复核,才能判断更强预训练究竟提升学习速度、最终上限,还是两者兼有。
- 跨模型族与奖励噪声复现。 在自然语言、代码和多解任务上,用不同模型族、verifier 质量与总端到端成本重算前沿;若 RL 份额上升趋势仍在,才接近可迁移定律。
证据边界与资料索引
截至 2026-07-23,arXiv 仍只有 2026-07-17 发布的 v1;官方代码仓 HEAD 为 40f0442,相较前一版只新增 RL 墙钟估计,没有改变训练实现。全文结论以论文、附录、官方代码、数据与模型发布物为主;相关论文只用于比较命题边界,不把二手报道当实验事实。本文独立复算了 LOO 误差差值、策略采样误差量级、算力分解和两种墙钟口径,但未重跑 H200 训练,因此性能数字均按发布方报告陈述。
主材料与官方资产
- 合作者 Leon Li 的发布帖:以“完整训练管线能否拥有统一 scaling law”为主问题,配图对应论文的预训练—SFT—RL 管线、联合拟合与策略变化总览。主帖与配图可公开核验;页面所示 3 条自回复在未登录公开视图中不可读,因此本文不把其可能内容当作证据。
- 第一作者 Jingyan Shen 的完整发布串文:依次概括受控棋类试验台、固定总算力下的权衡、局部 log-linear 定律、算力分配前沿、pass@16 分叉、搜索宽度与深度,以及 OLMo-2 数学迁移;作者明确提示精确比例是 regime-specific 的局部结果。
- Francesco Bertolotti 的论文导读帖:四张配图分别概括论文摘要、完整训练管线、算力最优前沿与三类策略变化;其中预算端点为取整表述,策略分类需按论文定义拆开解释。
- Minty 的二次解读帖:主文准确概括了有限 RL 预算内的底座差异、困难题上的正确尾部发现与错误模态放大,以及单条 OLMo-2 数学轨迹的定性迁移;“RL 不能完全补偿弱预训练”仍需限定为已观测算力窗口。配图是论文 Figure 4 的外推算力前沿,并不直接展示主文所讲的策略演化或弱底座曲线。公开只读材料显示 6 条回复,但未提供完整回复正文,本文不据此推测争议内容。
- Understanding Reasoning from Pretraining to Post-Training:论文摘要、PDF 与版本信息。
- pre2post-chess:棋类预训练、SFT、RL 与策略分析代码。
- Lichess Puzzle Database:棋题生成、CSV 字段与“通常唯一走法;mate-in-one 可有多个有效将杀着”的官方说明,用于校准精确线路奖励的边界。
- Pre-to-Post Chess Collection:数据、预训练模型、SFT 模型与相关发布物集合。
- Chess Pretraining Dataset、Chess Puzzle Benchmark、Post-training Datasets。
- Pre-to-Post OLMo Math Models:数学迁移实验的模型链。
用于校准“发现、覆盖与预算”的一手研究
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?:RLVR 小 \(k\) 改善与大 \(k\) 覆盖边界。
- From f(x) and g(x) to f(g(x)):受控原子函数与未见组合,显示 RL 可通过组合旧技能获得新技能。
- The RL Grokking Recipe:在受控代码任务中研究 pass@K=0 家族和 grokking 条件。
- The Coverage Principle:高质量回答概率质量与后训练、测试时扩展的关系。
- The Interplay of Pre-Training, Mid-Training, and RL on Reasoning:底座 headroom、数据阶段与 RL 收益。
- Front-Loading Reasoning:把多样推理模式提前注入预训练和 SFT 的路线。
- The Art of Scaling Reinforcement Learning Compute for LLMs:用 sigmoid 曲线区分 RL 的算力效率与渐近上限,是本文 20M 饱和分析的直接方法背景。
- RL Excursions during Pre-Training:显示 RL 在早期 checkpoint 也能有效,且数据组成可能比模型规模更能改变 RL 收益,进一步说明 token 数不是唯一因果变量。