核心判断
原帖把工作概括为“35B 通过扩大测试时搜索 horizon 击败 1,000B”。这句话抓住了系统工程方向,却把论文证据压缩得过头。Agents-A1 的最终能力并非只来自推理时多走几步,而是来自一整套前置投入:约 10 万条、平均 4.5 万 token 的 SFT 轨迹,分领域 SFT / RL 教师,外部搜索与执行环境,以及把专项教师重新蒸馏回统一学生的训练。按均值粗算,SFT 语料在 packing 和 loss masking 前约包含 45 亿 trajectory tokens;因此这不是以极少数据“免费换掉参数”,而是把训练与推理计算重新分配。更准确的表述是:它把部分能力预算从单个模型的参数,迁移到了训练轨迹、验证器、领域教师、工具和推理时间。
模型确实较小
公开权重约 351 亿 BF16 参数;MoE 每 token 激活 8 / 256 个专家,模型命名口径约 3B active。
训练轨迹确实很长
10 万条 SFT 数据平均 45K token;但论文没有做“短轨迹 → 长轨迹”的受控 scaling curve。
不是全面击败 1T
按论文 Table 9,Agents-A1 对 Kimi-K2.6 是 8 胜 8 负;对另外两组大模型也未取得多数胜场。
“在若干 benchmark 上得分更高”不等于“35B 模型整体超过 1T 模型”。这里比较的是不同脚手架、工具、推理预算和评测协议下的系统结果;参数量只是其中一个变量。
它真正要解决的问题:长程任务中的可纠错执行
搜索、科研和机器学习工程不是一次前向就能完成的静态问答。Agent 必须反复获取信息、执行动作、读取环境反馈、判断是否偏航,再决定下一步。轨迹越长,早期错误越可能累积;仅把模型做大,未必会自动产生可审计的行动过程和稳定的错误恢复。
Agents-A1 将能力拆成五种原子动作:信息获取、工具调用、可执行迭代、证据验证、约束追踪。它用 Knowledge-Action Graph(KAG)保存的不只是“实体—关系”,而是每一步的状态、动作、观察与验证器结果:
其中 (C_d) 是领域材料,(A_d) 是允许的行动,(O_d) 是工具返回或执行状态,(V_d) 是正确性、证据、约束和完成度检查。这个设计的关键不是“图”这个名字,而是让失败、修复和验证参与数据筛选、上下文构造、奖励或教师评价,使模型见过如何完成过程,而不只是最终答案。需要注意,这不等于每个验证器结果都被直接写进 token-level loss。
KAG 是数据与环境基础设施,不是模型内部新增的图神经网络或持久记忆模块。部署时,35B 权重不会自动携带那张训练期知识图;它学到的是更可能采取哪些行动,以及如何利用当前工具反馈。
核心机制:先分科训练,再把专项能力装回一个学生
阶段一:长轨迹 SFT 建立行为先验
基座是 Qwen3.5-35B-A3B。SFT 数据约 10 万条,整体平均 45K token;分领域均值为深度研究 44K、代码与工程 48K、科学 37K、通用 Agent 39K,指令跟随只有 3K。训练最大序列长度 131,072,batch size 16,只训练一个 epoch。这里真正扩大的,是模型在监督阶段看到的状态—行动—反馈链。
阶段二:按失败结构训练不同教师
- 搜索教师:先 SFT,再用约 2,000 个“有时答对、有时答错”的问题做 GRPO;每题 8 条 rollout,最高 300 次工具调用,并加入搜索轮数与重复查询惩罚。
- 科学教师:先强化无工具推导,再用搜索、页面访问、代码和学术检索轨迹做第二阶段 SFT。
- 指令教师:先对可验证格式约束做 RL,再对长上下文证据定位和局部规则做 RL。
- 工具教师:用 outcome reward 判断是否完成,再只对失败轨迹加入 rubric process reward;公开描述称最终 hard-task set 只有 64 题,并反复复用。
这些教师的价值不是参数更多,而是梯度更纯:搜索教师不必同时维护长篇科学推导风格,工具教师可以专注动作合法性和完成度。论文自己也观察到,全域 SFT 会让 HLE、指令跟随和通用 Agent 任务退化,说明“把所有好数据混在一起”并不会自动得到好通才。
阶段三:On-Policy Distillation 处理领域冲突
学生先生成自己的轨迹,领域标签把样本硬路由到对应教师;教师不另写标准答案,而是在学生已经走到的 prefix 上提供 token 分布。这比离线模仿更贴近部署时状态,因为教师必须评价学生真实会到达、甚至已经偏离理想路径的上下文。工具输出、用户回合与环境观察只作为上下文,不参与语言模型 loss。
“过程监督”实际通过四条不同通道进入训练
| 通道 | 过程信息如何起作用 | 是否直接承担 token loss |
|---|---|---|
| SFT assistant turns | 监督推理文本、动作选择、工具调用与最终回答 | 是 |
| 工具观察 / 用户回合 | 作为后续动作的条件上下文 | 否,论文明确 mask |
| 验证器结果 | 筛选轨迹、决定接受/修复,并在部分 RL 中形成 outcome / process reward | 通常不是语言建模目标 |
| OPD 教师分布 | 在学生自己到达的 prefix 上约束下一 token 的局部分布 | 是,但只作用于学生生成位置 |
因此“structured process feedback”应理解为一套间接与直接信号混合的训练系统。KAG 能保存失败记录,不代表最终 SFT 会等权学习失败;搜索数据会删除错误、过短和明显猜测轨迹,工具 RL 才明确利用失败样本的 rubric 进度做密集排序。论文的叙事比“每一步都有 verifier loss”更宽,也更弱。
SVA:最有技术含量、也最缺消融的一步
普通 sampled-token OPD 只比较 rollout 实际采样到的一个 token,容易漏掉附近同样合理的候选。Salient Vocabulary Alignment(SVA)先取教师在当前位置的 top-k token 集合 (S_{i,t}^{(k)}),把师生概率都在这个集合内重新归一化,再计算截断 reverse KL:
它比只监督一个 sampled token 信息密度更高,又比全词表 KL 便宜。每个样本先按自身生成长度取平均,再在每个 active domain 内平均,最后对 active domains 平均,避免长轨迹、样本多或 loss 大的领域天然主导更新。
真正新增的部分
多教师硬路由、按领域归一化,并把 top-k 局部分布匹配用于六类异质 Agent 行为的统一。
并非从零发明
论文引用的《Revisiting On-Policy Distillation》已经提出 teacher top-K local support matching 与 truncated reverse KL;Agents-A1 的贡献更像跨域工程化。
论文没有披露最终 (k)、学生落在 teacher top-k 内的 coverage、OPD 训练超参数,也没有比较 sampled-token OPD、SVA、无领域归一化和不同 k。由于概率在 top-k 内重新归一化,集合外质量不会直接进入该 KL;作者定义了 coverage 监控这一风险,却没有报告数值。方法看起来合理,但当前主结果不能单独归因给 SVA。
一个比“没报告 k”更根本的目标函数盲点
设教师 top-k 集合为 \(S\),学生只把很小的总概率 \(\varepsilon\) 放进这个集合,但集合内的相对比例刚好复制教师:
重新归一化后仍有 \(\bar p_s=\bar p_t\),所以截断 KL 可以等于 0;与此同时 coverage \(\rho=\varepsilon\) 可以任意小。更严格地说,学生的全词表 softmax 分母会在“除以集合内总质量”时代数消掉,\(\bar p_s\) 等价于只在 \(S\) 内做 softmax,因此集合外 logits 对这项 loss 的梯度为 0。也就是说,SVA loss 只保证“进入教师候选集合后怎么分”,不保证学生愿意把多少概率放进这个集合。论文把 coverage 定义为监控量,却没有把它写进优化目标,也没有报告训练曲线。若没有额外的全词表 KL、coverage regularizer 或足够大的 k,学生仍可能把大量概率留给教师 top-k 之外的 token。
可能的收益
teacher top-k 能过滤长尾噪声,reverse KL 会更集中地压制教师不认可的局部候选,适合工具名、参数和值域这类尖锐决策。
可能的代价
多解搜索、同义查询和开放式行动需要保留多样性;teacher-selected support 与 reverse KL 可能过早收缩探索,而论文没有给熵、coverage 或失败恢复消融。
领域归一化也隐含了一个采样假设
每个 mini-batch 先在领域内平均,再对当批出现的 active domains 等权平均。这能阻止大领域凭样本量压过小领域,但总体目标会随“这一批出现了哪些领域”而变化:稀有领域一旦出现,就和高频领域获得同等总权重。要让这种设计稳定,需要分层采样、足够大的跨域 batch 或明确的 domain schedule;论文只说会平衡各域 unique prompts,没有披露 batch 构造和梯度冲突统计。
结果审计:强提升成立,“全面越级”不成立
相对自身基座,提升广泛而且幅度很大
| 任务 | 基座 | 全域 SFT | 最终模型 | OPD 阶段变化 | 该数字说明什么 |
|---|---|---|---|---|---|
| GAIA | 59.8 | 95.2 | 96.0 | +0.8 | 主要增益已经在长轨迹 SFT 阶段出现 |
| FrontierScience-Research | 2.5 | 31.7 | 40.0 | +8.3 | 专项教师整合继续带来显著收益 |
| MLE-Bench-Lite | 24.2 | 39.4 | 43.9 | +4.5 | 工程闭环继续改善,但仍弱于前沿大模型 |
| HLE w/ tools | 47.4 | 41.6 | 47.6 | +6.0 | OPD 基本修复 SFT 造成的退化 |
| IFBench | 70.2 | 68.7 | 80.6 | +11.9 | 最清晰的跨域冲突修复案例 |
| LongBench-v2 | 59.0 | 58.3 | 60.2 | +1.9 | 从小幅退化恢复为小幅净增益 |
按论文 16 个共同指标,最终模型相对全域 SFT 在 15 项上提高,只有 XBench-DS-2510 从 88.0 降到 86.0。这是 OPD 整体有价值的最强内部证据:它确实修复了 HLE、IFBench、LongBench-v2 等冲突域。但最终阶段同时包含领域教师、on-policy rollout、硬路由、SVA 和领域归一化,仍不能把 15/16 的改善单独归因给 SVA。
与大模型逐项比较,胜负接近,而不是碾压
| 对照模型 | 可比指标数 | Agents-A1 胜 | 平 | 负 | 结论 |
|---|---|---|---|---|---|
| Kimi-K2.6 | 16 | 8 | 0 | 8 | 刚好五五开 |
| DeepSeek-V4-Pro Max | 16 | 6 | 1 | 9 | 总体负多于胜 |
| GPT-5.5 xhigh | 15 | 7 | 0 | 8 | 接近,但没有多数胜场 |
Agents-A1 的优势集中在 SEAL-0、HiPhO、FrontierScience-Olympiad / Research、IFBench;弱项集中在 BrowseComp、SciCode、MLE-Bench、HLE、τ²-Bench 和 MatTools。也就是说,它不是用一种通用 horizon 技巧均匀提升所有能力,而是在训练覆盖和工具协议高度匹配的领域出现强增益。
12 小时 Whale Challenge 案例有启发,但不是因果证据
模型从简单 CNN 的验证 AUC 0.58 出发,经音频增强、时间分布诊断、近期数据训练、Mel-CNN ensemble 和重增强,把“最佳验证 AUC”推到 0.9935。这展示了长程试验管理能力;但公开材料没有给出完整动作轨迹、每个独立 seed 的曲线、最终隐藏测试成绩,也没有短 horizon 或相同算力下大模型对照。连续选择 best validation 还可能累积验证集适配。因此它更像高质量 case study,而不是 horizon 越长必然越好的证明。
新增证据:4B 版本比“35B 对 1T”更能说明问题
官方在 2026-07-14 发布了 Agents-A1-4B。配置显示它是 dense Qwen3.5 架构,精确 BF16 参数量约 45.39 亿、32 层、262K 最大位置;它不是论文所述 35B MoE 的量化版。官方没有同步发布 4B 的训练技术报告、数据配比或 OPD 超参数,因此只能把模型卡分数视为发布方报告,不能默认它完整复用了 35B recipe。
| 任务 | Qwen3.5-4B | Agents-A1-4B | 4B 增益 | Agents-A1 35B | 观察 |
|---|---|---|---|---|---|
| GAIA | 58.3 | 95.1 | +36.8 | 96.0 | 4B 与 35B 只差 0.9 |
| XBench-DS-2510 | 73.0 | 90.0 | +17.0 | 86.0 | 4B 反超 35B 4.0 |
| FrontierScience-Research | 1.7 | 33.3 | +31.6 | 40.0 | 小模型获得巨大系统增益,仍有能力差距 |
| VitaBench | 22.0 | 40.3 | +18.3 | 38.8 | 4B 反超 35B 1.5 |
| MatTools | 10.9 | 49.3 | +38.4 | 47.1 | 4B 反超 35B 2.2 |
| MLE-Lite | 7.6 | 22.7 | +15.1 | 43.9 | 开放工程任务仍明显依赖模型容量 |
在模型卡列出的 13 个共同任务中,4B 在 XBench、IFEval、VitaBench、MatTools 四项追平或超过 35B;但在 SciCode、MLE-Lite、IFBench 和 LongBench-v2 等任务仍明显落后。这个结果比“35B 对 1T”更接近一个自然实验:同系列后训练与 agent scaffold 对小模型的杠杆非常大,但内部表示容量仍决定开放式代码、工程和长上下文的上限。
两种模型不是只改变参数量的受控实验:基座一个是 dense 4B,一个是 35B-A3B MoE;公开材料没有确认数据、教师、训练步数和工具预算完全一致,也没有 seed 或置信区间。4B 模型卡还引入了论文表中没有的对照模型与部分更新基线,不能与 arXiv Table 9 无缝拼接。
配置层还有一个实际部署细节:4B tokenizer 的默认 system prompt 把 current date 固定成 2026-07-14,模型卡同时提醒部署者应动态更新。若服务端不覆盖 system prompt,后续检索任务可能从错误日期先验开始;这说明 Agent 能力不仅在权重中,也在容易被忽略的模板和运行时配置中。
为什么不能把排行榜直接读成参数效率定律
- 论文与公开评测说明冲突。论文 Section 5.1 称四个搜索 benchmark 都报告 pass@1;仓库 Search README 却明确写 BrowseComp 达到 300 次调用或 context 上限时清空上下文重试,最多五轮,并称结果使用 retry@5。75.5 究竟是哪种口径,公开材料无法唯一确定。
- 系统里不只有 35B 模型。页面读取由另一个 summarization model 提炼,搜索依赖商业搜索服务,评测还使用不同 judge;这些外部模型的身份和成本没有完整披露。“35B”描述的是主策略模型,不是端到端系统的全部计算。
- 工具条件不一致。Agents-A1 在 HiPhO、FS-O、FS-R 使用搜索、访问、代码和学术工具;对照模型采用其标准 tool-free 结果。论文称这样更严格,但这不是控制变量比较。
- 推理预算不一致。搜索任务最多 300 回合;MLE 每题一张 H200、12 小时;GPT-5.5 用 xhigh reasoning effort,其余模型常用采样参数。参数量没有同时控制 token、工具调用、wall-clock 和环境算力。
- 基线来源混合。部分分数取自原技术报告,缺失项才在作者环境重测;τ²-Bench 的 Qwen 官方值 81.2 与作者复现值约 32.5 差距巨大,已经证明版本、模拟用户与环境可以支配结论。
- 模型卡是持续变化的展示页,不是论文冻结表。当前模型卡加入 Qwen3.6、Nex-N2-mini、IFEval 与 4B 结果,部分同名基线也与 arXiv 表不同,例如 35B Qwen 的 SciCode 从论文 37.1 变成 37.7、VitaBench 从论文复现 26.0 变成 31.9。比较时必须记录来源版本,不能跨表挑数。
- 不确定性不足。MLE 与 MolBench 明确有三次重复,多数表格没有 seed、置信区间或显著性检验。FrontierScience-Research 的巨大领先值得关注,但还不能据此建立普遍规律。
在作者给定的长程工具系统里,Agents-A1 对同源 35B 基座产生了广泛提升,并在一组科学、搜索和指令 benchmark 上达到大模型区间。这个结论不需要接受“35B 全面击败 1T”的营销表达。
开放程度:权重可用,训练结论尚不可完整复现
| 资产 | 公开状态 | 能核验什么 | 还缺什么 |
|---|---|---|---|
| 35B 权重与配置 | 已公开,Apache-2.0 | 35.1B BF16 参数、40 层、256 experts、top-8、262K 最大位置等 | 无法仅靠权重还原训练数据与教师过程 |
| 4B 权重与配置 | 已公开,Apache-2.0 | 4.539B dense 参数、32 层、262K context 与模型卡评测 | 没有对应训练报告、数据/教师说明、消融或独立复现 |
| 搜索评测 | 代码已公开 | 工具接口、judge、300-call 上限、外部服务依赖 | 正式数据需另备;pass@1 / retry@5 口径冲突 |
| 工具评测 | 代码型子集公开 | τ²、Vita、MatTools、MolBench 的 runner 与部分任务 | 大体积 fixture、oracle、生成结果与部分材料未附 |
| MLE 评测 | 仅协议文档 | 12 小时、H200、3 seeds、工具概念 | README 明示 agentic harness 与评测代码尚未发布 |
| 训练与 KAG | 未公开 | 只能根据论文理解抽象流程 | 数据、生成器、教师 checkpoint、SVA / OPD 实现、超参数、训练算力 |
本轮没有加载 35B / 4B 权重或重跑数十个昂贵 benchmark,因此模型表现属于发布方报告;模型结构、仓库公开范围、公式和表格口径则可由公开文件直接核验。截至 2026-07-22,官方评测仓库最新 commit 仍停留在 2026-07-16:MLE harness 继续标记为 coming soon,训练数据与合成流水线的公开请求也没有维护者答复。现阶段最现实的独立复现,是固定一个公开 benchmark、同一工具栈和同一预算,对 Agents-A1 与同源 Qwen 基座做成对运行,而不是试图一次复制整张排行榜。
术语对齐
独立判断:它改变的是能力核算单位
1. 参数规模没有消失,只是不能再单独解释系统能力
一个 Agent 系统的有效预算更接近:
35B 主模型配 300 次工具调用和 12 小时 H200,可能比 1T 模型的一次短回答消耗更多总 wall-clock 与外部算力。Agents-A1 的意义不是“免费打败大模型”,而是证明计算放在哪里可以重新设计:把一部分静态记忆与一次性内部推理,换成按需检索、执行与验证。
2. 真正的 scaling 变量应是“可验证前沿”,不是裸长度
如果每一步都有强验证器,扩展 horizon 能把失败变成新信息;如果反馈稀疏或 judge 不可靠,长轨迹只会放大偏航。因而更值得画的曲线不是 score 对 token,而是 score 对“有效验证节点数”、错误恢复率、分支数、状态压缩质量和总成本。论文的 KAG 直觉恰好支持这个解释,但实验没有把它做成 scaling law。
3. 多教师 OPD 更像能力调度器,不是能力凭空生成器
专项教师先拥有强技能,OPD 的任务是减少把它们塞回一个学生时的梯度冲突。最终学生经常仍弱于对应教师,论文也明确承认这一点。这说明 OPD 的价值应按“单模型覆盖率 / 专项性能损失 / 部署成本”的 Pareto 前沿评价,而不是只看是否刷新某个单项榜。
4. 小模型在 Agent benchmark 上越级,首先说明 scaffold leverage 很大
当搜索、科学和工程任务允许外部工具时,策略模型最重要的能力从“知道全部答案”转向“提出下一步高价值行动、维护状态、识别停止条件”。4B 在 XBench、VitaBench、MatTools 上反超 35B,说明高反馈密度环境可以显著压缩参数差距;但在 SciCode、MLE、IFBench 和 LongBench-v2 上仍明显落后,说明开放式代码、工程搜索和长上下文仍受内部表示容量约束。小模型路线最适合动作可验证、错误可恢复的环境,不应无条件外推到开放世界自主 Agent。
5. SVA 的真正风险不是 top-k 太小,而是只约束条件分布
SVA 优化的是“已知 token 落在教师 top-k 集合内时,学生应如何分配相对概率”,并不直接优化“学生有多大概率进入这个集合”。这把一个完整的分布匹配问题拆成了 conditional alignment 与 coverage 两部分,但论文只训练前者、监控后者。工程上若要复用这个想法,应同时报告 coverage 分位数、集合外采样率和 action entropy,并考虑加入 coverage 下界或稀疏全词表 KL;否则 loss 下降可能掩盖真正的行为偏移。
工程实践:如果要采用这条路线,应该怎么验收
- 固定系统边界。同时记录主模型、summarizer、judge、搜索服务、工具版本、最大回合、重试策略和 context compaction;不要只记录模型名。
- 画 budget curve。至少评测 10 / 30 / 100 / 300 次工具调用下的成功率、成本、延迟与失败类型,确认后半程仍提供边际收益。
- 分开 outcome 与 process。不仅看最终 pass@1,还看无效调用率、重复查询率、可恢复错误比例、证据覆盖率和 premature stop。
- 对照同源基座。Agents-A1 与 Qwen3.5-35B-A3B 必须在完全相同 scaffold 下成对比较;再加入一个大模型,才能估算权重质量和系统工程各自贡献。
- 复核 retry 口径。pass@1、best-of-N、retry@N 和清空上下文重试是不同产品策略,不能共用一个分数名。
- 把验证器当核心资产。优先投入可执行检查、状态一致性、证据引用和任务完成判定;没有可靠 feedback,延长 horizon 通常只是延长失败。
- 把 SVA coverage 纳入验收。不能只看截断 KL;至少记录 teacher top-k coverage、集合外实际采样率、不同 k 的任务曲线,以及是否需要 coverage regularizer。
证据边界与资料索引
本文重新核对了 2026-07-13 的 arXiv v2 全文、TeX 源文件、公式、全部主表与附录,并在 2026-07-22 复查官方仓库、35B / 4B 配置、模型卡和公开 issue。原始 X 页面在无登录脚本环境下不能稳定展开自回复;可直接核验的主帖文本、日期、作者和配图已还原,核心技术判断均回到论文与官方资产。未运行 35B / 4B 权重,也未独立复现长时 benchmark;所有性能数字均按发布方报告处理,4B 结果不视为论文主表的一部分。
- Grigory Sapunov:Agents-A1 解读主帖
- Scaling the Horizon, Not the Parameters(arXiv:2606.30616 v2)
- Agents-A1 官方仓库与公开评测代码
- Agents-A1 官方模型卡、权重与配置
- Agents-A1-4B 官方模型卡、权重与配置
- 数据合成流水线公开请求与训练数据公开请求
- Revisiting On-Policy Distillation:teacher top-K local support matching 的直接前置工作
- Agents-K1:同团队的 agent-native knowledge orchestration 前置工作
- Qwen3.5 基座技术说明