第一遍:原文到底讲了什么
文章不是一篇提出新算法的论文,而是一篇面向从业者的路线综述。它的核心问题是:self-evolving、self-improving 与 recursive self-improvement 到底各指什么;眼下产业与研究界有哪些真实系统;这些系统究竟在改模型、改 Agent,还是只改当前任务的产出。
原文的机构盘点、三层定义、全部主要案例、两条公式、联合优化、可解释性延伸与结尾限定均纳入下文;重复的图注和同义宣传语被合并,不影响论证理解。
作者为什么认为“自进化”已经从口号变成路线
文章先用一组 2026 年案例建立现实感。OpenAI 在 GPT‑5.6 发布中给出内部 RSI Index,把研究系统调试、kernel 优化、训练配方实验和改进另一模型放进同一组内部评测,并报告 Sol 相对 GPT‑5.5 提升 16.2 分。Anthropic 则把递归改进描述成一个逐步自动化的研发过程:模型先写代码、审代码、跑清晰目标下的实验,再逐渐承担开放式研究。其公开材料称,2026 年 5 月 Claude 已贡献 Anthropic 超过 80% 的合入代码,但也明确提醒“代码行数”会夸大真实生产率。
文章随后扩展到 MiniMax 的内部 harness 自修改、Sakana 的 RSI Lab、Apodex 的大规模多 Agent 验证、Weco 的双层 autoresearch,以及以 latent-space 改进为目标的创业公司。作者借此强调:行业实际押注的并不是同一种机制;有人优化研究产物,有人让部署后的 Agent 写回技能,有人尝试联动 harness 与权重,还有人研究潜在空间里的推理结构。
这部分数字多来自发布机构自己的博客、内部评测或尚未公开完整复现材料的实验。文章把它们当作“路线正在形成”的迹象,而不是已经证明自主智能会指数爆发。
三层分类:关键不是谁在循环,而是循环改写了什么
作者采用 Shilong Liu 的分类,把系统拆成 Model、Harness 与 Artifacts。Model 是产生动作或文本的基础模型;Harness 是把模型变成 Agent 的外部运行结构,包括 prompt、memory、tool、skill、hook、路由、工作流与评测;Artifacts 是 Agent 产生的代码、论文、算法、模型配置或其他任务结果。
Artifacts
循环修改当前任务的产物。成功会让这一次的代码、算法或实验配置更好,但不必改变下一次运行时的 Agent。
Harness
把失败经验写回可复用的 prompt、memory、skill、tool 或工作流。一次变更会影响后续任务。
Model
通过自训练、可验证奖励、自对弈、测试时训练或联合优化改变模型参数或模型内部能力。
三层不是互斥箱子。Harness 的执行轨迹可以成为训练数据;模型变强后能设计更好的 harness;更好的模型与 harness 又能搜索出更强 artifacts;成功 artifacts 还可能被包装为新工具。原文把这个相互反哺关系画成闭环,并把它视为未来系统的主要形态。
Artifacts 路线:让 Agent 成为“候选生成器 + 实验员”
Autoresearch
Karpathy 的项目把问题压缩到一个可严格比较的小环境:Agent 只能修改 train.py,每个候选固定训练 5 分钟,再用验证集 bits-per-byte(val_bpb,越低越好)决定保留还是丢弃。固定墙钟预算让系统必须同时权衡模型质量与硬件效率;大约每小时可跑 12 次实验,一夜约 100 次。这里真正被优化的是训练代码和配置,而不是执行搜索的 Agent 自身。
AlphaEvolve
Google DeepMind 的 AlphaEvolve 用 Gemini 生成候选程序、自动评估器验证候选、演化框架保留高分个体。它已经用于数据中心、芯片设计、矩阵乘法与 AI 训练;其中一些算法反过来服务于底层模型训练。作者把这看成“改产物逐渐接到改自身生产基础设施”的过渡案例。
这一路线的必要条件很朴素:目标必须可运行、结果必须可比较、错误候选要能廉价回退。它首先是一种扩大搜索空间的工程方法;LLM 的贡献是把以往人工设计的变异算子,升级为能读代码、解释失败、提出新候选的通用搜索启发式。
Harness 路线:把一次失败变成以后都能复用的状态
原文认为近期最现实的自我改进发生在 Harness 层,因为它不需要重训模型,修改轻、可回滚、部署反馈快。Hermes Agent 会把复杂任务经验沉淀成技能并持续维护;MiniMax 报告内部 M2.7 在 100 多轮中执行“分析失败 → 改 scaffold → 跑评测 → 保留或回退”,使内部评测提高 30%;Apodex 则把验证从单个 Agent 的继续推理中拆出,用并行子 Agent、共享报告池和专门验证角色处理冲突。
RHI 如何形式化“哪个 harness 更好”
Recursive Harness Self-Improvement(RHI)把 harness 写成 Agent loop 的 prompt 级规格,并通过自身历史中的成对偏好反馈迭代。对任务 \(x\),其目标可以概括为寻找成对胜率最高的 harness:
\(\mathcal{H}\) 是候选 harness 空间,\(\mu\) 是竞争 harness 的参照分布,\(\mathcal{A}(H,x)\) 表示用 harness \(H\) 解任务 \(x\) 的 Agent,指示函数在评估器偏好 \(y\) 时取 1。直观地说,它优化的不是一次回答分数,而是“当前 harness 对其他候选的期望胜率”。论文报告在 30 个合成机器学习研究任务中,少数几轮更新即可让低推理强度 Agent 超过同模型最高推理强度设置,推理成本最多降低 60%;作者将主要机制归因于更好的跨 Agent 信息流和上下文管理。
Ai2 的反证为什么重要
同一时期的 Ai2 研究指出,Harness evolution 本身也是反复采样、评估、改写的搜索过程。如果不给简单 parallel sampling、sequential refinement 或 test-time scaling 相同的反馈与推理预算,就无法判断收益来自“harness 学到了可迁移结构”,还是来自“搜索次数更多”。他们在 Terminal-Bench 2.1 上做预算匹配与 held-out 测试,发现自动 harness evolution 没有稳定胜过简单 test-time scaling,泛化也有限。
Model 路线:从“自己提供训练信号”到 harness—权重协同
原文把不依赖人工 gold answer 的训练都放进广义模型自进化:self-training 用高置信或一致性样本反哺训练;RLVR 用可验证奖励更新策略;self-play 让不同版本相互出题或对抗;test-time training 则在推理现场更新模型。更狭义、更接近 RSI 的版本,是 AI 自己发现训练瓶颈、提出实验、修改代码或数据、训练下一代,再让下一代继续接管研发循环。
SIA:两个旋钮由同一个反馈 Agent 调度
SIA 让 Feedback-Agent 根据执行轨迹决定改 scaffold 还是触发 LoRA 权重更新。论文报告联合更新在中文法律分类、GPU kernel 和单细胞 RNA 去噪三个任务上都优于只改 harness,并分别给出相对既有最好结果 +25.1%、kernel 延迟 1,161 → 1,017 微秒、去噪指标 +20.4% 的发布方结果。它说明 prompt 不能替代全部领域学习,但还没有证明系统会改进“如何改进”的元能力。
Continual Harness:内层高频改流程,外层低频蒸馏模型
Continual Harness 在不重置的长程游戏中,让内层 Refiner 持续修改 prompt、子 Agent、技能和记忆,外层则用过程奖励模型挑出低质量片段,再由更强教师重标并更新策略。论文的重要负面结果是能力依赖:强模型档位能降低按钮成本、逼近人工工程 harness;较弱模型有时反而比极简基线完成度更低、成本更高。Harness 不是免费外挂,模型必须具备读取、选择和执行新规则的能力。
为什么原文最后转向可解释性
作者认为,如果系统始终不知道“训练如何塑造推理”,权重自我更新仍是黑箱调参。因此文章把 on-policy distillation 的 forking token、Anthropic J-space 和连续潜在推理的 superposition 纳入版图:它们不直接构成 RSI,却试图找到模型内部的决策点、评估意识和并行搜索表示,为未来更可控的自我修改提供观测面。
第二遍:证据审计——哪些说法站得稳
| 主张 | 证据状态 | 审计结论 |
|---|---|---|
| GPT‑5.6 的 RSI Index 相对 GPT‑5.5 提升 16.2 分 | 官方报告 | OpenAI 页面直接支持,但这是内部复合评测;任务明细、权重、统计不确定性与独立复现尚不足,不能等同“已实现 RSI”。 |
| Claude 贡献 Anthropic 80% 以上合入代码 | 官方报告 | Anthropic 公开材料支持,并主动提醒代码行数夸大生产率;这证明研发自动化加速,不证明模型独立决定研究方向。 |
| RHI 最高降本 60%,低 reasoning 超过高 reasoning | 论文报告 | arXiv v1 摘要支持,范围是 30 个合成机器学习研究任务;外部有效性与预算匹配仍需独立复现。 |
| MiniMax M2.7 自主改 scaffold,内部评测 +30% | 发布方报告 | MiniMax 官方博客支持 100 多轮和 30%,但内部任务、评测集与完整轨迹未公开,无法排除分布内过拟合。 |
| AIDE² 已达到“点火”或智能爆炸 | 不成立 | Weco 只主张 Level 1 net positive;把 AIDE47 放到外层虽更快到达相似上限,但差异不显著,也没有渐近更优。发布方明确否认已经达到 ignition。 |
| 自动 harness evolution 普遍优于简单搜索 | 被反例削弱 | Ai2 的预算对等实验未发现稳定优势,并发现 held-out 泛化有限。有效结论应是“在特定表示、评测器和任务分布上可能有用”。 |
| Artifacts、Harness、Model 三层都等同 RSI | 概念过宽 | 来源 taxonomy 把三者组织为 self-evolving systems,但明确区分 artifact optimization 与 agent self-modification;原文结尾也承认 RSI 是更严格子集。 |
文章最强的部分是把近期散乱材料组织成可理解的对象图,并且纳入 Ai2 的反面证据、弱模型用不好 harness 的失败案例,以及 AIDE² 尚未 ignition 的边界。最弱的部分是开头把若干层级都宽泛称为 RSI,容易让读者把“有循环”“能回退”“产物变好”误读成“系统改进自身的能力正在递归增强”。
独立判断:分类要用两条轴,而不是一棵三层树
Artifacts / Harness / Model 只回答更新写到哪里,没有回答更新是否真的构成自我改进。更可靠的判断需要第二条独立轴:更新能否跨任务持久化、是否在 held-out 任务上泛化、是否在固定预算下优于简单搜索,以及改进后的系统能否成为更强的改进者。
| 改进层级 | 最低证据 | 典型系统 | 不能推出什么 |
|---|---|---|---|
| 结果优化 | 同一目标下 best-so-far 变好 | Autoresearch、AlphaEvolve | 不能推出 Agent 本身学习了 |
| 持久适应 | 更新写回后续任务可复用 | skill / memory / harness 更新 | 不能推出分布外有效或总体净收益 |
| 可泛化自我改进 | 固定预算、私有评测、held-out 任务仍胜 | AIDE² Level 1 的目标 | 不能推出改进速度会继续加速 |
| 递归改进 | 新系统作为 improver 时渐近优于旧系统 | 尚缺强证据 | 不能仅凭一次更快到顶就宣称 ignition |
| 加速递归 | 固定物理预算下改进斜率持续上升 | 当前无可信示例 | 不能从短期 benchmark 曲线外推智能爆炸 |
只要目标、评分器、任务分布和准入门槛仍由人固定,系统就在一个人类预先画好的适应度地形上搜索。它可能非常自主地改代码,却没有自主决定什么值得改。真正的递归改进不只要求 proposer 变强,还要求 evaluator 的覆盖、抗利用性与治理同步升级;否则生成器越强,越可能只是更快地过拟合或利用固定评测。
这也解释了为什么预算匹配是核心而非评测细节。Harness evolution、best-of-\(N\)、并行采样与顺序 refinement 都在消费更多候选、反馈和推理。只有在相同总成本、相同信息访问和相同 held-out 协议下,才能把收益归因于“学到了更好的更新结构”。否则,“进化”可能只是 test-time search 的重新命名。
工程上应该怎么做
- 先从 Harness 开始。它比权重更新轻、可审计、可回滚,最适合建立真实闭环;但每个写回都要有版本、来源、作用域和失效条件。
- 把搜索预算列入基线。与同成本的多采样、顺序改写和人工规则比较,避免把额外推理包装成方法增益。
- 分离 public signal 与 promotion gate。Agent 可以看到训练反馈,但最终准入应依赖私有任务、回归集和无法直接针对优化的检查。
- 测 improver transfer。不要只看新 Agent 解题更强,还要把它放到“改另一个 Agent”的位置,测试是否更快、更稳、更能跨域地产生有效更新。
- 保护治理状态。权限、评测器、回滚策略和安全边界不应与普通 prompt、skill 一样被无条件自修改。
术语与容易混淆的边界
证据边界与资料索引
主材料为周星星于 2026-07-30 编辑的知乎文章。机构内部结果均按发布方报告处理;本页核对公开正文、官方博客、论文摘要与明确实验说明,没有独立复现训练、长程 Agent 运行或内部 benchmark。RHI、SIA、Continual Harness 与 Ai2 工作均为 2026 年公开预印本,其结论可能随版本、代码发布和独立复现更新。
- 周星星:《自进化(Self-evolving/RSI),一篇就够了》
- Shilong Liu:A Taxonomy of Self-evolving Agents
- OpenAI:GPT‑5.6
- Anthropic:When AI builds itself
- Karpathy:autoresearch
- Google DeepMind:AlphaEvolve
- MiniMax:M2.7 — Early Echoes of Self-Evolution
- Recursive Harness Self-Improvement
- Rethinking the Evaluation of Harness Evolution for Agents
- Weco AI:AIDE²
- SIA: Self Improving AI with Harness & Weight Updates
- Continual Harness: Online Adaptation for Self-Improving Foundation Agents
- Nous Research:Hermes Agent