当 AI 开始构建自己:Anthropic 内部实践与递归自我改进的未来
文章目录
Anthropic 内部正在发生一个值得关注的变化:AI 不再只是被研究和开发的产品,也开始参与开发 AI 的过程。从补全代码,到自主修改代码库、运行实验、组织并行 Agent,Claude 正逐渐进入模型研发循环本身。
如果这条路径继续延伸,终点可能是 Recursive Self-Improvement(递归自我改进,RSI):一个 AI 系统能够自主设计、训练和评估自己的继任者,让“模型进步”本身成为下一轮模型进步的加速器。
本文根据我的笔记与 Anthropic Institute 的文章 When AI builds itself 整理。重点不是断言 RSI 一定发生,而是理解:Anthropic 内部已经把哪些工作交给 Claude,距离真正闭环还缺什么,以及这条趋势可能把人类角色推向哪里。
1. 从辅助工具到改进循环的一部分
Anthropic 把 AI 参与自身研发的过程划分为五个阶段。真正重要的变化,不只是模型生成了更多代码,而是它与环境之间的接口逐渐闭合:从只能给建议,发展为能够行动、观察结果、修正方案,再把工作委派给其他 Agent。
-
构建最初的 Claude
人类在笔记本电脑上编写代码和文档,AI 还是被开发的对象。
-
Chatbot
模型生成局部代码片段,人类复制、粘贴并整合结果。
-
Coding Agent
Agent 可以直接读写代码库,从补全片段走向完成整个文件。
-
自主 Agent
Agent 自己运行代码、观察结果,并把数小时工作委派给其他 Agent。
-
闭合改进循环
AI 设计实验、训练并评估继任模型,模型改进开始反过来加速模型改进。
这条时间线可以压缩成三个层次:
- 生成(Generation):模型给出文本和代码,人类负责执行;
- 行动(Agency):模型可以操作代码库、运行工具并根据反馈迭代;
- 闭环(Closing the loop):模型不只执行研发任务,还参与选择实验、训练模型和改进下一代系统。
Chatbot 到 Coding Agent 的跨越,来自“能否直接作用于环境”;Autonomous Agent 到 RSI 的跨越,则取决于“能否独立选择值得推进的方向”。前者主要是执行问题,后者涉及研究品味、判断、验证和治理。
2. 外部趋势:Agent 可以可靠完成的任务正在变长
Anthropic 引用了 METR 的任务时长研究:AI 能够以给定可靠度独立完成的任务时长,近期大约每四个月翻一倍,快于此前约七个月翻一倍的趋势。
任务时长比“单题正确率”更接近 Agent 的真实价值。一道题答对,并不等于可以在数小时里维护计划、处理失败、使用工具并交付可验证结果。时间范围变长,意味着 AI 开始从局部助手进入完整工作单元。
类似趋势也出现在软件工程与研究复现基准:
- SWE-bench 要求模型根据真实 GitHub Issue 修改真实代码库并通过项目测试;
- CORE-Bench 测试模型能否利用论文的代码和数据复现实验结果;
- 许多基准迅速接近饱和,迫使评测转向更开放、更长时、验证成本更高的任务。
但公开 Benchmark 只能证明模型“有能力做什么”,无法说明它已经怎样改变前沿实验室的生产过程。更有价值的证据来自 Anthropic 内部。
3. Anthropic 内部:Claude 已经参与了多少工作?
3.1 超过 80% 的合并代码由 Claude 编写
Anthropic 披露,截至 2026 年 5 月,合并进内部代码库的代码中,超过 80% 可归因于 Claude。Claude Code 在 2025 年 2 月发布研究预览之前,这个比例还只有低个位数。
与此同时,2026 年第二季度,典型工程师每天合并的代码量约为 2024 年的 8 倍。代码行数并不等于生产率:更多代码可能意味着维护负担,统计归因也并不完整。但两个时间拐点仍然很明显:
- 2025 年,Claude 从“建议代码”转向“运行并修改代码”;
- 2026 年,模型开始在更长时间范围内自主完成任务。
这里最值得注意的不是“AI 写了多少行”,而是工程师的工作单位发生了变化:人不再逐行表达实现,而是定义目标、提供约束、检查结果,并同时引导更多工作流。

图 1:Code contributed per person, per quarter。柱形表示每位活跃贡献者每天合并代码行数的季度平均值,并以 2025 年前平均水平为基准。2026 年 Q2 为尚未结束的季度;虚线标注模型或产品的公开发布节点。来源:Anthropic Institute。
3.2 AI 开始完成原本不会被安排的工作
生产率提升不只表现为更快完成计划内任务。Anthropic 还观察到 Claude 承担了大量过去不会获得人力优先级的工作,例如探索性工具、长期积压的清理和跨越大量陌生上下文的修复。
一个典型案例发生在 2026 年 4 月:Claude 提交了 800 多项修复,让一类 API 错误下降约一千倍。负责监督的工程师估计,如果由人类完成,可能需要四年。
这揭示了 Agent 的另一类价值:它不只是替代昂贵的人类时间,还可以让那些“单项价值不低、但过于零碎和痛苦”的工作第一次变得经济可行。
3.3 代码质量从可用走向接近人类
“代码好”至少包含两个条件:
- 能正确运行并解决问题;
- 其他工程师能够理解、维护和继续构建。
Anthropic 的内部观察是:员工在任务中纠正、重定向或接管 Claude 的频率持续下降,即使是缺少清晰规格的开放任务也在改善。原文判断,Claude 编写的代码在 2025 年末仍略逊于人类,到 2026 年已经大致接近人类水平,并可能继续超过。

图 2:Claude Code session success rate。曲线采用每周统计的四周移动平均,并由 LLM Judge 判断 Session 是否在不需要人工纠正的情况下完成任务。最显著的变化来自开放问题:它从 2025 年下半年的约 10%–25%,提升到 2026 年 5 月约 76%;简单和常规任务则较早进入高成功率区间。来源:Anthropic Institute。
代码审查也因此改变。Anthropic 的变更在合并前会由自动 Claude Reviewer 检查缺陷和安全问题。回溯分析显示,如果历史变更都经过这类审查,大约可以提前发现导致 claude.ai 既往事故的 三分之一 Bug。
这形成了一个早期闭环:Claude 写代码,Claude 审查代码,人类从逐行生产转向监督两套相互制约的模型流程。不过,“模型审模型”不能替代外部测试、权限隔离和独立评估,否则同源错误也可能被共同忽略。
4. 从工程执行到研究执行
构建前沿模型大致包含两类工作:
- Engineering:写代码、建设基础设施、运行并维护训练系统;
- Research:选择问题、设计实验、解释结果并决定下一步。
Claude 在工程执行上进展更快,但 Anthropic 的案例表明,它也正在进入实验循环。
4.1 在目标明确时,实验优化已表现出超人能力
Anthropic 在发布模型时会运行一个固定测试:给 Claude 一段训练小模型的代码,在保持正确性的前提下尽可能加速。模型需要反复重写、执行、计时、判断瓶颈,再进入下一轮。
在同类设置中:
- 2025 年 5 月,Claude Opus 4 平均把起始代码加速约 3 倍;
- 2026 年 4 月,Claude Mythos Preview 达到约 52 倍;
- 熟练人类研究员花 4–8 小时,通常达到约 4 倍。
绝对倍数依赖起始代码有多少优化空间,不能直接理解为真实前沿训练整体加速 52 倍。更可靠的信号是:在目标和正确性检查都预先给定时,模型在一年内从“有帮助”走向了明显超过人类的搜索与执行能力。
4.2 Agent 已能自己设计一组实验,但问题仍由人选择
在一项弱模型监督强模型的开放研究中,Claude Agent 提出假设、并行实验、共享发现并迭代方案。两名人类研究者在一周左右恢复了理论性能差距的约 23%,Agent 使用约 800 小时累计运行时间和 1.8 万美元算力,恢复了约 97%。
这个结果很强,但边界同样关键:
- 人类选择了研究问题;
- 人类定义了评分规则和成功边界;
- 结果没有干净地迁移到生产规模模型;
- 大量并行算力并不等价于更少的现实成本。
因此,Claude 已经能够在“给定问题空间”中组织研究,却还没有证明自己可以稳定判断“哪个问题最值得研究”。
5. 真正缺失的一环:Research Taste
Anthropic 用员工成长路径解释当前边界:
| 工作层次 | 示例 | Claude 当前位置 |
|---|---|---|
| 执行明确任务 | “修复导出按钮” | 已非常强 |
| 根据目标设计方法 | “调查高负载下网络为何变慢” | 快速提升 |
| 选择值得解决的问题 | “下季度应该构建什么?” | 人类仍有明显优势 |
当写代码、运行实验和整理结果的边际人力成本接近零,稀缺资源就从执行转向方向:哪些结果可信?哪个异常值得追踪?何时应该放弃一条路线?一个技术上成功的实验是否回答了真正重要的问题?
这就是 Research Taste(研究品味)。它不是一个静态 Benchmark 分数,而是对问题价值、证据质量、隐含假设和长期后果的综合判断。
所以,今天更准确的人机分工是:
|
|
RSI 真正发生的条件,不是 AI 会写训练代码,而是它能可靠接管这个循环最上层的方向选择,同时建立足以防止错误和目标偏移不断累积的验证机制。
6. 工作方式将怎样改变?
如果 AI 与人类代码质量达到相当水平,人类首先会从编写转向审查。但 AI 生成速度远高于人类审查速度,审查很快又会成为瓶颈。下一步只能是让 AI 承担第一层审查,让人类集中在异常、高风险变更和系统级判断上。
同样的变化会发生在研究中:
|
|
即使 AI 永远没有完全成熟的研究品味,组织仍可能获得复合加速:人类只处理个位数比例的方向性工作,每位研究者同时引导远多于过去的实验。但根据 Amdahl 定律,一个环节加速后,瓶颈会转移到尚未加速的环节——评测、算力、电力、数据、硬件生产、组织决策与安全审查都会成为新的上限。
7. 三种可能的未来
未来一:能力曲线进入平台期,但今天的能力广泛扩散
当前趋势可能是 S 曲线的一部分。规模化收益减弱后,进一步突破可能需要 Transformer 之外的新架构或新的训练范式。
即便模型能力停在今天,扩散仍足以改变大量知识工作。多数组织尚未完成流程重构,因此“现有能力被真正使用”本身仍有很长的生产率释放期。
未来二:持续复合加速,但人类保留方向权
AI 研发被大幅自动化,人类继续决定问题、评价结果并批准下一阶段。实验室会像一个由少量人类负责人监督的大规模虚拟研究组织,执行速度越来越接近算力速度。
这可能是最保守、也最容易低估的情景。它不要求 AI 完全替代研究者,只要求每位研究者管理的有效 Agent 数量不断增加。
未来三:完整递归自我改进
AI 可以设计继任模型、修改训练系统、运行训练、评价新模型,再决定下一轮改进。此时,AI 进步速度主要受制于算力、能源、芯片、数据与验证,而不是人类研究工时。
这不意味着整个社会会立即以同样速度变化。智能可以加快药物设计,却不能压缩长期副作用观察所需的真实时间;可以改进政策分析,却不能让制度信任在一夜之间形成;可以优化机器人,却仍受工厂和供应链约束。
因此未来可能出现强烈的不均匀性:上游“虚拟实验室”按计算速度迭代,下游世界仍按生物、物理、制度和关系的速度运行。
8. 我对这条趋势的进一步思考
8.1 RSI 更像系统能力,而不是单一模型能力
完整闭环需要模型之外的一整套基础设施:代码与实验环境、长期记忆、任务调度、独立 Evaluator、权限控制、可追溯日志、模型训练平台以及明确的停止机制。因此,RSI 不会只是某次模型发布中突然出现的一个能力开关,更可能是模型与 Harness、算力和组织流程共同跨过阈值。
8.2 加速会先表现为并行化,而不是“一个超级研究员”
短期最现实的变化,是一个人同时监督几十或上百个持续工作的 Agent。它们搜索不同方向、复现实验、检查失败案例并维护基础设施。单个 Agent 不必拥有完美研究品味,只要并行候选足够多、筛选机制足够好,也能显著扩大搜索空间。
8.3 验证能力必须至少和生成能力同步增长
当实验和代码生成便宜后,错误结果也会变得更便宜、更大量。系统最危险的失败不是明显崩溃,而是一个看似合理的错误被下一代模型继承、放大并继续优化。
所以未来最重要的 Agent 未必是 Generator,而可能是:
- 能独立复现实验的 Verifier;
- 主动寻找反例的 Red Team Agent;
- 检查数据污染与评测泄漏的 Auditor;
- 对训练过程和模型行为进行持续监控的 Safety Agent。
8.4 人类角色会从生产者转向治理者
如果“做”越来越由 AI 完成,人类的核心价值会向目标设定、价值判断、责任承担和停止权迁移。问题不再只是“AI 能不能发现更好的模型”,而是:谁定义“更好”?谁有权启动下一轮训练?出现哪些信号必须暂停?不同实验室如何验证彼此确实遵守限制?
技术闭环越完整,治理闭环就越不能缺席。
9. 结语:我们尚未进入闭环,但已经进入反馈阶段
Anthropic 的内部数据并不能证明递归自我改进必然发生,也不能直接外推到所有公司。代码行数、员工自评和内部 Judge 都有局限,公开材料也来自对这条趋势有直接利益关系的前沿实验室。
但把所有证据放在一起,一个方向已经很清楚:
AI 正从“帮助人类开发 AI”,走向“承担越来越完整的 AI 开发循环”。
今天,人类仍然选择问题、设定成功标准并判断结果;Claude 已经大量承担实现、实验、修复、审查和局部方向建议。未来真正决定是否进入 RSI 的,不只是模型智力,而是研究判断能否被可靠自动化,以及验证、控制和协调机制能否赶上生成与执行的速度。
我们还没有闭合循环,但反馈已经开始。
参考资料
- Anthropic Institute: When AI builds itself
- METR: Measuring AI ability to complete long tasks
- SWE-bench
- CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark
数据说明:本文引用的 Anthropic 内部指标以原文披露时点为准;原文包含截至 2026 年 9 月 18 日的更新。内部统计与案例应被视为趋势证据,而不是对所有组织都成立的普遍生产率测量。
文章作者 zhengxz
上次更新 2026-09-28