Anthropic 内部正在发生一个值得关注的变化:AI 不再只是被研究和开发的产品,也开始参与开发 AI 的过程。从补全代码,到自主修改代码库、运行实验、组织并行 Agent,Claude 正逐渐进入模型研发循环本身。

如果这条路径继续延伸,终点可能是 Recursive Self-Improvement(递归自我改进,RSI):一个 AI 系统能够自主设计、训练和评估自己的继任者,让“模型进步”本身成为下一轮模型进步的加速器。

本文根据我的笔记与 Anthropic Institute 的文章 When AI builds itself 整理。重点不是断言 RSI 一定发生,而是理解:Anthropic 内部已经把哪些工作交给 Claude,距离真正闭环还缺什么,以及这条趋势可能把人类角色推向哪里。

1. 从辅助工具到改进循环的一部分

Anthropic 把 AI 参与自身研发的过程划分为五个阶段。真正重要的变化,不只是模型生成了更多代码,而是它与环境之间的接口逐渐闭合:从只能给建议,发展为能够行动、观察结果、修正方案,再把工作委派给其他 Agent。

  1. 构建最初的 Claude

    人类在笔记本电脑上编写代码和文档,AI 还是被开发的对象。

  2. Chatbot

    模型生成局部代码片段,人类复制、粘贴并整合结果。

  3. Coding Agent

    Agent 可以直接读写代码库,从补全片段走向完成整个文件。

  4. 自主 Agent

    Agent 自己运行代码、观察结果,并把数小时工作委派给其他 Agent。

  5. 闭合改进循环

    AI 设计实验、训练并评估继任模型,模型改进开始反过来加速模型改进。

这条时间线可以压缩成三个层次:

  1. 生成(Generation):模型给出文本和代码,人类负责执行;
  2. 行动(Agency):模型可以操作代码库、运行工具并根据反馈迭代;
  3. 闭环(Closing the loop):模型不只执行研发任务,还参与选择实验、训练模型和改进下一代系统。

Chatbot 到 Coding Agent 的跨越,来自“能否直接作用于环境”;Autonomous Agent 到 RSI 的跨越,则取决于“能否独立选择值得推进的方向”。前者主要是执行问题,后者涉及研究品味、判断、验证和治理。

2. 外部趋势:Agent 可以可靠完成的任务正在变长

Anthropic 引用了 METR 的任务时长研究:AI 能够以给定可靠度独立完成的任务时长,近期大约每四个月翻一倍,快于此前约七个月翻一倍的趋势。

任务时长比“单题正确率”更接近 Agent 的真实价值。一道题答对,并不等于可以在数小时里维护计划、处理失败、使用工具并交付可验证结果。时间范围变长,意味着 AI 开始从局部助手进入完整工作单元。

类似趋势也出现在软件工程与研究复现基准:

  • SWE-bench 要求模型根据真实 GitHub Issue 修改真实代码库并通过项目测试;
  • CORE-Bench 测试模型能否利用论文的代码和数据复现实验结果;
  • 许多基准迅速接近饱和,迫使评测转向更开放、更长时、验证成本更高的任务。

但公开 Benchmark 只能证明模型“有能力做什么”,无法说明它已经怎样改变前沿实验室的生产过程。更有价值的证据来自 Anthropic 内部。

3. Anthropic 内部:Claude 已经参与了多少工作?

3.1 超过 80% 的合并代码由 Claude 编写

Anthropic 披露,截至 2026 年 5 月,合并进内部代码库的代码中,超过 80% 可归因于 Claude。Claude Code 在 2025 年 2 月发布研究预览之前,这个比例还只有低个位数。

与此同时,2026 年第二季度,典型工程师每天合并的代码量约为 2024 年的 8 倍。代码行数并不等于生产率:更多代码可能意味着维护负担,统计归因也并不完整。但两个时间拐点仍然很明显:

  • 2025 年,Claude 从“建议代码”转向“运行并修改代码”;
  • 2026 年,模型开始在更长时间范围内自主完成任务。

这里最值得注意的不是“AI 写了多少行”,而是工程师的工作单位发生了变化:人不再逐行表达实现,而是定义目标、提供约束、检查结果,并同时引导更多工作流。

Anthropic 每位活跃贡献者每季度合并的代码量,以 2025 年前的平均值为 1×

图 1:Code contributed per person, per quarter。柱形表示每位活跃贡献者每天合并代码行数的季度平均值,并以 2025 年前平均水平为基准。2026 年 Q2 为尚未结束的季度;虚线标注模型或产品的公开发布节点。来源:Anthropic Institute。

3.2 AI 开始完成原本不会被安排的工作

生产率提升不只表现为更快完成计划内任务。Anthropic 还观察到 Claude 承担了大量过去不会获得人力优先级的工作,例如探索性工具、长期积压的清理和跨越大量陌生上下文的修复。

一个典型案例发生在 2026 年 4 月:Claude 提交了 800 多项修复,让一类 API 错误下降约一千倍。负责监督的工程师估计,如果由人类完成,可能需要四年。

这揭示了 Agent 的另一类价值:它不只是替代昂贵的人类时间,还可以让那些“单项价值不低、但过于零碎和痛苦”的工作第一次变得经济可行。

3.3 代码质量从可用走向接近人类

“代码好”至少包含两个条件:

  1. 能正确运行并解决问题;
  2. 其他工程师能够理解、维护和继续构建。

Anthropic 的内部观察是:员工在任务中纠正、重定向或接管 Claude 的频率持续下降,即使是缺少清晰规格的开放任务也在改善。原文判断,Claude 编写的代码在 2025 年末仍略逊于人类,到 2026 年已经大致接近人类水平,并可能继续超过。

Anthropic 内部 Claude Code Session 在四种任务复杂度下的成功率变化

图 2:Claude Code session success rate。曲线采用每周统计的四周移动平均,并由 LLM Judge 判断 Session 是否在不需要人工纠正的情况下完成任务。最显著的变化来自开放问题:它从 2025 年下半年的约 10%–25%,提升到 2026 年 5 月约 76%;简单和常规任务则较早进入高成功率区间。来源:Anthropic Institute。

代码审查也因此改变。Anthropic 的变更在合并前会由自动 Claude Reviewer 检查缺陷和安全问题。回溯分析显示,如果历史变更都经过这类审查,大约可以提前发现导致 claude.ai 既往事故的 三分之一 Bug。

这形成了一个早期闭环:Claude 写代码,Claude 审查代码,人类从逐行生产转向监督两套相互制约的模型流程。不过,“模型审模型”不能替代外部测试、权限隔离和独立评估,否则同源错误也可能被共同忽略。

4. 从工程执行到研究执行

构建前沿模型大致包含两类工作:

  • Engineering:写代码、建设基础设施、运行并维护训练系统;
  • Research:选择问题、设计实验、解释结果并决定下一步。

Claude 在工程执行上进展更快,但 Anthropic 的案例表明,它也正在进入实验循环。

4.1 在目标明确时,实验优化已表现出超人能力

Anthropic 在发布模型时会运行一个固定测试:给 Claude 一段训练小模型的代码,在保持正确性的前提下尽可能加速。模型需要反复重写、执行、计时、判断瓶颈,再进入下一轮。

在同类设置中:

  • 2025 年 5 月,Claude Opus 4 平均把起始代码加速约 3 倍;
  • 2026 年 4 月,Claude Mythos Preview 达到约 52 倍;
  • 熟练人类研究员花 4–8 小时,通常达到约 4 倍。

绝对倍数依赖起始代码有多少优化空间,不能直接理解为真实前沿训练整体加速 52 倍。更可靠的信号是:在目标和正确性检查都预先给定时,模型在一年内从“有帮助”走向了明显超过人类的搜索与执行能力。

4.2 Agent 已能自己设计一组实验,但问题仍由人选择

在一项弱模型监督强模型的开放研究中,Claude Agent 提出假设、并行实验、共享发现并迭代方案。两名人类研究者在一周左右恢复了理论性能差距的约 23%,Agent 使用约 800 小时累计运行时间和 1.8 万美元算力,恢复了约 97%。

这个结果很强,但边界同样关键:

  • 人类选择了研究问题;
  • 人类定义了评分规则和成功边界;
  • 结果没有干净地迁移到生产规模模型;
  • 大量并行算力并不等价于更少的现实成本。

因此,Claude 已经能够在“给定问题空间”中组织研究,却还没有证明自己可以稳定判断“哪个问题最值得研究”。

5. 真正缺失的一环:Research Taste

Anthropic 用员工成长路径解释当前边界:

工作层次 示例 Claude 当前位置
执行明确任务 “修复导出按钮” 已非常强
根据目标设计方法 “调查高负载下网络为何变慢” 快速提升
选择值得解决的问题 “下季度应该构建什么?” 人类仍有明显优势

当写代码、运行实验和整理结果的边际人力成本接近零,稀缺资源就从执行转向方向:哪些结果可信?哪个异常值得追踪?何时应该放弃一条路线?一个技术上成功的实验是否回答了真正重要的问题?

这就是 Research Taste(研究品味)。它不是一个静态 Benchmark 分数,而是对问题价值、证据质量、隐含假设和长期后果的综合判断。

所以,今天更准确的人机分工是:

1
2
3
4
5
人类:选择目标、定义约束、判断证据、承担责任
  ↓
AI:实现、运行、搜索、并行化、记录与初步评价
  ↓
人类:校验方向,决定是否进入下一轮

RSI 真正发生的条件,不是 AI 会写训练代码,而是它能可靠接管这个循环最上层的方向选择,同时建立足以防止错误和目标偏移不断累积的验证机制。

6. 工作方式将怎样改变?

如果 AI 与人类代码质量达到相当水平,人类首先会从编写转向审查。但 AI 生成速度远高于人类审查速度,审查很快又会成为瓶颈。下一步只能是让 AI 承担第一层审查,让人类集中在异常、高风险变更和系统级判断上。

同样的变化会发生在研究中:

1
2
3
4
5
过去:人提出一个想法 → 人实现一个实验 → 人等待结果 → 人分析

现在:人提出方向 → 多个 Agent 并行实现与实验 → Evaluator 筛选 → 人判断

未来:AI 生成候选方向 → AI 实验与交叉验证 → 人监督目标、风险与停止条件

即使 AI 永远没有完全成熟的研究品味,组织仍可能获得复合加速:人类只处理个位数比例的方向性工作,每位研究者同时引导远多于过去的实验。但根据 Amdahl 定律,一个环节加速后,瓶颈会转移到尚未加速的环节——评测、算力、电力、数据、硬件生产、组织决策与安全审查都会成为新的上限。

7. 三种可能的未来

未来一:能力曲线进入平台期,但今天的能力广泛扩散

当前趋势可能是 S 曲线的一部分。规模化收益减弱后,进一步突破可能需要 Transformer 之外的新架构或新的训练范式。

即便模型能力停在今天,扩散仍足以改变大量知识工作。多数组织尚未完成流程重构,因此“现有能力被真正使用”本身仍有很长的生产率释放期。

未来二:持续复合加速,但人类保留方向权

AI 研发被大幅自动化,人类继续决定问题、评价结果并批准下一阶段。实验室会像一个由少量人类负责人监督的大规模虚拟研究组织,执行速度越来越接近算力速度。

这可能是最保守、也最容易低估的情景。它不要求 AI 完全替代研究者,只要求每位研究者管理的有效 Agent 数量不断增加。

未来三:完整递归自我改进

AI 可以设计继任模型、修改训练系统、运行训练、评价新模型,再决定下一轮改进。此时,AI 进步速度主要受制于算力、能源、芯片、数据与验证,而不是人类研究工时。

这不意味着整个社会会立即以同样速度变化。智能可以加快药物设计,却不能压缩长期副作用观察所需的真实时间;可以改进政策分析,却不能让制度信任在一夜之间形成;可以优化机器人,却仍受工厂和供应链约束。

因此未来可能出现强烈的不均匀性:上游“虚拟实验室”按计算速度迭代,下游世界仍按生物、物理、制度和关系的速度运行。

8. 我对这条趋势的进一步思考

8.1 RSI 更像系统能力,而不是单一模型能力

完整闭环需要模型之外的一整套基础设施:代码与实验环境、长期记忆、任务调度、独立 Evaluator、权限控制、可追溯日志、模型训练平台以及明确的停止机制。因此,RSI 不会只是某次模型发布中突然出现的一个能力开关,更可能是模型与 Harness、算力和组织流程共同跨过阈值。

8.2 加速会先表现为并行化,而不是“一个超级研究员”

短期最现实的变化,是一个人同时监督几十或上百个持续工作的 Agent。它们搜索不同方向、复现实验、检查失败案例并维护基础设施。单个 Agent 不必拥有完美研究品味,只要并行候选足够多、筛选机制足够好,也能显著扩大搜索空间。

8.3 验证能力必须至少和生成能力同步增长

当实验和代码生成便宜后,错误结果也会变得更便宜、更大量。系统最危险的失败不是明显崩溃,而是一个看似合理的错误被下一代模型继承、放大并继续优化。

所以未来最重要的 Agent 未必是 Generator,而可能是:

  • 能独立复现实验的 Verifier;
  • 主动寻找反例的 Red Team Agent;
  • 检查数据污染与评测泄漏的 Auditor;
  • 对训练过程和模型行为进行持续监控的 Safety Agent。

8.4 人类角色会从生产者转向治理者

如果“做”越来越由 AI 完成,人类的核心价值会向目标设定、价值判断、责任承担和停止权迁移。问题不再只是“AI 能不能发现更好的模型”,而是:谁定义“更好”?谁有权启动下一轮训练?出现哪些信号必须暂停?不同实验室如何验证彼此确实遵守限制?

技术闭环越完整,治理闭环就越不能缺席。

9. 结语:我们尚未进入闭环,但已经进入反馈阶段

Anthropic 的内部数据并不能证明递归自我改进必然发生,也不能直接外推到所有公司。代码行数、员工自评和内部 Judge 都有局限,公开材料也来自对这条趋势有直接利益关系的前沿实验室。

但把所有证据放在一起,一个方向已经很清楚:

AI 正从“帮助人类开发 AI”,走向“承担越来越完整的 AI 开发循环”。

今天,人类仍然选择问题、设定成功标准并判断结果;Claude 已经大量承担实现、实验、修复、审查和局部方向建议。未来真正决定是否进入 RSI 的,不只是模型智力,而是研究判断能否被可靠自动化,以及验证、控制和协调机制能否赶上生成与执行的速度。

我们还没有闭合循环,但反馈已经开始。

参考资料

数据说明:本文引用的 Anthropic 内部指标以原文披露时点为准;原文包含截至 2026 年 9 月 18 日的更新。内部统计与案例应被视为趋势证据,而不是对所有组织都成立的普遍生产率测量。