Agentic LLM Reasoning(一):从 Chain of Thought 到搜索、反思与 RLVR

模型能回答一个问题,不等于它能完成一项任务。

普通 Chatbot 接收 Prompt,然后返回 Response;Agent 则要在不断变化的环境中决定下一步做什么,执行动作,读取结果,再判断应该继续、回退还是换一条路。这种能力首先依赖 Reasoning(推理)。

一个完整的 Agent 系统至少需要三类能力:

  1. Reasoning:分析状态、拆解问题、比较候选路径并形成决策;
  2. Action:调用工具,把决策转化为对外部世界的操作;
  3. Interaction:读取行动结果,与环境或其他 Agent 持续交换信息并修正策略。

本文是 Agentic Large Language Models 系列的第一篇。我不会把 Reasoning 当成一串孤立术语来罗列,而会沿着同一个问题展开:当一次生成或一条推理链不够可靠时,系统还能增加什么? 后续两篇将分别讨论 Action 和 Interaction。

当 AI 开始构建自己:Anthropic 内部实践与递归自我改进的未来

Anthropic 内部正在发生一个值得关注的变化:AI 不再只是被研究和开发的产品,也开始参与开发 AI 的过程。从补全代码,到自主修改代码库、运行实验、组织并行 Agent,Claude 正逐渐进入模型研发循环本身。

如果这条路径继续延伸,终点可能是 Recursive Self-Improvement(递归自我改进,RSI):一个 AI 系统能够自主设计、训练和评估自己的继任者,让“模型进步”本身成为下一轮模型进步的加速器。

本文根据我的笔记与 Anthropic Institute 的文章 When AI builds itself 整理。重点不是断言 RSI 一定发生,而是理解:Anthropic 内部已经把哪些工作交给 Claude,距离真正闭环还缺什么,以及这条趋势可能把人类角色推向哪里。

未来 5—10 年的 AI 架构推演:Base Model、个人智能与企业私有能力层

我对未来 5—10 年 AI 的一个核心判断是:人们不会为每个人、每家公司重新训练一套完整模型,而会在共享的 Base Model 之上,挂载属于个人和组织的私有认知层。

基础模型提供通用智力,个人数据提供身份与连续性,企业数据提供领域知识和业务规则,Agent 系统则把这些能力转化为行动。

大模型与 AI Agent Benchmark 全景指南:它们究竟在评估什么

看模型发布报告时,我们经常会遇到一长串名字:Artificial Analysis Intelligence Index、LMArena、HELM、ARC-E、MMLU、GSM8K、SWE-bench、GAIA、WebArena、OSWorld……它们的分数不能直接横向比较,因为这里既有综合指数和排行榜,也有单项 benchmark;各自测量的能力、输入形式、可用工具和评分方式都不同。

本文整理一张从“大模型答题”到“Agent 完成真实任务”的评测地图,并解释每个常见 benchmark 究竟是什么、适合测什么,以及不能从分数中推出什么结论。

nanochat 源码解读:从参数配置到单步训练

本文沿着 scripts/base_train.py 的执行顺序阅读 nanochat:从命令行参数、随机种子和 DDP 环境开始,依次进入模型构建、权重初始化、Scaling Laws、优化器、DataLoader、梯度累积与单步训练。重点不是抽象介绍 GPT,而是理解源码中的每一段配置如何落到真实训练过程里。

前置知识

本文默认读者已经了解 token embedding、causal self-attention、MLP、残差连接和交叉熵。如果这些概念还不熟悉,建议先阅读我的简易实现文章:Transformer Architecture:从 Token Embedding 到训练循环,再回来读 nanochat 的工程化实现。

Transformer Architecture:从 Token Embedding 到训练循环

Transformer 看起来由许多组件组成,但一条 GPT 风格的前向路径可以概括为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
Token IDs
   ↓
Token Embedding + Position Embedding
   ↓
[LayerNorm → Self-Attention → Residual]
   ↓
[LayerNorm → FFN → Residual]
   ↓
重复多个 Transformer Blocks
   ↓
Final LayerNorm → LM Head
   ↓
Next-token logits → Cross-Entropy Loss

本文从一个简单的 GPT 实现出发,沿着数据流解释每一步的作用和张量形状。完整源码放在文章最后,读完前面的原理后可以结合代码对照理解。

Anthropic Agent 演进(一):从 Workflow 到 Agent,为什么需要 Harness

“Agent” 经常被当作一个宽泛标签:只要模型调用了工具、执行了多步任务,就被称为 Agent。Anthropic 的工程实践给出了一个更有用的区分:Workflow 的路径由代码预先定义;Agent 则由模型根据环境反馈动态决定下一步。

这是“Anthropic Agent 演进”系列的第一篇。我们先建立共同语言:从增强型 LLM、固定 Workflow,一直到真正的自主 Agent,并解释为什么模型外部还需要一层 Harness。

Anthropic Agent 演进(二):Context Reset 与 Structured Handoff

长任务的核心矛盾不是“模型能不能写代码”,而是:任务可能持续数小时或数天,但一次 Context Window 终究有限。把整个历史无限重放,会同时遇到容量和噪声问题。

Anthropic 第一代 Long-Running Agent Harness 的答案是:重置对话上下文,但把项目状态写进结构化工件,让下一轮 Agent 可以恢复工作。