大模型与 AI Agent Benchmark 全景指南:它们究竟在评估什么

看模型发布报告时,我们经常会遇到一长串名字:ARC-E、ARC-C、MMLU、GPQA、GSM8K、HumanEval、SWE-bench、GAIA、WebArena、OSWorld……它们的分数不能直接横向比较,因为每个 benchmark 测量的能力、输入形式、可用工具和评分方式都不同。

本文整理一张从“大模型答题”到“Agent 完成真实任务”的评测地图,并解释每个常见 benchmark 究竟是什么、适合测什么,以及不能从分数中推出什么结论。

nanochat 源码解读:从参数配置到单步训练

本文沿着 scripts/base_train.py 的执行顺序阅读 nanochat:从命令行参数、随机种子和 DDP 环境开始,依次进入模型构建、权重初始化、Scaling Laws、优化器、DataLoader、梯度累积与单步训练。重点不是抽象介绍 GPT,而是理解源码中的每一段配置如何落到真实训练过程里。

前置知识

本文默认读者已经了解 token embedding、causal self-attention、MLP、残差连接和交叉熵。如果这些概念还不熟悉,建议先阅读我的简易实现文章:Transformer Architecture:从 Token Embedding 到训练循环,再回来读 nanochat 的工程化实现。

Transformer Architecture:从 Token Embedding 到训练循环

Transformer 看起来由许多组件组成,但一条 GPT 风格的前向路径可以概括为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
Token IDs
   ↓
Token Embedding + Position Embedding
   ↓
[LayerNorm → Self-Attention → Residual]
   ↓
[LayerNorm → FFN → Residual]
   ↓
重复多个 Transformer Blocks
   ↓
Final LayerNorm → LM Head
   ↓
Next-token logits → Cross-Entropy Loss

本文从一个简单的 GPT 实现出发,沿着数据流解释每一步的作用和张量形状。完整源码放在文章最后,读完前面的原理后可以结合代码对照理解。

Anthropic Agent 演进(一):从 Workflow 到 Agent,为什么需要 Harness

“Agent” 经常被当作一个宽泛标签:只要模型调用了工具、执行了多步任务,就被称为 Agent。Anthropic 的工程实践给出了一个更有用的区分:Workflow 的路径由代码预先定义;Agent 则由模型根据环境反馈动态决定下一步。

这是“Anthropic Agent 演进”系列的第一篇。我们先建立共同语言:从增强型 LLM、固定 Workflow,一直到真正的自主 Agent,并解释为什么模型外部还需要一层 Harness。

Anthropic Agent 演进(二):Context Reset 与 Structured Handoff

长任务的核心矛盾不是“模型能不能写代码”,而是:任务可能持续数小时或数天,但一次 Context Window 终究有限。把整个历史无限重放,会同时遇到容量和噪声问题。

Anthropic 第一代 Long-Running Agent Harness 的答案是:重置对话上下文,但把项目状态写进结构化工件,让下一轮 Agent 可以恢复工作。

Anthropic Agent 演进(三):Planner–Generator–Evaluator 质量闭环

第一代 Harness 让 Agent 能跨 Context 持续工作,但“持续”不等于“高质量”。生成者评价自己的作品时,往往会把“基本能运行”误判成“已经足够好”,主观设计任务尤其明显。

Anthropic 的下一步是把计划、生成和评价拆成三个职责,让外部 Evaluator 成为 Generator 必须面对的反馈来源。

Anthropic Agent 演进(四):Managed Agent Runtime——Session、Harness 与 Sandbox

前几代 Harness 关注的是模型怎样持续工作、怎样提高质量。走向托管服务后,问题变成了系统工程:Session 如何持久化?Harness 崩溃后怎样恢复?Sandbox 如何替换?怎样连接客户自己的 VPC?凭据如何不暴露给模型生成的代码?

Anthropic Managed Agents 的核心答案是:把 Brain、Hands 和 Session 解耦为稳定接口。

Stanford CS329A:Self-Improving AI Agents 的完整技术框架

Self-Improving AI Agent 并不是一个会无限递归修改自己的神秘系统。更实际的理解是:Agent 在生成、行动、观察和验证之间形成闭环,把推理时获得的反馈用于改进当前答案、后续决策,甚至下一轮训练。

这篇文章沿着 Stanford CS329A 的课程主线,把测试时计算、验证器、工具反馈、规划搜索、强化学习、深度研究与长程评测串成一个完整框架。