未来 5—10 年的 AI 架构推演:Base Model、个人智能与企业私有能力层
我对未来 5—10 年 AI 的一个核心判断是:人们不会为每个人、每家公司重新训练一套完整模型,而会在共享的 Base Model 之上,挂载属于个人和组织的私有认知层。
基础模型提供通用智力,个人数据提供身份与连续性,企业数据提供领域知识和业务规则,Agent 系统则把这些能力转化为行动。
我对未来 5—10 年 AI 的一个核心判断是:人们不会为每个人、每家公司重新训练一套完整模型,而会在共享的 Base Model 之上,挂载属于个人和组织的私有认知层。
基础模型提供通用智力,个人数据提供身份与连续性,企业数据提供领域知识和业务规则,Agent 系统则把这些能力转化为行动。
看模型发布报告时,我们经常会遇到一长串名字:Artificial Analysis Intelligence Index、LMArena、HELM、ARC-E、MMLU、GSM8K、SWE-bench、GAIA、WebArena、OSWorld……它们的分数不能直接横向比较,因为这里既有综合指数和排行榜,也有单项 benchmark;各自测量的能力、输入形式、可用工具和评分方式都不同。
本文整理一张从“大模型答题”到“Agent 完成真实任务”的评测地图,并解释每个常见 benchmark 究竟是什么、适合测什么,以及不能从分数中推出什么结论。
本文沿着 scripts/base_train.py 的执行顺序阅读 nanochat:从命令行参数、随机种子和 DDP 环境开始,依次进入模型构建、权重初始化、Scaling Laws、优化器、DataLoader、梯度累积与单步训练。重点不是抽象介绍 GPT,而是理解源码中的每一段配置如何落到真实训练过程里。
前置知识
本文默认读者已经了解 token embedding、causal self-attention、MLP、残差连接和交叉熵。如果这些概念还不熟悉,建议先阅读我的简易实现文章:Transformer Architecture:从 Token Embedding 到训练循环,再回来读 nanochat 的工程化实现。
Transformer 看起来由许多组件组成,但一条 GPT 风格的前向路径可以概括为:
|
|
本文从一个简单的 GPT 实现出发,沿着数据流解释每一步的作用和张量形状。完整源码放在文章最后,读完前面的原理后可以结合代码对照理解。
“Agent” 经常被当作一个宽泛标签:只要模型调用了工具、执行了多步任务,就被称为 Agent。Anthropic 的工程实践给出了一个更有用的区分:Workflow 的路径由代码预先定义;Agent 则由模型根据环境反馈动态决定下一步。
这是“Anthropic Agent 演进”系列的第一篇。我们先建立共同语言:从增强型 LLM、固定 Workflow,一直到真正的自主 Agent,并解释为什么模型外部还需要一层 Harness。
长任务的核心矛盾不是“模型能不能写代码”,而是:任务可能持续数小时或数天,但一次 Context Window 终究有限。把整个历史无限重放,会同时遇到容量和噪声问题。
Anthropic 第一代 Long-Running Agent Harness 的答案是:重置对话上下文,但把项目状态写进结构化工件,让下一轮 Agent 可以恢复工作。
第一代 Harness 让 Agent 能跨 Context 持续工作,但“持续”不等于“高质量”。生成者评价自己的作品时,往往会把“基本能运行”误判成“已经足够好”,主观设计任务尤其明显。
Anthropic 的下一步是把计划、生成和评价拆成三个职责,让外部 Evaluator 成为 Generator 必须面对的反馈来源。
前几代 Harness 关注的是模型怎样持续工作、怎样提高质量。走向托管服务后,问题变成了系统工程:Session 如何持久化?Harness 崩溃后怎样恢复?Sandbox 如何替换?怎样连接客户自己的 VPC?凭据如何不暴露给模型生成的代码?
Anthropic Managed Agents 的核心答案是:把 Brain、Hands 和 Session 解耦为稳定接口。