Agentic LLM Reasoning(一):从 Chain of Thought 到搜索、反思与 RLVR
模型能回答一个问题,不等于它能完成一项任务。
普通 Chatbot 接收 Prompt,然后返回 Response;Agent 则要在不断变化的环境中决定下一步做什么,执行动作,读取结果,再判断应该继续、回退还是换一条路。这种能力首先依赖 Reasoning(推理)。
一个完整的 Agent 系统至少需要三类能力:
- Reasoning:分析状态、拆解问题、比较候选路径并形成决策;
- Action:调用工具,把决策转化为对外部世界的操作;
- Interaction:读取行动结果,与环境或其他 Agent 持续交换信息并修正策略。
本文是 Agentic Large Language Models 系列的第一篇。我不会把 Reasoning 当成一串孤立术语来罗列,而会沿着同一个问题展开:当一次生成或一条推理链不够可靠时,系统还能增加什么? 后续两篇将分别讨论 Action 和 Interaction。