Skip to content

阅读路径

本页速览 三阶段 Agent 论文书单:入门 5 篇建立直觉(ReAct、CoT、Toolformer、MRKL、Generative Agents),进阶 8 篇建立系统能力(Reflexion、Voyager、SWE-agent、CodeAct 等),前沿聚焦 2025-2026 的 agentic RL、Deep Research 与自我改进。每篇附 arXiv 编号、一句话价值、阅读时长与前置依赖。

阅读路径 ​

Agent 领域的论文有个特点:数量爆炸,但真正值得逐字读的不过二十篇。2023 年至今 arXiv 上挂着 "LLM agent" 关键词的论文数以千计,绝大多数是同一批核心思想的变体、组合或评测。这份书单的做法是反过来:先选出奠基性的十几篇精读,把概念框架搭起来,剩下的论文你就能用「它是 X 的变体」一句话归类,扫一眼摘要就够了。

三个阶段,层层递进:

阶段一 入门(5 篇)      阶段二 进阶(8 篇)       阶段三 前沿(2025-2026)
建立直觉                 建立系统能力             跟上最新方向
─────────────          ─────────────────        ──────────────────
CoT ──────────┐        Reflexion / ToT          Agentic RL(R1 及之后)
ReAct ────────┼──►     Voyager / HuggingGPT ──► Deep Research 系统
MRKL          │        CoALA / 综述              Computer Use
Toolformer    │        SWE-agent / CodeAct      自我改进(DGM)
Generative Ag.┘                               多智能体失败模式(MAST)
「一个 agent 是什么」   「一个 agent 系统怎么造」  「这个领域在往哪走」

阅读建议

论文不在读得多,在于读完能复述。检验标准:合上书,你能不能用三句话讲清楚这篇论文「解决了什么问题、核心机制是什么、为什么 work」。做不到就重读核心章节,别急着开下一篇。每篇都建议配合官方代码仓库或 论文地图 一起看。

一、怎么用这份书单 ​

每篇论文按统一格式给出四个信息:

  • arXiv 编号:全部经过检索核实,直接拼 arxiv.org/abs/编号 即可访问;
  • 一句话价值:这篇论文给领域贡献的那个「不可替代的东西」;
  • 预计阅读时间:按「精读核心章节 + 扫读实验」的标准估算,不含跑代码;
  • 前置依赖:读它之前最好先读过什么,没有依赖就不写。

关于读论文的方法,几个老生常谈但真有用的建议:

  1. 先读 Introduction 和 Figure 1。Agent 论文的信息密度集中在系统架构图里,看懂图就看懂了一半。
  2. 实验部分重点看消融(ablation)。主结果只告诉你「work」,消融才告诉你「为什么 work」——通常是某个组件在起作用,而这才是你能搬走的部分。
  3. 警惕基准污染与幸存者偏差。2023 年很多论文报告的「巨大提升」建立在 GPT-4 做 baseline、几十个任务的玩具环境上。看到数字先问:任务集多大?baseline 公不公平?
  4. 按自己的节奏跳读。这份书单有明确的依赖链,但同一阶段内顺序不严格,遇到卡壳可以先跳过。

如果你还没读过站内 什么是 AI Agent 和 Agent 全景解剖,建议先读完这两篇再开始,论文里的术语会顺很多。

二、阶段一:入门——建立直觉(5 篇) ​

这五篇回答一个问题:一个 agent 的最小构成是什么。读完你应该能手搓一个 Thought-Action-Observation 循环,这也是 Agent Loop 一节的理论源头。

1. Chain-of-Thought Prompting(CoT) ​

  • arXiv:2201.11903(2022 年 1 月,Google,NeurIPS 2022)
  • 一句话价值:让模型把中间推理步骤写出来,再给出答案——「先想后说」这个今天看来理所当然的技巧,是所有 agent 推理能力的起点。
  • 预计阅读时间:40 分钟(正文很短,实验可扫读)
  • 前置依赖:会写基本 prompt 即可

读这篇的重点不是「CoT 能提分」(结论早已是常识),而是理解为什么把推理外化成文本会有效:context 里的推理 trace 实际上充当了工作记忆,后续 token 的生成条件建立在已写下的中间结论上。这个「外部化思考」的直觉,是理解 ReAct、Reflexion 乃至 reasoning model 的总钥匙。

2. MRKL Systems ​

  • arXiv:2205.00445(2022 年 5 月,AI21 Labs)
  • 一句话价值:最早明确提出「LLM 当路由器 + 外部专家模块当执行器」的模块化架构——今天所有 tool-use agent 的架构原型。
  • 预计阅读时间:45 分钟

MRKL(Modular Reasoning, Knowledge and Language)的历史地位被低估了。它比 ReAct 早半年,核心主张到今天仍然成立:LLM 不擅长的事(精确计算、实时事实、私有数据)不要硬让它做,路由给专门的工具。缺点是工程实现(每个 expert 都要训练/微调)已被 function calling 时代淘汰,读架构思想即可,别纠结实现细节。

3. ReAct ​

  • arXiv:2210.03629(2022 年 10 月,Princeton + Google Brain,ICLR 2023)
  • 一句话价值:把推理(Thought)和行动(Action)交织在同一个 trace 里,让模型「边想边做边观察」——现代 agent loop 的奠基之作,也是面试中出现率最高的论文。
  • 预计阅读时间:1.5 小时
  • 前置依赖:CoT

如果整个书单只读一篇,读这篇。ReAct 的格式朴素到不像论文——就是 Thought: ... / Action: ... / Observation: ... 的循环——但它第一次证明了 reasoning trace 可以指导 action、action 的反馈(observation)又可以修正 reasoning,两者互相增强。读的时候注意两个问题:它如何缓解 CoT 的「闭门造车」(幻觉链)?又如何缓解纯 action 序列的「无计划乱撞」?想通这两点,你看后来所有 agent 框架都会有一种「万变不离其宗」的通透。配合站内 Planning 一节读效果更好。

4. Toolformer ​

  • arXiv:2302.04761(2023 年 2 月,Meta AI,NeurIPS 2023)
  • 一句话价值:让语言模型通过自监督学会「何时、调哪个、传什么参数」地调用 API——工具使用从「prompt 工程」走向「模型能力」的第一步。
  • 预计阅读时间:1 小时
  • 前置依赖:MRKL(理解「为什么需要工具」)

Toolformer 的思路是:在文本中自动插入 API 调用,只保留那些真实降低了语言模型 loss 的调用,然后用这些数据微调模型。这个「用自监督信号筛选有用调用」的想法,是后来 function calling 微调和 agentic RL 的先声。它的具体方法(少样本自标注)今天已经被更好的方案取代,但**「工具使用能力可以被训出来,而不只是 prompt 出来」**这个判断,决定了 2024 年之后整个行业的走向。详见 工具与 MCP。

5. Generative Agents ​

  • arXiv:2304.03442(2023 年 4 月,Stanford + Google,UIST 2023)
  • 一句话价值:25 个 agent 在虚拟小镇里自主生活两天并涌现出社会行为——memory stream、reflection、planning 三件套的设计范本,agent 记忆系统的必读源头。
  • 预计阅读时间:1.5 小时
  • 前置依赖:无(但读过 ReAct 会更懂它的 action 层)

这篇的价值不在「小镇很好玩」,而在它给出了一套完整的认知架构:观察进入 memory stream;检索时按 recency / relevance / importance 加权;重要记忆触发 reflection 生成更高层抽象;reflection 再驱动 planning。这套 design pattern 后来被无数 agent 产品(包括大量陪伴类和游戏类产品)直接抄走。读的时候重点想:哪些部分是「为了 demo 效果」,哪些是「任何长程 agent 都需要的」?站内 Memory 一节对这套机制有工程化的展开。

阶段一自测

读完五篇,试着回答:ReAct 的 Thought 和 CoT 的 reasoning 有什么本质区别?MRKL 的路由器和 ReAct 的自主决策,哪条路线赢了,为什么?Generative Agents 的 memory stream 解决了 ReAct 框架里哪个没被处理的问题?能流畅回答这三个问题,阶段一就算过关。

三、阶段二:进阶——建立系统能力(8 篇) ​

入门篇教你「单个 agent 怎么转起来」,进阶篇回答更难的问题:怎么让 agent 在长程、真实、会失败的任务里可靠地工作。这八篇覆盖反思、搜索式规划、终身学习、任务编排、架构综述、以及软件工程 agent 的两条路线。

6. Reflexion ​

  • arXiv:2303.11366(2023 年 3 月,Princeton 等,NeurIPS 2023)
  • 一句话价值:把「失败经验」写成自然语言反思存进记忆,下一次 trial 时喂回 prompt——不动模型权重,纯靠语言实现「吃一堑长一智」。
  • 预计阅读时间:1 小时
  • 前置依赖:ReAct

Reflexion 自称是 "verbal reinforcement learning",但读的时候要清醒:它不是 RL,没有梯度更新,「学习」全部发生在 context 里。这既是它的优势(即插即用)也是天花板(context 长度有限、反思质量依赖模型自省能力)。它提出的「Actor → Evaluator → Self-Reflection → Memory」四元组是后来几乎所有 self-correction 系统的模板。值得一并思考的问题:什么时候反思有用,什么时候反思只是浪费 token?(提示:没有可靠反馈信号时,反思经常是在强化幻觉。)

7. Tree of Thoughts(ToT) ​

  • arXiv:2305.10601(2023 年 5 月,Princeton + Google,NeurIPS 2023)
  • 一句话价值:把单链推理扩展成「生成多个候选思路 → 自我评估 → 树搜索」,让规划从一次性生成变成可回溯的显式搜索。
  • 预计阅读时间:1 小时
  • 前置依赖:CoT

ToT 的工程价值常被质疑(多次采样 + 逐层评估,token 成本翻几倍),但它的概念价值巨大:它第一次把**「问题求解 = 在思维空间里搜索」**这个经典 AI 观点完整地搬进 LLM 语境,直接启发了后来的 reasoning model(o1/R1 那一代可以理解为「把 ToT 的搜索内化进模型」)。读它时重点看 BFS/DFS 如何与 LLM 的 self-evaluation 耦合,以及为什么「评估一个想法」和「生成一个想法」需要分开设计 prompt。

8. HuggingGPT ​

  • arXiv:2303.17580(2023 年 3 月,浙大 + 微软亚研,NeurIPS 2023)
  • 一句话价值:LLM 当控制器,把任务拆解后分派给 HuggingFace 上的专业模型执行——「LLM 编排专家模型」路线的代表作,也是多工具编排的工程范本。
  • 预计阅读时间:1 小时
  • 前置依赖:MRKL

HuggingGPT 的四阶段流水线(任务规划 → 模型选择 → 任务执行 → 响应生成)是理解「编排型 agent」的最好样本。它和 MRKL 一脉相承,但把「expert」从 API 换成了整个模型社区。读的时候注意它的硬伤:规划错一步全链条崩、模型描述文档与真实行为经常不符——这正是后来 agentic workflow 强调错误恢复和验证的原因。

9. Voyager ​

  • arXiv:2305.16291(2023 年 5 月,NVIDIA 等,TMLR 2024)
  • 一句话价值:Minecraft 里的终身学习 agent:自动课程(curriculum)提出新目标、技能库(skill library)沉淀可复用代码、执行反馈驱动迭代修正——「agent 如何持续变强」的完整答案。
  • 预计阅读时间:1.5 小时
  • 前置依赖:ReAct、Generative Agents

Voyager 是 Generative Agents 思想在「能力增长」方向上的对偶:一个沉淀记忆,一个沉淀技能。它的 skill library(验证过的代码片段存入向量库,用时检索组合)是今天 agent 产品里「技能/工具沉淀」功能的学术原型,2025-2026 年各家的 Agent Skills 机制都能看到它的影子。读的时候重点想:技能入库前的 self-verification 为什么是关键?没有这个闸门,库会迅速被错误代码污染。

10. CoALA:Cognitive Architectures for Language Agents ​

  • arXiv:2309.02427(2023 年 9 月,Princeton)
  • 一句话价值:用认知科学中的「认知架构」框架统一梳理 agent 设计空间:记忆分几种、动作空间怎么划、决策循环怎么组织——不是一篇提出新方法的文章,而是一张帮你给所有 agent 论文归类的地图。
  • 预计阅读时间:2 小时
  • 前置依赖:阶段一全部

CoALA 适合慢读。它把 agent 的决策拆成 proposal → evaluation → selection → execution 的循环,把记忆拆成 working / episodic / semantic / procedural,然后把几百篇已有工作安插进这个框架。读完你再看新论文,第一反应会是「这是 CoALA 框架里 X 模块的改进」——这正是我们说的「归类能力」。强烈建议配合站内 论文地图 对照着读。

11. A Survey on LLM-based Autonomous Agents ​

  • arXiv:2308.11432(2023 年 8 月,人大高瓴等,发表在 Frontiers of Computer Science)
  • 一句话价值:国内团队出品的经典综述,按「Profile / Memory / Planning / Action」四模块拆解 agent 构建,外加评测方法梳理——查漏补缺的工具书。
  • 预计阅读时间:2-3 小时(选读,不必全读)
  • 前置依赖:阶段一全部

综述的用法是当字典查,不是当小说读。建议的方式:先读它的分类框架章节,然后对照前面读过的九篇,看每篇被归到了哪个格子;遇到你完全没听说过的格子(比如多模态感知、具身方向),再去读对应小节。它和 CoALA 的分工是:CoALA 给认知视角,这篇给工程模块视角,两个视角都掌握才算建立了完整的概念坐标系。

12. CodeAct ​

  • arXiv:2402.01030(2024 年 2 月,UIUC 等,ICML 2024)
  • 一句话价值:把 agent 的动作空间从「一次一个的 JSON 函数调用」统一为「可执行 Python 代码」——可以组合、可以控制流、可以错误处理,成功率显著提升。
  • 预计阅读时间:1 小时
  • 前置依赖:ReAct、Toolformer

CodeAct 回答了一个非常工程的问题:agent 的「手」应该长什么样? JSON function calling 每步只能调一个工具、返回一个结果;代码则天然支持循环、条件、中间变量和 try/except。这个判断深刻影响了后来的产品形态——Claude Code、OpenHands、各家 Code Mode 本质都是 CodeAct 路线。读的时候顺带思考它的代价:代码执行的沙箱安全问题(站内 安全 一节专门讨论)。

13. SWE-agent ​

  • arXiv:2405.15793(2024 年 5 月,Princeton,NeurIPS 2024)
  • 一句话价值:提出 Agent-Computer Interface(ACI)概念——给 agent 用的命令、反馈格式、编辑工具要像给人用的 UI 一样精心设计——并借此在 SWE-bench 上打出早期 SOTA。
  • 预计阅读时间:1.5 小时
  • 前置依赖:ReAct;最好知道 SWE-bench 是什么

SWE-agent 最重要的洞察是:模型能力之外,接口设计本身就是性能。同样的底座模型,把「打开文件」设计成带行号窗口的 open 命令、把编辑设计成有语法检查的 edit 命令,成功率能差出一大截。这解释了为什么各家 coding agent 的工具集长得越来越像——大家都在收敛到好用的 ACI。这篇是做 coding agent 的人绕不开的一篇,配合站内 SWE-agent 案例 读,能看到论文到开源项目的完整链路。

进阶阶段的常见误区

不要试图复现每一篇的实验。阶段二的目的是建立「设计空间」感:面对一个新 agent 系统,你能说出它的规划用了 ToT 还是 ReAct、记忆用了哪种结构、动作空间是 JSON 还是代码、反馈回路是 Reflexion 式还是环境式。复现留给真正要动手的那一两篇(推荐 SWE-agent 或 Voyager,代码质量都比较高)。

四、阶段三:前沿——2025-2026 的方向(选读) ​

前两个阶段是「已沉淀的共识」,这一阶段是「正在发生的争论」。下列论文/报告都经过检索核实,但前沿文献的结论是流动的,读的时候重点关注问题定义而非具体数字。

14. DeepSeek-R1 与 Agentic RL ​

  • arXiv:2501.12948(2025 年 1 月,DeepSeek)
  • 一句话价值:证明了大规模强化学习(RLVR,基于可验证奖励)可以把长链推理「训」进模型,而不只是 prompt 出来——这把 2023 年靠 prompt 技巧搭建的很多东西(CoT、ToT 的一部分动机)内化成了模型能力,也开启了 agentic RL 这条主线。
  • 预计阅读时间:1.5 小时
  • 前置依赖:CoT、ToT

读 R1 的正确姿势是带着问题读:当推理能力被训进模型后,agent 系统里还剩下什么是需要外置的? 答案是:长程任务的脚手架、工具编排、环境反馈——这恰好就是 2025 年之后 agent 工程的重心。想系统跟进这条线,可以顺藤摸瓜读综述 The Landscape of Agentic Reinforcement Learning for LLMs(arXiv 2509.02547,2025 年 9 月),它梳理了 agentic RL 的任务环境、奖励设计和训练方法的版图。

15. Deep Research Agents: A Systematic Examination And Roadmap ​

  • arXiv:2506.18096(2025 年 6 月,综述)
  • 一句话价值:系统拆解 Deep Research 类产品(OpenAI / Google / Perplexity 的 deep research 功能)的技术栈:检索策略、多步规划、长上下文管理、报告生成与引用——做研究型 agent 的入门地图。
  • 预计阅读时间:1.5-2 小时
  • 前置依赖:ReAct、RAG 的基本概念

Deep Research 是 2025 年最成功的新 agent 品类之一:用户给一个研究问题,系统自主检索数十上百个来源,产出带引用的长报告。这篇综述把产品黑盒拆成了可研究的模块。读的时候对照真实产品(OpenAI 于 2025 年 2 月发布的 deep research、Google Gemini 的同名功能)使用效果,想想哪些模块还有明显的提升空间——那通常就是还缺论文的地方,也就是机会。

16. OSWorld 与 Computer Use ​

  • arXiv:2404.07972(2024 年 4 月,HKU + Salesforce + CMU 等,NeurIPS 2024)
  • 一句话价值:第一个在真实操作系统环境里评测 agent 的基准:369 个跨应用任务跑在真实 VM 里,agent 只能看屏幕截图、发鼠标键盘事件——computer use 方向的测量基石。
  • 预计阅读时间:1 小时
  • 前置依赖:无(知道多模态模型的基本概念即可)

OSWorld 论文本身是个基准论文,但它定义的范式(截图 → 动作坐标 → 执行 → 再看截图)就是 Anthropic 2024 年 10 月推出的 Claude computer use 以及 OpenAI Operator 所采用的基本形态。读这篇的重点是理解为什么 GUI agent 这么难:视觉 grounding、长程状态追踪、不可逆操作的风险。论文报告的初代模型成功率低得可怜(个位数到十几的百分比),两年后的今天数字涨了很多但仍远未「解决」——读论文时查一下当前 leaderboard,你能直观感受这个方向的爬坡速度。

17. Darwin-Gödel Machine(DGM) ​

  • arXiv:2505.22954(2025 年 5 月,Sakana AI + UBC + Vector Institute)
  • 一句话价值:让 coding agent 改写自己的代码,用 SWE-bench 等基准的实证分数做进化压力,开放式地积累自我改进——「自我改进 agent」方向 2025 年的标志性工作。
  • 预计阅读时间:1.5 小时
  • 前置依赖:SWE-agent、Voyager

DGM 是 Gödel Machine 思想的去理论化版本:不要求「可证明有益的修改」,只要「基准上实证有效」就保留进种群,配合开放式进化的 archive 防止陷入局部最优。它的结果(自我改进把 SWE-bench 分数从约 20% 推到约 50%,数字以论文版本为准)展示了 recursive self-improvement 的工程可行性,同时也暴露了它的风险面——自我修改的 agent 天然更难审计和约束,读的时候值得一并思考 安全 维度。

18. Why Do Multi-Agent LLM Systems Fail?(MAST) ​

  • arXiv:2503.13657(2025 年 3 月,UC Berkeley 等)
  • 一句话价值:对 7 个主流多智能体框架做系统性失败分析,归纳出 14 种失败模式(MAST 分类法)——给「多智能体狂热」泼的一盆高质量冷水。
  • 预计阅读时间:1 小时
  • 前置依赖:对 多智能体架构 有基本了解

这篇的立场非常对工程师胃口:多智能体系统在基准上的提升经常微乎其微,失败大多不是模型不行,而是系统设计问题——任务规格不清、agent 间对话跑偏、验证环节缺失。读完你对「什么时候该用多智能体」会有清醒得多的判断(多数情况下单个强 agent + 好工具就够了,多智能体是过度设计)。它提出的失败分类法也可以直接拿来当自己系统的 debug 清单。

五、按目标选路 ​

不是所有人都需要读完全部十八篇。按你的目标裁剪:

目标必读选读可以跳过
做 coding agent(求职或产品)ReAct、CodeAct、SWE-agent、Reflexion、R1Toolformer、OSWorld、DGMGenerative Agents、HuggingGPT
做研究/搜索型 agentReAct、CoT、Deep Research 综述、ToT综述(2308.11432)、MASTVoyager、OSWorld
做通用 agent 平台/框架ReAct、MRKL、Toolformer、CoALA、CodeActHuggingGPT、MAST、Agentic RL 综述Generative Agents 细节
做多智能体系统Generative Agents、MAST、CoALAHuggingGPT、VoyagerSWE-agent、OSWorld
准备面试(时间紧)CoT、ReAct、Reflexion、SWE-agent、R1CoALA 框架章节其余全部后置
研究 self-improvement 方向Reflexion、Voyager、DGMR1、Agentic RL 综述MRKL、HuggingGPT

几个补充建议:

  • 求职导向的读者,读完必读列之后直接去 求职知识地图 和 面试题,用论文里的概念去组织答案,比继续多读论文性价比高。
  • 准备写论文/做研究的读者,阶段三只是入口,顺着每篇的引用网络往前滚雪球才是正道,也可以参考站内 前沿论文导读。
  • 所有「做产品」路线的读者,请把 实践避坑 和论文一起读——论文不会告诉你成本和延迟的账怎么算。

六、读不进去怎么办 ​

最后说点务实的。论文对多数工程师不是舒适的阅读材料,几个降门槛的办法:

  1. 先看二手解读再读原文。YouTube/B 站上这些经典论文几乎都有精读视频,先看 20 分钟解读建立全局图,再读原文填细节,效率高得多。
  2. 跑代码代替读实验。ReAct 用 50 行 Python 就能手写一个(参考 亲手造一个 Agent),跑通一次比读三遍实验章节管用。
  3. 带着自己的问题读。「如果我要给这个 agent 加记忆,改哪里?」这种问题会强迫你读架构而不是读故事。
  4. 允许自己读不懂数学。这批论文绝大多数不涉及重数学,少数涉及的(如 RL 部分的 loss 设计)第一遍跳过完全没问题。

参考资料 ​