Skip to content

论文地图

本页速览 把 2022-2026 年的 Agent 研究版图整理成一张可导航的地图:推理规划、工具使用、记忆、多智能体、具身、Coding Agent、评测、安全、综述九大分区,每个分区给出经核实的代表作 arXiv 编号与一句话现状。

本页含时效性内容,数据截止于 2026-08;JD、价格、产品功能等信息可能已变化,引用前请核对原始出处。

论文地图 ​

Agent 研究从 2022 年底到现在,论文数量已经从「能读完」膨胀到「没人能读完」。好消息是:真正有结构影响力的工作不超过五十篇,其余大多是它们的排列组合。这份地图把版图划成九个分区,每个分区只放经过核实、至今仍被反复引用的代表作,并给出该方向的一句话现状判断。

使用建议:先读论文阅读路径确定顺序,再用本地图定位分区,最后到核心论文精读看逐篇拆解。所有 arXiv 编号均经检索核实(截至 2026 年 8 月),点击即可直达摘要页。

一、推理与规划(Reasoning & Planning) ​

一切 Agent 能力的底座。这条线回答的问题是:模型在行动之前,如何「想」。

论文arXiv一句话贡献
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models2201.11903一句 "Let's think step by step" 级别的 prompt,解锁了多步推理
Self-Consistency Improves Chain of Thought Reasoning2203.11171采样多条推理链再投票,用算力换正确率的第一个成熟方案
ReAct: Synergizing Reasoning and Acting in Language Models2210.03629把 Thought/Action/Observation 交织成 loop,Agent 范式的事实起点
Reflexion: Language Agents with Verbal Reinforcement Learning2303.11366失败后生成文字反思写入记忆,下一次 trial 带着教训重来
Tree of Thoughts: Deliberate Problem Solving with LLMs2305.10601把单链推理扩展成可搜索的思维树(BFS/DFS + 自评估)

现状一句话:纯 prompt 层的推理技巧(CoT/ToT)已经被 o1/R1 这类 reasoning model 内化进了权重,今天你不再需要手写思维链;但 ReAct 的「推理-行动交织」骨架和 Reflexion 的「用文字做 RL」思想,仍是所有 Agent Loop 的默认设计。详见规划机制与 Agent Loop。

判断

2026 年再读 ToT 要带着历史眼光:它证明的是「搜索 + 评估器」能显著提升推理,这个思想被后来的 MCTS 蒸馏和 RL 训练(而不是 prompt 树)继承了。工程上你几乎不该在生产 Agent 里跑 prompt 版 ToT——成本是单链的几十倍,收益大多已被 reasoning model 覆盖。

二、工具使用(Tool Use) ​

这条线把 LLM 从「聊天器」变成「能调用外部能力的控制器」,是 Agent 与 Chatbot 的分水岭。

论文arXiv一句话贡献
TALM: Tool Augmented Language Models2205.12255早期证明小模型 + 工具微调可以反超纯大模型
Toolformer: Language Models Can Teach Themselves to Use Tools2302.04761自监督标注 API 调用位置,让模型自学「何时调、调什么」
HuggingGPT: Solving AI Tasks with ChatGPT and its Friends2303.17580LLM 当控制器调度 Hugging Face 上的专家模型,模型即工具
Gorilla: Large Language Model Connected with Massive APIs2305.15334面向海量 API 的检索感知微调,工具调用准确率的标杆工作

现状一句话:工具调用的研究问题已经基本「工程化解决」——主流模型原生支持 function calling,MCP 协议统一了工具接入层,难点从「会不会调」变成了「权限、幂等、失败恢复」。Toolformer 式的训练方法仍有价值,但主要属于模型厂商而非应用工程师。

三、记忆与个性化(Memory & Personalization) ​

没有记忆的 Agent,每次对话都是第一天上班。这条线研究信息如何写入、组织、检索、遗忘。

论文arXiv一句话贡献
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(RAG)2005.11401参数记忆 + 非参数检索的原始框架,比 Agent 概念还早,却是所有外部记忆的地基
Generative Agents: Interactive Simulacra of Human Behavior2304.03442memory stream + 重要性/新近性/相关性打分检索 + 反思抽象,Agent 记忆架构的模板
MemGPT: Towards LLMs as Operating Systems2310.08560把 context window 当内存、外部存储当磁盘,让 LLM 自己管理分页换入换出

现状一句话:RAG 已是基础设施而非研究前沿;真正的前沿在「记忆的操作系统化」——MemGPT 一系演变成了今天的 Letta 等产品,而「让 Agent 自主决定记什么、忘什么」仍没有公认最优解。工程取舍见记忆系统与 RAG。

四、多智能体(Multi-Agent) ​

单个 Agent 能力到顶之后,自然的想法是组建团队。这条线又分成「模拟社会」和「协作干活」两支。

论文arXiv一句话贡献
CAMEL: Communicative Agents for "Mind" Exploration2303.17760角色扮演式双 Agent 对话,用 inception prompting 防跑偏
Generative Agents(模拟社会一支的源头)2304.0344225 个 Agent 在小镇里自主生活,涌现行为出圈之作
MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework2308.00352把软件公司 SOP 编码进多 Agent 协作流,角色 + 流程双约束
AgentVerse: Facilitating Multi-Agent Collaboration2308.10848招募-讨论-执行-评估四阶段的可组装多 Agent 框架
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation2308.08155把一切抽象为「可对话 Agent + 对话模式」,微软的多 Agent 编程框架

现状一句话:模拟社会一支学术声量大、产业落地少;协作干活一支分化成了框架(AutoGen、CrewAI)和产品(Manus 等)。社区共识也在回归理性——多 Agent 在多数场景是过度设计,单 Agent + 好工具的能力边界远比 2023 年想象得远。深入讨论见多智能体架构。

五、具身与游戏(Embodied & Game) ​

游戏和机器人是 Agent 最好的试验场:环境封闭、奖励可测、失败便宜。

论文arXiv一句话贡献
Do As I Can, Not As I Say(SayCan)2204.01691LLM 出「想做什么」、affordance 函数出「能做什么」,两者相乘选动作
Voyager: An Open-Ended Embodied Agent with Large Language Models2305.16291Minecraft 里的终身学习 Agent:自动课程 + 技能库 + 自我验证
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2307.15818把机器人动作表示成文本 token,和互联网知识一起训练出 VLA 模型

现状一句话:Voyager 的「技能库 = 可执行代码记忆」直接启发了后来的 Coding Agent;SayCan 的 affordance 思想演变成了 VLA 大模型(RT-2 及后续)。具身智能在 2025-2026 成为融资与发文双热门,但和软件 Agent 的工程栈已经明显分家。

六、Coding Agent ​

Agent 研究里最先跑通商业闭环的分区。代码有可执行的验证信号(测试过没过),天然适合 Agent Loop。

论文arXiv一句话贡献
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?2310.06770用真实 GitHub issue 定义了「自动修 bug」的标准考题
Executable Code Actions Elicit Better LLM Agents(CodeAct)2402.01030让 Agent 直接输出可执行代码作为动作,比 JSON 工具调用更强
SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering2405.15793提出 ACI 概念:给 Agent 设计的命令行接口和给人设计的一样重要
OpenHands: An Open Platform for AI Software Developers as Generalist Agents2407.16741开源的通用软件 Agent 平台,CodeAct 思想的工程化集大成者

现状一句话:这是九个分区里「论文 → 产品」转化最快的一个——SWE-bench(及其人工筛选子集 SWE-bench Verified)成为所有编程产品的军备竞赛榜单,SWE-agent 和 OpenHands 的思想直接流进了 Claude Code、Cursor、Devin。案例拆解见 SWE-agent、OpenHands、Claude Code。

注意

读 Coding Agent 论文时警惕一个口径问题:论文报告的 SWE-bench 分数通常带 retry、带 scaffold 调优,和你拿同一模型裸跑的结果可能差数倍。比较两个系统时,先确认它们用的是同一 benchmark 变体、同一 retry 预算。

七、评测与 Benchmark ​

Agent 评测是这个领域最「诚实」的分区:它不断证明我们以为已经解决的问题其实没解决。

论文arXiv一句话贡献
AgentBench: Evaluating LLMs as Agents2308.036888 类交互环境(OS、数据库、网页、游戏等)的第一个系统性 Agent 评测套件
WebArena: A Realistic Web Environment for Building Autonomous Agents2307.13854自托管的真实网站副本上测网页操作,把 web Agent 评测从玩具拉到实战
GAIA: a Benchmark for General AI Assistants2311.12983概念上简单、但需要工具链组合的多步助理任务,人做 92%,当时的 GPT-4 插件版不到两成
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments2404.07972真实操作系统里执行、按系统状态判分,computer-use Agent 的标准考场
τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains2406.12045用 LLM 模拟用户和 Agent 多轮对抗,专测规则遵循与一致性;论文里著名的结论:多次重试下成功率(pass^k)骤降

现状一句话:benchmark 的核心矛盾从「没有考题」变成了「考题被刷分」——一线厂商对榜单的针对性优化让分数通胀,社区的对策是不断出更难、更难污染的变体(SWE-bench Verified、τ-bench 的续作等)。自己搭评测的方法论见评测体系与实战 evals。

八、安全与对齐(Safety & Alignment) ​

Agent 有手有脚之后,「说错话」的风险升级成了「做错事」。这是九个分区里最年轻、也最被低估的一个。

论文arXiv一句话贡献
AgentDojo: A Dynamic Environment to Evaluate Attacks and Defenses for LLM Agents2406.13352prompt injection 攻防的动态评测场:同时衡量「任务完成率」和「被注入后的失守率」
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents2410.09024110 个多步恶意任务测滥用风险;发现领先模型对恶意 agentic 请求「出人意料地顺从」,简单越狱模板即可迁移到 Agent 场景

现状一句话:研究的共识结论很刺耳——把安全的 chatbot 包进 Agent 外壳,安全性不会自动继承;工具返回内容是最大的注入面。防御侧仍没有银弹,工程上靠的是权限收敛、人机确认、trace 审计这套「无聊但有效」的组合。落地清单见安全与防护。

边界

这个分区的论文数量远少于其他八个,不是因为问题小,而是因为攻防细节有披露风险、很多工作以厂商 system card 而非论文形式发布。读文献之外,务必跟踪厂商的安全文档和红队报告。

九、综述类(Surveys) ​

想快速建立全局观,综述是捷径;但综述的保鲜期通常只有一年,读新不读旧。

论文 / 文章出处一句话贡献
A Survey on Large Language Model based Autonomous Agents2308.11432提出「Profile / Memory / Planning / Action」四模块划分,被后续综述广泛沿用
The Rise and Potential of Large Language Model Based Agents: A Survey2309.07864从「单 Agent → 多 Agent → Agent 社会」的组织视角梳理版图,篇幅巨大适合当字典查
LLM Powered Autonomous Agents(Lilian Weng 博客)lilianweng.github.io非论文,但「Planning + Memory + Tool use」三分法是整个社区引用最多的心智模型

现状一句话:2024 年之后的综述开始转向专项(记忆综述、多 Agent 综述、评测综述、推理模型综述),通吃型大综述的价值在下降——领域成熟的表现。入门仍建议从 Lilian Weng 这篇博客开始,半小时建立骨架。

十、知识图谱:主题间的关联与演进 ​

下面这张图把九个分区按时间和影响关系连成一张网。箭头表示「思想流向」,左侧是源头,右侧是下游。

                        2020        2022           2023                    2024           2025-26
                          │           │              │                       │               │
  ┌─────────────┐   RAG ──┴──► CoT ───┴──► ReAct ────┼──► Reflexion ────────┼──► reasoning ─┴──► 内化进模型权重
  │ ① 推理与规划 │        (2005.11401) (2201.11903) (2210.03629)           │    models       (o1/R1 系)
  └─────────────┘                          │          (ToT 2305.10601 分支: prompt 树搜索, 后被 RL 训练取代)
                                           ▼
  ┌─────────────┐   TALM ──────► Toolformer ──► HuggingGPT / Gorilla ──► function calling ──► MCP
  │ ② 工具使用   │  (2205.12255)  (2302.04761)   (2303.17580 / 2305.15334)   原生支持        协议统一
  └─────────────┘                          │
                                           ▼
  ┌─────────────┐   Generative Agents ◄─────┘   MemGPT ──────────────► Letta 等记忆产品
  │ ③ 记忆       │   (2304.03442, memory stream)  (2310.08560, LLM-as-OS)
  └─────────────┘          │
                           ▼
  ┌─────────────┐   CAMEL ──► MetaGPT / AgentVerse / AutoGen ──► 多 Agent 框架 ──► 回归单 Agent
  │ ④ 多智能体   │ (2303.17760) (2308.00352 / 2308.10848 / 2308.08155)  热潮         理性的反思
  └─────────────┘
  ┌─────────────┐   SayCan ──► Voyager ──► RT-2 (VLA) ──────────► 具身智能独立赛道
  │ ⑤ 具身与游戏 │ (2204.01691) (2305.16291) (2307.15818)
  └─────────────┘                │
                                 │ 技能库 = 代码记忆
                                 ▼
  ┌─────────────┐   SWE-bench ──► CodeAct ──► SWE-agent ──► OpenHands ──► Claude Code / Devin
  │ ⑥ Coding    │  (2310.06770)  (2402.01030) (2405.15793)  (2407.16741)   等产品落地
  └─────────────┘        │
                         ▼
  ┌─────────────┐   AgentBench ──► WebArena / GAIA ──► OSWorld / τ-bench ──► 抗污染变体
  │ ⑦ 评测       │  (2308.03688)  (2307.13854 / 2311.12983) (2404.07972 / 2406.12045)
  └─────────────┘                                                        │
  ┌─────────────┐   AgentDojo / AgentHarm ───────────────────────────────┘ 攻防评测常态化
  │ ⑧ 安全       │  (2406.13352 / 2410.09024)
  └─────────────┘
  ┌─────────────┐   2308.11432 / 2309.07864 / Lilian Weng 博客 ──► 专项综述时代
  │ ⑨ 综述       │
  └─────────────┘

读这张图的方式:

  1. 横向是时间:2022 年之前只有 RAG 一根独苗;2023 年是寒武纪大爆发,九个分区有七个在那年定型;2024 年重心转向评测和 Coding 的工程化;2025-2026 年则是 reasoning model 把①的 prompt 技巧收编、以及安全与评测的军备竞赛。
  2. 纵向是依赖:没有①的 ReAct 就没有②的工具调用循环;没有③的记忆模板就没有④的模拟社会;⑤的技能库思想直接浇灌了⑥。Coding Agent 是全图最大的「汇」,几乎每个分区的成果都在那里变现。
  3. 消失的分支同样重要:prompt 版 ToT、多 Agent 社会模拟,都是声量巨大但工程上被证伪或搁置的方向。地图上不画出来的论文,大多数是死在这条路上的。

如果你准备求职或转行,⑥和⑦是面试出现频率最高的两个分区——既能考深度(SWE-bench 的评分机制),又能考广度(不同 benchmark 的适用边界)。配套阅读:面试高频问题、前沿动态。

参考资料 ​