外观
精选资源清单
这份清单的目标不是「全」,而是「每一条都值得你花时间」。收录标准只有三条:内容是否一手(官方文档、作者本人博客、原始仓库)、是否经过工程实践检验(生产案例、可运行代码)、是否仍在维护(2025 年之后还有实质更新)。满足两条以上才进得来。
清单按学习路径组织:先读官方文档和名篇建立判断力,再挑一个框架动手,然后用评测基准校准认知,最后靠信息源保持更新。如果你还没想清楚先学什么,建议先过一遍学习路径再回来按图索骥。
使用建议
Agent 领域的信息半衰期大约是 6 个月。这份清单标注了 dataAsOf(2026-08),框架星数、课程状态都可能变化,引用具体数字前请以原页面为准。比收藏链接更重要的是:每周固定读 2-3 个一手信息源,比刷二手资讯高效得多。
一、官方文档与 Cookbook
官方文档是这个领域唯一「不会骗你」的资料来源——厂商要对自己的 API 负责。第三方教程经常抄旧版 API,官方文档不会。三家风格各异,可以按需取用:Anthropic 的文档偏「设计哲学与最佳实践」,OpenAI 的偏「指南与示例代码」,Google 的偏「结构化参考手册」。
Anthropic
- Claude 官方文档 —— Agent SDK、工具调用、MCP 集成的权威参考。注意域名已从 docs.anthropic.com 迁移到 docs.claude.com,老书签该换了。适合所有用 Claude 系模型做开发的人。
- Claude Cookbooks —— 官方维护的可复制代码片段集,覆盖 RAG、工具使用、Agent 模式,直接能跑。适合边抄边学的动手派。
- Claude Code 文档 —— 即使你不打算用 Claude Code,它的文档也是「一个成熟 Coding Agent 暴露了哪些配置面」的最佳观察样本,配合本站 Claude Code 案例拆解读效果更好。
OpenAI
- OpenAI Agents SDK 文档 —— 轻量级 Agent 框架的官方文档,handoff、guardrail、tracing 的概念定义讲得很干净,详见本站 OpenAI Agents SDK 页。
- OpenAI Cookbook —— 官方示例仓库,其中
examples/agents_sdk/目录有从单 Agent 到多 Agent 协作的完整 notebook,甚至包括一份「从 Claude Agent SDK 迁移过来」的对照指南,适合评估两家 SDK 差异时读。 - A Practical Guide to Building Agents —— OpenAI 2025 年发布的企业级 Agent 构建指南(PDF),把 Agent 拆成模型、工具、指令三要素,并给出何时从单 Agent 演进到多 Agent 的判断标准。面向技术决策者,工程师读也不亏。
感受一下官方 SDK 的极简风格(摘自官方文档的 quickstart 形态,细节以文档为准):
python
from agents import Agent, Runner
# 定义 Agent:名字、指令(instructions)、可用工具
agent = Agent(
name="assistant",
instructions="你是一个严谨的助手,先给结论再给依据。",
)
# Runner 负责跑 Agent Loop,run_sync 是同步入口
result = Runner.run_sync(agent, "帮我总结一下这周的大模型新闻")
print(result.final_output)十行以内就是一个能跑的 Agent——这也是为什么 2025 年之后「要不要上框架」的争论转向「要不要上大框架」。轻量 SDK 已经把样板代码压缩到接近零。
Google
- Agent Development Kit (ADK) 文档 —— Google 2025 年开源的 Agent 框架,文档质量在大厂出品里属上乘,多语言实现(Python/Java/Go/TS)各有仓库。
- google/adk-python —— ADK 主仓库,samples 目录比文档本身更值得翻。
协议层
- Model Context Protocol 官网与规范 —— MCP 的一手规范所在地,specification 目录下有带日期的版本快照(如 2025-06-18 版),写 MCP server 之前先读规范而不是博客。本站工具与 MCP有入门讲解。
- modelcontextprotocol GitHub 组织 —— 官方 SDK 与参考 server 实现集中在这里。
二、书籍与课程
书籍
Agent 方向专门成书且经得起推敲的不多,目前只推荐一本打底:
《AI Engineering》Chip Huyen(O'Reilly, 2025) —— 严格说这不是一本 Agent 专著,而是一本「基于基础模型构建应用」的工程全景书,但 eval、RAG、finetuning、推理成本这些章节正是 Agent 工程的地基。配套仓库 chiphuyen/aie-book 有作者整理的资源。适合想建立系统视角而不是追框架的工程师。有中文版译本出版,购买前以书店页面的版本信息为准。
阅读顺序建议:时间紧的话先读 eval 与 RAG 两章(Agent 工程的两大基石),prompt engineering 章节点到为止,finetuning 章节可以等业务真碰到瓶颈再回头看。
为什么没有更多书
Agent 工程 2024 年底才开始收敛出共识(Anthropic 的 Building effective agents 发表于 2024 年 12 月),一本纸质书的出版周期追不上这个速度。现阶段博客 + 官方文档 + 论文是更好的载体,书籍适合补地基而不是追前沿。
免费课程
- Hugging Face Agents Course —— 免费、开源、可拿证书的 Agent 课程,以 smolagents 为主线讲 Code Agent 范式,配套站点在 huggingface.co/learn 下,有社区维护的中文翻译。适合零基础系统入门。
- Microsoft AI Agents for Beginners —— 微软 2025 年 2 月发布的入门课,从最初 10 课扩到 18 课,覆盖工具使用、Agentic RAG、规划、多 Agent 等设计模式,官方提供简体中文版。GitHub star 约 5 万+,适合有代码经验的初学者按课表推进。
- DeepLearning.AI: AI Agents in LangGraph —— LangChain 创始人 Harrison Chase 亲授的短课(约 1 小时体量),从手写 ReAct 循环讲到 LangGraph 的 state 与 persistence。免费,适合作为 LangGraph 的第一次接触。
- DeepLearning.AI 短课系列整体值得关注:同一平台上还有 Functions, Tools and Agents with LangChain 等 Agent 相关短课,体量小、可白嫖,适合碎片时间查漏补缺。
- Google 与 Kaggle 合作的 5 天 AI Agents 密集课程(5-Day AI Agents Intensive)—— 以 ADK 为主线的直播式训练营,课程资料沉淀在 Kaggle 上可自行学习。适合想跟 Google 技术栈的人。
关于证书
上面这些课程的证书在求职市场上权重很低——面试官想看到的是你用课程里的模式做出了什么东西。把每门课的 capstone 项目改造、扩展、部署上线,写进作品集,价值远大于证书本身。详见本站简历分析。
三、工程博客名篇
如果说论文告诉你「什么可行」,工程博客告诉你「什么在生产里真的 work」。下面这些是 2024-2026 年间被引用最多、含金量经过时间检验的篇目,按必读程度排序。
读这类文章有个方法论:不要只记结论,要记「结论成立的边界」。比如「多 Agent 比单 Agent 好」只在「任务可并行、信息量超单上下文」时成立——Anthropic 在同一篇文章里明说大多数 coding 任务反而不适合多 Agent。把这些边界条件摘出来,面试和架构评审时都用得上。
| 篇目 | 来源与时间 | 一句话价值 |
|---|---|---|
| Building effective agents | Anthropic,2024-12 | 这个领域被引用最多的工程文章,没有之一。核心观点「大多数场景不需要复杂框架,简单的可组合模式就够」至今有效 |
| Context Engineering for AI Agents: Lessons from Building Manus | Manus(季逸超),2025-07 | 从 KV-cache 命中率到「文件系统即上下文」,全是踩坑换来的结论,本站上下文工程和 Manus 案例都引用了它 |
| How we built our multi-agent research system | Anthropic,2025-06 | Claude Research 功能背后的多 Agent 架构复盘,含「token 消耗解释 80% 的性能方差」这类硬结论,配合多智能体架构读 |
| Effective context engineering for AI agents | Anthropic,2025 | 把 context engineering 从口号变成方法论:什么该进上下文、什么该留在外面 |
| Context Engineering for Agents | LangChain,2025 | 把 context 策略归纳为 write/select/compress/isolate 四类,是目前最好用的分类框架之一 |
| Writing effective tools for agents | Anthropic,2025 | 工具设计的实操指南——为 Agent 写工具和为人写 API 是两种不同的手艺 |
| Building agents with the Claude Agent SDK | Anthropic,2025-09 | Claude Code 同款 SDK 的官方构建指南,「给一个能跑循环的 harness,而不是一堆规则」的思路很有代表性,配合本站 Claude Agent SDK 页 |
| Demystifying evals for AI agents | Anthropic,2026-01 | Agent 评测的系统性指南:grader 三分法、pass@k 与 pass^k 的区别、按 Agent 类型(coding/对话/研究/computer use)分别怎么评。配合本站评测体系读 |
| 12-Factor Agents | HumanLayer(Dex Horthy),2025 | 反框架立场的生产原则清单,「own your context window」「small, focused agents」等条目已成行业口头禅。GitHub 仓库形式,适合打印贴墙 |
| Claude Code best practices | Anthropic,2025-04 | 名义上讲 CLI 用法,实质是「如何与一个 Coding Agent 高效协作」的心智模型 |
| Unrolling the Codex agent loop | OpenAI,2025 | Codex CLI 作者亲自拆解 Agent Loop 的实现细节:prompt 前缀如何对齐缓存、context 超阈值后怎么 compact。配合本站 Agent Loop 读 |
| Effective harnesses for long-running agents | Anthropic,2025-11 | 跑数小时的长程 Agent 怎么做可靠执行:harness 设计、断点恢复、跨会话记忆,长任务是 2026 年的主战场 |
还有两个博客值得订阅而不是读单篇:
- Anthropic Engineering —— 更新频率不高但篇篇有料,上述名篇一半出自这里。
- LangChain 博客 —— 立场自带带货属性(毕竟是自家框架),但其「agent 概念辨析」和「生产案例访谈」系列质量稳定,读时注意区分事实与软文。
四、开源框架与仓库
星数为 2026 年中的数量级,来自公开统计页面,GitHub star 随时在变,以仓库首页为准。选型逻辑见本站框架选型总览,这里只做导航。
先给一个判断:2026 年的框架格局已经明显分层——底层是各家官方 SDK(轻、贴 API),中层是编排框架(LangGraph、CrewAI 这类管状态和流程的),上层是低代码平台。大多数生产团队的实际选择是「官方 SDK + 少量自研编排」或「LangGraph 全家桶」,两头都占的中间派框架正在被挤压。选框架前先想清楚自己卡在哪一层。
Python 编排框架
| 仓库 | Star 量级 | 定位与适合谁 |
|---|---|---|
| langchain-ai/langchain | 13 万+ | 生态最大的 LLM 应用框架,集成最多;适合需要快速拼接现成组件的场景 |
| langchain-ai/langgraph | 数万(约 3-5 万) | 图结构的有状态 Agent 编排,生产级 Agent 的常见默认选项;适合要精细控制流程的团队 |
| openai/openai-agents-python | 1 万+ | 轻量 SDK,handoff/guardrail/tracing 三件套;适合 OpenAI 生态内快速起步 |
| crewAIInc/crewai | 5 万+ | 角色扮演式多 Agent,几十行代码出原型;适合业务流程自动化和演示,见本站 CrewAI 页 |
| microsoft/autogen | 5 万+ | 对话式多 Agent 框架,注意:官方仓库已进入维护模式,微软已将重心转向 Microsoft Agent Framework;新项目不建议上车,见本站 AutoGen 页 |
| huggingface/smolagents | 1 万+ | 核心仅约千行代码的极简框架,主打 CodeAgent(让模型写代码作为动作);适合想看清 Agent 本质的学习者 |
| google/adk-python | 1 万+ | Google 的 Agent 开发套件,Gemini 生态首选,支持 A2A 协议 |
| pydantic/pydantic-ai | 1 万+ | Pydantic 团队出品,类型安全优先;适合讨厌框架魔法、想要 FastAPI 式体验的工程师 |
TypeScript / JavaScript
- mastra-ai/mastra —— TS 生态里目前最完整的 Agent 框架,工作流、记忆、eval 都有内置;适合前端/全栈团队。
- langchain-ai/langgraphjs —— LangGraph 的 JS 版本,与 Python 版概念对齐。
- google/adk-js —— Google ADK 的 TypeScript 实现。
平台与低代码
- Flowise —— 拖拽式 Agent 构建器(star 5 万+量级),适合不会写代码或需要快速验证想法的人;复杂场景会撞到天花板。
- 字节跳动的 Coze(扣子开源版)与 Dify 是国内最常用的两个开源 Agent/LLM 应用平台,本站分别有 Coze 与 Dify 的案例分析。
示例与模板
- Shubhamsaboo/awesome-llm-apps —— 100+ 个可直接运行的 Agent/RAG 应用模板(star 12 万+量级),从旅行助手到多 Agent 团队,每个都能 clone 下来跑。找作品集灵感先看这里,再配合本站作品集项目指南二次加工,不要原样照搬。
生态组件
- modelcontextprotocol/servers —— MCP 官方参考 server 合集(文件系统、Git、数据库等),自己写 server 前先抄结构。
- mem0ai/mem0 —— Agent 记忆层开源方案(star 5 万+量级),做长期记忆时值得先读它的论文和实现再决定自建还是引入,配合本站记忆一章。
读源码的建议
想真正理解 Agent Loop,与其读十个框架的文档,不如精读一个最小实现:smolagents 核心代码约千行,一个下午能读完,读完你会知道所谓「框架」到底帮你做了什么、又藏了什么。之后再去看 LangGraph 这类大框架,关注点会清晰很多。
五、评测与数据集
读 benchmark 的意义不在于背分数,而在于理解「这个领域如何定义难」。以下是 Agent 评测中最常被引用的基准,详见本站评测体系。先给一张速查表:
| 基准 | 考什么 | 一句话定位 |
|---|---|---|
| SWE-bench Verified | 修真实 GitHub issue | Coding Agent 的事实标准 |
| τ-bench / τ²-bench | 多轮对话 + 工具调用 | 客服/对话式 Agent 的可靠性试金石 |
| GAIA | 网页浏览 + 多模态 + 多步推理 | 「通用助理」的综合考卷 |
| WebArena / OSWorld | 网页 / 桌面 GUI 操作 | 浏览器与 computer-use Agent 的靶场 |
| Terminal-Bench | 终端长程任务 | 系统级能力的补充 |
| AgentBench | 八种环境的综合评测 | 学术向的多维能力剖面 |
| BrowseComp | 开放网络信息定位 | 「好验证、难解决」的浏览难题 |
各基准的详情:
- SWE-bench —— 用真实 GitHub issue 评测 Coding Agent,Verified 子集是当前事实标准。2024 年到 2025 年间,头部系统在其上的解决率从约 40% 升到 80% 以上(Anthropic 工程博客口径),是观察 Coding Agent 进展最好的单一指标。
- τ-bench / τ²-bench —— Sierra 出的对话式 Agent 基准,模拟零售、航空客服等多轮工具使用场景,专门考 pass^k(每次都做对)而不只是 pass@1(蒙对一次)。
- GAIA —— Hugging Face、Meta 等机构联合推出的通用助理基准(论文 arXiv:2311.12983),466 个真人设计的问题,考网页浏览、多模态、多步推理的综合能力,曾是「通用 Agent」宣传的标配参照。
- WebArena —— 自托管的网页任务环境(电商、论坛、协作软件),测浏览器 Agent 的端到端完成率;姊妹篇 OSWorld 把战场扩到整个桌面操作系统。
- Terminal-Bench —— 终端环境里的长程任务(编译内核、训练模型等),补 SWE-bench 不覆盖的系统级能力。
- AgentBench —— 清华 THUDM 组的多环境综合基准(操作系统、数据库、网页、卡牌游戏等八个环境),适合用来理解「Agent 能力不是单一维度」这件事。
- BrowseComp —— OpenAI 出的浏览类基准,题目「好验证、难解决」,专门测 Agent 在开放网络里找针的能力。
读榜单的纪律
同一个 benchmark,不同 harness(脚手架)下的分数不可直接比较——Anthropic 在评测文章里明说「评测一个 Agent 实际是评测 harness + 模型的组合」。看到任何分数先问三个问题:用的什么 scaffold、跑了几次取什么指标(pass@1 还是 pass@k)、成本多少。榜单用来观察趋势,不用来做采购决策。
六、社区与信息源
Newsletter 与播客
信息源贵在精不在多。以下三个足够覆盖「技术深度 + 行业视野」两个维度,全部免费:
- Latent Space —— swyx 与 Alessio 主理的「AI Engineer」newsletter + 播客,技术浓度最高的英文信源之一,Agent 方向的深度访谈基本以这里为首发。
- Import AI —— Jack Clark(Anthropic 联合创始人)写了多年的周更 newsletter,偏政策与研究趋势,帮你建立「大局观」。
- Simon Willison's Weblog —— 工程师视角的 LLM 观察日志,新模型新工具的上手实测与评论,Agent 生态的重要发布他几乎篇篇不落。
社区
- Reddit:r/LocalLLaMA(模型与推理一线讨论)、r/AI_Agents(Agent 垂直)、r/ClaudeAI(Claude 生态实战帖多)。
- Discord:LangChain、Hugging Face、CrewAI 等开源项目的官方 Discord 是提问和看 roadmap 的直接渠道,比 issue 区更适合「这样做对不对」类问题。
- Hacker News —— 重大发布与名篇的第一讨论现场,评论区常有作者本人下场,前文提到的 12-Factor Agents 就是先在这里发酵的。
- X/Twitter:关注官方账号(@AnthropicAI、@OpenAI、@GoogleDeepMind)加少量工程师型 KOL(如 @_akhaliq 的论文日更)即可,关注越多信噪比越低。一个可执行的纪律:关注列表超过 50 个就该清理了。
中文社区
- 公众号「机器之心」「量子位」「新智元」—— 中文 AI 资讯的「三大顶会」(机器之心官网、量子位官网),时效性强,适合扫标题跟动态;深度技术判断要自己过滤,它们的定位是媒体不是工程参考。
- WaytoAGI —— 中文圈最活跃的开源 AI 知识库社区,飞书文档形式维护,Agent 相关的中文教程与案例沉淀较多。
- 稀土掘金 AI 板块与知乎「大模型」话题 —— 中文工程实践帖的主要产地,质量方差大,按作者而不是按平台筛选。
七、Awesome 列表
当你需要的不是「精选」而是「穷举」(比如调研某个细分类目有没有现成轮子)时,用这些。使用 awesome 列表的正确姿势是按类目扫一遍、挑 2-3 个候选进 PoC,而不是从头点到尾:
- e2b-dev/awesome-ai-agents —— 收录最勤快的 Agent 项目大全(star 约 3 万),开源/闭源分列,更新到 2026 年仍在活跃合并 PR。
- kyrolabs/awesome-agents —— 另一个高星 Agent 导航,按框架、平台、应用分类。
- dair-ai/Prompt-Engineering-Guide —— 提示工程领域最知名的 awesome 仓库(star 7 万+量级),含论文与指南索引,配合本站提示工程使用。
- ai-boost/awesome-harness-engineering —— 2026 年新兴的细分导航,专门收录 harness/scaffold 工程(agent loop、evals、memory、权限、可观测性)的文章与工具,比泛 Agent 列表更贴工程一线。
- 论文向的入口直接看本站论文地图与核心论文清单,比通用 awesome 列表更聚焦 Agent。
最后一句实话
资源清单解决不了「收藏了但不读」的问题。比扩充书签栏更有效的策略是:固定 2-3 个一手信源(比如 Anthropic Engineering + Latent Space + 一个中文源),每周读完,然后动手把读到的模式在自己的小 Agent 里复现一遍。输入和输出的比例保持在 1:1,是这个领域最快的学习方式。
八、不同身份的用法建议
同一份清单,不同处境的人应该有不同的打开方式:
| 你是谁 | 优先读 | 先跳过 |
|---|---|---|
| 零基础转行,还在补概念 | 微软/ Hugging Face 课程 → Building effective agents → 本站概念辨析 | benchmark 细节、多 Agent 论文 |
| 在职工程师,要在项目里落地 | 官方文档 + Cookbook → 12-Factor Agents → Manus context engineering → 成本与可观测性章节 | 课程类内容(太慢) |
| 准备求职面试 | 博客名篇全部 + SWE-bench/τ-bench 的设计思想 + 本站面试题与知识地图 | 低代码平台 |
| 做产品/技术决策 | OpenAI 企业指南 + Anthropic 多 Agent 复盘里的成本分析(多 Agent 约 15 倍 token 消耗)+ 框架选型 | 源码级内容 |
一个可执行的四周节奏,供参考:
- 第 1 周:读 Building effective agents + 任选一个入门课程的前半,用 官方 SDK 手写一个最小 Agent,不碰框架。
- 第 2 周:读 Manus 与 LangChain 两篇 context engineering,回到自己的 Agent 上加 KV-cache 友好的改造;开始读 Claude Cookbooks 里与你方向相关的 notebook。
- 第 3 周:读 Demystifying evals,给自己的 Agent 写一个 20 条用例的小 eval 集(Anthropic 的建议就是从小样本开始),顺便读 12-Factor Agents 对照检查。
- 第 4 周:挑一个框架(LangGraph 或 OpenAI Agents SDK)把第 1 周的 Agent 重写一遍,体会框架到底省了什么事;同时在 awesome-llm-apps 里挑一个模板魔改成作品集项目。
四周之后,这份清单里的信息源类资源(第六节)开始接管——你的主要任务从「系统学」切换为「持续跟」。
参考资料
- Building effective agents — Anthropic Engineering —— Agent 工程领域被引用最多的奠基性文章(2024-12),本文「名篇」筛选的基准线。
- Context Engineering for AI Agents: Lessons from Building Manus —— Manus 团队的 context engineering 实战总结(2025-07),已经 FetchURL 核实原文。
- How we built our multi-agent research system — Anthropic Engineering —— 多 Agent 架构与 token 经济学分析(2025-06),已经 FetchURL 核实。
- Demystifying evals for AI agents — Anthropic Engineering —— Agent 评测方法论(2026-01),已经 FetchURL 核实,本文评测一节的 grader 分类与 pass@k/pass^k 概念出处。
- A practical guide to building agents — OpenAI —— OpenAI 官方 Agent 构建指南(2025)。
- Model Context Protocol 官方文档 —— MCP 一手规范与版本化 specification。
- microsoft/ai-agents-for-beginners —— 微软免费 Agent 入门课程(2025 年发布,含官方中文翻译)。
- e2b-dev/awesome-ai-agents —— 本文 awesome 列表一节的收录标准参照,星数量级数据来自其仓库页及第三方 star 统计(2026 年中)。