概念辨析:Agent / Workflow / Copilot / RAG
厘清 Agent 领域最易混淆的概念群:Anthropic 对 Workflow 与 Agent 的权威划分、Agent 与 Chatbot/Copilot/RAG/Agentic AI/RPA/多 Agent/Harness 的边界,每个概念给出一句话定义、典型例子和「看到 X 就知道它是 Y」的判断标准,最后附一张技术选型决策流程图。
AI AGENT HANDBOOK
从零理解到亲手构建 AI 智能体 —— 智能体循环 · 提示词与上下文工程 · 工具与 MCP · 记忆 · 规划 · 多智能体 · 评测与安全
50+ 篇内容不是要你通读的图书馆,而是可以按需组合的路线图
只读十篇的话,读这些
拆解 AI Agent 的精确定义与公式(LLM + 规划 + 记忆 + 工具),对比 Anthropic、OpenAI、IBM 的权威表述,梳理 2023-2026 年 Agent 爆发的技术前提,并用 30 行伪代码展示最小 Agent 的完整循环。
导读本站三条学习路线的完整使用说明:2 周求职冲刺、8 周系统进阶、在职建造者案头速查索引,附逐日计划、每周检验标准和 20 题自检清单。
导读Function Calling 的完整时序与宿主执行模型、让模型「选得对、调得准」的工具设计原则、工具爆炸的应对(Tool Search / 分层暴露)、MCP 协议架构与 2026 年生态现状,附手写 MCP server 最小可运行示例。
核心组件从 prompt engineering 到 context engineering 的范式升级:为什么上下文是稀缺资源,写入/选择/压缩/隔离四大策略如何落地,以及 Manus、Claude Code 在生产环境验证过的会话压缩、工具掩码、KV cache 优化技术。
核心组件Agent Loop 是所有智能体的心脏:拆解感知-思考-行动-观察四拍循环,给出可直接照抄的完整伪代码实现,精讲 ReAct 模式,对比 Claude Code、SWE-agent、OpenHands 三款真实系统的循环设计差异,并给出死循环、原地打转、过早收工三类失控模式的对策表。
核心组件多 agent 什么时候值得、什么时候是过度设计。拆解 Anthropic Research 与 Cognition 两派对立观点,五种编排模式、A2A 协议现状、真实系统案例与成本量化,给出从单 agent 升级到多 agent 的决策框架。
进阶架构系统讲解 AI Agent 评测:为什么比模型评测难一个数量级,从单元、轨迹、结果到系统的四层评估框架,LLM-as-judge 的偏差与校准,SWE-bench、GAIA、OSWorld、τ-bench 等主流 benchmark 的最新格局,以及如何自建防污染的私有 eval。
进阶架构2026 年 Agent 框架全景:从裸 SDK、OpenAI Agents SDK、Claude Agent SDK 到 LangGraph、CrewAI、Microsoft Agent Framework 与低代码平台,附对比表、隐藏成本分析和可落地的选型决策树。
框架与平台编程 Agent 的标杆产品深度解剖:从 CLI 到 Web/SDK 的形态演进、主 Agent Loop + Task 子代理的架构、通用原子工具设计哲学、上下文压缩与子代理隔离、权限模型与 hooks 机制,以及可复用到自建 Agent 的完整借鉴清单。
产品案例不用任何框架,只用 LLM API 手写一个能跑的最小 Agent:50 行 Agent Loop 起步,逐版加上错误回传、步数上限、todo 规划和上下文压缩,每步附完整可运行代码与预期运行轨迹。
实践指南逐篇精读 Agent 领域 10 篇奠基论文:ReAct、Toolformer、MRKL、Chain-of-Thought、Tree of Thoughts、Reflexion、Generative Agents、Voyager、SWE-agent、CodeAct,含 arXiv 编号、方法图解、实验数据与对后世框架的影响。
论文精读Agent 工程师面试全题库:10 道概念题、8 道系统设计题、4 道手写编码题,外加项目深挖、开放观点题与反问清单。每题附考察点和成段的答题框架,而非一句话标准答案。
求职与JD按模块浏览,或直接搜索
厘清 Agent 领域最易混淆的概念群:Anthropic 对 Workflow 与 Agent 的权威划分、Agent 与 Chatbot/Copilot/RAG/Agentic AI/RPA/多 Agent/Harness 的边界,每个概念给出一句话定义、典型例子和「看到 X 就知道它是 Y」的判断标准,最后附一张技术选型决策流程图。
拆解 AI Agent 的精确定义与公式(LLM + 规划 + 记忆 + 工具),对比 Anthropic、OpenAI、IBM 的权威表述,梳理 2023-2026 年 Agent 爆发的技术前提,并用 30 行伪代码展示最小 Agent 的完整循环。
本站三条学习路线的完整使用说明:2 周求职冲刺、8 周系统进阶、在职建造者案头速查索引,附逐日计划、每周检验标准和 20 题自检清单。
从 1966 年的 ELIZA 到 2025 年的编程 Agent 军备赛:梳理 AI Agent 六十年思想史与近五年技术爆发史,讲清 ReAct、function calling、MCP、A2A 等关键节点为何在那个时刻出现,并提炼三条可复用的历史规律。
把一个生产级 Agent 系统拆成六层——感知、认知核心、规划、行动、记忆、治理,逐层讲清职责、关键设计决策与常见实现,并给出完整分层架构图和一次请求的系统之旅。
Function Calling 的完整时序与宿主执行模型、让模型「选得对、调得准」的工具设计原则、工具爆炸的应对(Tool Search / 分层暴露)、MCP 协议架构与 2026 年生态现状,附手写 MCP server 最小可运行示例。
系统梳理 Agent 规划能力的四种经典模式(ReAct、Plan-and-Execute、Tree of Thoughts、Reflexion)、Todo 清单机制的工程价值、推理模型时代显式规划的去留之争,以及过度规划、计划僵化等失败模式的对策。
LLM 本身无状态,Agent 的记忆全靠系统设计。本文拆解短期/长期记忆的分类学(CoALA)、摘要压缩与显著性保留、向量检索/结构化画像/文件笔记/知识图谱四种长期记忆实现,以及最难的写入策略与评估方法。
从文档解析到重排生成的 RAG 全链路工程解剖:切分策略对比、混合检索与重排、向量数据库选型、Agentic RAG 的本质区别、RAGAS 评估与失败排查清单。
从 prompt engineering 到 context engineering 的范式升级:为什么上下文是稀缺资源,写入/选择/压缩/隔离四大策略如何落地,以及 Manus、Claude Code 在生产环境验证过的会话压缩、工具掩码、KV cache 优化技术。
面向 Agent 场景的提示词工程实战:System Prompt 四层结构解剖、工具描述与指令层级、ReAct/规划/反思等高级模式、注入防护边界,以及 eval 驱动的提示词迭代方法论。
Agent Loop 是所有智能体的心脏:拆解感知-思考-行动-观察四拍循环,给出可直接照抄的完整伪代码实现,精讲 ReAct 模式,对比 Claude Code、SWE-agent、OpenHands 三款真实系统的循环设计差异,并给出死循环、原地打转、过早收工三类失控模式的对策表。
系统拆解 AI Agent 的攻击面与防御体系:提示注入(直接/间接)为什么是头号威胁、EchoLeak 与 GitHub MCP 等真实事件复盘、最小授权与沙箱隔离的工程做法、OWASP LLM Top 10 2025 解读,以及如何红队测试自己的 Agent。
拆解 Agent 任务的真实 token 消耗结构与 10-100 倍成本来源,给出模型分级路由、prompt caching、上下文瘦身、延迟与限流工程的落地做法,附一个带假设的成本优化前后对比案例。
多 agent 什么时候值得、什么时候是过度设计。拆解 Anthropic Research 与 Cognition 两派对立观点,五种编排模式、A2A 协议现状、真实系统案例与成本量化,给出从单 agent 升级到多 agent 的决策框架。
Agent 系统的可观测性三支柱、trace 数据模型(run/span/事件)、LangSmith/Langfuse/Helicone 与 OTel GenAI 语义约定的现状对比,以及从失败轨迹倒推根因的调试方法论和生产监控指标体系。
系统讲解 AI Agent 评测:为什么比模型评测难一个数量级,从单元、轨迹、结果到系统的四层评估框架,LLM-as-judge 的偏差与校准,SWE-bench、GAIA、OSWorld、τ-bench 等主流 benchmark 的最新格局,以及如何自建防污染的私有 eval。
系统讲解 human-in-the-loop 的工程实现:按风险分级的审批模型、对抗审批疲劳的 allowlist 与批量审批、基于 checkpoint 的中断恢复、控制权交接协议,以及 Claude Code / Cursor / Devin 的权限设计拆解和无人值守护栏清单。
2026 年 Agent 框架全景:从裸 SDK、OpenAI Agents SDK、Claude Agent SDK 到 LangGraph、CrewAI、Microsoft Agent Framework 与低代码平台,附对比表、隐藏成本分析和可落地的选型决策树。
微软研究院的对话式多 Agent 框架:0.4 重构后的 Core/AgentChat/Extensions 三层架构、Team 编排模式与 Magentic-One 系统解析,以及并入 Microsoft Agent Framework 后 2026 年的真实选型建议。
驱动 Claude Code 的那套 agent harness 开放成的官方 SDK:文件/Bash 工具开箱即用,自带子代理、Skills、hooks、MCP 与权限系统,用 Python/TypeScript 几十行代码就能构建生产级长任务智能体。
CrewAI 用「角色 + 目标 + 背景故事」定义 Agent,用 Crew 做自治协作、用 Flow 做事件驱动控制,是落地最快的多 Agent 框架之一。本篇基于 v1.15.x 官方文档讲清核心概念、可运行代码、与 LangGraph/AutoGen 的哲学差异及真实社区批评。
LangGraph 是 LangChain 生态的 Agent 编排层:用图状态机显式控制 Agent 的每一步。本文基于 2026 年 8 月的 v1.x 文档,讲清 State/Node/Edge、Checkpointer、interrupt 人机协作、LangSmith Deployment 部署与生态分工,并诚实评价其复杂度争议。
OpenAI 官方轻量 Agent 框架:Swarm 的生产级继任者,以 Agent / Handoff / Guardrail / Session / Tracing 六个原语覆盖大多数 Agent 应用,默认走 Responses API 但模型不锁定 OpenAI。
字节跳动的低代码 Agent 搭建平台:Bot 编排、插件、工作流、知识库、多渠道发布一应俱全,2025 年 7 月开源 coze-studio 与 coze-loop,2026 年 Coze 3.0 转向多 Agent 协作。本文拆解其能力、架构推断、定价与和 Dify/n8n 的边界。
2023 年 3 月发布、GitHub 史上增长最快的仓库,AutoGPT 引爆了第一波 agent 狂热,又用自身的失败给整个行业上了一课。本文复盘它的原始架构缺陷、留下的工程教训,以及 2026 年转型为可视化 AutoGPT Platform 的现状。
编程 Agent 的标杆产品深度解剖:从 CLI 到 Web/SDK 的形态演进、主 Agent Loop + Task 子代理的架构、通用原子工具设计哲学、上下文压缩与子代理隔离、权限模型与 hooks 机制,以及可复用到自建 Agent 的完整借鉴清单。
从 Copilot 替代品到年化收入数十亿美元的 agentic IDE:拆解 Cursor 的 Tab 补全、Agent 模式、codebase 语义索引与自研 Composer 模型,以及「IDE 内嵌」与「终端自主」两条 Agent 产品路线之争。
Cognition 的「AI 软件工程师」Devin 全景复盘:从 2024 年 SWE-bench 13.86% 的轰动发布与 Upwork 演示造假争议,到 2025 年降价 25 倍、收购 Windsurf、2026 年 260 亿美元估值与 4.92 亿美元年化收入的完整轨迹,以及它留给 Agent 工程的真实教训。
开源 LLM 应用开发平台 Dify 深度解析:来自苏州语灵团队的 14 万星项目,覆盖可视化 Workflow/Agent 编排、RAG 引擎、插件系统与 MCP 双向支持,附自部署架构、商业化模式与 Coze/n8n/LangFlow 对比。
2025 年 3 月凭一支演示视频出圈的通用 AI Agent:邀请码被炒至数万元、自报 GAIA 三档 SOTA,一年后 20 亿美元卖身 Meta 又被中国监管叫停。本文拆解其多智能体架构、虚拟机沙箱,以及那篇被全行业转发的 Context Engineering 博客。
从 OpenDevin 到 OpenHands:解剖这个开源社区驱动的全栈开发 agent 平台——事件流架构、CodeAct「动作即代码」动作空间、Docker 沙箱运行时、微 agent,以及它在 SWE-bench 上的真实表现和与 SWE-agent 的设计分歧。
搜索 × LLM 最成功的产品化样本:拆解 Perplexity 的检索增强答案生成、引用溯源与 Deep Research 多步研究 agent,梳理其从答案引擎到 Comet 浏览器的演进、商业模式与版权争议。
普林斯顿团队 2024 年的经典工作,提出 Agent-Computer Interface(ACI):工具接口该为模型设计,而不是为人设计。靠接口优化把 SWE-bench 解决率从 3.8% 拉到 12.5%,并用 mini-SWE-agent 的 100 行代码反向证明 scaffold 的时代性。
Agent 开发的翻车大全:12 条高频反模式按「症状→根因→解法」逐条拆解,从多 Agent 过度工程、上下文膨胀到无评测调 prompt,附 Replit 删库、Cursor 客服幻觉等公开事故的复盘。
给上一篇教程的研究助理 Agent 搭一套完整评测:20-50 任务的分层任务集、代码断言 + LLM-as-judge 双层评分器(含完整 judge prompt)、轨迹与成本记录、CI 回归工作流、可运行的 Python 评测脚本,以及一次真实的「评测发现退化→定位→修复」复盘。
不用任何框架,只用 LLM API 手写一个能跑的最小 Agent:50 行 Agent Loop 起步,逐版加上错误回传、步数上限、todo 规划和上下文压缩,每步附完整可运行代码与预期运行轨迹。
用 OpenAI Agents SDK 做三个渐进项目:30 分钟跑通的天气聊天 Agent、带 todo 与文件记忆的研究助理、researcher/writer/critic 三角色多 Agent 加最小评测脚本,附三版复杂度与能力边界对照表。
AGENTS.md 已成为 6 万多个开源项目采用的跨工具开放标准,CLAUDE.md 是 Claude Code 的对应机制。本文给出可直接套用的结构模板、正反例对照、分层作用域规则和维护纪律,让你仓库里的"入职文档"真正改变 agent 的每次会话行为。
面向求职的 6 个 Agent 作品集项目,由浅入深覆盖 RAG、Agent Loop、深度研究、浏览器自动化、多 Agent 编排与人工审批,每个项目附里程碑拆解、简历写法与面试追问清单。
从 Anthropic、SWE-agent、Claude Code 等一线实践提炼的八条 Agent 设计原则:简单优先、为模型设计接口、可观测、为恢复而设计、上下文稀缺、权限分级、评测先行、随模型演进简化。每条附出处、正反例与落地检查项。
论文精读模块导读:为什么做 Agent 必须读论文、本模块的选文标准、三遍阅读法在 Agent 论文上的具体用法、如何识别 benchmark 污染与 cherry-pick,以及 2026 年还能用的 arXiv 工具链。
逐篇精读 Agent 领域 10 篇奠基论文:ReAct、Toolformer、MRKL、Chain-of-Thought、Tree of Thoughts、Reflexion、Generative Agents、Voyager、SWE-agent、CodeAct,含 arXiv 编号、方法图解、实验数据与对后世框架的影响。
把 2022-2026 年的 Agent 研究版图整理成一张可导航的地图:推理规划、工具使用、记忆、多智能体、具身、Coding Agent、评测、安全、综述九大分区,每个分区给出经核实的代表作 arXiv 编号与一句话现状。
梳理 2025-2026 年 Agent 研究的七个前沿方向——Agentic RL、Deep Research、Computer Use、自我改进、终身学习、多智能体协议与安全研究,每个方向给出代表性工作和「值得关注还是炒作」的明确判断。
三阶段 Agent 论文书单:入门 5 篇建立直觉(ReAct、CoT、Toolformer、MRKL、Generative Agents),进阶 8 篇建立系统能力(Reflexion、Voyager、SWE-agent、CodeAct 等),前沿聚焦 2025-2026 的 agentic RL、Deep Research 与自我改进。每篇附 arXiv 编号、一句话价值、阅读时长与前置依赖。
Agent 工程师面试全题库:10 道概念题、8 道系统设计题、4 道手写编码题,外加项目深挖、开放观点题与反问清单。每题附考察点和成段的答题框架,而非一句话标准答案。
拆解 2025-2026 年 Agent 浪潮下的五类岗位(Agent 工程师、AI 应用工程师、平台工程师、AI Infra、Agent 方向产品经理),附经核实的国内外薪资带、招聘热度数据,以及后端/算法/前端三条转型路线。
Agent 岗位简历的特殊写法:为什么项目比学历重要、STAR 法则怎么套在 Agent 项目上(含 3 个完整改写案例)、技术栈关键词的红线、零经验者的作品集与开源贡献路径,附投递前 20 项自评检查表。
基于 2026 年 8 月真实检索整理的约 20 条 Agent 方向在招 JD:国内覆盖字节、阿里、腾讯、美团、MiniMax,国外覆盖 OpenAI、Anthropic、Cursor、Cognition、Sierra,每条附来源链接,结尾给出 JD 高频要求词频总结。
把 Agent 岗位 JD 的高频关键词逐个翻译成可执行的考察点:LangGraph 实际问什么、RAG 经验的深浅两档、Agent 架构的标准答案、prompt engineering 的真实门槛,以及 2025 年后新增的 MCP 要求,附能力画像与学习优先级。
按「官方文档、书籍课程、工程博客、开源框架、评测数据集、社区信息源、awesome 列表」七大类整理的 Agent 学习资源导航,每条附一句话价值判断与适合人群,链接均经核实。
收录 120+ 个 AI Agent 领域核心术语,按基础概念、推理规划、工具协议、记忆检索、架构编排、工程运维、产品生态七组分类,每条一句话精确定义并附站内深入阅读链接,支持锚点互跳,是阅读全站时的随身字典。
精读 Claude、ChatGPT/Codex、Cursor、Devin、Manus、Perplexity 六份公开或泄露的 system prompt,解剖结构、提炼可复用的工具描述与边界设定技巧,总结出顶级 Agent 提示词的十条共性。