Skip to content

术语表

本页速览 收录 120+ 个 AI Agent 领域核心术语,按基础概念、推理规划、工具协议、记忆检索、架构编排、工程运维、产品生态七组分类,每条一句话精确定义并附站内深入阅读链接,支持锚点互跳,是阅读全站时的随身字典。

术语表 ​

这是全站的字典页。读任何一篇文章时遇到生词,先来这里查;每个词条只给一句话的精确定义,深入的展开都通过「详见」链到对应长文。词条按七个主题分组,组内和组间用锚点互相跳转。

如何使用本页

  • 词条锚点格式为 #英文小写连字符,例如 [Token](#token),写本站其他页面时可直接引用 /resources/glossary#mcp 这类深链。
  • 术语定义以 2026 年 8 月的行业共识为准;Agent 领域术语漂移很快,同一个词两年前后可能含义不同,正文中已标注关键演变。

一、基础概念 ​

  • Agent(智能体):能感知环境、自主决策并调用工具执行动作以达成目标的系统;在 LLM 语境下,特指由模型在循环中决定下一步行动、而非走固定流程的程序。与 Workflow 的分界在于「路径由谁决定」。详见 什么是 AI Agent。
  • LLM(Large Language Model,大语言模型):基于海量文本训练、以下一个 Token 预测为核心任务的大型神经网络,是当代 Agent 的「发动机」,但本身只会生成文本,不构成 Agent。
  • Foundation Model(基础模型):在大规模数据上预训练、可适配多种下游任务的通用模型,GPT、Claude、Gemini、DeepSeek 等皆属此类;强调「预训练一次、多处适配」的范式。
  • Token:模型处理文本的最小单位,由分词器(tokenizer)切分得到;英文约 0.75 个词、中文约 0.5–1 个汉字对应一个 token。计费、限速、上下文窗口都以它为单位。
  • Context Window(上下文窗口):模型单次请求能看到的 token 总量上限,包含输入与输出;窗口内的一切就是 Agent 的「工作记忆」,装不下的内容必须靠 RAG、Memory 或 Compaction 处理。详见 上下文工程。
  • Temperature(温度):控制采样随机性的参数,越低输出越确定;写代码、调工具的 Agent 场景通常设 0 或接近 0,创意写作才调高。它影响的是「选词分布」,不改变模型能力。
  • Prompt(提示词):喂给模型的输入文本的统称;在 Agent 系统里,prompt 是被代码动态拼装的工程产物,而非一句手写的话。详见 Prompt 工程。
  • System Prompt(系统提示词):位于对话最顶端、定义模型角色、边界与行为准则的指令,优先级高于用户消息;Claude Code 等产品的 system prompt 长达数千 token,是 Agent 行为的主要塑造者。本站收录了多份真实产品的 system prompt,见 Prompt 档案。
  • In-context Learning(上下文学习):模型不改权重、仅凭 prompt 中的示例或说明即时学会新任务的能力;few-shot(给几个例子)与 zero-shot(只给指令)是它的两种形态,也是一切 prompt 技巧的理论基础。
  • Hallucination(幻觉):模型生成看似合理但与事实不符内容的现象;根因是它只对「像不像人话」负责、不对「真不真」负责。工程上的缓解手段是 RAG、工具核实与引用溯源,而非调高 prompt 里的「请诚实」。
  • Reasoning Model(推理模型):经专门训练、会先产出长串内部推理再给出答案的模型(如 OpenAI o 系列、DeepSeek-R1、Claude 的 extended thinking 模式);用更多 test-time compute 换复杂任务准确率。
  • Inference(推理):用训练好的模型生成输出的过程,与训练(training)相对;日常说「推理成本」指 token 生成开销,注意它与「reasoning(逻辑推理)」是同一个英文词的两个义项,需看语境区分。
  • Fine-tuning(微调):在预训练模型上用领域数据继续训练以改变其行为;2026 年的共识是:能靠 prompt + 上下文解决的问题不要微调,微调留给风格固化、格式强约束和蒸馏小模型。
  • RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习):用人类偏好数据训练奖励模型、再据此强化学习对齐 LLM 的技术;后续变体 RLAIF 用 AI 反馈替代部分人工标注,Constitutional AI 是 Anthropic 的代表性实现。
  • Multimodal(多模态):模型同时处理文本、图像、音频、视频等多种输入/输出形态的能力;Computer Use 依赖视觉模态读屏,语音 Agent 依赖音频模态实时交互。
  • Structured Output(结构化输出):强制模型输出符合指定 JSON Schema 的功能;是 Function Calling 和 Agent 间数据交换的地基,比「prompt 里求它输出 JSON」可靠得多。
  • SLM(Small Language Model,小语言模型):参数量较小、可本地或边缘部署的模型(数 B 级);在 Agent 系统里常做路由、分类、护栏判断等廉价前置步骤,与大模型分工以省成本。详见 成本优化。
  • Context Engineering(上下文工程):设计「在每一步把什么信息放进上下文窗口」的学科,2025 年中由 Shopify CEO Tobi Lütke 与 Andrej Karpathy 等人的讨论带火,被视为 prompt 工程的升维——prompt 是写一句话,context engineering 是管理整个信息供给系统。详见 上下文工程。
  • Vibe Coding(氛围编程):Karpathy 2025 年 2 月造的概念,指「不细看代码、凭感觉让 AI 写、跑不通就再骂一轮」的开发方式;适合原型和玩具项目,用于生产代码则是事故温床。
  • AGENTS.md:放在仓库根目录、写给 coding Agent 看的说明文件(构建命令、目录约定、禁区),类似给新员工的 README;2025 年起被 OpenAI Codex、Cursor、Claude Code(其变体为 CLAUDE.md)等广泛支持。写法详见 编写 AGENTS.md。

二、推理与规划 ​

  • Chain-of-Thought(CoT,思维链):让模型「一步步想」再作答的提示技术(Wei 等,2022),显著提升数学与逻辑任务表现;是后来一切 reasoning 技术的起点。详见 核心论文导读。
  • ReAct:Yao 等 2022 年提出的范式(arXiv:2210.03629),把推理(Thought)与行动(Action/Observation)交替交织,让模型边想边查边改;它是现代 Agent Loop 的思想原型,至今仍是最常用的 Agent 骨架。
  • Tree of Thoughts(ToT,思维树):把 CoT 的单链扩展成可搜索的思维树,允许分支、评估、回溯(Yao 等,2023);理论漂亮,但推理成本数倍于单链,实践中多数场景被「推理模型 + 简单循环」取代。
  • Self-Consistency(自洽性):对同一问题采样多条 CoT 再投票取多数答案的技术;简单有效但成本成倍,推理模型兴起后使用频率下降。
  • Reflection / Self-Critique(反思):让模型审视自己的输出、发现错误并重写的模式;Anthropic 的构建指南将其列为基本工作流之一(evaluator-optimizer),对写作和代码有明显收益,对事实性错误收益有限——模型常「反思不出自己不知道的事」。
  • Reflexion:Shinn 等 2023 年提出的框架,Agent 失败后把教训写成文字存入记忆,下一轮尝试时读取;是「用语言做强化学习」的代表作,对需要多次试错的任务(如代码修复)有效。
  • Plan-and-Execute:先由规划器生成完整计划、再由执行器逐步执行的架构(BabyAGI、Plan-and-Solve 一脉);比 ReAct 更有全局观,但计划易过期,实践里常加「每步后重规划」。
  • Planning(规划):把目标分解为有序子任务的能力总称,实现方式从「prompt 里要求先列计划」到独立的规划模块不等;长程任务中规划与重规划的频率是成败关键。详见 规划与任务分解。
  • Task Decomposition(任务分解):把大任务拆成小任务的通用技术,CoT(隐式)、ToT(显式搜索)、Subagent(委派执行)都是它的实现形态。
  • Least-to-Most Prompting:先让模型把问题拆成由易到难的子问题、再依次求解的提示技术(Zhou 等,2022),对泛化到超纲问题优于普通 CoT。
  • Scratchpad(草稿本):让模型把中间计算写在输出里的技巧(Nye 等,2021),是 CoT 的前身;在 Agent 系统里也指 Agent 用来记中间状态的临时存储区。
  • Reasoning Trace(推理轨迹):模型或 Agent 在解题过程中产生的中间推理文本;对调试和 Eval 至关重要,但注意推理轨迹不一定如实反映模型「真实想法」(忠实性问题)。
  • Extended Thinking(扩展思考):Anthropic 对 Claude 可调推理预算功能的称呼,允许指定 thinking tokens 上限;OpenAI 对应概念是 reasoning effort。都是 test-time compute 的产品化旋钮。
  • Test-time Compute(测试时计算):推理阶段投入的计算量;2024 年 o1 之后成为新的 scaling 轴——不增大模型,而是让模型「想更久」来换性能。
  • Deep Research:一类产品形态:Agent 自主进行多轮搜索、阅读、综合,产出带引用的长篇研究报告;OpenAI(2025 年 2 月)、Gemini、Perplexity 均有同名功能,本质是「搜索增强的多步 Agent Loop」。
  • Inner Monologue(内心独白):早期 Agent 论文中对模型自言自语式推理的称呼(如 Inner Monologue, Huang 等 2022,用于机器人);现在一般并入 reasoning trace 的说法。

三、工具与协议 ​

  • Tool Calling(工具调用):模型在输出中表达「我要调用某工具」、由宿主程序执行并把结果回灌给模型的机制总称;是 Agent 与世界交互的唯一通道。详见 工具与 MCP。
  • Function Calling(函数调用):tool calling 的早期形态与别称,模型按预定义 JSON Schema 生成函数名与参数;OpenAI 2023 年 6 月首次推出,此后各厂商跟进并统称为 tool use / tool calling。
  • Tool Schema:用 JSON Schema 描述工具名称、功能、参数的结构化定义;写 schema 是门手艺——描述含糊的 schema 是工具误调用的首要原因。
  • MCP(Model Context Protocol,模型上下文协议):Anthropic 2024 年 11 月开源的协议,标准化「LLM 应用 ↔ 外部工具/数据源」的连接方式,被称为「AI 的 USB-C」;2025 年 3 月起 OpenAI、Google 相继支持,2025 年 12 月捐赠给 Linux 基金会旗下的 AAIF,成为厂商中立标准。详见 工具与 MCP。
  • MCP Server / Client / Host:MCP 的三方角色:Server 暴露工具、资源与 prompt 模板;Client 是应用内与 Server 一对一的连接器;Host(如 Claude Code、Cursor、IDE)是发起连接的 Agent 应用本体。传输层支持 stdio(本地进程)与 HTTP(远程)。
  • A2A(Agent2Agent Protocol):Google 2025 年 4 月发布、同年 6 月捐给 Linux 基金会的协议,解决「不同厂商的 Agent 之间如何互相发现并协作」;与 MCP 互补而非竞争——MCP 管 Agent 调工具,A2A 管 Agent 找 Agent。详见 多智能体架构。
  • Agent Card:A2A 协议中 Agent 对外发布的「能力名片」JSON(约定路径 /.well-known/agent-card.json),声明自己会做什么、怎么调;是 A2A 服务发现的基础。
  • ACP(Agent Communication Protocol):IBM/BeeAI 系提出的 Agent 通信协议,2025 年协议混战后生态向 A2A 收敛,ACP 一脉的设计并入 Linux 基金会体系;选型时只需记住:工具用 MCP,Agent 互通看 A2A。
  • Computer Use:让模型直接看屏幕截图、输出鼠标键盘操作来控制真实电脑的能力;Anthropic 2024 年 10 月首个公开 API,OpenAI Operator 等产品随后跟进。准确率仍远低于人类,适合兜底而非主通道。详见 Claude Agent SDK。
  • Browser Agent / Browser Use:Computer Use 的浏览器特化形态:解析 DOM 或截图来操作网页,常用于数据采集与 Web 自动化;开源代表是 browser-use 库,产品代表是各类「自动帮你填表订票」的 Agent。
  • Code Interpreter(代码解释器):给模型一个可执行代码的 Sandbox 环境,让它「写代码解决问题」而非「心算」;对数学、数据分析类任务是质变,现已成为 ChatGPT、Claude 等的标配工具。
  • GUI Agent:以图形界面为操作对象的 Agent 统称,Computer Use 与 Browser Agent 是其子类;核心难点是视觉 grounding(把「确定按钮」映射到像素坐标)。
  • Agent Skills(技能):Anthropic 2025 年 10 月推出、12 月发布为开放标准(规范在 agentskills.io)的能力封装格式:一个含 SKILL.md(元数据 + 指令)及可选脚本、参考文件的文件夹,Agent 按需加载。可理解为「可复用的专家经验包」。
  • Progressive Disclosure(渐进式披露):Skills 与 MCP 共用的省 token 设计原则:启动时只加载名称和描述(几十 token),任务匹配时才读入完整指令,执行时再按需读参考文件——三级加载,把常驻上下文压到最小。
  • Tool Registry(工具注册表):Agent 系统里登记、发现、管理可用工具的目录;MCP 生态 2025 年推出官方 Registry 以解决 server 发现与信任问题,企业内部也常自建 registry 做权限与审计收口。

四、记忆与检索 ​

  • RAG(Retrieval-Augmented Generation,检索增强生成):先从知识库检索相关片段、再连同问题一起喂给模型生成的架构;是对抗 幻觉 和知识截止的主力手段,2026 年仍是企业落地第一选择。详见 RAG 检索增强。
  • Agentic RAG:让 Agent 自主决定「要不要查、查什么、查几轮、查完够不够」的 RAG 形态,区别于一次性检索的朴素 RAG;质量更高但更慢更贵,适合复杂问法。
  • Embedding(嵌入):把文本(或图像)映射为高维向量的技术,语义相近则向量距离相近;是语义检索的数学基础。选 embedding 模型要看 MTEB 榜单与语言覆盖,别只看维度。
  • Vector Database(向量数据库):存储 embedding 并支持近似最近邻(ANN)检索的数据库,代表有 Pinecone、Milvus、Qdrant、pgvector 等;中小规模用 pgvector 往往足够,没必要一上来就独立向量库。
  • Semantic Search(语义搜索):基于向量相似度而非关键词匹配的搜索;擅长同义改写,弱于精确术语和编号,所以生产系统几乎都与 BM25 混用。
  • Chunking(分块):把长文档切成检索粒度片段的策略;块太大稀释相关性、太小丢失上下文,主流做法是按语义边界(标题、段落)切并保留重叠区,进阶方案是父子块与 late chunking。
  • HyDE(Hypothetical Document Embeddings):先让模型编造一份「假设答案」、再用它的向量去检索真实文档的技术(Gao 等,2022);对「问题与答案措辞差异大」的场景有效,代价是多一次生成延迟。
  • Reranking(重排序):检索出候选后用更强的 cross-encoder 模型重新精排的环节;通常能把检索质量拉高一个档次,是性价比最高的 RAG 优化之一。
  • Hybrid Search / BM25(混合检索):BM25 是经典的关键词统计检索算法;混合检索把 BM25 的精确匹配与向量的语义匹配做加权融合,再经 rerank 精排,是 2026 年生产 RAG 的默认配方。
  • Knowledge Graph(知识图谱):以实体-关系-实体三元组存储知识的图结构;在 Agent 场景用于多跳推理与可解释检索,构建成本高,适合关系密集的领域(医疗、法务、金融)。
  • GraphRAG:微软 2024 年提出的方法,用 LLM 从语料抽取知识图谱、再基于社区摘要做全局问答;擅长「这份语料整体讲了什么」类问题,增量更新麻烦是其主要短板。
  • Long-term Memory(长期记忆):跨会话持久保存的用户偏好、事实与经验,与单次会话内的短期记忆(对话历史)相对;实现上通常是「写入判定 + 向量/结构化存储 + 召回注入」三件套。详见 记忆系统。
  • Memory Types(记忆分类):借自认知科学的三分法——情景记忆(发生过的事)、语义记忆(知识与事实)、程序性记忆(怎么做事);Agent 系统里分别对应对话存档、事实库与 Skills/SOP。
  • Context Compaction(上下文压缩/压实):会话逼近 上下文窗口 上限时,把早期历史总结成摘要以腾空间的技术;Claude Code 等产品的 /compact 即是手动触发版。摘要必然有损,关键决策要提前落盘。
  • Context Rot / Context Poisoning(上下文腐化/中毒):上下文越长、混入的无关或错误信息越多,模型表现越差的现象;2025 年多项研究证实「窗口大不等于都能用好」,对策是少塞、勤清、及时压缩,而非无脑堆满 1M token。
  • Memory Tool:把记忆操作本身做成工具(save_memory / search_memory)交给模型自主调用的设计;比「每轮自动注入全部记忆」更省 token,也更接近人类「想起来再记」的行为。

五、架构与编排 ​

  • Workflow(工作流):步骤与控制流由开发者预先写死的 LLM 编排方式,与 Agent(路径由模型动态决定)相对;Anthropic 的建议是「能用 workflow 解决就别上 Agent」,确定性、成本、可调试性全面占优。详见 概念辨析。
  • Agent Loop(智能体循环):Agent 的最小骨架——「模型思考 → 调工具 → 观察结果 → 再思考」的循环,直到任务完成或触及终止条件;所有花哨架构都是这个循环的变体。详见 Agent Loop。
  • Orchestration(编排):对多个 LLM 调用、工具、Agent 的流程进行组织与调度的总称;框架之争(LangGraph vs CrewAI vs 手写)本质就是编排抽象之争。详见 框架选型总览。
  • Multi-Agent System(多智能体系统):多个各有专长的 Agent 分工协作完成任务的架构;收益是上下文隔离与专业化,代价是调试难、token 消耗数倍(Anthropic 实测约 4–15 倍于单 Agent)。详见 多智能体架构。
  • Supervisor(主管模式):一个中央 Agent 负责分派任务、汇总结果,其余 Agent 只干活不互聊的多智能体拓扑;是最常用也最稳的多 Agent 结构,OpenAI Agents SDK 与 LangGraph 都内置支持。
  • Handoff(移交):一个 Agent 把对话控制权连同上下文转交给另一个 Agent 的机制;OpenAI Agents SDK 的核心原语,客服场景的「转人工/转专家」就是典型 handoff。
  • Subagent(子代理):被主 Agent 派生、拥有独立上下文窗口、完成后只把结论带回的临时 Agent;Claude Code 的 Task tool 即此设计——隔离上下文、保护主线程干净是其最大价值。
  • Router(路由):先用一次廉价调用判断意图、再把请求分发到不同分支(模型、prompt 或 Agent)的模式;是最简单也最该先做的编排优化。
  • Orchestrator-Workers(编排器-工人模式):中央 LLM 动态拆解任务并派发给多个并行 worker、最后综合结果的拓扑(Anthropic 命名);与 Supervisor 的区别在于子任务是运行时动态生成的。
  • Evaluator-Optimizer(评估器-优化器模式):一个 LLM 生成、另一个 LLM 按标准打分并反馈、循环迭代直到达标的工作流;是 Reflection 模式的工程化版本,适合有明确验收标准的任务。
  • Parallelization(并行化):多个 LLM 调用同时跑再合并结果的模式,分子任务并行(sectioning)与多结果投票(voting)两类;换来的不只是速度,还有准确率(多数表决)。
  • HITL(Human-in-the-Loop,人在回路):在关键节点(删数据、发邮件、付款)暂停执行、等人类批准或修正的设计;不是能力不足的妥协,而是高风险场景的默认架构。详见 人机协作。
  • State(状态):Agent 运行过程中跨步骤传递的数据结构(消息历史、中间产物、计数器);LangGraph 把 state 作为一等公民,所有节点读写同一份类型化状态。
  • Checkpoint(检查点):把 Agent 中间状态持久化、支持中断恢复与时间旅行的机制;LangGraph 的 checkpointer 是代表实现,也是 HITL「暂停等待人工」能成立的技术前提。
  • Graph-based Agent(图结构 Agent):把 Agent 流程建模为「节点 + 边」的有向图,节点是计算、边是转移条件;比纯代码循环更显式、可持久化,代价是抽象税——简单 Agent 用它是过度设计。
  • Agent-as-Tool(代理即工具):把一个完整 Agent 包装成普通工具供另一个 Agent 调用的模式;与 Subagent 几乎同义,不同框架叫法不同(LangGraph 叫 tool-calling subgraph,OpenAI 叫 agents as tools)。
  • Swarm(蜂群):去中心化的多 Agent 拓扑,Agent 之间两两通信、无中央调度;OpenAI 2024 年的实验性教学框架 Swarm 让这个词流行开来(其理念后并入 Agents SDK),但生产上几乎都用 Supervisor,swarm 更多是研究概念。

六、工程与运维 ​

  • Eval(评估):用结构化测试集与打分标准衡量 Agent 质量的工程实践;没有 eval 的 Agent 迭代等于闭眼开车——这是 2026 年工程团队与玩具项目最硬的分水岭。详见 评估体系 与 Evals 实战。
  • Benchmark(基准测试):公开标准化的评测集(如 SWE-bench、GAIA);适合横向比较模型,但无法替代针对你自己业务的私有 eval——榜单分数高不代表在你的任务上行。
  • LLM-as-a-Judge:用另一个 LLM 当裁判给输出打分的评估方法;可扩展但有自己的偏差(偏好长答案、偏好自己的输出风格),需用人工标注定期校准裁判本身。
  • Trace(轨迹):一次 Agent 运行的完整记录——每步的输入、输出、工具调用、token 消耗与时间;是调试 Agent 的第一现场。详见 可观测性。
  • Observability(可观测性):对 Agent 系统采集 trace、指标与日志以理解其行为的实践;代表工具有 LangSmith、Langfuse、Braintrust、Arize Phoenix,2025 年起 OpenTelemetry 的 GenAI 语义约定成为采集层事实标准。
  • Prompt Injection(提示注入):攻击者把恶意指令藏进网页、邮件、文档等外部内容,劫持读到它的 Agent;是 Agent 安全的头号威胁,且目前没有完美解法,只能靠最小权限、隔离与人工确认纵深防御。详见 安全与对齐。
  • Jailbreak(越狱):诱导模型绕过自身安全限制的对话攻击;与 prompt injection 的区别在于目标是模型本体而非其读取的外部内容。
  • Guardrails(护栏):在模型输入输出两侧做的程序化检查(敏感词、PII 过滤、话题限制、格式校验);要点是护栏跑在模型之外、确定可审计,而不是又写一个「请你不要犯错」的 prompt。
  • Sandbox(沙箱):隔离执行 Agent 生成代码或命令的环境(容器、microVM 如 Firecracker、gVisor);给 Agent 开放 shell 而不上沙箱,等于把生产机交给一个会被注入的实习生。
  • Red Teaming(红队测试):主动扮演攻击者、系统性试探 Agent 安全边界的实践;上线前必做,且要覆盖工具滥用路径,不只测聊天内容。
  • Least Privilege(最小权限原则):Agent 的每个工具只授予完成任务所必需的最小权限(只读优于读写、限定目录优于全盘);是防注入损失扩大化的最后一道墙。
  • Approval Flow(审批流):高风险动作执行前必须经人类或策略引擎批准的机制;与 HITL 同族,工程实现上通常借助 checkpoint 暂停-恢复。
  • Data Exfiltration(数据外泄):被注入的 Agent 把读到的敏感数据通过工具调用(发请求、写公开仓库)送出去的攻击;防御关键是限制出站通道而非指望模型「自觉」。
  • Golden Dataset(黄金数据集):人工精心标注、作为回归基准的测试集;规模不必大(几十到几百条),但必须覆盖核心业务路径,且随线上 badcase 持续增补。
  • Rate Limit(速率限制):模型 API 对请求频率与 token 吞吐的限制(RPM/TPM);Agent 单任务就要发起几十次调用,比聊天应用更容易撞限,架构上要做队列与退避。
  • TTFT(Time to First Token,首 token 延迟):发出请求到收到第一个 token 的时间,是流式体验的核心指标;对 Agent 更重要的是端到端任务时长——它等于 TTFT 与生成时间的多轮累加。
  • Prompt Caching(提示缓存):厂商对重复前缀(system prompt、长文档)缓存 KV 以降价提速的机制(Anthropic、OpenAI、Gemini 均支持);工程要点是把稳定内容放前面、变动内容放后面,命中率决定账单量级。详见 成本优化。
  • Retry & Fallback(重试与降级):模型调用失败时的恢复策略——瞬时错误指数退避重试,持续失败降级到备选模型或简化 prompt;多模型 fallback 链是生产 Agent 的标配。
  • Determinism / Reproducibility(确定性/可复现性):同一输入得到同一输出的性质;LLM 即使 temperature=0 也不保证逐 token 一致(浮点与批处理所致),eval 与回归测试要按「分布稳定」而非「完全一致」来设计断言。

七、产品与生态 ​

  • Claude Code:Anthropic 的终端原生 coding Agent(2025 年 5 月 GA),以极简工具集 + 长 system prompt + Subagent 著称,是「少即是多」Agent 设计的标杆,其运行时已被抽出为 Claude Agent SDK。详见 Claude Code 解剖。
  • Claude Agent SDK:Anthropic 把 Claude Code 内核抽出的开发框架(原名 Claude Code SDK),适合构建以文件与 shell 为操作对象的 Agent。详见 Claude Agent SDK。
  • Cursor:Anysphere 的 AI 原生 IDE,从「带 Copilot 的编辑器」进化为以内置 Agent 模式为核心的开发环境;是 IDE 路线 coding Agent 的代表。详见 Cursor 解剖。
  • GitHub Copilot:GitHub 的 AI 编程助手,从行内补全起家,2025 年起全面转向 Agent 模式(异步 coding agent、可指派 issue);胜在与 GitHub 工作流(PR、Actions、Code Review)的深度整合。
  • Devin:Cognition 推出的「AI 软件工程师」,以全自主完成开发任务为卖点;2024 年发布时演示引发巨大争议,促使行业更严肃地区分 demo 与可交付能力。详见 Devin 复盘。
  • Manus:蝴蝶效应(Monica)团队 2025 年 3 月发布的通用 Agent 产品,以「云上虚拟机里跑完整电脑环境」的形态出圈,引爆了国内通用 Agent 赛道。详见 Manus 解剖。
  • OpenAI Codex:OpenAI 的 coding Agent 产品线(CLI + 云端沙箱任务,2025 年推出);注意与 2021 年同名的早期代码模型是两回事。
  • LangChain:Harrison Chase 2022 年创立的 LLM 应用框架,生态最大但抽象层争议也大;2025 年 10 月发布 1.0(LTS),核心收敛为 create_agent 与中间件,底层运行时让位给 LangGraph。
  • LangGraph:LangChain 团队的图结构 Agent 编排框架,把流程建模为 state + 节点 + 边,内建 checkpoint 与 HITL;2025 年 10 月随 1.0 成为生产级标准选项之一。详见 LangGraph 实战。
  • OpenAI Agents SDK:OpenAI 的轻量 Agent 框架(前身是实验项目 Swarm),核心原语只有 Agent、Handoff、Guardrails、Tracing 四样;哲学是「原语少、贴近模型 API」。详见 OpenAI Agents SDK。
  • Responses API:OpenAI 2025 年 3 月推出的 Agent 导向 API,把工具调用、推理项、对话状态管理内建进接口,逐步取代 Chat Completions 成为新应用默认入口。
  • CrewAI:以「角色扮演团队」为隐喻的多 Agent 框架,Agent 有 role/goal/backstory 三要素;上手快、概念友好,适合业务流程原型。详见 CrewAI。
  • AutoGen / AG2:微软研究院开源的多 Agent 对话框架,以「Agent 之间对话即编程」为核心;2024 年底社区分叉出 AG2,2025 年微软将其能力并入 AutoGen 后续版本与 Agent Framework,选型时注意版本谱系。详见 AutoGen。
  • LlamaIndex:以数据连接与索引见长的框架,RAG 管线能力最全,后也扩展出 Agent 与工作流模块;知识密集型 Agent 项目的常见选择。
  • Dify:开源的 LLM 应用低代码平台(LangGenius),可视化编排 workflow + RAG + Agent,自托管友好,国内私有化部署采用率高。详见 Dify。
  • Coze(扣子):字节跳动的 Bot/Agent 搭建平台,插件生态与分发渠道(豆包、飞书、微信)是其壁垒;适合运营与非研发角色快速上线 Bot。详见 Coze 解剖。
  • n8n:开源工作流自动化工具,2024 年起内置 AI Agent 节点(支持工具调用与记忆),成为「传统自动化 + LLM」混合编排的热门选择。
  • OpenHands:开源的 AI 软件开发者平台(前身 OpenDevin),提供完整的 Agent 运行时、沙箱与评测基建,是研究 coding Agent 的标准实验场。详见 OpenHands。
  • SWE-bench:普林斯顿团队 2023 年发布的基准,用真实 GitHub issue 评测 Agent 修 bug 能力;官方家族含原版(2294 题,12 个 Python 仓库)、Lite(300 题)、Verified(500 题,人工筛过)、Multilingual(300 题,9 种语言)、Multimodal(517 题)。Verified 已被顶尖模型打到接近饱和,2026 年业界转向更难的 SWE-bench Pro 与 Terminal-Bench。详见 SWE-agent 案例。
  • Terminal-Bench:评测 Agent 在真实终端里完成系统级任务(装环境、调服务、写脚本)的基准(斯坦福大学与 Laude Institute 等,2025);比 SWE-bench 更贴近「全栈运维型」能力。
  • GAIA:Meta、HuggingFace、AutoGPT 等联合发布的通用助手基准(2023),考网页浏览、多模态、工具链协作的综合任务;题目分三级难度,曾是通用 Agent 的试金石,头部系统分数已逼近上限。
  • AAIF(Agentic AI Foundation):Linux 基金会 2025 年 12 月成立的专项基金,由 Anthropic、Block、OpenAI 联合发起,Google、微软、AWS 等支持,托管 MCP、goose 等 Agent 基础设施项目;标志着 Agent 协议层进入厂商中立治理时代。

术语会过期

本页 2025 年之前的流行词(如 AutoGPT 式「全自主 Agent」、GPT-3 时代的「prompt 魔法」)有些已沦为历史名词,而 MCP、Skills、context engineering 等 2024–2025 年才出现的词如今是面试高频。学术语的正确姿势是理解它解决什么问题,而非背诵定义——概念背后的工程取舍才是长期资产。详见 演进简史。

参考资料 ​