外观
智能体演进简史
「Agent」这个词在 AI 领域被用滥之前,已经有六十年的历史。理解这段历史不是怀旧——2023 年 AutoGPT 踩过的坑,1995 年的 BDI 研究者早就踩过一遍;2025 年 MCP 解决的问题,和 1980 年代专家系统的困境在结构上是同一个。读史的意义在于:当下一个热点出现时,你能判断它是真范式转移,还是旧思想换了新引擎。
这一页按五个时期展开:前 LLM 时代的思想准备(1966–2019)、GPT 时代前夜的方法奠基(2020–2022)、2023 年的寒武纪爆发、2024 年的工程化收敛,以及 2025–2026 年的「Agent 元年」。如果你想先建立 Agent 的整体概念框架,可以先读什么是 AI Agent,再回来读历史。
一、前 LLM 时代(1966–2019):思想早已齐备,缺的是引擎
1.1 ELIZA 与 Shakey:Agent 的两种原型
1966 年,MIT 的 Joseph Weizenbaum 发表了 ELIZA——一个用模式匹配和替换规则模拟心理治疗师的对话程序。ELIZA 没有任何「理解」,它把用户的陈述句改写成疑问句抛回去,但很多用户坚信机器懂自己。Weizenbaum 本人对此深感不安,后来成了 AI 最著名的批评者之一。
ELIZA 留下的遗产是双重的:它证明了「对话界面」的强大欺骗性/亲和力,也第一次暴露了后来被称为「ELIZA 效应」的陷阱——人类会本能地把流畅的语言输出当作智能的证据。2023 年大众对 AutoGPT 的过度期待,本质上是 ELIZA 效应在 LLM 时代的重演。
几乎同一时期(1966–1972 年),斯坦福国际研究院(SRI)的 Shakey 机器人走的是另一条路线:它用摄像头感知环境,用 STRIPS 规划器把「把箱子推到另一个房间」这样的目标分解成动作序列,再控制轮子执行。感知—规划—行动这个三段式结构,就是今天 Agent Loop 的直系祖先。区别在于:Shakey 的规划器只能处理手工建模的符号世界,而今天的 Agent 用 LLM 直接对开放世界做推理。
Shakey (1969) 现代 LLM Agent (2025)
┌───────────────┐ ┌───────────────┐
│ 摄像头/传感器 │ │ context窗口 │
└──────┬────────┘ └──────┬────────┘
▼ ▼
│ 世界模型(符号) │ │ LLM(隐式世界模型)│
└──────┬────────┘ └──────┬────────┘
▼ ▼
│ STRIPS 规划器 │ ───► │ 推理+规划(CoT/ReAct)│
└──────┬────────┘ └──────┬────────┘
▼ ▼
│ 轮子/机械动作 │ │ 工具调用(function call)│
└───────────────┘ └───────────────┘1.2 专家系统:第一次「AI 落地」泡沫
1970–80 年代,AI 的旗舰是专家系统:把领域专家的知识写成 if-then 规则,交给推理机执行。斯坦福的 MYCIN(1970 年代)能诊断血液感染并推荐抗生素,准确率据称可达 65% 左右、超过部分非专科医生;DEC 的 XCON 从 1980 年起为 VAX 计算机做配置,据说每年为公司省下数千万美元。专家系统在 1980 年代初掀起第一波商业化浪潮,日本「第五代计算机」计划更是举国押注。
然后它在 1980 年代末崩盘了。原因对今天的 Agent 开发者极其有参考价值:
- 知识获取瓶颈:把专家脑中的隐性知识榨成规则,成本高到不可持续。
- 脆弱性:规则库一旦超出设计边界,系统不是「变笨一点」,而是直接给出荒谬答案——没有优雅降级。
- 维护地狱:数千条规则之间的相互作用无人能懂,改一条规则可能弄坏十条。
1987 年前后的 Lisp 机市场崩溃叠加专家系统泡沫破裂,带来了第二次 AI 寒冬。教训被浓缩成一句话:手工注入知识的路走不通,智能必须从数据和经验中规模化地学出来——这正是后来机器学习和 LLM 胜出的根本原因。
1.3 BDI 与多智能体系统:Agent 理论的成型
寒冬里,学界反而完成了 Agent 的理论奠基。哲学家 Michael Bratman 在 1987 年的《Intention, Plans, and Practical Reason》中提出:理性主体的行为可以用信念(Belief)、愿望(Desire)、意图(Intention)三个心智状态来描述。Anand Rao 和 Michael Georgeff 在 1990 年代初把它形式化为 BDI 模型,并在 1995 年发表《BDI Agents: From Theory to Practice》,同年 Michael Wooldridge 与 Nicholas Jennings 发表综述《Intelligent Agents: Theory and Practice》,系统定义了 Agent 的自主性、社会性、反应性和主动性。
这一代研究(史称「分布式人工智能」/ 多智能体系统,MAS)贡献了至今仍在用的概念词汇表:目标驱动、意图提交(commitment)、Agent 间通信语言(KQML/FIPA ACL)、合同网协议(Contract Net)。当 2025 年 Google 推出 A2A 协议解决 Agent 间互操作时,熟悉这段历史的人会发现:问题没变,只是当年没有足够聪明的执行体让这些协议物尽其用。
历史的讽刺
1990 年代的 MAS 研究在工程上死于「每个 Agent 都太笨」——用规则和符号推理搭出来的 Agent,连自己的领域都处理不好,遑论协作。LLM 把「单个 Agent 的智能」这块短板补上之后,1995 年的理论框架几乎原样复活。概念的生命周期远比技术长。
1.4 强化学习 Agent:另一条血脉
与符号 AI 平行发展的,是从试错中学习的强化学习(RL)路线。这条线上站着一串 Agent 史上的里程碑:
- 1992 年,Gerald Tesauro 的 TD-Gammon 用神经网络加时序差分学习玩西洋双陆棋,达到人类顶尖棋手水平——第一次证明「自学可以胜过手工规则」。
- 1997 年,IBM 深蓝 以暴力搜索击败国际象棋世界冠军卡斯帕罗夫,但那不算「学习」,算工程胜利。
- 2013–2015 年,DeepMind 的 DQN 只用屏幕像素和游戏得分学会玩几十种 Atari 游戏,登上《Nature》封面,深度强化学习(Deep RL)时代开启。
- 2016 年 3 月,AlphaGo 以 4:1 击败李世乭;2017 年的 AlphaGo Zero 完全抛弃人类棋谱、纯自我对弈,以 100:0 碾压初代 AlphaGo。Monte Carlo Tree Search + 深度网络 + 自我博弈,成为「在封闭规则环境中训练超人 Agent」的标准配方。
- 2019 年,AlphaStar(星际争霸 II)和 OpenAI Five(Dota 2)先后击败人类职业选手,把 RL Agent 推进到部分可观测、长时序、多智能体的复杂游戏。
RL 血脉对 LLM Agent 的贡献常常被低估:它留下了「Agent = 在环境中通过奖励信号学习策略」这个严格定义,贡献了 PPO 等算法(后来成为 RLHF 的引擎),也留下了一个清醒剂——游戏里的超人 Agent 无法迁移到开放世界,因为游戏有明确的奖励函数,而真实世界没有。给真实世界造奖励函数这件事,要等到 RLHF 才有了解法。
1.5 小结:前 LLM 时代缺的三样东西
到 2019 年为止,Agent 的「躯体图纸」其实已经画完:感知—规划—行动的循环(Shakey)、目标与意图管理(BDI)、从经验中学习(RL)、Agent 间协作协议(MAS)。真正缺的是三样东西:
- 通用的语言理解——能理解任意自然语言描述的任务,而不是预定义符号;
- 通用的世界知识——不用手工录入的常识与领域知识;
- 优雅降级——面对超出分布的输入,输出「大致合理」而非「荒谬」。
这三样,恰好是 LLM 一次性补上的。
二、GPT 时代前夜(2020–2022):方法论的奠基
2.1 GPT-3:提示工程登场
2020 年 5 月,OpenAI 发布 GPT-3 论文(arXiv:2005.14165)。1750 亿参数的模型本身不是新闻——真正的发现是 in-context learning:不用微调,只在 prompt 里给几个示例(few-shot),模型就能临时「学会」新任务。这意味着 AI 的能力配置方式从「训练」变成了「写一段话」。
提示工程(prompt engineering)由此诞生。事后看,这是 Agent 史上的关键一跃:Agent 的「程序」第一次可以用自然语言书写,system prompt 就是可执行的意图说明书。今天我们在 Prompt 工程 里讨论的几乎所有技巧,源头都在这里。
2.2 InstructGPT:对齐让模型「可用」
GPT-3 的问题是它只会「续写」,不会「听指令」。2022 年 1 月 OpenAI 宣布、3 月发表论文(arXiv:2203.02155)的 InstructGPT 用 RLHF(人类反馈强化学习)解决了这一点:让人类标注员给模型输出排序,训练奖励模型,再用 PPO 微调。结论是反直觉的——1.3B 参数的 InstructGPT 在「有用、听话」上被认为优于 175B 的 GPT-3。
RLHF 对 Agent 的意义在于:它第一次给了开放世界一个可优化的「奖励信号」。RL 时代「真实世界没有奖励函数」的死结,被「从人类偏好中学一个奖励模型」绕开了。
2.3 Chain-of-Thought 与 ReAct:推理和行动的两块基石
2022 年 1 月,Google Brain 的 Jason Wei 等人发表 Chain-of-Thought Prompting(arXiv:2201.11903):只要在 prompt 里示范「一步步推理」,模型在数学和逻辑题上的成绩就大幅跃升。CoT 揭示了一个此后被反复利用的事实:LLM 的推理能力不是不存在,而是需要用生成过程把它「引出来」。
2022 年 10 月,普林斯顿与 Google 的 Shunyu Yao 等人发表 ReAct(arXiv:2210.03629),把 CoT 从「纯思考」扩展为「思考 + 行动」的交错循环:模型交替生成 Thought(推理)、Action(调用工具/检索)、Observation(观察结果),直到得出答案。这个三段式结构看起来平淡无奇,但它统一了推理与工具使用,成为此后几乎所有 LLM Agent 的运行时骨架——今天你在 LangGraph、Claude Agent SDK、OpenAI Agents SDK 里看到的 loop,都是 ReAct 的后代。论文精读可见核心论文。
同样在 2022 年 10 月,Harrison Chase 开源了 LangChain——最初只是把「prompt 模板 + 外部调用 + 链式组合」封装成 Python 库的小项目。它的出现说明:方法论一旦确立,工程框架会立刻跟上,哪怕模型还远远不够强。
2.4 ChatGPT:一切引信的总集合
2022 年 11 月 30 日,OpenAI 把 InstructGPT 的配方用在 GPT-3.5 上,包上对话界面,发布 ChatGPT。五天破百万用户,两个月破亿——这不是 Agent 事件,但它完成了 Agent 爆发的全部前置条件:公众接受了对话界面,开发者拿到了便宜好用的指令模型 API,资本开始相信「AI 能做事」。2023 年 3 月 14 日 GPT-4 发布,提供了第一个「够聪明到可以当 Agent 引擎」的模型。
引信齐备,只差一根火柴。
三、寒武纪爆发(2023):自主 Agent 的第一次狂欢
3.1 AutoGPT 与 BabyAGI:现象级开源
2023 年 3 月底,Toran Bruce Richards 在 GitHub 开源 AutoGPT:给 GPT-4 一个目标,它自己拆解任务、联网搜索、读写文件、循环执行,直到目标完成。项目发布不到三周(4 月中旬)星标即突破 7 万,成为当时 GitHub 史上增长最快的项目之一,最终越过 15 万星。4 月初,Yohei Nakajima 发布了更极简的 BabyAGI——大约 140 行 Python,一个任务队列加执行循环,演示了「任务创建 → 优先级排序 → 执行 → 再规划」的最小闭环。
这两个项目的技术含量都不算高,但它们完成了一次大规模的社会实验:让几十万人第一次看到「AI 自己干活」的样子。随后的诚实复盘同样重要——AutoGPT 在长任务上频繁陷入死循环、幻觉累积、烧钱失控,「全自动通用 Agent」的愿景被证明远超当时模型的能力。这个判断在当时是泼冷水,事后看是准确的:AutoGPT 的架构没错,是引擎还没造好。详见 AutoGPT 案例。
3.2 Generative Agents:斯坦福小镇
2023 年 4 月,斯坦福与 Google 的 Joon Sung Park 等人发表《Generative Agents: Interactive Simulacra of Human Behavior》(arXiv:2304.03442):25 个由 LLM 驱动的虚拟人生活在一个像素风小镇里,各自有日程、记忆和社交关系。研究者只给一个初始设定「Isabella 想办情人节派对」,两天后派对自发地开起来了——邀请、传播、赴约全是 Agent 自主行为。
这篇论文的工程贡献比「小镇」的噱头更持久:记忆流(memory stream)+ 反思(reflection)+ 检索打分的记忆架构,至今仍是 Agent 记忆系统设计的经典参考。它也点燃了「多智能体社会模拟」这条研究线。
3.3 function calling:从自由文本到结构化调用
2023 年 6 月 13 日,OpenAI 在 API 更新中推出 function calling:开发者把函数签名(JSON Schema)告诉模型,模型在需要时输出结构化的函数名和参数,由外部代码执行后把结果喂回去。这看起来只是 API 的小改进,实际是 Agent 工程的分水岭:
- 在此之前,工具调用靠 prompt 约定输出格式(ReAct 风格),解析脆弱、出错率高;
- 在此之后,「模型决策 + 结构化输出」成为一等公民,工具调用的可靠性第一次达到生产可用。
同期 LangChain、LlamaIndex 等框架疯狂生长,「LLM 应用开发」成为独立工种。10 月,普林斯顿团队发布 SWE-bench——用真实 GitHub issue 测试模型修 bug 能力的基准,为第二年编程 Agent 的军备竞赛提供了计分牌。
为什么 2023 年的自主 Agent 大多失败,而 2025 年的编程 Agent 成了?
差别不在架构,在三件事:模型强了两代(推理能力质变)、任务选对了(代码有编译器和测试当 verifier,天然可验证)、人类被保留在回路里(审批关键操作)。AutoGPT 想当「万能员工」,Claude Code 只想当「靠谱的结对程序员」——野心收敛反而打开了市场。
四、工程化收敛(2024):从 demo 到产品
4.1 RAG 成熟与「复合 AI 系统」
2024 年的主旋律是把 2023 年的狂野想法工程化。RAG 从「embedding + 向量库」的朴素配方,进化出查询改写、混合检索、rerank、评估闭环等一整套工艺,成为企业落地 LLM 的默认架构。Berkeley 的「Compound AI Systems」观点在业界流行开来:竞争力来自系统(模型 + 检索 + 工具 + 编排 + 评估),而不是单个模型。
4.2 编程 Agent 登场:Devin 与 SWE-agent
2024 年 3 月,Cognition 发布 Devin 的演示视频,号称「第一个 AI 软件工程师」,在 SWE-bench 上端到端解决真实 issue——演示的戏剧性和随之而来的「视频是否夸大了能力」的争议,让编程 Agent 第一次进入大众视野。4 月,普林斯顿开源 SWE-agent(NeurIPS 2024 论文),证明一个设计得当的 Agent-Computer Interface(ACI)能让 GPT-4 在 SWE-bench 上稳定解决约 12% 的 issue——分数不高,但路线被证实了。这两个项目的详细拆解见 Devin 案例 与 SWE-agent 案例。
4.3 多智能体框架混战与 computer use
2024 年也是框架的战国时代:微软的 AutoGen(2023 年 9 月发布初版,2024 年持续迭代)、CrewAI(2024 年初走红)、LangGraph(2024 年初发布 0.1,把 Agent 编排显式建模为状态图)各自圈粉,关于「多 Agent 是真需求还是过度设计」的争论贯穿全年。这场混战的经验教训被后来 Anthropic 的《Building Effective Agents》(2024 年 12 月)总结为:多数场景用简单 workflow 就够,别为炫技上多 Agent——详见框架选型总览与多智能体架构。
10 月 22 日,Anthropic 随新版 Claude 3.5 Sonnet 发布 computer use:模型直接看屏幕截图、移动鼠标、敲键盘,像人一样操作任意软件。当时它在 OSWorld 基准上只有约 15% 的成功率,远谈不上实用,但方向意义巨大——Agent 的行动空间从「调 API」扩展到「操作一切有 GUI 的软件」,为 2025 年的 Operator 和 Manus 类产品探了路。
9 月 OpenAI 发布 o1,把「推理时计算」(test-time compute)变成显式的训练目标:模型先生成长思维链再作答。推理模型的出现,补上了 Agent 引擎的最后一块短板——长程任务的规划和自我纠错能力。
4.4 MCP:工具生态的标准化
2024 年 11 月 25 日,Anthropic 发布并开源 Model Context Protocol(MCP):一套让任意 LLM 应用以统一方式连接数据源和工具的开放协议,client-server 架构,灵感明确来自语言服务器协议(LSP)。发布之初应者寥寥——真正的爆发要等到 2025 年 3 月 OpenAI 宣布支持之后。但历史地看,MCP 终结了「每个框架一套工具接口」的碎片化时代,细节见工具与 MCP。
五、Agent 元年(2025–2026):从演示到生产力
如果说 2023 年的关键词是「惊喜」,2024 年是「收敛」,那么 2025–2026 年的关键词只有一个:agentic——它从技术术语变成了整个行业的叙事中心。
5.1 推理模型点燃开年
2025 年 1 月 20 日,DeepSeek 发布并开源 R1,用极低成本复现了 o1 级别的推理能力,并公开了 RL 训练细节。R1 的冲击是双重的:推理能力从此不再是少数闭源厂商的特权,Agent 的「大脑」成本大幅下移;它也直接引发了全行业对「推理模型即 Agent 引擎」的共识。同月,OpenAI 发布 Operator——基于 computer use 技术、能自主操作浏览器完成订餐购物等任务的消费级 Agent。
5.2 Deep Research:研究型 Agent 品类确立
2025 年 2 月 2 日,OpenAI 发布 Deep Research:给一个研究问题,Agent 自主浏览几十上百个网页,交叉验证,输出带引用的长篇报告,在「Humanity's Last Exam」基准上大幅刷新纪录。Google(Gemini)、Perplexity 等迅速跟进同类产品。Deep Research 的意义在于确立了「长时间自主运行(几十分钟)+ 产出可交付物」这个产品形态——Agent 的衡量单位从「轮次」变成了「任务」。
5.3 编程 Agent 军备赛:2025 年最大的赢家赛道
2025 年编程 Agent 的密集发布,事后看是 Agent 史上商业化最成功的一波:
- 2 月 24 日,Anthropic 随 Claude 3.7 Sonnet 发布 Claude Code(研究预览):住在终端里的编程 Agent,直接读写代码库、跑测试、操作 git。
- 4 月,OpenAI 发布开源的 Codex CLI;5 月推出云端版 Codex——在隔离云环境中并行处理多个任务、直接提交 PR 的软件工程 Agent。
- 6 月,Google 开源 Gemini CLI;8 月阿里发布 Qwen Code;国内厂商(腾讯 CodeBuddy、字节 Trae 等)全面跟进 CLI 与 IDE Agent。
- 9 月,OpenAI 发布专为 agentic 编码优化的 GPT-5-Codex。
商业数据验证了赛道:据公开报道,Claude Code 上线约半年年化收入即冲到 10 亿美元量级,成为 Anthropic 增长最快的产品;Codex 在 2026 年初完成「绝地反击」,成为 OpenAI 的战略优先级产品。Cursor、GitHub Copilot 等 IDE 系产品也全面 Agent 化(后台 Agent、云端任务)。为什么是编程?因为代码任务自带 verifier(编译、测试),错误可被发现、过程可被审查,是人类最容易「放心放权」的领域。深度拆解见 Claude Code 案例。
5.4 Manus 与通用 Agent 的中国时刻
2025 年 3 月初,中国团队 Monica(蝴蝶效应)发布通用 Agent Manus 的演示:在云端虚拟机里自主操作浏览器和工具,完成做 PPT、分析股票、整理数据等长任务。内测邀请码一度被炒到天价,成为 2025 年国内 AI 圈的标志性事件。Manus 把「通用 Agent」从概念变成了可被普通人感知的产品,也把「Agent + 云端沙箱」的产品形态推到台前。5 月 Manus 开放注册,随后国内大厂(字节扣子空间、百度心响、阿里等)密集跟进通用 Agent 赛道。详见 Manus 案例。
5.5 协议层:MCP 与 A2A 的标准化之战
2025 年 Agent 基础设施最重要的进展发生在协议层:
- 3 月,OpenAI 宣布 Agents SDK 支持 MCP(距 Anthropic 发布仅四个月),MCP 从此成为事实标准,社区 MCP Server 数量当年内突破数千。
- 4 月 9 日,Google 在 Cloud Next 大会上发布 A2A(Agent2Agent)协议,联合 50 余家合作伙伴,解决 Agent 与 Agent 之间的互操作——与 MCP(Agent 连工具)形成互补。6 月 23 日,Google 将 A2A 捐赠给 Linux 基金会托管。
- 12 月 9 日,Linux 基金会宣布成立 Agentic AI Foundation(AAIF):Anthropic 捐赠 MCP,OpenAI 捐赠 AGENTS.md,Block 捐赠 goose,创始成员包括 Anthropic、OpenAI、Google、Microsoft、AWS 等。Agent 的核心协议至此完成中立化托管——这一幕像极了当年 Kubernetes 捐赠给 CNCF。
5.6 2026 年:深水区
进入 2026 年,行业的焦点从「发布新 Agent」转向「把 Agent 管起来」:协议规范持续大修(MCP 在 2026 年 7 月发布了问世以来最大规模的系统性修订),可观测性、评估、安全、成本成为工程团队的真实痛点——这正是本站进阶架构各章存在的理由。Claude Code 与 Codex 的竞争演变为「多 Agent 并行 + 后台自动化」的产品形态竞赛;Agent Skills(2025 年 10 月由 Claude Code 引入、12 月成为开放标准)开始成为 Agent 能力分发的新载体,并在 2026 年初被各主流编程工具跟进。行业的共识逐渐清晰:模型能力仍在涨,但差距越来越体现在 harness(脚手架)工程、上下文工程与评估体系上。
「agentic」一词也在这个阶段完成了从形容词到行业叙事的转变:财报电话会、产品发布会、招聘 JD 里到处都是它。这种热度值得警惕——2023 年 AutoGPT 的教训说明,叙事峰值往往早于能力兑现一到两年。但这次的差异在于,编程 Agent 已经拿出了可审计的商业收入,赛道至少有一条腿站在了实地上。对求职者而言,这意味着 2026 年的 Agent 岗位既真实又拥挤,区分度恰恰在历史规律三里说的那些「有 verifier 的方向」上——参见知识地图对技能栈的拆解。
读史的纪律
本节 2025–2026 年的内容以 2026 年 8 月的公开报道为准。Agent 领域的产品数据(收入、份额)大多来自厂商自述或二手报道,引用到简历、报告或投资材料前请回到一手来源核实。
六、六十年,一张表
| 时间 | 事件 | 历史意义 |
|---|---|---|
| 1966 | ELIZA 发布 | 对话界面的原型;「ELIZA 效应」预警 |
| 1966–72 | Shakey 机器人(SRI) | 感知—规划—行动循环的始祖 |
| 1970s | MYCIN 等专家系统 | 规则注入知识的巅峰与瓶颈 |
| 1987 | Bratman 提出 BDI 思想 | Agent 的心智状态理论化 |
| 1995 | Rao & Georgeff、Wooldridge & Jennings 论文 | BDI 落地,Agent 概念体系成型 |
| 1992 | TD-Gammon | 自学胜过手工规则的首次证明 |
| 2016.03 | AlphaGo 胜李世乭 | Deep RL + 搜索的超人 Agent |
| 2020.05 | GPT-3 论文 | in-context learning,提示工程诞生 |
| 2022.01 | Chain-of-Thought 论文 | 推理可以「被引出来」 |
| 2022.03 | InstructGPT 论文 | RLHF 让模型听懂指令 |
| 2022.10 | ReAct 论文;LangChain 开源 | 推理+行动的统一循环;框架时代开启 |
| 2022.11.30 | ChatGPT 发布 | 一切的前置条件集齐 |
| 2023.03 | GPT-4;AutoGPT 开源 | 够强的引擎;自主 Agent 现象级爆发 |
| 2023.04 | BabyAGI;Generative Agents | 最小 Agent 闭环;记忆流架构 |
| 2023.06.13 | OpenAI function calling | 工具调用结构化、生产可用 |
| 2023.10 | SWE-bench 发布 | 编程 Agent 有了计分牌 |
| 2024.03–04 | Devin 演示;SWE-agent 开源 | 编程 Agent 路线被证实 |
| 2024.09 | OpenAI o1 发布 | 推理时计算成为显式目标 |
| 2024.10.22 | Claude computer use | 行动空间扩展到任意 GUI |
| 2024.11.25 | MCP 发布 | 工具连接的标准化 |
| 2025.01.20 | DeepSeek-R1 开源 | 推理能力平民化 |
| 2025.02 | Deep Research;Claude Code 发布 | 研究型 Agent 品类;终端编程 Agent |
| 2025.03 | Manus 发布;OpenAI 支持 MCP | 通用 Agent 破圈;MCP 成事实标准 |
| 2025.04–06 | A2A 发布并捐赠 Linux 基金会 | Agent 间互操作协议 |
| 2025.05–09 | Codex 云端版、Gemini CLI、GPT-5-Codex | 编程 Agent 军备赛白热化 |
| 2025.12.09 | AAIF 成立,MCP/AGENTS.md 捐赠 | Agent 协议中立化托管 |
| 2026 | 工程深水区:评估、可观测、Skills、多 Agent 并行 | 竞争从模型转向系统工程 |
七、三条历史规律
规律一:概念领先工程十年,工程等待引擎。 BDI 的理论 1995 年就成型了,等一个够聪明的执行体等了近三十年;AutoGPT 的架构 2023 年就火了,等一个够强的推理模型等了两年。遇到「新概念」时先问:这是真新,还是旧思想等到了新引擎?多数时候是后者——这不丢人,反而是可预测的机会窗口。
规律二:每一次爆发都以「标准化」收尾。 function calling 标准化了工具调用(2023),MCP 标准化了工具连接(2024–25),A2A 标准化了 Agent 互联(2025),AGENTS.md/Skills 标准化了 Agent 的知识与能力分发(2025–26)。混乱期是框架开发者的战场,标准化之后价值向上层应用和下层基础设施迁移。对个人学习者的启示:学协议和标准(它们寿命长),慎学框架的私有抽象(它们寿命短)。
规律三:落地的顺序由「可验证性」决定。 Agent 先在编程爆发(有编译器和测试),其次在研究分析(有引用可查),而「全自动生活助理」至今没有真正成立(无 verifier、错误代价高)。判断一个 Agent 方向是否临近爆发,别问「模型够不够聪明」,问「这个任务的结果能不能被便宜地验证」。这条规律对选项目、选 offer 同样适用——详见岗位版图。
参考资料
- ReAct: Synergizing Reasoning and Acting in Language Models (arXiv:2210.03629) —— 现代 Agent Loop 的奠基论文,2022 年 10 月。
- Generative Agents: Interactive Simulacra of Human Behavior (arXiv:2304.03442) —— 斯坦福小镇实验与记忆流架构,2023 年 4 月。
- OpenAI: Function calling and other API updates(Simon Willison 记录) —— 2023 年 6 月 13 日 function calling 发布的同期记录。
- Introducing computer use(Anthropic) —— 2024 年 10 月 22 日 computer use 发布原文。
- Introducing deep research(OpenAI) —— 2025 年 2 月 2 日 Deep Research 发布原文。
- Google Cloud donates A2A to Linux Foundation —— 2025 年 6 月 23 日 A2A 中立化托管的官方公告。
- Donating the Model Context Protocol and establishing the Agentic AI Foundation(Anthropic) —— 2025 年 12 月 9 日 MCP 捐赠与 AAIF 成立。
- Linux Foundation Announces the Formation of the Agentic AI Foundation —— AAIF 官方新闻稿,含创始项目与成员名单。