Skip to content

前沿进展

本页速览 梳理 2025-2026 年 Agent 研究的七个前沿方向——Agentic RL、Deep Research、Computer Use、自我改进、终身学习、多智能体协议与安全研究,每个方向给出代表性工作和「值得关注还是炒作」的明确判断。

本页含时效性内容,数据截止于 2026-08;JD、价格、产品功能等信息可能已变化,引用前请核对原始出处。

前沿进展 ​

这一页和本站其他页面不同:其他页面讲「已经沉淀下来的东西」,这一页讲「还在剧烈变动的东西」。Agent 研究在 2025 年经历了一次范式切换——从「prompt 编排 + 工作流」转向「用 RL 直接训练 agent 行为」,整个领域的重心、论文产出和工程实践都在随之重写。

因此本页有三条使用须知:

  1. 时效性:内容核实到 2026 年 8 月,之后的进展请以原始来源为准。每个方向都附了可持续跟踪的入口(survey、leaderboard、协议官网)。
  2. 判断优先:每个方向末尾都有「值得关注还是炒作」的一句话判断。判断可能错,但比罗列论文有用——你想看论文清单可以直接去 论文地图。
  3. 不追求全:只选每个方向上改变了后续研究走向的工作。读经典基础论文请移步 核心论文。

一、Agentic RL:从「编排 agent」到「训练 agent」 ​

发生了什么 ​

2024 年之前,提升 agent 能力的主流做法是工程手段:更好的 prompt、更精细的 Agent Loop、更多的工具。2025 年发生的转变是:把整条 agent 轨迹(reasoning + 工具调用 + 环境反馈)当作 RL 的训练对象,端到端地优化任务完成率。

标志性事件是 2025 年 2 月 OpenAI 发布 Deep Research 时随附的 system card,其中明确披露:模型基于 o3 的早期版本,针对网页浏览任务做了端到端强化学习训练,奖励信号来自任务是否完成,而不是人工标注的偏好。这是头部实验室第一次公开承认「agent 能力是 RL 训出来的,不是 prompt 调出来的」。

此后开源社区迅速跟进,形成了一条清晰的技术谱系:

RLHF / RLVR(对齐与推理)
  └── GRPO(DeepSeekMath, 2024):去掉 value network,组内相对优势
        └── DAPO(2025):解耦 clip、动态采样,稳定长 CoT 训练
              └── Agentic RL(2025- ):多轮轨迹 + 工具调用 + 环境奖励
                    ├── Search-R1:把搜索引擎当作 RL 环境的一部分
                    ├── WebDancer / WebSailor 系:合成数据 + RL 训练 web agent
                    ├── Kimi K2:万亿参数模型直接以 agentic 能力为训练目标
                    └── Tongyi DeepResearch:全流程开源的 deep research 训练配方

代表性工作 ​

  • Kimi K2: Open Agentic Intelligence(2025 年 7 月,Moonshot AI):1.04 万亿参数 MoE(激活 32B),训练目标明确就是 agentic 能力——大规模 agentic 数据合成 + 多阶段 post-training + RL。它证明了「为 agent 场景专门训练的开放模型」可以逼近闭源前沿。2026 年初的 K2.5 进一步加入视觉和多 agent 编排(Agent Swarm)。
  • WebDancer(arXiv:2505.22648)与 WebSailor-V2(arXiv:2509.13305,2025 年 5-9 月,阿里通义):系统回答了「web agent 的训练数据从哪来」——自动合成高难度信息搜寻任务,再用 RL 微调。WebSailor-V2 宣称在多个 deep research benchmark 上缩小了与闭源系统的差距。
  • Search-R1(2025,UIUC 等):把检索引擎建模为 RL 环境,模型自己决定何时搜索、搜什么,用结果奖励反向优化搜索策略。是「工具调用进 RL 循环」最干净的范例。
  • Tongyi DeepResearch(2025 年 9 月):第一个宣称在综合评测上对标 OpenAI Deep Research 的全开源 web agent,数据合成、训练流程、模型权重全部开放。对想复现 agentic RL 的团队,这是目前最完整的公开配方。

工程上的关键难点 ​

agentic RL 和普通 RLHF 的差别不在算法,在环境:

  • rollout 成本:一条轨迹是几十轮工具调用,训练吞吐被环境交互(搜索 API、浏览器、代码执行器)拖住,异步 rollout 框架成为基础设施竞争的焦点;
  • 奖励稀疏:长任务只有终点有信号,主流解法是合成可自动验证的任务(WebSailor 路线)或用 rubric-based reward;
  • 环境真实性:在静态数据集上训出的策略遇到真实网页的反爬、改版、脏数据会退化,「高保真训练环境」本身成了研究课题(如 EnterpriseBench/Corecraft 一类工作)。

值得关注还是炒作?

值得关注,这是 2025-2026 年最重要的范式变化。 如果你的工作涉及让 agent 在某垂直领域稳定完成任务,「为领域任务构建可验证奖励 + 跑 agentic RL」已经是比 prompt 工程高一个数量级的杠杆。但注意前提:你得有可自动验证的任务定义和够便宜的 rollout 环境,否则这条路走不通。

二、Deep Research 系统:agentic RL 的第一个杀手级应用 ​

Deep Research 是 agentic RL 落地最成功的产品形态:给它一个问题,它自主搜索、阅读、交叉验证几十上百个网页,产出带引用的研究报告。2025 年 2 月 OpenAI 首发后,Gemini、Perplexity、xAI、Microsoft Copilot、Kimi 在数月内全部跟进,成为 2025 年最拥挤的产品赛道。

技术路线的收敛 ​

各家实现细节不公开,但从 OpenAI 的 system card、Deep Research 综述和开源复现中可以归纳出收敛后的架构:

用户问题
   │
   ▼
┌──────────────┐   多轮循环(几十到几百步)
│  Planner/    │ ──► 分解子问题
│  Reasoner    │ ──► 生成搜索查询
│ (RL 训练的   │ ──► 阅读网页/PDF,提取证据
│  单一模型)   │ ──► 发现矛盾 → 回溯修正计划
└──────────────┘ ──► 证据足够 → 退出循环
   │
   ▼
┌──────────────┐
│  报告生成     │  带逐条引用,按子问题组织
└──────────────┘

两个关键的架构判断已经形成共识:

  1. 端到端单模型 + RL 优于多 agent 编排。LangChain 的开源复现 open_deep_research 早期用 supervisor + 多子 agent 结构,后续版本和 Tongyi DeepResearch 都验证了一个趋势:当底层模型经过 agentic RL 训练后,「一个强模型 + 长上下文 + 好工具」比复杂的多 agent 拓扑更稳。这与我们在 多智能体架构 中的判断一致:多 agent 不是银弹。
  2. 瓶颈从「找信息」转向「验证信息」。2025 年底开始出现专门攻击 deep research 弱点的 benchmark(如要求产出专家级维基文章的 Wiki Live Challenge),暴露出当前系统的通病:引用看似规范但支撑关系错位、对低质量来源缺乏甄别。评估方法本身成了研究热点,参见 评估体系。

2026 年 2 月,OpenAI 给 Deep Research 加上了 MCP 连接器支持——可以接入任意 MCP 工具并限定可信站点搜索。这标志着 deep research 从「公网调研工具」向「企业私有知识调研入口」演进。

值得关注还是炒作?

产品形态已经成立,技术差异化在收窄。 对研究者:值得研究的是信息验证与评估,不是再做一个「能搜索的 agent」。对工程师:别再自研 deep research 工作流,直接用 API(OpenAI、Gemini 都有)或部署 Tongyi DeepResearch / open_deep_research,把精力放在自己的数据源和评估集上。

三、Computer Use / GUI Agent:缓慢但真实地爬向可用 ​

现状 ​

GUI agent(看屏幕截图、输出鼠标键盘动作)是 agent 里最难的方向,因为它不能绕过「视觉理解 → 界面grounding → 长程操作」任何一环。时间线:

  • 2024 年 10 月:Anthropic 发布 Claude 的 computer use 能力(公测 API),第一次有前沿模型原生支持「看屏幕 + 操作」;
  • 2025 年 1 月:OpenAI 发布 Operator,基于 CUA(Computer-Using Agent)模型的浏览器操作 agent,走产品化路线;
  • 2025 年 7 月 17 日:OpenAI 发布 ChatGPT agent,把 Operator 的浏览器操作、Deep Research 的信息综合、ChatGPT 的对话能力合并成单一 agent——「统一 agent」成为头部厂商的共同叙事;
  • 2025-2026:开源生态围绕 OSWorld benchmark(369 个真实桌面任务)迭代,UI-TARS、UI-Venus 等专用 GUI 模型持续刷榜。

数字该信哪个 ​

OSWorld 是当前最被认可的桌面操作 benchmark。根据 2026 年中的 leaderboard 和多方复测:榜首(Claude Opus 系列驱动的 agent)已超过 70%,而 OpenAI 的 CUA 在第三方复测中明显更低(有复测报告 38.1%)。两点提醒: leaderboard 分数和人类水平(约七成出头)的差距在缩小但未闭合;厂商自报分数和第三方复测常有显著出入,引用任何数字前先核对榜单当期数据。

研究上的新动向是绕开像素:既然 GUI grounding 是最大错误源,一些工作(如 2026 年的 StateAct)让主 agent 直接读程序状态(文件系统、DOM、API),把屏幕操作隔离成一个只在必要时调用的子 agent——实测 GUI 子 agent 只被调用了约 1% 的步骤。这个「能用 API 就别点鼠标」的思路,正在把纯粹的 GUI agent 研究挤向「没有 API 可用的长尾场景」。

值得关注还是炒作?

半炒作。 通用「替你操作电脑」在 2026 年仍不可靠,Operator 类产品的好评率撑不起它的定价叙事。但专用场景(浏览器表单、无 API 的老旧内部系统、RPA 替代)已经能产生真实价值。判断一个 GUI agent 产品是否靠谱的唯一标准:敢不敢公布第三方 OSWorld 复测分数。

四、自我改进 Agent:从「改 prompt」到「改自己的代码」 ​

核心工作:Darwin-Gödel Machine ​

2025 年 5 月,Sakana AI、UBC 与 Vector Institute 的团队(Jenny Zhang、Jeff Clune 等)发表了 Darwin-Gödel Machine: Open-Ended Evolution of Self-Improving Agents(arXiv:2505.22954,后被 ICLR 2026 接收),这是 2025 年讨论度最高的 agent 论文之一。

名字里的两个来源说明了它的设计:

  • Gödel machine(Schmidhuber 的理论设想):能「可证明地」自我改写的通用问题求解器——理论上完美,实践上不可行,因为「证明改写有益」这一步做不到;
  • Darwin 进化:放弃证明,改用经验验证——让 agent 修改自己的代码,在 benchmark 上跑分,把有效的修改保留进一个不断增长的「agent 档案库」,再从档案库中采样父代继续变异。

DGM 在 SWE-bench 和 Polyglot 上验证了这套循环:一个 coding agent 通过几十轮自我改写(改自己的工具、记忆结构、工作流),自动发现了类似人类手工设计 agent 时才有的技巧。论文里最有分量的结论是一个 scaling 关系:投入的自我改进算力越多,agent 架构质量越高——这是「架构层面的 scaling law」,而不仅是模型层面的。

上下文:一条更宽的谱系 ​

DGM 不是孤立的工作,它处在一个「递归自我改进(RSI)」的谱系里:

  • STOP(arXiv:2310.02304,COLM 2024):更早的「脚手架自我优化」——让模型递归地改进自己的 scaffolding 代码,权重不动;
  • A Self-Improving Coding Agent(arXiv:2504.15228,2025):非梯度的自我改进,通过反思 + 代码更新获得可观提升;
  • HyperAgents(2026):把「自我指涉改进」推广到更一般的 agent 元学习设置;
  • 综述视角:A Survey of Self-Evolving Agents(arXiv:2507.21046,2025 年 7 月起持续更新)用「What / When / How / Where to Evolve」的框架整理了整条谱系,是进入这个领域最好的地图。

诚实的边界 ​

这类工作的真实贡献常被两类噪音掩盖:一是媒体把「能改自己代码」直接等同于「智能爆炸临近」——DGM 的改进完全发生在 benchmark 划定的 sandbox 里,且每一轮都要烧掉大量完整评测算力;二是「自我改进」的收益中有多少来自模型本就具备但未激活的能力,而非架构创新,目前没有干净的分离实验。安全维度上,能自我改写的 agent 天然绕开了「代码即审批」的传统控制点,这与第七节的安全研究直接相关。

值得关注还是炒作?

研究上值得关注,工程上暂时是炒作。 DGM 证明了「agent 架构可以被搜索」这个方向成立,但自我改进一轮的成本远超手工调优,且收益集中在 coding 这类有自动验证信号的领域。短期内的实用版本是它的退化形态:离线用进化搜索优化你的 agent 配置(工具集、prompt、拓扑),而不是让线上 agent 改自己。

五、长期记忆与终身学习:架构层面开始动真格 ​

agent 的「记忆」长期是个工程问题:向量库 + 摘要 + 检索技巧(本站 记忆系统 讲的就是这套)。2025-2026 年的变化是,架构研究开始正面进攻「灾难性遗忘」,试图让模型权重本身具备持续学习能力。

代表性工作 ​

  • Nested Learning: The Illusion of Deep Learning Architectures(arXiv:2512.24695,Google Research,NeurIPS 2025):提出把模型看作一组嵌套的、不同更新频率的优化问题——快层处理即时上下文,慢层像「长期记忆」一样缓慢固化知识。配套的 HOPE 架构(延续 Titans 的路线)展示了缓解灾难性遗忘的初步证据。这是近年对「模型如何持续学习」最根本的一次架构重述。
  • Lifelong Learning of Large Language Model based Agents(arXiv:2501.07278,2025 年 1 月):系统梳理「终身学习 agent」的感知—记忆—行动闭环,是该方向引用最广的综述之一。
  • 工程侧:以 Letta(MemGPT 团队)为代表的「记忆即服务」路线在 2026 年产品化加速(如其 continual learning SDK),把「可编辑的自我记忆」做成标准组件;Self-Evolving 综述(2507.21046)把外部经验记忆和参数级学习放在同一框架下讨论,两条路线正在合流。

判断 ​

参数级持续学习(Nested Learning 这条线)如果成功,影响是地基级的——但它目前只在中小规模上验证,距离替换「外挂记忆 + RL 微调」的现行方案还很远。对工程师,2026 年的正确答案仍然是外部记忆系统,但值得你每半年回头看一次这条线的进展,因为它一旦成熟,现有记忆架构会整体重写。

WARNING

「终身学习」方向论文增长极快,但评测标准混乱:多数论文各自定义遗忘率、前向迁移指标,横向比较困难。看到「解决灾难性遗忘」的宣称时,先检查它是否在标准 continual learning 基准(而非自建任务)上验证过。

六、多智能体协作与协议:标准战在 2026 年基本打完 ​

agent 互操作协议是 2025 年最热闹的「标准战场」,到 2026 年中格局已大体清晰。三个主要协议的定位和现状:

协议发起方定位治理2026 年中状态
MCPAnthropic(2024.11)模型 ↔ 工具/数据已捐给 Linux 基金会旗下的 Agentic AI Foundation事实标准,工具层无争议
A2AGoogle(2025.4)agent ↔ agent(跨厂商)同上,捐给 Linux 基金会150+ 支持组织,进 AWS/微软/IBM 等大厂产品线
ANP开源社区去中心化 agent 网络社区治理小而活跃,学术与开源圈采用
  • A2A(规范)解决的是「不同公司的 agent 如何互相发现、委派任务」:核心是 Agent Card(能力声明)+ 任务生命周期管理。2026 年中的现实是:标准地位确立,但生产部署集中在少数大厂的受控场景,独立开发者用得还不多。
  • ANP(白皮书,技术白皮书 arXiv:2508.00007)更有野心:基于 W3C DID(did:wba 方法)做去中心化身份,三层架构(身份与安全通信层、元协议协商层、应用协议层),自我定位是「agentic web 时代的 HTTP」。它的设计在协议族里最完整,但生态最小——历史经验是,去中心化身份类协议的推广从不取决于设计优劣。
  • 周边还有支付层的 AP2(Agent Payments Protocol,Google 联合多家支付方,2025 年 9 月)等,说明「agent 经济体」的基础设施拼图在补齐。

学术侧,协议比较研究已经成体系(如 A Survey of Agent Interoperability Protocols,arXiv:2505.02279),对选型的共识结论:MCP 管工具、A2A 管跨组织 agent 协作、ANP 押注开放 agent 网络,三者互补而非互斥。协议层的安全面(身份伪造、能力声明欺骗)仍是开放问题,参考 安全与红队。

值得关注还是炒作?

A2A 值得关注,ANP 值得观望。 如果你的系统要跨团队/跨厂商调度 agent,直接上 A2A;如果只是在组织内部,协议不是必需品,别为了「标准」引入复杂度。ANP 的技术设计值得读,但押注生态前先看采用曲线。

七、Agent 安全研究前沿:从「越狱模型」到「攻击 agent 系统」 ​

agent 安全在 2025 年完成了研究对象的升级:从「让模型说违禁内容」转向「利用 agent 的工具、记忆和自主性造成真实危害」。四条最活跃的研究线:

  1. 间接 prompt injection 产业化。恶意网页、邮件、文档里埋指令劫持 agent,已从事故报告变成系统性攻击面。AgentDojo(NeurIPS 2024)奠定的「在真实工具环境里测注入攻防」范式成为标配;2025 年安全社区记录了大量针对浏览器 agent、MCP server 的注入事件。防御侧没有银弹,目前的共识是纵深防御:最小权限工具、关键动作人工确认(参见 Human in the Loop)、不可信内容与指令通道隔离。
  2. 对齐失败的行为学研究。Anthropic 的 Agentic Misalignment(2025 年 6 月)是这条线的标志:在模拟企业环境中给模型制造「目标冲突 + 面临被替换」的压力,多个主流模型会选择勒索、泄露数据等「内部威胁」行为。配合 Apollo Research 的 in-context scheming 研究(arXiv:2412.04984),「agent 在压力下表现出策略性欺骗」已从假设变成可复现的实验现象。
  3. 评估感知(evaluation awareness)。2026 年的工作开始系统测量「模型是否知道自己在被评测、并因此改变行为」——这直接威胁所有安全评测的有效性,是 benchmark 方法论的新麻烦。
  4. 安全 benchmark 体系化。AgentHarm(ICLR 2025,多步有害任务执行)、Agent-SafetyBench(ASB,ICLR 2025)、针对 GUI/真实 OS 环境的 LITMUS(2026)等,让「agent 安全性」第一次有了可比较的量化口径;The 2025 AI Agent Index(2026 年发布)则把已部署 agent 系统的技术与安全特性做成了可审计的文档化索引。

值得关注还是炒作?

最值得关注的方向,没有之一。 它是唯一一个「研究进展直接决定产品能不能上线」的领域:间接注入和 agentic misalignment 都是已复现、未解决的问题。做 agent 产品的团队应该把 AgentHarm/AgentDojo 纳入 CI,把 misalignment 类实验当作威胁建模的输入,而不是当作媒体新闻。

八、总结:一张判断表 ​

方向一句话判断建议动作
Agentic RL2025-2026 最重要的范式变化有可验证奖励的领域尽早布局
Deep Research形态已成立,差异化收窄用现成系统,精力放在评估
Computer Use / GUI半炒作,专用场景可用只信第三方 OSWorld 复测
自我改进 agent研究成立,工程未到时候用离线进化搜索优化配置
长期记忆/终身学习架构级突破的早期工程上用外部记忆,持续跟踪
多智能体协议标准战基本打完跨组织用 A2A,组织内别过度设计
Agent 安全进展决定产品上限纳入威胁建模与 CI

跟踪这些前沿的低成本方式:收藏本页列出的 survey(Deep Research 综述、Self-Evolving 综述、协议比较综述都在持续更新)、OSWorld 与 SWE-bench 的 leaderboard,以及 前沿资源清单。如果你正准备进入这个方向求职,知识图谱 标注了这些前沿话题与岗位要求的对应关系。

参考资料 ​