Skip to content

Devin

本页速览 Cognition 的「AI 软件工程师」Devin 全景复盘:从 2024 年 SWE-bench 13.86% 的轰动发布与 Upwork 演示造假争议,到 2025 年降价 25 倍、收购 Windsurf、2026 年 260 亿美元估值与 4.92 亿美元年化收入的完整轨迹,以及它留给 Agent 工程的真实教训。

本页含时效性内容,数据截止于 2026-08;JD、价格、产品功能等信息可能已变化,引用前请核对原始出处。

Devin ​

2024 年 3 月 12 日,一家叫 Cognition 的小公司发布了一段演示视频,宣布他们造出了「世界上第一个 AI 软件工程师」Devin。创始团队是国际信息学奥赛(IOI)金牌得主,身后是 Founders Fund 领投的 2100 万美元 A 轮,以及 Collison 兄弟、Elad Gil 等一串硅谷名人。视频里 Devin 自己读文档、自己配环境、自己调试,甚至「在 Upwork 上接了真实的外包活并赚到了钱」。

接下来两年半发生的事情,几乎浓缩了整个 Agent 行业的成长史:一夜封神、被逐帧打假、沉寂打磨、悄然商用、天价并购、估值狂飙。截至 2026 年 5 月,Cognition 以 260 亿美元估值完成超 10 亿美元融资,年化收入(run-rate revenue)达到 4.92 亿美元,客户名单里有花旗、梅赛德斯-奔驰、高盛、美国陆军和美国海军。

这个页面不复述神话,也不重复嘲讽,而是把 Devin 当作一个标本拆开看:它做了什么、哪些是真的、哪些教训值得每个做 Agent 的人记住。

一、发布:轰动与打假,只隔了五周 ​

1.1 2024 年 3 月的冲击 ​

Devin 发布时最硬的论据是 SWE-bench 成绩:在真实 GitHub issue 上端到端解决 13.86%,而此前最好的无辅助基线是 1.96%——即使把要改的文件直接告诉模型,当时的最好成绩也只有 4.80%。约 7 倍的差距,而且是「无辅助」对「有辅助」。

但请注意官方技术报告里的脚注,这个 13.86% 有三个限定条件:

  • 只在 SWE-bench 全集的随机 25% 子集上评测;
  • 其余模型大多在「告知需修改文件」(assisted)的条件下对比,Devin 是 unassisted——这一点对 Devin 有利,是真实加分项;
  • 评测由 Cognition 自己执行,没有第三方复现。

公平地说,13.86% 在 2024 年 3 月是货真价实的 SOTA,它直接点燃了「Agent 能端到端解决 issue」这条赛道的军备竞赛。SWE-bench 此后成为行业事实标准,围绕它的方法论讨论我们放在 Agent 评测 和 SWE-agent 案例 里展开。

当时的舆论烈度现在回头看仍然惊人:「软件工程师五年内消失」「CS 学位不值钱了」的标题铺满科技媒体,Devin 的 waitlist 一码难求,二手邀请在社交平台被当作身份象征。这种狂热本身就是后来反噬的燃料——把期望值推到不可能兑现的高度,是 Devin 公关策略最大的成功,也是最大的失误。

1.2 五周后的逐帧打假 ​

2024 年 4 月,一位有 35 年工程经验的开发者 Carl Brown 在他的 YouTube 频道 Internet of Bugs 上发布了一条 25 分钟的视频:《Debunking Devin: "First AI Software Engineer" Upwork lie exposed!》,在 Hacker News 和 Reddit 上刷屏。他把 Cognition 官方演示中「Devin 在 Upwork 完成真实外包任务」的那段视频逐帧拆开,发现了几个硬伤:

  • 任务被精心挑选且被曲解。Upwork 客户要的是「帮我跑通一个已有的道路损伤检测视觉模型」,本质是环境配置和运维问题;而演示把 Devin 呈现为「从零写代码完成开发任务」。
  • Devin 修的是自己造的 bug。视频里 Devin 调试半天的错误,很多是它自己生成代码时引入的——先制造问题再解决问题,看起来像在工作。
  • 没有走真实的 Upwork 流程。没有投标、没有交付、没有任何证据表明客户验收或付款。
  • 产出代码质量差。不必要的复杂和冗余,人类复现同样结果只花了约 36 分钟,Devin 折腾了 6 个多小时。

这件事的行业意义远大于八卦价值:它确立了「演示视频陷阱」这个术语的实体原型——Agent 演示展示的从来不是能力分布,而是运气分布的最好一次抽样。这个问题至今存在,2026 年各家厂商的发布会依然在用同一招。

演示视频陷阱(Demo Video Trap)

看任何 Agent 产品的演示,默认问自己三个问题:这个任务跑了几次才成功一次?任务是谁挑选的?失败后的人工善后成本是多少?Devin 事件的教训不是「这家公司是骗子」,而是「单次演示对能力的证明力约等于零」。真正的信号来自第三方长周期实测——比如下文 Answer.AI 的那次。

1.3 一年后的第三方实测:20 个任务,14 个失败 ​

2025 年 1 月,Answer.AI 团队(Jeremy Howard 创办的实验室)发布了《Thoughts On A Month With Devin》——当时互联网上罕见的、基于一个月真实使用的详细评测。他们给 Devin 派了 20 个真实任务,覆盖新建项目、研究、分析存量代码、修改存量代码四类,结果:

结果数量说明
成功3含最初的 Notion→Google Sheets 数据迁移等「胶水任务」
失败14过度复杂的「代码汤」、陷入死循环、幻觉出不存在的功能
无定论3有产出但未真正解决问题

更致命的不是失败率,而是不可预测性:「我们无法找到任何规律来预判哪个任务会成功。」 以及自主性变成负债的典型症状——让它把多个应用部署到一个 Railway 实例(Railway 根本不支持),Devin 没有识别出任务不可行,而是花了一整天尝试各种方案并幻觉出不存在的功能。

这篇评测和 2024 年 4 月的打假视频,共同构成了 Devin 前半段生涯的舆论底色。值得强调的是:它们批评的是 2024 年底到 2025 年初那个版本的 Devin,后面我们会看到产品和市场都发生了实质变化。

二、产品形态:一个住在云上的「远程同事」 ​

Devin 和 Cursor、Claude Code 的根本区别不在模型能力,而在交互拓扑。它不是 IDE 里的副驾驶,也不是你终端里的命令行伙伴,而是一个有独立工位的远程员工:

        你(人)                        Devin(云端)
┌────────────────────┐      ┌──────────────────────────────────┐
│  Slack / Web 界面   │      │  独立的云端沙箱(Docker 容器)      │
│  ─ 派任务           │      │  ├─ shell(装依赖、跑测试)         │
│  ─ 看进度播报        │─────▶│  ├─ 代码编辑器                    │
│  ─ 中途纠偏          │      │  ├─ 浏览器(读文档、预览网页)      │
│  ─ Review PR        │      │  └─ 长任务规划器                  │
└────────────────────┘      │           │                      │
                            │           ▼                      │
                            │   完成后提交 Pull Request         │
                            └──────────────────────────────────┘

这个形态带来三个结构性特征:

  • 异步长任务。你派完任务去开会,它自己跑几小时甚至几天。这是它区别于 Cursor(同步、人盯每一行改动)和 Claude Code(同步、每次改动要授权)的本质。
  • 自带完整环境。沙箱里有 shell、编辑器、浏览器,能装依赖、读 API 文档、预览自己写的网页。环境的完整性是它的护城河,也是它失败时的放大器——Answer.AI 的实测里,Devin 经常在环境问题上耗尽预算。
  • 以 PR 为交付物。干完活的产出是一个 Pull Request,进入人类既有的 code review 流程。这一点非常关键:Devin 没有要求工程师改变验收方式,而是把自己嵌进了现有的工程协作结构里。

2.1 产品线的扩展 ​

2025 年 4 月 Devin 2.0 发布后,产品边界明显从「单个远程工程师」扩展为「一个工程团队的 AI 基础设施」:

  • Parallel Devins:同时派出多个 Devin 实例并行处理任务队列,配一个总览界面管理它们。管理的颗粒度从「盯一个 Agent」变成了「管一队 Agent」。
  • Devin Wiki:自动为你的仓库生成和维护文档——架构图、源码链接、模块说明,随代码演进持续更新。瞄准的是企业里最痛的存量知识问题。
  • Devin Search:对代码库的语义化问答,带引用的回答。
  • Interactive Planning:正式开工前先和你对齐计划,把模糊需求拆成可确认的步骤再执行。这是对「自主性负债」问题的正面回应——把纠偏点前移。
  • Agent-native IDE:一个类 VS Code 的界面,可以在 Devin 工作过程中随时介入、接管、共同编辑。
  • API 与集成:Slack、VS Code 扩展、API,让它能被嵌进 CI/CD 和工单系统自动触发。

注意这个产品演进的隐含逻辑:2024 年的 Devin 卖的是「替代工程师」,2025 年之后的 Devin 卖的是「工程杠杆」——Wiki 和 Search 甚至和写代码无关,卖的是代码库理解。这个转向是它能活下来的关键,后文展开。

2.2 一次典型任务的生命周期 ​

把抽象架构落到具体操作,一次 Devin 任务大致长这样:

  1. 派活:在 Slack 里 @Devin(或在 Web 界面)描述任务,附上 issue 链接、相关文档、环境线索。任务描述的质量直接决定成败——这是用 Devin 最像「带新人」的地方。
  2. 对齐计划(2.0 之后):Devin 先输出一份执行计划,拆出步骤、列出假设,等你确认或修正后再动手。跳过这一步直接开跑,是新手最常见的翻车姿势。
  3. 异步执行:它在自己的沙箱里 clone 仓库、装依赖、跑测试、写代码,过程中在 Slack 里播报进度。你可以随时插话纠偏,也可以打开 IDE 界面直接接管。
  4. 交付与验收:完成后提交 PR,附上它的工作总结。然后进入你团队正常的 code review——这里没有任何特殊通道,它被当作一个普通贡献者对待。
  5. 计费结算:按实际消耗的 ACU 扣费。一个卡死一整天的失败任务和一个十分钟搞定的成功任务,账单可能差不多——这决定了「尽早掐死跑偏的任务」是使用 Devin 的核心生存技能。

第 5 点是很多团队的第一课:用 Devin 的成本控制,本质是任务粒度和止损纪律的管理学,不是技术问题。相关方法论见 成本工程。

三、技术公开信息:少,但有干货 ​

Cognition 对架构细节一直守口如瓶,但有几处公开信息值得认真读。

3.1 长时程规划与「压缩式记忆」 ​

发布时官方说法是「long-term reasoning and planning」的进步让 Devin 能执行「需要数千个决策」的工程任务。真正有价值的技术披露在 2025 年 6 月 Cognition 工程师 Walden Yan 的著名博客《Don't Build Multi-Agents》里。这篇文章反直觉地主张:不要急着上多智能体架构,并给出了两条 context engineering 原则:

  1. Share context:共享完整的 agent trace,而不只是消息片段;
  2. Actions carry implicit decisions:每个动作都携带隐含决策,并行子 Agent 之间的决策冲突是可靠性杀手。

他们给出的实践路线是:默认使用单线程线性 Agent;当上下文窗口不够时,引入一个专门做「历史压缩」的模型,把动作与对话历史压缩成关键决策和事件——Cognition 透露他们为此微调了小模型。这与 Context Engineering 一页讲的「上下文是稀缺资源」完全同构,也是 Multi-Agent 架构 一节讨论可靠性取舍时的重要一手材料。

为什么「反多智能体」的 Cognition 却做了 Parallel Devins?

不矛盾。Cognition 反对的是多个 Agent 协作完成同一个任务(决策冲突、上下文割裂);Parallel Devins 是多个 Agent 各自独立完成互不耦合的任务(像派活给不同的远程员工)。前者是分布式决策,后者是任务级并行。判断你的场景该用哪种,就看子任务之间是否需要共享决策上下文。

3.2 SWE-bench 数字的通货膨胀 ​

把 Devin 的成绩放进时间轴,能直观看到这两年代码 Agent 的能力斜率:

时间系统成绩备注
2023-10Claude 2 等基线~1.96%(无辅助)SWE-bench 论文基线
2024-03Devin13.86%全集 25% 随机子集,无辅助
2025-09Claude Sonnet 4.582.0%SWE-bench Verified(人工筛选子集)

注意口径差异:Devin 的 13.86% 跑在原始 SWE-bench 的随机子集上,后来的高分大多跑在 Verified 子集上,两者不可直接相减。但数量级的变化是真实的:这个 benchmark 在两年内从「谁能两位数谁是英雄」卷到了接近饱和,迫使行业转向更长时程的新基准(如 SWE-EVO、Terminal-Bench)。这也是为什么读任何 benchmark 数字都必须先问口径——详见 Agent 评测。

3.3 自研模型:从调包到训练 ​

Cognition 早期是纯粹的「模型使用者」,2025 年起转向自研:收购 Windsurf 后继承了 SWE-1 模型家族(SWE-1、SWE-1-lite、SWE-1-mini,2025 年 5 月发布,主打软件工程全流程与长任务),并在 2026 年推出 SWE-1.6——按官方说法已成为 Windsurf 内使用最多的模型,速度最高 950 tok/s。同时官方强调自己是「independent agent lab」:与所有基础模型实验室合作,按任务类别(他们自称评测 100+ 类软件工程任务)自动选择性价比最优的模型。自研小模型做压缩、第三方旗舰模型做推理、自家模型补速度与成本——这套混合供给策略,值得每个算账的 Agent 团队参考,相关讨论见 成本工程。

四、商业模式与定价:从奢侈品到白菜价 ​

Devin 的定价史本身就是一部市场教育史:

时间定价背景
2024-03 ~ 2024-11仅限 waitlist,定向邀请制造稀缺,产能爬坡
2024-12$500/月,正式开放定位企业级「AI 员工」,按人头对比工程师薪资定价
2025-04(Devin 2.0)Core 版 $20/月,按 ACU(Agent Compute Unit)计费,超额约 $2.25/ACU;Team 版 $500/月含 250 ACU(约 $2.00/ACU)入门价直降 25 倍
2026 年Core $20 / Team $500 的框架延续,ACU 单价随模型成本下降继续摊薄价格战常态化

2025 年 4 月的降价是一次防御性动作,不是实力展示。彼时 Cursor 以 $20/月横扫个人开发者,Claude Code 把终端 Agent 的体验拉到新高度,开源的 OpenHands 在 benchmark 上追到同一量级。$500/月 的定价在「15% 任务成功率」的口碑下完全不可持续。降价 + ACU 计量,本质是把商业模式从「雇一个 AI 员工」(按席位收费)改成「买算力按量付费」——承认了自己卖的是计算资源,不是劳动力。

这个转变对行业的定价有普遍参考价值:当 Agent 的成功率不足以按「产出」定价时,只能按「消耗」定价。等成功率高到可以承诺结果时,才会出现按 issue 数、按 PR 数的结果定价——2026 年的 Devin 企业合同里已经出现了这种混合模式,但按量计费仍是主干。

五、2025-2026:Windsurf 收购与估值狂飙 ​

5.1 年度最戏剧性并购 ​

2025 年年中的 Windsurf 收购案值得单独复盘,因为它同时改写了三家公司的命运:

  1. 2025 年春:OpenAI 与 AI 编程工具 Windsurf(母公司 Codeium)洽谈约 30 亿美元收购,谈判最终破裂——微软与 OpenAI 的知识产权条款是核心障碍之一。
  2. 2025-07-11:Google 闪电出手,以约 24 亿美元的技术授权费 + 人才协议,把 Windsurf CEO Varun Mohan、联合创始人 Douglas Chen 和核心研发团队带进 Google DeepMind。Windsurf 瞬间成为「空壳」——品牌、产品、客户和大部分员工还在,灵魂没了。
  3. 2025-07-14:三天后,Cognition 宣布收购 Windsurf 剩余部分——产品、品牌、企业客户和留下的人。

这笔交易被普遍视为 2025 年最复杂的 AI 并购:Google 拿走人和技术授权,Cognition 拿走产品和收入,OpenAI 空手而归。对 Cognition 的战略意义很明确:Windsurf 补上了 Devin 缺失的那一半——同步 IDE 场景(Cascade Agent、SWE-1 模型家族、成熟的企业销售管道)。此后 Cognition 的产品矩阵变成了「异步云端 Agent(Devin)+ 同步 IDE(Windsurf)」的双轨结构,直接对标 Cursor 与 GitHub Copilot 的主战场。

5.2 融资与收入曲线 ​

时间事件
2024-03$21M A 轮(Founders Fund 领投)
2024-04$175M,估值 $2B(报道口径,未独立核实)
2025-08约 $500M,估值 $9.8B
2025-09$400M 轮
2026-05-27超 $1B,估值 $26B(Lux Capital、General Catalyst、8VC 领投)

伴随 2026 年 Series D 披露的数字:年化收入 4.92 亿美元;企业用量自 2026 年初增长超 10 倍;客户包括花旗、梅赛德斯-奔驰、高盛、Dell、桑坦德、美国陆军与美国海军;奔驰把一个人估 8 个月的遗留系统现代化项目压到了 8 天;拉美最大银行 Itaú 用 Devin 自动修复 70% 的安全漏洞;Cognition 自己 89% 的代码提交由 Devin 完成(其余由 Windsurf 本地 Agent 完成)。

读这些数字时保持职业怀疑:它们全部来自公司官方博客,没有第三方审计。但「能通过高盛、花旗、美军的安全与采购审查」这件事本身,是比任何 benchmark 都硬的能力证明——这些机构不会为一段 viral 视频付钱。

5.3 放到竞争格局里看 ​

2026 年的代码 Agent 市场已经分层,Devin 的位置和邻居们:

产品交互形态自主程度定价锚点典型用户
Devin云端异步,Slack/PR 交付高(数小时无人值守)$20 起 + ACU 计量企业工程团队,批量任务
CursorIDE 内同步低(人盯每次改动)$20/月席位个人开发者
Claude Code终端同步,可挂云任务中(逐步授权)订阅 + API 计量工程师个人与小团队
OpenHands开源自托管高(类 Devin)模型 API 成本想自建/研究的团队

Devin 的差异化不在「更聪明」——模型层大家用的是同一批——而在三件事:异步长任务的产品化完整度、企业合规与采购通道(这是军方和银行客户选择它的实际原因)、以及收购 Windsurf 后「异步 + 同步」双轨覆盖。它的风险同样清晰:Anthropic 和 OpenAI 的自有 Agent 产品正在把同样的能力以更低的价格打进同一批客户。

怎么读厂商自报的案例数字

「8 个月压到 8 天」这类对比,分母通常是「人类团队按传统流程的最悲观估计」,分子通常不含需求澄清、环境准备和最终验收的人工时间。正确的用法不是记住倍数,而是记住任务类型:遗留系统现代化、安全漏洞批量修复、依赖升级——这类「定义清晰、量大、单体力智力含量低」的任务,正是当前自主 Agent 的甜点区。把 Agent 派去干这个,比让它「端到端开发新功能」靠谱得多。

六、争议与教训:自主性宣传 vs 现实差距 ​

Devin 是研究「Agent 产品宣传学」的最佳样本,教训可以提炼成四条。

6.1 「AI 软件工程师」这个词本身就是问题 ​

把产品命名为「工程师」,等于承诺了工程师的全集:理解模糊需求、权衡取舍、为结果负责。而 2024-2025 年的 Devin 实际交付的是「在良好定义的任务上有一定成功率的执行者」。命名与能力的落差,直接导致了舆论的反噬强度——如果它当初叫「Devin:自动化 PR 机器人」,不会有那样的轰动,也不会有那样的打假。给你的 Agent 产品起名时,名字承诺的就是用户的验收标准。

6.2 自主性是把双刃剑,纠偏点必须前移 ​

Answer.AI 实测中最有教育意义的失败模式不是「做错了」,而是「在不可能的任务上奋战一整天」。全自主 + 长时程意味着错误假设会以小时为单位复利放大。Devin 2.0 用 Interactive Planning 把计划确认前置、用 IDE 允许人随时接管,本质是在架构上承认:当前的自主 Agent 需要的是『结构化的人类介入点』,而不是『更少的人类介入』。这正是 Human-in-the-Loop 设计的核心命题,也是 Agent 落地陷阱 里排在第一的那条。

6.3 口碑低谷不是终点,分发和信任重建才是长赛 ​

按 2025 年初的舆论,Devin「已经死了」:演示造假、实测翻车、定价离谱。但 Cognition 做了三件对的事:把价格降到试用无门槛的区间;用 Wiki/Search 进入「代码库理解」这个成功率高得多的场景;用 Windsurf 收购拿到企业分发渠道。到 2026 年,它成了收入最高的 Agent 公司之一。教训是反直觉的:Agent 产品的竞争不在单次任务成功率,而在「失败成本 × 试错频率」的工程学——谁能把失败的代价降到足够低、让用户愿意持续试,谁就能等到模型能力追上来的那一天。

6.4 对基准和演示保持制度性怀疑 ​

Devin 事件之后,行业的免疫反应是真实的:SWE-bench 官方推出了人工筛选的 Verified 子集和第三方托管评测;厂商自报数字普遍被默认打折扣;「放出完整 trace」逐渐成为可信发布的最低配置。如果你正在做自己的 Agent 评测,直接抄这个作业:公开任务集、公开完整轨迹、让第三方可复现——方法论见 Evals 实践。

七、对行业的正面推动 ​

批评之外,必须承认 Devin 的历史贡献同样真实:

  • 它把「全自主长任务 Agent」从科幻变成了品类。2024 年 3 月之前,主流叙事是 Copilot 式的补全;之后,「异步云端 Agent」成为每家厂商的标配——GitHub Copilot coding agent、Jules、OpenAI Codex(2025 版)、Claude Code 的云任务,全都是这个品类。
  • 它教育了 SWE-bench。13.86% 的冲击力让这个学术基准变成行业标准,客观上推动了整个评测生态的成熟。
  • 它蹚出了「沙箱 + PR 交付」的工程范式。云端隔离环境、以 PR 接入人类 review 流程,如今是所有同类产品的默认架构。
  • 它贡献了最好的架构辩论文本。《Don't Build Multi-Agents》至今是 context engineering 领域被引用最多的工程博客之一。
  • 它提供了完整的商业样本。从 $500 到 $20 的定价修正、从「替代人」到「工程杠杆」的定位修正、从产品公司到「agent lab + 模型训练」的形态演进——每一步都是可研究的决策案例。

八、小结 ​

Devin 的故事不是一个「骗子现形记」,也不是「王者归来」的爽文,而是 Agent 行业第一份完整的压力测试报告:

  • 宣传端,它演示了过度承诺的代价——能力是真的,但被夸大后,真实部分也会被当作假的;
  • 产品端,它演示了自主性的正确打开方式——不是无人值守,而是把人类介入点设计进架构;
  • 商业端,它演示了活到模型追上来的策略——降价、换场景、买渠道,然后等待。

对学习者,建议的打开方式是:去读一遍 Answer.AI 的实测原文,再读一遍 Cognition 的 Series D 博客,把两份材料里描述的同一家公司对照起来看——你会得到比任何二手评论都深刻的判断力。想动手体验同类架构,开源的 OpenHands 是最直接的平替;想理解底层循环,回到 Agent Loop 和 规划能力 这两页。

参考资料 ​