外观
Devin
2024 年 3 月 12 日,一家叫 Cognition 的小公司发布了一段演示视频,宣布他们造出了「世界上第一个 AI 软件工程师」Devin。创始团队是国际信息学奥赛(IOI)金牌得主,身后是 Founders Fund 领投的 2100 万美元 A 轮,以及 Collison 兄弟、Elad Gil 等一串硅谷名人。视频里 Devin 自己读文档、自己配环境、自己调试,甚至「在 Upwork 上接了真实的外包活并赚到了钱」。
接下来两年半发生的事情,几乎浓缩了整个 Agent 行业的成长史:一夜封神、被逐帧打假、沉寂打磨、悄然商用、天价并购、估值狂飙。截至 2026 年 5 月,Cognition 以 260 亿美元估值完成超 10 亿美元融资,年化收入(run-rate revenue)达到 4.92 亿美元,客户名单里有花旗、梅赛德斯-奔驰、高盛、美国陆军和美国海军。
这个页面不复述神话,也不重复嘲讽,而是把 Devin 当作一个标本拆开看:它做了什么、哪些是真的、哪些教训值得每个做 Agent 的人记住。
一、发布:轰动与打假,只隔了五周
1.1 2024 年 3 月的冲击
Devin 发布时最硬的论据是 SWE-bench 成绩:在真实 GitHub issue 上端到端解决 13.86%,而此前最好的无辅助基线是 1.96%——即使把要改的文件直接告诉模型,当时的最好成绩也只有 4.80%。约 7 倍的差距,而且是「无辅助」对「有辅助」。
但请注意官方技术报告里的脚注,这个 13.86% 有三个限定条件:
- 只在 SWE-bench 全集的随机 25% 子集上评测;
- 其余模型大多在「告知需修改文件」(assisted)的条件下对比,Devin 是 unassisted——这一点对 Devin 有利,是真实加分项;
- 评测由 Cognition 自己执行,没有第三方复现。
公平地说,13.86% 在 2024 年 3 月是货真价实的 SOTA,它直接点燃了「Agent 能端到端解决 issue」这条赛道的军备竞赛。SWE-bench 此后成为行业事实标准,围绕它的方法论讨论我们放在 Agent 评测 和 SWE-agent 案例 里展开。
当时的舆论烈度现在回头看仍然惊人:「软件工程师五年内消失」「CS 学位不值钱了」的标题铺满科技媒体,Devin 的 waitlist 一码难求,二手邀请在社交平台被当作身份象征。这种狂热本身就是后来反噬的燃料——把期望值推到不可能兑现的高度,是 Devin 公关策略最大的成功,也是最大的失误。
1.2 五周后的逐帧打假
2024 年 4 月,一位有 35 年工程经验的开发者 Carl Brown 在他的 YouTube 频道 Internet of Bugs 上发布了一条 25 分钟的视频:《Debunking Devin: "First AI Software Engineer" Upwork lie exposed!》,在 Hacker News 和 Reddit 上刷屏。他把 Cognition 官方演示中「Devin 在 Upwork 完成真实外包任务」的那段视频逐帧拆开,发现了几个硬伤:
- 任务被精心挑选且被曲解。Upwork 客户要的是「帮我跑通一个已有的道路损伤检测视觉模型」,本质是环境配置和运维问题;而演示把 Devin 呈现为「从零写代码完成开发任务」。
- Devin 修的是自己造的 bug。视频里 Devin 调试半天的错误,很多是它自己生成代码时引入的——先制造问题再解决问题,看起来像在工作。
- 没有走真实的 Upwork 流程。没有投标、没有交付、没有任何证据表明客户验收或付款。
- 产出代码质量差。不必要的复杂和冗余,人类复现同样结果只花了约 36 分钟,Devin 折腾了 6 个多小时。
这件事的行业意义远大于八卦价值:它确立了「演示视频陷阱」这个术语的实体原型——Agent 演示展示的从来不是能力分布,而是运气分布的最好一次抽样。这个问题至今存在,2026 年各家厂商的发布会依然在用同一招。
演示视频陷阱(Demo Video Trap)
看任何 Agent 产品的演示,默认问自己三个问题:这个任务跑了几次才成功一次?任务是谁挑选的?失败后的人工善后成本是多少?Devin 事件的教训不是「这家公司是骗子」,而是「单次演示对能力的证明力约等于零」。真正的信号来自第三方长周期实测——比如下文 Answer.AI 的那次。
1.3 一年后的第三方实测:20 个任务,14 个失败
2025 年 1 月,Answer.AI 团队(Jeremy Howard 创办的实验室)发布了《Thoughts On A Month With Devin》——当时互联网上罕见的、基于一个月真实使用的详细评测。他们给 Devin 派了 20 个真实任务,覆盖新建项目、研究、分析存量代码、修改存量代码四类,结果:
| 结果 | 数量 | 说明 |
|---|---|---|
| 成功 | 3 | 含最初的 Notion→Google Sheets 数据迁移等「胶水任务」 |
| 失败 | 14 | 过度复杂的「代码汤」、陷入死循环、幻觉出不存在的功能 |
| 无定论 | 3 | 有产出但未真正解决问题 |
更致命的不是失败率,而是不可预测性:「我们无法找到任何规律来预判哪个任务会成功。」 以及自主性变成负债的典型症状——让它把多个应用部署到一个 Railway 实例(Railway 根本不支持),Devin 没有识别出任务不可行,而是花了一整天尝试各种方案并幻觉出不存在的功能。
这篇评测和 2024 年 4 月的打假视频,共同构成了 Devin 前半段生涯的舆论底色。值得强调的是:它们批评的是 2024 年底到 2025 年初那个版本的 Devin,后面我们会看到产品和市场都发生了实质变化。
二、产品形态:一个住在云上的「远程同事」
Devin 和 Cursor、Claude Code 的根本区别不在模型能力,而在交互拓扑。它不是 IDE 里的副驾驶,也不是你终端里的命令行伙伴,而是一个有独立工位的远程员工:
你(人) Devin(云端)
┌────────────────────┐ ┌──────────────────────────────────┐
│ Slack / Web 界面 │ │ 独立的云端沙箱(Docker 容器) │
│ ─ 派任务 │ │ ├─ shell(装依赖、跑测试) │
│ ─ 看进度播报 │─────▶│ ├─ 代码编辑器 │
│ ─ 中途纠偏 │ │ ├─ 浏览器(读文档、预览网页) │
│ ─ Review PR │ │ └─ 长任务规划器 │
└────────────────────┘ │ │ │
│ ▼ │
│ 完成后提交 Pull Request │
└──────────────────────────────────┘这个形态带来三个结构性特征:
- 异步长任务。你派完任务去开会,它自己跑几小时甚至几天。这是它区别于 Cursor(同步、人盯每一行改动)和 Claude Code(同步、每次改动要授权)的本质。
- 自带完整环境。沙箱里有 shell、编辑器、浏览器,能装依赖、读 API 文档、预览自己写的网页。环境的完整性是它的护城河,也是它失败时的放大器——Answer.AI 的实测里,Devin 经常在环境问题上耗尽预算。
- 以 PR 为交付物。干完活的产出是一个 Pull Request,进入人类既有的 code review 流程。这一点非常关键:Devin 没有要求工程师改变验收方式,而是把自己嵌进了现有的工程协作结构里。
2.1 产品线的扩展
2025 年 4 月 Devin 2.0 发布后,产品边界明显从「单个远程工程师」扩展为「一个工程团队的 AI 基础设施」:
- Parallel Devins:同时派出多个 Devin 实例并行处理任务队列,配一个总览界面管理它们。管理的颗粒度从「盯一个 Agent」变成了「管一队 Agent」。
- Devin Wiki:自动为你的仓库生成和维护文档——架构图、源码链接、模块说明,随代码演进持续更新。瞄准的是企业里最痛的存量知识问题。
- Devin Search:对代码库的语义化问答,带引用的回答。
- Interactive Planning:正式开工前先和你对齐计划,把模糊需求拆成可确认的步骤再执行。这是对「自主性负债」问题的正面回应——把纠偏点前移。
- Agent-native IDE:一个类 VS Code 的界面,可以在 Devin 工作过程中随时介入、接管、共同编辑。
- API 与集成:Slack、VS Code 扩展、API,让它能被嵌进 CI/CD 和工单系统自动触发。
注意这个产品演进的隐含逻辑:2024 年的 Devin 卖的是「替代工程师」,2025 年之后的 Devin 卖的是「工程杠杆」——Wiki 和 Search 甚至和写代码无关,卖的是代码库理解。这个转向是它能活下来的关键,后文展开。
2.2 一次典型任务的生命周期
把抽象架构落到具体操作,一次 Devin 任务大致长这样:
- 派活:在 Slack 里
@Devin(或在 Web 界面)描述任务,附上 issue 链接、相关文档、环境线索。任务描述的质量直接决定成败——这是用 Devin 最像「带新人」的地方。 - 对齐计划(2.0 之后):Devin 先输出一份执行计划,拆出步骤、列出假设,等你确认或修正后再动手。跳过这一步直接开跑,是新手最常见的翻车姿势。
- 异步执行:它在自己的沙箱里 clone 仓库、装依赖、跑测试、写代码,过程中在 Slack 里播报进度。你可以随时插话纠偏,也可以打开 IDE 界面直接接管。
- 交付与验收:完成后提交 PR,附上它的工作总结。然后进入你团队正常的 code review——这里没有任何特殊通道,它被当作一个普通贡献者对待。
- 计费结算:按实际消耗的 ACU 扣费。一个卡死一整天的失败任务和一个十分钟搞定的成功任务,账单可能差不多——这决定了「尽早掐死跑偏的任务」是使用 Devin 的核心生存技能。
第 5 点是很多团队的第一课:用 Devin 的成本控制,本质是任务粒度和止损纪律的管理学,不是技术问题。相关方法论见 成本工程。
三、技术公开信息:少,但有干货
Cognition 对架构细节一直守口如瓶,但有几处公开信息值得认真读。
3.1 长时程规划与「压缩式记忆」
发布时官方说法是「long-term reasoning and planning」的进步让 Devin 能执行「需要数千个决策」的工程任务。真正有价值的技术披露在 2025 年 6 月 Cognition 工程师 Walden Yan 的著名博客《Don't Build Multi-Agents》里。这篇文章反直觉地主张:不要急着上多智能体架构,并给出了两条 context engineering 原则:
- Share context:共享完整的 agent trace,而不只是消息片段;
- Actions carry implicit decisions:每个动作都携带隐含决策,并行子 Agent 之间的决策冲突是可靠性杀手。
他们给出的实践路线是:默认使用单线程线性 Agent;当上下文窗口不够时,引入一个专门做「历史压缩」的模型,把动作与对话历史压缩成关键决策和事件——Cognition 透露他们为此微调了小模型。这与 Context Engineering 一页讲的「上下文是稀缺资源」完全同构,也是 Multi-Agent 架构 一节讨论可靠性取舍时的重要一手材料。
为什么「反多智能体」的 Cognition 却做了 Parallel Devins?
不矛盾。Cognition 反对的是多个 Agent 协作完成同一个任务(决策冲突、上下文割裂);Parallel Devins 是多个 Agent 各自独立完成互不耦合的任务(像派活给不同的远程员工)。前者是分布式决策,后者是任务级并行。判断你的场景该用哪种,就看子任务之间是否需要共享决策上下文。
3.2 SWE-bench 数字的通货膨胀
把 Devin 的成绩放进时间轴,能直观看到这两年代码 Agent 的能力斜率:
| 时间 | 系统 | 成绩 | 备注 |
|---|---|---|---|
| 2023-10 | Claude 2 等基线 | ~1.96%(无辅助) | SWE-bench 论文基线 |
| 2024-03 | Devin | 13.86% | 全集 25% 随机子集,无辅助 |
| 2025-09 | Claude Sonnet 4.5 | 82.0% | SWE-bench Verified(人工筛选子集) |
注意口径差异:Devin 的 13.86% 跑在原始 SWE-bench 的随机子集上,后来的高分大多跑在 Verified 子集上,两者不可直接相减。但数量级的变化是真实的:这个 benchmark 在两年内从「谁能两位数谁是英雄」卷到了接近饱和,迫使行业转向更长时程的新基准(如 SWE-EVO、Terminal-Bench)。这也是为什么读任何 benchmark 数字都必须先问口径——详见 Agent 评测。
3.3 自研模型:从调包到训练
Cognition 早期是纯粹的「模型使用者」,2025 年起转向自研:收购 Windsurf 后继承了 SWE-1 模型家族(SWE-1、SWE-1-lite、SWE-1-mini,2025 年 5 月发布,主打软件工程全流程与长任务),并在 2026 年推出 SWE-1.6——按官方说法已成为 Windsurf 内使用最多的模型,速度最高 950 tok/s。同时官方强调自己是「independent agent lab」:与所有基础模型实验室合作,按任务类别(他们自称评测 100+ 类软件工程任务)自动选择性价比最优的模型。自研小模型做压缩、第三方旗舰模型做推理、自家模型补速度与成本——这套混合供给策略,值得每个算账的 Agent 团队参考,相关讨论见 成本工程。
四、商业模式与定价:从奢侈品到白菜价
Devin 的定价史本身就是一部市场教育史:
| 时间 | 定价 | 背景 |
|---|---|---|
| 2024-03 ~ 2024-11 | 仅限 waitlist,定向邀请 | 制造稀缺,产能爬坡 |
| 2024-12 | $500/月,正式开放 | 定位企业级「AI 员工」,按人头对比工程师薪资定价 |
| 2025-04(Devin 2.0) | Core 版 $20/月,按 ACU(Agent Compute Unit)计费,超额约 $2.25/ACU;Team 版 $500/月含 250 ACU(约 $2.00/ACU) | 入门价直降 25 倍 |
| 2026 年 | Core $20 / Team $500 的框架延续,ACU 单价随模型成本下降继续摊薄 | 价格战常态化 |
2025 年 4 月的降价是一次防御性动作,不是实力展示。彼时 Cursor 以 $20/月横扫个人开发者,Claude Code 把终端 Agent 的体验拉到新高度,开源的 OpenHands 在 benchmark 上追到同一量级。$500/月 的定价在「15% 任务成功率」的口碑下完全不可持续。降价 + ACU 计量,本质是把商业模式从「雇一个 AI 员工」(按席位收费)改成「买算力按量付费」——承认了自己卖的是计算资源,不是劳动力。
这个转变对行业的定价有普遍参考价值:当 Agent 的成功率不足以按「产出」定价时,只能按「消耗」定价。等成功率高到可以承诺结果时,才会出现按 issue 数、按 PR 数的结果定价——2026 年的 Devin 企业合同里已经出现了这种混合模式,但按量计费仍是主干。
五、2025-2026:Windsurf 收购与估值狂飙
5.1 年度最戏剧性并购
2025 年年中的 Windsurf 收购案值得单独复盘,因为它同时改写了三家公司的命运:
- 2025 年春:OpenAI 与 AI 编程工具 Windsurf(母公司 Codeium)洽谈约 30 亿美元收购,谈判最终破裂——微软与 OpenAI 的知识产权条款是核心障碍之一。
- 2025-07-11:Google 闪电出手,以约 24 亿美元的技术授权费 + 人才协议,把 Windsurf CEO Varun Mohan、联合创始人 Douglas Chen 和核心研发团队带进 Google DeepMind。Windsurf 瞬间成为「空壳」——品牌、产品、客户和大部分员工还在,灵魂没了。
- 2025-07-14:三天后,Cognition 宣布收购 Windsurf 剩余部分——产品、品牌、企业客户和留下的人。
这笔交易被普遍视为 2025 年最复杂的 AI 并购:Google 拿走人和技术授权,Cognition 拿走产品和收入,OpenAI 空手而归。对 Cognition 的战略意义很明确:Windsurf 补上了 Devin 缺失的那一半——同步 IDE 场景(Cascade Agent、SWE-1 模型家族、成熟的企业销售管道)。此后 Cognition 的产品矩阵变成了「异步云端 Agent(Devin)+ 同步 IDE(Windsurf)」的双轨结构,直接对标 Cursor 与 GitHub Copilot 的主战场。
5.2 融资与收入曲线
| 时间 | 事件 |
|---|---|
| 2024-03 | $21M A 轮(Founders Fund 领投) |
| 2024-04 | $175M,估值 $2B(报道口径,未独立核实) |
| 2025-08 | 约 $500M,估值 $9.8B |
| 2025-09 | $400M 轮 |
| 2026-05-27 | 超 $1B,估值 $26B(Lux Capital、General Catalyst、8VC 领投) |
伴随 2026 年 Series D 披露的数字:年化收入 4.92 亿美元;企业用量自 2026 年初增长超 10 倍;客户包括花旗、梅赛德斯-奔驰、高盛、Dell、桑坦德、美国陆军与美国海军;奔驰把一个人估 8 个月的遗留系统现代化项目压到了 8 天;拉美最大银行 Itaú 用 Devin 自动修复 70% 的安全漏洞;Cognition 自己 89% 的代码提交由 Devin 完成(其余由 Windsurf 本地 Agent 完成)。
读这些数字时保持职业怀疑:它们全部来自公司官方博客,没有第三方审计。但「能通过高盛、花旗、美军的安全与采购审查」这件事本身,是比任何 benchmark 都硬的能力证明——这些机构不会为一段 viral 视频付钱。
5.3 放到竞争格局里看
2026 年的代码 Agent 市场已经分层,Devin 的位置和邻居们:
| 产品 | 交互形态 | 自主程度 | 定价锚点 | 典型用户 |
|---|---|---|---|---|
| Devin | 云端异步,Slack/PR 交付 | 高(数小时无人值守) | $20 起 + ACU 计量 | 企业工程团队,批量任务 |
| Cursor | IDE 内同步 | 低(人盯每次改动) | $20/月席位 | 个人开发者 |
| Claude Code | 终端同步,可挂云任务 | 中(逐步授权) | 订阅 + API 计量 | 工程师个人与小团队 |
| OpenHands | 开源自托管 | 高(类 Devin) | 模型 API 成本 | 想自建/研究的团队 |
Devin 的差异化不在「更聪明」——模型层大家用的是同一批——而在三件事:异步长任务的产品化完整度、企业合规与采购通道(这是军方和银行客户选择它的实际原因)、以及收购 Windsurf 后「异步 + 同步」双轨覆盖。它的风险同样清晰:Anthropic 和 OpenAI 的自有 Agent 产品正在把同样的能力以更低的价格打进同一批客户。
怎么读厂商自报的案例数字
「8 个月压到 8 天」这类对比,分母通常是「人类团队按传统流程的最悲观估计」,分子通常不含需求澄清、环境准备和最终验收的人工时间。正确的用法不是记住倍数,而是记住任务类型:遗留系统现代化、安全漏洞批量修复、依赖升级——这类「定义清晰、量大、单体力智力含量低」的任务,正是当前自主 Agent 的甜点区。把 Agent 派去干这个,比让它「端到端开发新功能」靠谱得多。
六、争议与教训:自主性宣传 vs 现实差距
Devin 是研究「Agent 产品宣传学」的最佳样本,教训可以提炼成四条。
6.1 「AI 软件工程师」这个词本身就是问题
把产品命名为「工程师」,等于承诺了工程师的全集:理解模糊需求、权衡取舍、为结果负责。而 2024-2025 年的 Devin 实际交付的是「在良好定义的任务上有一定成功率的执行者」。命名与能力的落差,直接导致了舆论的反噬强度——如果它当初叫「Devin:自动化 PR 机器人」,不会有那样的轰动,也不会有那样的打假。给你的 Agent 产品起名时,名字承诺的就是用户的验收标准。
6.2 自主性是把双刃剑,纠偏点必须前移
Answer.AI 实测中最有教育意义的失败模式不是「做错了」,而是「在不可能的任务上奋战一整天」。全自主 + 长时程意味着错误假设会以小时为单位复利放大。Devin 2.0 用 Interactive Planning 把计划确认前置、用 IDE 允许人随时接管,本质是在架构上承认:当前的自主 Agent 需要的是『结构化的人类介入点』,而不是『更少的人类介入』。这正是 Human-in-the-Loop 设计的核心命题,也是 Agent 落地陷阱 里排在第一的那条。
6.3 口碑低谷不是终点,分发和信任重建才是长赛
按 2025 年初的舆论,Devin「已经死了」:演示造假、实测翻车、定价离谱。但 Cognition 做了三件对的事:把价格降到试用无门槛的区间;用 Wiki/Search 进入「代码库理解」这个成功率高得多的场景;用 Windsurf 收购拿到企业分发渠道。到 2026 年,它成了收入最高的 Agent 公司之一。教训是反直觉的:Agent 产品的竞争不在单次任务成功率,而在「失败成本 × 试错频率」的工程学——谁能把失败的代价降到足够低、让用户愿意持续试,谁就能等到模型能力追上来的那一天。
6.4 对基准和演示保持制度性怀疑
Devin 事件之后,行业的免疫反应是真实的:SWE-bench 官方推出了人工筛选的 Verified 子集和第三方托管评测;厂商自报数字普遍被默认打折扣;「放出完整 trace」逐渐成为可信发布的最低配置。如果你正在做自己的 Agent 评测,直接抄这个作业:公开任务集、公开完整轨迹、让第三方可复现——方法论见 Evals 实践。
七、对行业的正面推动
批评之外,必须承认 Devin 的历史贡献同样真实:
- 它把「全自主长任务 Agent」从科幻变成了品类。2024 年 3 月之前,主流叙事是 Copilot 式的补全;之后,「异步云端 Agent」成为每家厂商的标配——GitHub Copilot coding agent、Jules、OpenAI Codex(2025 版)、Claude Code 的云任务,全都是这个品类。
- 它教育了 SWE-bench。13.86% 的冲击力让这个学术基准变成行业标准,客观上推动了整个评测生态的成熟。
- 它蹚出了「沙箱 + PR 交付」的工程范式。云端隔离环境、以 PR 接入人类 review 流程,如今是所有同类产品的默认架构。
- 它贡献了最好的架构辩论文本。《Don't Build Multi-Agents》至今是 context engineering 领域被引用最多的工程博客之一。
- 它提供了完整的商业样本。从 $500 到 $20 的定价修正、从「替代人」到「工程杠杆」的定位修正、从产品公司到「agent lab + 模型训练」的形态演进——每一步都是可研究的决策案例。
八、小结
Devin 的故事不是一个「骗子现形记」,也不是「王者归来」的爽文,而是 Agent 行业第一份完整的压力测试报告:
- 宣传端,它演示了过度承诺的代价——能力是真的,但被夸大后,真实部分也会被当作假的;
- 产品端,它演示了自主性的正确打开方式——不是无人值守,而是把人类介入点设计进架构;
- 商业端,它演示了活到模型追上来的策略——降价、换场景、买渠道,然后等待。
对学习者,建议的打开方式是:去读一遍 Answer.AI 的实测原文,再读一遍 Cognition 的 Series D 博客,把两份材料里描述的同一家公司对照起来看——你会得到比任何二手评论都深刻的判断力。想动手体验同类架构,开源的 OpenHands 是最直接的平替;想理解底层循环,回到 Agent Loop 和 规划能力 这两页。
参考资料
- Introducing Devin, the first AI software engineer — Cognition —— 2024 年 3 月官方发布原文,含能力演示清单与 SWE-bench 声明
- SWE-bench technical report — Cognition —— 13.86% 成绩的官方技术报告,注意 25% 子集等限定条件
- Debunking Devin: "First AI Software Engineer" Upwork lie exposed! 相关报道 — 80 Level —— Internet of Bugs 打假视频事件的媒体记录
- Thoughts On A Month With Devin — Answer.AI —— 2025 年 1 月一个月 20 任务实测,14 失败 3 成功 3 无定论
- Devin 2.0 Explained — Analytics Vidhya —— Devin 2.0 新功能与降价的产品侧梳理
- Don't Build Multi-Agents — Cognition —— Cognition 的 context engineering 原则与反多智能体论证
- More Devins in More Places(Series D)— Cognition —— 2026 年 5 月 $26B 估值、$492M 年化收入与企业客户案例的官方披露
- Cognition revenue, valuation & funding — Sacra —— 第三方对 Cognition 融资史与收入的持续跟踪研究