Skip to content

Manus

本页速览 2025 年 3 月凭一支演示视频出圈的通用 AI Agent:邀请码被炒至数万元、自报 GAIA 三档 SOTA,一年后 20 亿美元卖身 Meta 又被中国监管叫停。本文拆解其多智能体架构、虚拟机沙箱,以及那篇被全行业转发的 Context Engineering 博客。

本页含时效性内容,数据截止于 2026-08;JD、价格、产品功能等信息可能已变化,引用前请核对原始出处。

Manus ​

Manus 是 2025 年 3 月由中国团队蝴蝶效应(Butterfly Effect,旗下产品 Monica)发布的通用 AI Agent 产品,名字取自拉丁语「手」,寓意把 AI 从「思考」延伸到「动手」。它是第一个以「通用 Agent」身份真正出圈的产品:发布当天全网求邀请码,二手平台最高炒到数万元,A 股一批「Manus 概念股」跟风涨停。

对学习者来说,Manus 的价值不只在产品本身。它后来的轨迹——爆火、融资、迁址新加坡、20 亿美元卖身 Meta、被中国监管叫停、2026 年 8 月恢复独立运营——几乎是一整部通用 Agent 赛道的浓缩史。而 Manus 团队 2025 年 7 月发表的 Context Engineering 博客,至今仍是构建生产级 Agent 最有价值的公开工程文献之一。

一、现象级发布:2025 年 3 月的出圈事件 ​

发布与传播 ​

2025 年 3 月 6 日凌晨,Monica.im 以一支演示视频发布 Manus,自称「全球首款通用型 AI Agent」。创始人肖弘是 90 后连续创业者(此前做过 Monica 浏览器插件),联合创始人兼首席科学家季逸超(Yichao 'Peak' Ji)是 NLP 老兵。演示中 Manus 展示了筛简历、做股票深度分析、调研房产、生成网站等能力,与聊天式 AI 的区别在于:它直接交付任务成果,而不只是给出建议。

传播烈度超出所有人预期:

  • 内测采用邀请制,官网因流量激增多次宕机;
  • 邀请码在二手平台被炒至 999 元到 5 万元不等,个别报道出现 8.8 万甚至 10 万元的天价挂单;
  • 微博热搜、营销号刷屏,一批跟 AI 关系不大的 A 股公司被列为「Manus 概念股」大涨;
  • 拿到邀请码的用户实测后口碑迅速分化:有人惊叹自动化能力,也有人遇到卡顿、迟缓、任务未完成。

饥饿营销是一把双刃剑

邀请制 + 演示视频的组合制造了稀缺感和传播爆点,但也透支了信任。当真实用户发现体验与演示视频存在差距时,「过度营销」「炒作」的反噬随之而来。后续所有 Agent 产品发布时,「是否开放实测」几乎成了媒体的第一问。

GAIA 成绩宣称:需要打折扣看 ​

Manus 官网宣称在 GAIA 基准(General AI Assistants,评估通用 AI 助手解决真实世界问题的能力)的全部三个难度级别上取得 SOTA,并给出了与 OpenAI Deep Research 的对比数字:

GAIA 难度级别Manus(自报)OpenAI Deep Research此前 SOTA
Level 1(基础任务)86.5%74.3%67.9%
Level 2(多步推理)70.1%69.1%67.4%
Level 3(复杂编排)57.7%47.6%42.3%

但有一个关键细节:发布时(2025 年 3 月 5 日截止的榜单数据)GAIA 官方榜单上并没有 Manus 的评测记录,这些数字是 Manus 自测自报的。自测 SOTA 在 Agent 行业并不少见(评测配置、pass@1 口径、工具预算都会影响结果),读任何 Agent 产品的 benchmark 宣传都应先看是否经过第三方复现。评测方法论的更多讨论见评测与 Evals。

二、产品定位:通用任务执行 ​

Manus 的定位可以概括成一句话:给 AI 一台云端电脑,让它替你干活。它不是垂直工具(只写代码、只做搜索),而是通用执行层,典型任务类型包括:

  • 深度研究:跨网站检索、阅读、综合,输出带引用的研究报告(对标 OpenAI Deep Research);
  • 数据分析:抓取数据、清洗、用 Python 分析、生成图表和报告;
  • 网站与应用生成:从需求描述直接生成并部署可访问的网站;
  • 办公自动化:筛简历、做 PPT、整理表格、比价、订行程。

产品形态上有几个值得注意的设计:

  • 云端异步执行:任务跑在 Manus 的云端虚拟机上,用户关掉浏览器任务照样继续,完成后收到通知。这与本地 Agent(如 Claude Code)是两种截然不同的产品哲学。
  • 过程可视化:用户可以实时看到 Agent 的操作回放——打开了哪个网页、执行了什么命令、正在写哪个文件。这种「看着 AI 干活」的透明感是它演示传播力强的核心原因。
  • 成果交付物导向:最终交付的是文件(报告、表格、网站),不是一段对话。

商业化上,Manus 采用订阅制,档位从每月 19 美元到 199 美元不等(2025 年 8 月披露口径),免费账户提供有限的基础额度。2025 年 8 月上线的 Wide Research 功能允许同时调度上百个子 Agent 并行处理大规模研究任务,被包含在 199 美元/月的顶级订阅中。

一次典型的 Manus 任务长什么样 ​

以「帮我分析特斯拉最新财报并生成一份带图表的研究报告」为例,任务的实际执行流程大致是:

  1. 规划:规划模块把需求拆成子目标,写入 todo.md(抓财报原文 → 提取关键财务数据 → 用 Python 画图 → 撰写报告 → 校验事实与引用)。
  2. 检索与浏览:Agent 在沙箱里驱动无头浏览器访问财报页面、新闻源和第三方数据源,遇到登录墙或反爬会自行换源。
  3. 数据处理:把抓到的数据存成沙箱内的文件,写 Python 脚本清洗、计算同比/环比、生成图表,脚本报错就自己读堆栈、改代码、重跑。
  4. 写作与组装:基于沙箱里的中间产物撰写报告,图表以文件形式引用。
  5. 交付:产出打包的文件(Markdown/HTML 报告 + 图表 + 数据表),同时保留完整的操作回放供用户审计。

整个过程中用户可以随时插话纠正方向——收到新输入时,Manus 会立即回复确认而不是闷头继续执行(这正是下文「工具掩码」一节提到的设计)。据参与早期实测的从业者估算,单个研究类任务的推理成本约 2 美元量级,约为同期 OpenAI Deep Research 的十分之一(该数字来自播客讨论,非官方披露,引用前请核对)。

三、技术架构:公开信息拼图 ​

Manus 没有开源,其架构信息来自官方介绍、团队访谈和第三方拆解,拼凑出来的图景大致如下:

┌──────────────────────── Manus 云端 ────────────────────────┐
│                                                             │
│  用户请求 ──> ┌──────────┐                                  │
│               │ 规划模块  │ 任务分解为子目标/todo.md         │
│               └────┬─────┘                                  │
│                    ▼                                        │
│         ┌─────────────────────┐      工具集(约 29 种)      │
│         │   执行 Agent Loop    │ ──> 浏览器(browser_*)     │
│         │ (多智能体协同:     │ ──> Shell(shell_*)        │
│         │   规划/执行/验证)   │ ──> 文件读写 / 代码执行      │
│         └────────┬────────────┘                             │
│                  ▼                                          │
│      ┌────────────────────────┐                             │
│      │  独立虚拟机沙箱(VM)   │  每个任务一台「云电脑」:     │
│      │  Linux 环境 + 文件系统 │  装软件、跑脚本、存中间产物   │
│      └────────────────────────┘                             │
│                                                             │
│  底层模型:Claude(主)+ 基于 Qwen 的微调模型(非自研底座)  │
└─────────────────────────────────────────────────────────────┘

几个要点:

  • 多智能体架构(Multiple Agent):官方称复杂任务被分解为规划、执行、验证等子模块,各模块由独立的模型支持,通过 API 协同。这与 Multi-Agent 架构一章讨论的主流形态一致。
  • 虚拟机沙箱:每个任务运行在独立的云端 Linux 虚拟机中,运行方式与 Anthropic 的 Computer Use 类似——Agent 拥有完整操作系统,可以装依赖、跑代码、操作浏览器,而不是只能调几个封装好的 API。截至 2025 年 12 月官方披露的数据,Manus 累计创建了超过 8000 万台虚拟计算机。
  • 不训底层模型:底层依赖 Claude 等前沿模型和基于通义千问(Qwen)的微调模型(2025 年 3 月 11 日 Manus 宣布与阿里通义千问团队达成战略合作)。这是它有意的战略选择,见下。

Context Engineering 博客:Manus 最重要的技术遗产 ​

2025 年 7 月 18 日,季逸超发表了《Context Engineering for AI Agents: Lessons from Building Manus》,公开了 Manus 的核心工程经验。文章开篇点题:团队曾面临「基于开源模型自训端到端 agentic 模型」还是「在前沿模型的 in-context learning 能力之上做工程」的抉择,最终选择后者——「如果模型进步是上涨的潮水,我们要做船,而不是钉在海底的柱子」。整个 Agent 框架为此重写过四次,团队自嘲这个过程叫「随机研究生下降」(Stochastic Graduate Descent)。

文中六条经验,条条都是生产环境换来的,这里提炼要点(更系统的展开见上下文工程):

1. 围绕 KV cache 设计(Design Around the KV-Cache) 季逸超认为 KV-cache 命中率是生产级 Agent 最重要的单一指标。Agent 的输入输出比极度失衡(Manus 平均约 100:1——上下文不断变长,而每步输出只是一个短的函数调用),缓存命中与否直接决定延迟和成本:以 Claude Sonnet 为例,缓存输入 token 0.3 美元/百万,未缓存 3 美元/百万,差 10 倍。实践要求:prompt 前缀保持稳定(别在 system prompt 开头放精确到秒的时间戳)、上下文只追加不修改(append-only)、JSON 序列化保持确定性、需要时显式标记 cache breakpoint。这条经验的成本含义在成本优化一章有进一步展开。

2. 用掩码而不是删除(Mask, Don't Remove) 工具数量膨胀时,直觉做法是用 RAG 动态加载工具,但 Manus 实验结论是:除非绝对必要,不要在迭代中途增删工具定义——工具定义位于上下文前部,任何变动都会让后续 KV cache 全部失效;且历史动作引用了已删除的工具名会让模型困惑。Manus 的解法是用上下文感知的状态机管理工具可用性,在解码阶段 mask 掉不允许的 token logits,工具定义本身保持不动。利用 response prefill 还能实现三种 function calling 约束模式(auto / required / specified)。配合刻意设计的命名约定(浏览器工具统一 browser_ 前缀、命令行工具统一 shell_ 前缀),可以在不写 stateful logits processor 的情况下按组约束动作空间。

3. 把文件系统当作终极上下文(Use the File System as Context) 128K 的 context window 在真实 agentic 场景里不够用甚至是负担:网页/PDF 等 observation 动辄超长、长上下文性能衰减、传输和 prefill 都烧钱。Manus 的做法是把文件系统当作无限大、可持久、Agent 自己可读写的「外置记忆」。压缩策略全部设计为可恢复:网页内容可以从上下文丢弃,只要保留 URL;文档内容可以省略,只要沙箱里留着路径。逻辑很硬:Agent 必须基于全部历史状态预测下一步,你无法预知哪条 observation 在十步之后变得关键,所以任何不可逆压缩都有风险。

4. 用复述操控注意力(Manipulate Attention Through Recitation) 用过 Manus 的人会注意到它处理复杂任务时总爱建一个 todo.md 并逐步打勾。这不是卖萌,是刻意的注意力操控:Manus 平均每个任务要调约 50 次工具,长循环中模型容易跑偏、遗忘最初目标。不断重写 todo 列表,等于把全局计划反复「复述」到上下文末尾,推入模型的近期注意力范围,规避 lost-in-the-middle 问题——不改架构,用自然语言把模型的焦点掰回任务目标。

5. 把错误留在上下文里(Keep the Wrong Stuff In) 多步任务中失败是常态而非异常。常见冲动是抹掉失败痕迹、重试或重置状态,但「擦除失败等于销毁证据」。把失败动作和对应的报错、堆栈留在上下文里,模型会隐式更新内部信念,降低重复同样错误的概率。季逸超认为错误恢复能力是真正的 agentic 行为最清晰的标志之一,而这恰恰是学术 benchmark 覆盖最弱的部分。

6. 别被自己的 few-shot 带沟里去(Don't Get Few-Shotted) 模型是出色的模仿者:上下文里全是相似的动作-观察对,它就会惯性重复这个模式,哪怕已不是最优。批量处理 20 份简历这类任务里,Agent 会陷入固定节奏,导致漂移、过度泛化甚至幻觉。Manus 的对策是在动作和观察的序列化模板、措辞、顺序和格式上注入少量结构化变化,用受控的随机性打破模式。

把六条经验落成代码 ​

下面这段骨架代码演示了如何在自己写的 Agent Loop 里同时落实其中四条经验(append-only 上下文、工具掩码、todo 复述、错误保留),可以直接作为实验起点:

python
# 一个体现 Manus 经验的极简 Agent Loop 骨架(伪代码,可对接任意 chat API)
SYSTEM_PROMPT = "你是一个通用任务执行 Agent。"  # 注意:不含时间戳,保持前缀稳定以命中 KV cache

# 工具定义一次性放入上下文前部,全程不增删 —— 保护 KV cache
TOOLS = [browser_open, browser_click, shell_exec, file_read, file_write]  # 命名带统一前缀

def agent_loop(task: str):
    context = [system(SYSTEM_PROMPT), user(task)]   # append-only:只追加,永不修改历史
    write_file("todo.md", f"# 任务目标\n{task}\n- [ ] 进行中")  # 复述:把目标写进文件

    step = 0
    while True:
        # 每 5 步把 todo.md 重新读进上下文末尾,对抗 lost-in-the-middle
        if step % 5 == 0:
            context.append(tool_result("file_read", read_file("todo.md")))

        # 工具掩码:工具定义不动,只按当前状态约束可选动作
        allowed = state_machine.allowed_tools()      # 例如收到用户插话时只允许「回复」
        action = model.chat(context, tools=TOOLS,
                            allowed_tools=allowed)   # 底层用 logits mask / prefill 实现

        try:
            observation = execute(action)            # 在沙箱中执行
        except Exception as e:
            observation = format_traceback(e)        # 错误保留:完整堆栈也进上下文
        context.append(assistant(action))
        context.append(tool_result(action.name, observation))
        step += 1

        if action.name == "finish":
            break

def compress(context):
    # 可恢复压缩:长 observation 丢弃正文,但保留 URL / 文件路径
    return [drop_body_keep_ref(m) if is_huge(m) else m for m in context]

注意这段代码里刻意没有做的事:没有在中途 del TOOLS[i]、没有重排历史消息、没有失败后重置 context。这三件事正是初学者最常犯、而 Manus 用真金白银的教训换来的禁忌。

为什么这篇文章值得精读

这六条经验覆盖了 Agent 工程里最贵的三类问题:成本与延迟(KV cache)、行为稳定性(工具掩码、防 few-shot 僵化)、长任务可靠性(文件系统外置记忆、复述、错误恢复)。它与 Anthropic 的《Effective Agents》《How we built our multi-agent research system》并列为 2025 年 Agent 工程领域被引用最多的实践文献。建议读原文,本文只是提炼。

四、商业与资本动态(截至 2026 年 8 月) ​

Manus 的资本故事比产品故事更跌宕,完整时间线如下:

时间事件
2023-02 / 2023-08真格基金种子轮(投后约 1400 万美元)与天使轮(投后约 5000 万美元)
2024-11A 轮融资,红杉中国、腾讯、真格基金、王慧文等参投,投后估值约 8500 万美元
2025-03-06Manus 发布,一夜爆红
2025-04Benchmark 领投 7500 万美元 B 轮,投后估值近 5 亿美元,约半年涨 5 倍
2025-06总部迁往新加坡,中国团队从约 120 人裁至约 40 人,官网屏蔽中国 IP
2025-08披露年化营收跑速约 9000 万美元;Benchmark 的投资因美国 AI 对外投资限制规则遭美国财政部审查
2025-12 月初官方披露累计处理超 147 万亿 token、创建超 8000 万台虚拟计算机;ARR 突破 1 亿美元,号称全球从零到 1 亿美元 ARR 最快的初创公司
2025-12-29/30Meta 宣布以超过 20 亿美元收购 Manus 母公司蝴蝶效应,创始人肖弘原计划出任 Meta 副总裁
2026-01-08中国商务部介入审查,评估技术出口合规性
2026-04-28国家发改委发布公告,收购案被叫停
2026-06彭博社报道 Meta 完成与 Manus 的运营隔离,停止数据共享,收购走向撤销
2026-08-11Manus 公告恢复以独立公司形式运营,腾讯等原股东牵头从中方财团回购股权;因收购当天及之后产生的部分用户数据安排删除/迁移

几个值得注意的点:

  • 迁址新加坡的争议:拿美国风投的钱、用美国模型的 API、屏蔽中国 IP、裁撤国内团队,这一系列「切割」动作在 2025 年年中引发了巨大舆论反弹,也为后来的监管审查埋下伏笔。
  • 中美监管的双向夹击:美国审查 Benchmark 对 Manus 的投资(担心触及对华 AI 投资限制),中国则叫停了 Meta 的收购。一家应用层 Agent 公司同时被两个大国监管盯上,这在 AI 行业还是头一遭。
  • 结果:折腾 16 个月后回到原点——独立运营,中国股东(腾讯牵头的财团)重新接盘,估值锚点仍是约 20 亿美元,但肖弘的 Meta 副总裁任命已成空谈。

一个耐人寻味的对比

Manus 靠「不训模型、只做应用层」证明了这条路能跑出最快的商业化速度(8 个月到 1 亿美元 ARR),但它的地缘遭遇也说明:应用层公司并不是中立地带——你用谁的模型、拿谁的钱、数据放在哪里,都会成为监管变量。这是 2026 年做 AI 出海创业必须纳入考量的现实约束。

五、争议:「套壳」之争 ​

Manus 从发布第一天起就背着「套壳」的质疑,这几乎是中文 AI 圈 2025 年上半年最大的口水战之一。

批评方的观点:Manus 没有自研底层模型,核心能力来自 Claude 等第三方 API,本质是「集成式操作系统」;邀请制是饥饿营销;全英文官网、要求海外支付,与「中国团队」的叙事自相矛盾;有开发者用开源项目 OpenManus(MetaGPT 团队出品)在很短时间内复现了其部分能力,说明护城河不深。

辩护方的观点:把任务拆解、工具编排、沙箱环境、上下文管理做到可用且稳定,本身就是极高门槛的工程能力。「做大模型和做应用的是两拨人」,应用层的价值不该被「套壳」二字抹杀。季逸超后来也公开说明产品使用了基于 Qwen 的微调模型,并非简单的 API 转发。

我的判断,分三层看:

  1. 「套壳」在技术上是事实,在商业上不是贬义。 Manus 团队自己也从不讳言——Context Engineering 博客开篇就讲了「做潮水上的船」的选择。真正的问题是:模型厂商会不会顺手把应用层吃掉?OpenAI 的 Operator 和 Deep Research、Anthropic 的 Claude Agent 能力在 2025 年快速跟进,说明这个威胁是真实的。
  2. 护城河的部分答案藏在工程细节里。 OpenManus 能复现界面和流程,但复现不了 KV cache 命中率、工具掩码状态机、可恢复压缩这些在数百万用户规模上调出来的工程参数。Context Engineering 博客之所以影响巨大,恰恰因为它展示了「壳」的厚度。
  3. 但纯应用层护城河确实有限。 Manus 最终选择卖身 Meta(以及后来回归中国资本),某种程度上印证了独立通用 Agent 产品在巨头夹击下的生存压力。对比 Devin 在垂直编程场景的深耕,通用 Agent 的差异化更难建立。

这场争论的行业价值在于:它把「模型能力 vs 工程价值」这对矛盾摆上了台面,此后一年所有 Agent 创业公司的融资 BP 里,几乎都有一页在回答「你的护城河是什么」。

六、对通用 Agent 赛道的意义 ​

抛开争议,Manus 在这个行业的历史上留下了几个抹不掉的坐标:

  1. 定义了通用 Agent 的产品范式。 「云端虚拟机沙箱 + 工具调用 + 异步执行 + 过程回放 + 交付文件」这套组合,此后成为通用 Agent 产品的标准配置。今天看各家产品,处处都有 Manus 的影子。
  2. 完成了大众层面对 Agent 的第一次市场教育。 在 Manus 之前,「AI Agent」对多数人是抽象概念;它用「看着 AI 替你干活」的直观体验,让「从聊天到干活」这个转变深入人心。如果你觉得什么是 AI Agent里的定义抽象,Manus 的演示视频就是最好的注解。
  3. 贡献了最有价值的工程方法论之一。 Context Engineering 博客把「上下文工程」这个词推成了行业标准术语,其经验(KV cache 优先、工具掩码、文件系统作上下文、错误保留)已经成为 Agent Loop 设计的必修课。
  4. 提供了营销与发布的教科书级案例(正反两面)。 邀请制饥饿营销的传播效率与信任反噬同样惊人,后来者如 Manus 的同类产品和开源复现 都吸取了教训。
  5. 成为地缘博弈下 AI 应用公司的首个完整样本。 从中国团队起步、拿美元基金、迁址新加坡、被美国巨头收购、被中国监管叫停、回归中国资本——这条 16 个月的曲线,是理解 2026 年 AI 创业环境绕不开的案例。

对想动手的学习者,最直接的 takeaway 是:把 Context Engineering 那六条经验读透,然后在亲手构建一个 Agent 的实践中逐条验证——它们比任何框架教程都更接近生产环境的真实问题。

参考资料 ​