Meta 超级智能实验室(Meta Superintelligence Labs,MSL)正式发布了 Muse Spark 1.1,这是 Muse Spark 系列模型的最新版本,也是对 Muse Spark(1.0)的一次重大升级。
官方将其定义为面向智能体任务(agentic tasks)的多模态推理模型,主要提升集中在三个方向:工具与计算机使用(tool and computer use)、编码(coding)、多模态理解(multimodal understanding)。
与此同时,Meta 还推出了全新的 Meta Model API(公开预览版),开发者首次可以通过 API 接入 Muse Spark 1.1。模型目前已上线 Meta AI app("Thinking" 模式)和 meta.ai。
核心定位
官方对 Muse Spark 1.1 的表述要点:
- 多模态推理模型,面向智能体(agentic)任务设计。
- 上下文窗口 1 百万 token(1M tokens),并且模型可以主动管理该上下文:记忆动作、从更早的工作中检索信息,并在压缩时保留后续工作所需的关键步骤。
- 零样本(zero-shot)泛化到新的原生工具、MCP server 和自定义技能(custom skills)。
- 官方称其推进了"性能—效率前沿"(performance-efficiency frontier)。
- 产品愿景定位为"个人超级智能"(personal superintelligence)。

关键能力分项说明

Agents(智能体)
- 在需要跨多个外部 app 和服务进行规划与编排的个人智能体任务上表现优异。
- 零样本泛化到新的原生工具、MCP server、自定义技能。
- 相比 Muse Spark(1.0),处理复杂项目的速度显著更快。模型被训练为编排多智能体系统,以优化端到端延迟。
- 作为主智能体(main agent):收集上下文、制定计划、把执行委派给并行子智能体。
- 作为子智能体(subagent):恪守自身职责,理解可用工具,知道何时向上回交给主智能体。
- 可主动管理 1M token 上下文窗口:记忆动作、从早期工作中检索、压缩时保留后续关键步骤。
Computer Use(计算机使用)
- 擅长跨多个应用、信息实时变化的计算机使用工作流,能在长会话中保持上下文,适应不断变化的需求,在陌生界面中导航时将人工干预降到最低。
- 不再逐个点击、逐步推理,转而判断何时该自动化、何时该直接用界面:训练模型在"写脚本更快"时写脚本,在"直接交互更简单"时点击,并能在每一步生成批量动作。
- 演示案例(官方视频): "Agentic dinner party organization"(智能体组织晚宴)——真实场景中会出现改变任务的新上下文;Muse Spark 1.1 在下单时注意到这些变化并主动更新,无需用户介入。
Coding(编码)
- 在涉及大型、复杂代码库的真实任务上,编码能力有实质性提升。
- 能诊断和修复复杂 bug、在企业级系统中实现新功能、执行大型代码迁移。
- 在创建 Web 应用、端到端问答等用例上,相比 1.0 有大幅提升。
- 训练为能平滑适配多种 harness,可靠处理复杂的多轮动态,支持流行的智能体编码配置,常见特性包括:planning mode、goal conditioning、subagent delegation、context compaction。
- 演示案例(OpenCode 中 Debugging): Muse Spark 1.1 构建一个聊天 Web 应用,自动截图以识别用户可见的故障,回溯到相关代码实施修复并验证,过程中同时调用编码、多模态理解与工具调用能力。
- Meta 内部使用: Meta 内部开发者和研究人员日常使用 Muse Spark 1.1。在内部主要编码评测 Meta Internal Coding Bench 上,Muse Spark 1.1 显著优于 Muse Spark,并与领先竞品相当。研究人员也开始用它自动化模型开发与评测任务。
- 演示案例(OpenCode 中 DeepSWE 评测): Muse Spark 1.1 在一组 DeepSWE 任务上自我评测(不同推理强度),并基于结果生成分析仪表盘。
Multimodal(多模态)
- 在感知(perception)、多模态推理、工具使用上表现优异,可与真实环境交互并产出有事实依据(grounded)的输出。
- 强项:视觉转代码工件生成(visual-to-code artifact generation)、超细粒度图像/视频字幕(ultra-descriptive captioning)、多模态用例的智能体工作流执行。
- 在感知与动作需要同时发生的场景尤其有价值:模型可检查视觉与音频、在长工作流中保留细节,并在代为操作计算机时利用这些细节。
- 演示案例(Facebook Marketplace 智能体): 用手机拍摄的视频,Muse Spark 1.1 提取有用照片、对产品进行推理,并操作用户浏览器代为发布 Facebook Marketplace 商品上架信息。

安全评估(基于 Advanced AI Scaling Framework)
Meta 依据其 Advanced AI Scaling Framework 对 Muse Spark 1.1 进行了部署前的广泛安全评测。该框架为最先进模型定义了评测、威胁模型和部署阈值。
总体结论
- 经防护措施后,Muse Spark 1.1 在 Chemical & Biological(化学与生物)、Cybersecurity(网络安全)、Loss of Control(失控) 三个前沿风险领域,残余风险均为 中等或更低(moderate or lower)。
- 防护前(unmitigated):模型在 Chemical & Biological 达到 高风险(high) 阈值;在 Cybersecurity 不能排除触及高风险阈值的可能;Loss of Control 仍为中等或更低。
- 防护后(mitigated):三个领域残余风险均降至中等或更低,因此正式发布。

各领域要点
- Chemical & Biological: 相比 1.0 能力有所增强,但没有出现此前 Muse Spark Safety & Preparedness Report 中未提到过的新类型风险;通过针对性防护措施(含 API 部署的新增防护)将残余风险降至中等或更低。
- Cybersecurity: 相比 1.0 在网络任务上更强,防护前达到高风险阈值;通过多层防护(持续拒绝提供进攻性网络滥用信息、对长期恶意使用进行可扩展的阻拦)将残余风险降至中等或更低。
- Loss of Control: 评估为中等或更低,模型没有表现出走失控路径所需的能力和意愿。
对抗鲁棒性(Adversarial Robustness)
- 在内容安全、越狱(jailbreak)、Agent 滥用、prompt injection(提示注入)等评测中,相比 1.0 鲁棒性大幅提升,官方称接近同类模型的 SOTA 水平。
- 第三方红队验证:相比其他主流模型,Muse Spark 1.1 风险更低、拒绝行为更平衡。
- 官方建议:部署时配合系统级控制(应用层策略防护、严格工具白名单、工作区隔离)。
Benchmark 表现
数据来源:Muse Spark 1.1 Evaluation Report(Table 1 / Table 2 / Table 6)。 对比模型均为通过各自 API、以高推理强度(reasoning effort)评测,部分评测因 Claude 拒绝率高而未报告 Claude。
能力类(与灾难性风险相关)
| 领域 | 评测项 | Muse Spark 1.1 | Muse Spark 1.0 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|
| Chemical & Biological | MBCT | 53.2 | 54.4 | 56.0 | – | 46.2 |
| VCT | 52.0 | 49.7 | 52.1 | – | 44.6 | |
| HPCT | 61.9 | 55.7 | 67.7 | – | 62.9 | |
| WMDP-Bio | 89.0 | 88.4 | 90.4 | – | 89.5 | |
| WMDP-Chem | 87.0 | 85.6 | 85.5 | – | 86.3 | |
| ProtocolQA | 88.0 | 87.3 | 78.2 | – | 88.9 | |
| SeqQA(agentic) | 98.2 | 97.3 | 98.2 | – | 95.4 | |
| ABC Bench(Fragment Design) | 97.0 | 96.8 | 92.2 | – | 95.8 | |
| ABC Bench(Liquid Handling) | 93.7 | 92.3 | 93.2 | – | 99.2 | |
| ABC Bench(Screening Evasion) | 63.2 | 54.1 | – | – | – | |
| BioDesign Tools(avg) | 55.2 | 39.2 | 67.4 | – | 62.4 | |
| Cybersecurity | Cybench(pass@1) | 92.9 | 65.4 | 100.0 | 95.0 | – |
| Curated CTFs(pass@1) | 89.9 | 72.0 | – | – | – | |
| CyberGym(pass@1) | 59.0 | 43.5 | 81.8 | 78.8 | – | |
| ExploitGym(pass@1) | 0.8 | – | 14.8 | – | 1.4 | |
| CyScenarioBench(pass@1) | 0.5 | 0.0 | 26.0 | 16.6 | – | |
| Social Engineering | 5.1 | – | 1.2 | 7.1 | 13.7 | |
| AIRS-Bench | 77.0 | – | 86.0 | 84.0 | 83.0 | |
| Loss of Control | SHADE-Arena | 6.8 | – | 0.5 | 7.6 | 1.6 |
| GDM-Stealth(of 4) | 2/4 | 1/4 | 1/4 | 0/4 | 3/4 | |
| GDM Situational Awareness | 55.1 | 29.3 | 60.0 | 53.1 | 54.5 |
Table 1 来源说明:为评测能力子集快照;部分 Chemical & Biological 项因 Claude 拒绝率高未报告 Claude。加粗为最高能力值。

AIRS-Bench(端到端研究能力,Table 6)
| 模型 | 有效提交率(%)↑ | 平均归一化分数(≥0)↑ |
|---|---|---|
| Muse Spark 1.1 | 99.00 ± 2.00 | 0.77 ± 0.08 |
| GPT-5.5 | 100.00 ± 0.00 | 0.87 ± 0.08 |
| Claude Opus 4.8 | 100.00 ± 0.00 | 0.84 ± 0.06 |
| Gemini 3.1 Pro | 99.00 ± 0.00 | 0.83 ± 0.01 * |
分数含义:1.0 = 匹配人类 SOTA,>1.0 = 超越人类 SOTA。* 取自 Muse Spark Safety & Preparedness Report,按 10 个 seed 计算(其余为 5 个)。

安全 / 鲁棒性 / 行为倾向(Table 2)
| 领域 | 评测项 | Muse Spark 1.1 | Muse Spark 1.0 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|
| Chemical & Biological(拒绝率) | BioTIER | 97.7 | 98.0 | 69.2 | 94.9 | 57.7 |
| Chemical Agents | 99.8 | 99.4 | 97.0 | 96.4 | 96.8 | |
| Cybersecurity(滥用 ASR) | Cyber Misuse Chat(ASR) | 2.8 | – | 39.1 | 42.5 | 31.6 |
| Catastrophic Cyber Misuse(ASR) | 3.9 | – | 18.1 | 20.1 | 3.1 | |
| Poly-Guard Bench(ASR) | 6.9 | – | 48.4 | 28.1 | 46.2 | |
| Loss of Control | MASK | 95.7 | 89.1 | 90.1 | 94.4 | 40.5 |
| Agentic Misalignment | 1.1 | 47.7 | 0.0 | 0.0 | 52.6 | |
| Jailbreak | StrongREJECT v2(ASR) | 0.5 | 25.2 | 0.5 | 4.5 | 51.0 |
| FORTRESS(ARS) | 12.3 | 20.2 | 16.3 | 18.2 | 29.8 | |
| Agent Robustness | AgentHarm(ASR) | 3.4 | – | 1.5 | 0.0 | 20.4 |
| AgentDojo(pass@1 ASR) | 0.7 | 11.9 | 1.2 | 0.5 | 3.3 | |
| GraySwan ART(pass@1 ASR) | 0.3 | 6.1 | 0.8 | 0.1 | 1.0 | |
| False Refusals | OR-Bench(FRR) | 4.8 | 8.0 | 6.7 | 3.3 | 2.5 |
| Cyber Misuse Chat(FRR) | 5.7 | 11.0 | 1.3 | 2.2 | 0.1 | |
| AgentHarm Verified(benign)(FRR) | 16.5 | – | 21.6 | 37.5 | 5.7 | |
| Model Behavior | SAVE-Bench(编码 Agent 风险升级) | 90.7 | – | 32.2 | 85.9 | 17.8 |
| Internal Sycophancy | 49.2 | 57.9 | 45.5 | 32.4 | 65.6 | |
| DeceptionBench(Honesty) | 0.1 | – | 0.7 | 0.1 | 25.5 | |
| HLE Calibration(Miscalibration) | 23.4 | 50.3 | 44.2 | 26.5 | 50.4 | |
| Alignment Faking(Scheming) | -0.2 | 1.8 | 0.6 | 0.2 | 14.0 |
Table 2 来源说明:ASR = Attack Success Rate(攻击成功率,越低越好);FRR = False Refusal Rate(误拒率,越低越好);加粗为最佳安全表现。

软件工程 / 编码定性结论(来自报告正文)
- 在 SWE-Bench Verified Hard 上,Muse Spark 1.1 至少一次解决了 42 个独立任务中的 24 个,刚超过能力检查点阈值("解决超过一半独立任务")。
- 在 Terminal-Bench 2.1、SWE-Bench Pro 等编码基准上,落后于 Claude Opus 4.8 和/或 GPT-5.5。
- 在 DeepSWE、DeepSearchQA 等长周期智能体任务上,相对 1.0 有显著改进,但仍落后于或持平于表现最好的竞品。
- AIRS-Bench(端到端研究生命周期):归一化分数 0.77,低于 GPT-5.5(0.87)、Claude Opus 4.8(0.84)、Gemini 3.1 Pro(0.83),模型仍不足以持续自动化 AI R&D 关键任务。
General Capabilities 评测范围(第 5 节,逐项方法)
报告第 5 节覆盖以下基准,但具体分数多以图表形式呈现(见原文 figures),文本未逐一列出数值:
- Agents: OSWorld-Verified、OSWorld 2.0、WebArena-Verified、GDPval-AA、JobBench、MCP Atlas、Toolathlon-Verified、DeepSearchQA、WideSearch、Finance Agent v2
- Coding: Terminal-Bench 2.1、SWE-Bench Pro、DeepSWE v1.1、VibeCodeBench v1.1
- Health: HealthBench Pro
- Multimodal: CharXiv Reasoning、BabyVision
- Reasoning: Humanity's Last Exam(HLE)、MRCR v2(1M context 8-needle 检索)
评测设置:Muse Spark 1.1 全部通过 Meta Model API,使用 xhigh 推理强度;对比模型取其各自最高推理强度(Gemini=high、Claude=max adaptive、GPT=xhigh)。
定价与接入方式

Meta Model API(公开预览)
- 面向开发者首次开放,自助式(self-serve),OpenAI SDK 兼容(OpenAI-compatible)。
- 定价(按量付费):输入 $1.25 / 百万 token,输出 $4.25 / 百万 token。
- 注册即赠 $20 一次性免费额度。
- 内置 web search grounding(联网搜索 + 引用):在任意 Responses API 调用中加
{"type": "web_search"}工具即可获取实时信息,并生成带引用的答案。 - 支持视觉输入(如 base64 编码 PNG)。
- 目前面向美国地区开发者。
官方资源
- 博客(产品):https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
- 评测报告(PDF):https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report
- 评测方法论:https://ai.meta.com/static-resource/muse-spark-1-1-eval-methodology
- 开发者指南:https://developer.meta.com/ai/resources/blog/build-with-muse-spark
早期合作伙伴反馈
官方在博客中引用了三位早期合作伙伴的评价:
"Muse Spark 最让人印象深刻的是它把多少东西塞进了一个模型:百万级 token 上下文、完整多模态支持(图像、视频、PDF)、内置带引用的搜索、强推理、顶级编码能力(尤其是前端和设计)、结构化输出、并行工具调用——全部在一个干净的 OpenAI 兼容包里。一个完整的智能体地基。" —— Amjad Masad,Replit CEO
"Meta 显然是在为严肃的智能体编码而造——强工具使用,加上一个让大规模真实编码工作负载在经济上可行的价格点。这种组合很少见,也正是我们希望 Cline 开发者能尽早用上的原因。" —— Saoud Rizwan,Cline CEO
"在我们的企业工作评测集上测试时,Muse Spark 展现出与当今领先前沿模型相当的企业级能力。这种智能水平,结合它在跨行业(专业服务、公共部门、工业运营)结构化、流程化工作流上的优势,使其对组织很有吸引力。" —— Yashodha Bhavnani,Box AI 产品副总裁
参考链接
- 官方博客(Introducing Muse Spark 1.1):https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
- Muse Spark 1.1 Evaluation Report(一手评测报告,PDF):https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report
- Evaluation Methodology:https://ai.meta.com/static-resource/muse-spark-1-1-eval-methodology
- 开发者指南(Build with Muse Spark on Meta Model API):https://developer.meta.com/ai/resources/blog/build-with-muse-spark
- Meta Advanced AI Scaling Framework:https://ai.meta.com/static-resource/Meta_Advanced-AI-Scaling-Framework-v2
