Luxsynthesis Blog
返回全部
模型

Muse Spark 1.1 发布:Meta 推出多模态推理模型,并上线全新 Meta Model API

Meta 超级智能实验室发布 Muse Spark 1.1,面向智能体任务的多模态推理模型,上下文窗口 1M token,并在工具使用、编码、多模态理解上大幅提升。同步推出 OpenAI SDK 兼容的 Meta Model API,输入 $1.25 / 百万 token。

作者
Luxsynthesis
发布日期
阅读时长
12 分钟阅读
Muse Spark 1.1 发布:Meta 推出多模态推理模型,并上线全新 Meta Model API

Meta 超级智能实验室(Meta Superintelligence Labs,MSL)正式发布了 Muse Spark 1.1,这是 Muse Spark 系列模型的最新版本,也是对 Muse Spark(1.0)的一次重大升级。

官方将其定义为面向智能体任务(agentic tasks)的多模态推理模型,主要提升集中在三个方向:工具与计算机使用(tool and computer use)、编码(coding)、多模态理解(multimodal understanding)。

与此同时,Meta 还推出了全新的 Meta Model API(公开预览版),开发者首次可以通过 API 接入 Muse Spark 1.1。模型目前已上线 Meta AI app("Thinking" 模式)和 meta.ai。


核心定位

官方对 Muse Spark 1.1 的表述要点:

  • 多模态推理模型,面向智能体(agentic)任务设计。
  • 上下文窗口 1 百万 token(1M tokens),并且模型可以主动管理该上下文:记忆动作、从更早的工作中检索信息,并在压缩时保留后续工作所需的关键步骤。
  • 零样本(zero-shot)泛化到新的原生工具、MCP server 和自定义技能(custom skills)。
  • 官方称其推进了"性能—效率前沿"(performance-efficiency frontier)。
  • 产品愿景定位为"个人超级智能"(personal superintelligence)。

Muse Spark 1.1 核心定位:一个统一的智能核心,通过有机分支网络编排编码、计算机使用、多模态理解等多种能力,并主动管理 1M token 超长上下文


关键能力分项说明

主智能体(main agent)编排多个并行子智能体(subagent)的多智能体系统拓扑

Agents(智能体)

  • 在需要跨多个外部 app 和服务进行规划与编排的个人智能体任务上表现优异。
  • 零样本泛化到新的原生工具、MCP server、自定义技能。
  • 相比 Muse Spark(1.0),处理复杂项目的速度显著更快。模型被训练为编排多智能体系统,以优化端到端延迟。
    • 作为主智能体(main agent):收集上下文、制定计划、把执行委派给并行子智能体。
    • 作为子智能体(subagent):恪守自身职责,理解可用工具,知道何时向上回交给主智能体。
  • 可主动管理 1M token 上下文窗口:记忆动作、从早期工作中检索、压缩时保留后续关键步骤。

Computer Use(计算机使用)

  • 擅长跨多个应用、信息实时变化的计算机使用工作流,能在长会话中保持上下文,适应不断变化的需求,在陌生界面中导航时将人工干预降到最低。
  • 不再逐个点击、逐步推理,转而判断何时该自动化、何时该直接用界面:训练模型在"写脚本更快"时写脚本,在"直接交互更简单"时点击,并能在每一步生成批量动作。
  • 演示案例(官方视频): "Agentic dinner party organization"(智能体组织晚宴)——真实场景中会出现改变任务的新上下文;Muse Spark 1.1 在下单时注意到这些变化并主动更新,无需用户介入。

Coding(编码)

  • 在涉及大型、复杂代码库的真实任务上,编码能力有实质性提升。
  • 能诊断和修复复杂 bug、在企业级系统中实现新功能、执行大型代码迁移。
  • 在创建 Web 应用、端到端问答等用例上,相比 1.0 有大幅提升。
  • 训练为能平滑适配多种 harness,可靠处理复杂的多轮动态,支持流行的智能体编码配置,常见特性包括:planning mode、goal conditioning、subagent delegation、context compaction。
  • 演示案例(OpenCode 中 Debugging): Muse Spark 1.1 构建一个聊天 Web 应用,自动截图以识别用户可见的故障,回溯到相关代码实施修复并验证,过程中同时调用编码、多模态理解与工具调用能力。
  • Meta 内部使用: Meta 内部开发者和研究人员日常使用 Muse Spark 1.1。在内部主要编码评测 Meta Internal Coding Bench 上,Muse Spark 1.1 显著优于 Muse Spark,并与领先竞品相当。研究人员也开始用它自动化模型开发与评测任务。
  • 演示案例(OpenCode 中 DeepSWE 评测): Muse Spark 1.1 在一组 DeepSWE 任务上自我评测(不同推理强度),并基于结果生成分析仪表盘。

Multimodal(多模态)

  • 在感知(perception)、多模态推理、工具使用上表现优异,可与真实环境交互并产出有事实依据(grounded)的输出。
  • 强项:视觉转代码工件生成(visual-to-code artifact generation)、超细粒度图像/视频字幕(ultra-descriptive captioning)、多模态用例的智能体工作流执行。
  • 感知与动作需要同时发生的场景尤其有价值:模型可检查视觉与音频、在长工作流中保留细节,并在代为操作计算机时利用这些细节。
  • 演示案例(Facebook Marketplace 智能体): 用手机拍摄的视频,Muse Spark 1.1 提取有用照片、对产品进行推理,并操作用户浏览器代为发布 Facebook Marketplace 商品上架信息。

感知与动作同时发生:一个感知核心实时观察、理解并在多个应用界面间自主导航操作


安全评估(基于 Advanced AI Scaling Framework)

Meta 依据其 Advanced AI Scaling Framework 对 Muse Spark 1.1 进行了部署前的广泛安全评测。该框架为最先进模型定义了评测、威胁模型和部署阈值。

总体结论

  • 经防护措施后,Muse Spark 1.1 在 Chemical & Biological(化学与生物)Cybersecurity(网络安全)Loss of Control(失控) 三个前沿风险领域,残余风险均为 中等或更低(moderate or lower)
  • 防护前(unmitigated):模型在 Chemical & Biological 达到 高风险(high) 阈值;在 Cybersecurity 不能排除触及高风险阈值的可能;Loss of Control 仍为中等或更低。
  • 防护后(mitigated):三个领域残余风险均降至中等或更低,因此正式发布。

前沿风险:防护前 vs 防护后

各领域要点

  • Chemical & Biological: 相比 1.0 能力有所增强,但没有出现此前 Muse Spark Safety & Preparedness Report 中未提到过的新类型风险;通过针对性防护措施(含 API 部署的新增防护)将残余风险降至中等或更低。
  • Cybersecurity: 相比 1.0 在网络任务上更强,防护前达到高风险阈值;通过多层防护(持续拒绝提供进攻性网络滥用信息、对长期恶意使用进行可扩展的阻拦)将残余风险降至中等或更低。
  • Loss of Control: 评估为中等或更低,模型没有表现出走失控路径所需的能力和意愿。

对抗鲁棒性(Adversarial Robustness)

  • 在内容安全、越狱(jailbreak)、Agent 滥用、prompt injection(提示注入)等评测中,相比 1.0 鲁棒性大幅提升,官方称接近同类模型的 SOTA 水平。
  • 第三方红队验证:相比其他主流模型,Muse Spark 1.1 风险更低、拒绝行为更平衡。
  • 官方建议:部署时配合系统级控制(应用层策略防护、严格工具白名单、工作区隔离)。

Benchmark 表现

数据来源:Muse Spark 1.1 Evaluation Report(Table 1 / Table 2 / Table 6)。 对比模型均为通过各自 API、以高推理强度(reasoning effort)评测,部分评测因 Claude 拒绝率高而未报告 Claude。

能力类(与灾难性风险相关)

领域评测项Muse Spark 1.1Muse Spark 1.0GPT-5.5Claude Opus 4.8Gemini 3.1 Pro
Chemical & BiologicalMBCT53.254.456.046.2
VCT52.049.752.144.6
HPCT61.955.767.762.9
WMDP-Bio89.088.490.489.5
WMDP-Chem87.085.685.586.3
ProtocolQA88.087.378.288.9
SeqQA(agentic)98.297.398.295.4
ABC Bench(Fragment Design)97.096.892.295.8
ABC Bench(Liquid Handling)93.792.393.299.2
ABC Bench(Screening Evasion)63.254.1
BioDesign Tools(avg)55.239.267.462.4
CybersecurityCybench(pass@1)92.965.4100.095.0
Curated CTFs(pass@1)89.972.0
CyberGym(pass@1)59.043.581.878.8
ExploitGym(pass@1)0.814.81.4
CyScenarioBench(pass@1)0.50.026.016.6
Social Engineering5.11.27.113.7
AIRS-Bench77.086.084.083.0
Loss of ControlSHADE-Arena6.80.57.61.6
GDM-Stealth(of 4)2/41/41/40/43/4
GDM Situational Awareness55.129.360.053.154.5

Table 1 来源说明:为评测能力子集快照;部分 Chemical & Biological 项因 Claude 拒绝率高未报告 Claude。加粗为最高能力值。

网络安全能力:Muse Spark 1.0 → 1.1 的跃升

AIRS-Bench(端到端研究能力,Table 6)

模型有效提交率(%)↑平均归一化分数(≥0)↑
Muse Spark 1.199.00 ± 2.000.77 ± 0.08
GPT-5.5100.00 ± 0.000.87 ± 0.08
Claude Opus 4.8100.00 ± 0.000.84 ± 0.06
Gemini 3.1 Pro99.00 ± 0.000.83 ± 0.01 *

分数含义:1.0 = 匹配人类 SOTA,>1.0 = 超越人类 SOTA。* 取自 Muse Spark Safety & Preparedness Report,按 10 个 seed 计算(其余为 5 个)。

AIRS-Bench:端到端研究能力对比

安全 / 鲁棒性 / 行为倾向(Table 2)

领域评测项Muse Spark 1.1Muse Spark 1.0GPT-5.5Claude Opus 4.8Gemini 3.1 Pro
Chemical & Biological(拒绝率)BioTIER97.798.069.294.957.7
Chemical Agents99.899.497.096.496.8
Cybersecurity(滥用 ASR)Cyber Misuse Chat(ASR)2.839.142.531.6
Catastrophic Cyber Misuse(ASR)3.918.120.13.1
Poly-Guard Bench(ASR)6.948.428.146.2
Loss of ControlMASK95.789.190.194.440.5
Agentic Misalignment1.147.70.00.052.6
JailbreakStrongREJECT v2(ASR)0.525.20.54.551.0
FORTRESS(ARS)12.320.216.318.229.8
Agent RobustnessAgentHarm(ASR)3.41.50.020.4
AgentDojo(pass@1 ASR)0.711.91.20.53.3
GraySwan ART(pass@1 ASR)0.36.10.80.11.0
False RefusalsOR-Bench(FRR)4.88.06.73.32.5
Cyber Misuse Chat(FRR)5.711.01.32.20.1
AgentHarm Verified(benign)(FRR)16.521.637.55.7
Model BehaviorSAVE-Bench(编码 Agent 风险升级)90.732.285.917.8
Internal Sycophancy49.257.945.532.465.6
DeceptionBench(Honesty)0.10.70.125.5
HLE Calibration(Miscalibration)23.450.344.226.550.4
Alignment Faking(Scheming)-0.21.80.60.214.0

Table 2 来源说明:ASR = Attack Success Rate(攻击成功率,越低越好);FRR = False Refusal Rate(误拒率,越低越好);加粗为最佳安全表现。

对抗鲁棒性:攻击成功率(ASR)对比

软件工程 / 编码定性结论(来自报告正文)

  • SWE-Bench Verified Hard 上,Muse Spark 1.1 至少一次解决了 42 个独立任务中的 24 个,刚超过能力检查点阈值("解决超过一半独立任务")。
  • Terminal-Bench 2.1SWE-Bench Pro 等编码基准上,落后于 Claude Opus 4.8 和/或 GPT-5.5
  • DeepSWEDeepSearchQA 等长周期智能体任务上,相对 1.0 有显著改进,但仍落后于或持平于表现最好的竞品
  • AIRS-Bench(端到端研究生命周期):归一化分数 0.77,低于 GPT-5.5(0.87)、Claude Opus 4.8(0.84)、Gemini 3.1 Pro(0.83),模型仍不足以持续自动化 AI R&D 关键任务。

General Capabilities 评测范围(第 5 节,逐项方法)

报告第 5 节覆盖以下基准,但具体分数多以图表形式呈现(见原文 figures),文本未逐一列出数值:

  • Agents: OSWorld-Verified、OSWorld 2.0、WebArena-Verified、GDPval-AA、JobBench、MCP Atlas、Toolathlon-Verified、DeepSearchQA、WideSearch、Finance Agent v2
  • Coding: Terminal-Bench 2.1、SWE-Bench Pro、DeepSWE v1.1、VibeCodeBench v1.1
  • Health: HealthBench Pro
  • Multimodal: CharXiv Reasoning、BabyVision
  • Reasoning: Humanity's Last Exam(HLE)、MRCR v2(1M context 8-needle 检索)

评测设置:Muse Spark 1.1 全部通过 Meta Model API,使用 xhigh 推理强度;对比模型取其各自最高推理强度(Gemini=high、Claude=max adaptive、GPT=xhigh)。


定价与接入方式

Meta Model API:OpenAI SDK 兼容的统一开发者入口,背后连接联网搜索、视觉输入与按量计量

Meta Model API(公开预览)

  • 面向开发者首次开放,自助式(self-serve),OpenAI SDK 兼容(OpenAI-compatible)。
  • 定价(按量付费):输入 $1.25 / 百万 token,输出 $4.25 / 百万 token
  • 注册即赠 $20 一次性免费额度
  • 内置 web search grounding(联网搜索 + 引用):在任意 Responses API 调用中加 {"type": "web_search"} 工具即可获取实时信息,并生成带引用的答案。
  • 支持视觉输入(如 base64 编码 PNG)。
  • 目前面向美国地区开发者。

官方资源


早期合作伙伴反馈

官方在博客中引用了三位早期合作伙伴的评价:

"Muse Spark 最让人印象深刻的是它把多少东西塞进了一个模型:百万级 token 上下文、完整多模态支持(图像、视频、PDF)、内置带引用的搜索、强推理、顶级编码能力(尤其是前端和设计)、结构化输出、并行工具调用——全部在一个干净的 OpenAI 兼容包里。一个完整的智能体地基。" —— Amjad Masad,Replit CEO

"Meta 显然是在为严肃的智能体编码而造——强工具使用,加上一个让大规模真实编码工作负载在经济上可行的价格点。这种组合很少见,也正是我们希望 Cline 开发者能尽早用上的原因。" —— Saoud Rizwan,Cline CEO

"在我们的企业工作评测集上测试时,Muse Spark 展现出与当今领先前沿模型相当的企业级能力。这种智能水平,结合它在跨行业(专业服务、公共部门、工业运营)结构化、流程化工作流上的优势,使其对组织很有吸引力。" —— Yashodha Bhavnani,Box AI 产品副总裁


参考链接

返回全部
Muse Spark 1.1 发布:Meta 推出多模态推理模型,并上线全新 Meta Model API | Luxsynthesis Blog