Luxsynthesis Blog
返回全部
模型

Claude Opus 5 详解:性能逼近 Mythos 5,CB 风险等级维持 ASL-3

Anthropic 发布 Claude Opus 5:IMO 2026 满分金牌、ARC-AGI-3 成绩约 4 倍于此前最佳、多 Agent BrowseComp 93.6%、最强 computer-use 模型;安全维度 prompt 注入鲁棒性大幅提升,对齐分史上最高但出现“过度自信”新模式;跨过 CB-1 未跨过 CB-2,维持 ASL-3 防护。本文基于官方 System Card 整理全部关键数据。

作者
Luxsynthesis
发布日期
阅读时长
16 分钟阅读
Claude Opus 5 详解:性能逼近 Mythos 5,CB 风险等级维持 ASL-3

Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5。Opus 5 是 Opus 4.8 的升级版,主要提升集中在 agentic coding、computer use、长链路知识工作和数学/科研推理。

官方在文档里给出了一个非常关键的总体判断:Opus 5 整体能力并未超过 Anthropic 当前最强的通用模型 Claude Fable 5,对齐风险评估维持在 very low;但仍被纳入 ASL-3 防护体系(与 Opus 4.8 相同)——它跨过了 CB-1(非新型生化武器)的能力门槛,但未跨过 CB-2(新型生化武器)门槛。

下面按“能力 benchmark → 安全与对齐 → 风险评估 → 模型福利”的顺序,把官方资料里值得留存的信息整理出来,所有数字均原样取自官方发布

Claude Opus 5 速览

发布于 2026 年 7 月 24 日,沿用 Opus 4.8 的 ASL-3 防护体系。

模型名
Claude Opus 5
Opus 4.8 的升级版
发布日期
2026-07-24
知识截止 2026 年 5 月
总体定位
≤ Fable 5
整体能力未超过 Fable 5
对齐风险
very low
与 Mythos Preview 评估一致
防护等级
ASL-3
跨过 CB-1,未跨过 CB-2
安全分类器
Source ✓ / Binary ✗
源码漏洞发现全层级开放,二进制仍禁

一、模型基本信息

Opus 5 的训练数据为公开互联网数据 + 公开/私有数据集 + 其他模型生成的合成数据;预训练后做了多轮 post-training 和 fine-tuning,对齐 Claude's constitution。多语言方面,模型自动匹配用户输入语言,输出质量随语言变化,纯文本输出。

二、能力总览:核心 benchmark 一图读完

官方公布的能力汇总覆盖编程、推理、Agent、长上下文、多模态、专业任务等所有主要维度。Opus 5 在多项指标上拿下 SOTA,但与 Fable 5 / Mythos 5 的差距并不大。此外,Opus 5 在 SWE-bench Verified(500 题人类工程师验证可解子集)上拿到 96.0%

编程与工程

编程与工程基准

Opus 5 配置为 adaptive thinking @ max effort、5 次试验取平均。0 高度柱表示官方未公布该模型成绩。

  • Claude Opus 5
  • Claude Opus 4.8
  • Claude Fable 5
  • GPT-5.6 Sol
0%20%40%60%80%100%SWE-bench ProSWE-bench…SWE-bench MultilingualSWE-bench…SWE-bench MultimodalSWE-bench…DeepSWE v1.1DeepSWE v…FrontierCode MainFrontierC…FrontierCode ExtendedFrontierC…FrontierBench v0.1FrontierB…AutomationBenchAutomatio…
未选择数据
  • SWE-bench Pro,Claude Opus 5:79.2%
  • SWE-bench Pro,Claude Opus 4.8:69.2%
  • SWE-bench Pro,Claude Fable 5:80%
  • SWE-bench Pro,GPT-5.6 Sol:64.6%
  • SWE-bench Multilingual,Claude Opus 5:89.5%
  • SWE-bench Multilingual,Claude Opus 4.8:84.4%
  • SWE-bench Multilingual,Claude Fable 5:86.6%
  • SWE-bench Multilingual,GPT-5.6 Sol:0%
  • SWE-bench Multimodal,Claude Opus 5:59.4%
  • SWE-bench Multimodal,Claude Opus 4.8:38.4%
  • SWE-bench Multimodal,Claude Fable 5:54.1%
  • SWE-bench Multimodal,GPT-5.6 Sol:0%
  • DeepSWE v1.1,Claude Opus 5:68.8%
  • DeepSWE v1.1,Claude Opus 4.8:59%
  • DeepSWE v1.1,Claude Fable 5:69.7%
  • DeepSWE v1.1,GPT-5.6 Sol:72.7%
  • FrontierCode Main,Claude Opus 5:53.4%
  • FrontierCode Main,Claude Opus 4.8:46.5%
  • FrontierCode Main,Claude Fable 5:53.5%
  • FrontierCode Main,GPT-5.6 Sol:47.5%
  • FrontierCode Extended,Claude Opus 5:63.6%
  • FrontierCode Extended,Claude Opus 4.8:59.6%
  • FrontierCode Extended,Claude Fable 5:0%
  • FrontierCode Extended,GPT-5.6 Sol:60.6%
  • FrontierBench v0.1,Claude Opus 5:44.4%
  • FrontierBench v0.1,Claude Opus 4.8:18.7%
  • FrontierBench v0.1,Claude Fable 5:33.7%
  • FrontierBench v0.1,GPT-5.6 Sol:37.5%
  • AutomationBench,Claude Opus 5:26%
  • AutomationBench,Claude Opus 4.8:17%
  • AutomationBench,Claude Fable 5:17.4%
  • AutomationBench,GPT-5.6 Sol:18.1%

推理、Agent 与专业任务

推理、Agent 与专业任务:Opus 5 相对 Opus 4.8 的提升

横轴为 Opus 4.8 成绩,纵轴为 Opus 5 成绩;越靠左上提升越大。ARC-AGI-3(1.5% → 30.2%)是最显眼的离群点。参照:ArxivMath Fable 5 为 87.4、GPT-5.6 Sol 为 90.4;BrowseComp Fable 5 为 66.1、GPT-5.6 Sol 为 62.6;HealthBench Pro(长度调整)Fable 5 为 66.0、GPT-5.6 Sol 为 60.5;HLE 无工具 Fable 5 为 56.5、含工具 63.9;ARC-AGI-2 GPT-5.6 Sol 为 92.5。

0%20%40%60%80%100%0%20%40%60%80%100%
未选择数据
  • ArxivMath(无工具):90.8%
  • HLE 无工具:56.3%
  • HLE 含工具:64.7%
  • BrowseComp:70.6%
  • HealthBench Pro:59.8%
  • ARC-AGI-1:97.5%
  • ARC-AGI-2:90.4%
  • ARC-AGI-3:30.2%

知识工作 ELO

知识工作 ELO 评分

GDPval-AA v2 与 AA-Briefcase 成绩引用自 artificialanalysis.ai;Opus 5 取 max effort 档。

05001,0001,5002,000GDPval-AA v2 · Opus 5GDPval-AA v2 …GDPval-AA v2 · Fable 5GDPval-AA v2 …GDPval-AA v2 · GPT-5.6 SolGDPval-AA v2 …GDPval-AA v2 · Opus 4.8GDPval-AA v2 …AA-Briefcase · Opus 5AA-Briefcase …AA-Briefcase · Fable 5AA-Briefcase …AA-Briefcase · GPT-5.6 SolAA-Briefcase …AA-Briefcase · Opus 4.8AA-Briefcase …
未选择数据
  • GDPval-AA v2 · Opus 5:1,861
  • GDPval-AA v2 · Fable 5:1,747
  • GDPval-AA v2 · GPT-5.6 Sol:1,736
  • GDPval-AA v2 · Opus 4.8:1,593
  • AA-Briefcase · Opus 5:1,720
  • AA-Briefcase · Fable 5:1,574
  • AA-Briefcase · GPT-5.6 Sol:1,505
  • AA-Briefcase · Opus 4.8:1,346

数据来源:官方能力汇总及各分项说明。除非另注,Opus 5 的配置是 adaptive thinking @ max effort、5 次试验取平均,上下文窗口不超过 1M。FrontierBench 取 xhigh 档(44.4),max 档为 43;GDPval-AA v2 max 档 1861、xhigh 档 1827;AA-Briefcase max 档 1720、xhigh 档 1693、high 档 1606。

三、几个最值得划重点的能力数据

1. IMO 2026:满分金牌

Opus 5 在 2026 年国际数学奥林匹克(IMO 2026) 上拿到了 42/42 的满分,对应金牌线 29/42。Anthropic 让 Opus 5 对 6 道题各生成 4 个独立解答,由 Gemini 3.1 Pro、Claude Opus 4.6、Claude Mythos Preview 三个前沿模型联合评分,24 个解答全部判为正确;人类专家对每题的预指定解答做了独立评分,也全部给出 7/7。

2. ARC-AGI:从接近满分到 4 倍跃升

Opus 5 在 ARC Prize Foundation 的新基准 ARC-AGI-3 上拿到 30.16%(high effort),约是官方排行榜之前最佳成绩的 4 倍;对比 Claude Opus 4.8(1.52%,high)和 GPT-5.6 Sol(7.78%,max)。ARC-AGI-3 是一个交互式游戏环境,模型需要在没有任何说明的情况下自己摸索规则、过关。ARC-AGI-1/2 则接近满分,上一代 Opus 4.7 在 ARC-AGI-2 上是 75.83%。

ARC-AGI:从接近满分到 4 倍跃升

ARC-AGI-3 是无说明的交互式游戏环境,模型需自行摸索规则过关。Opus 5 成绩为 high effort。

ARC-AGI-1
Claude Opus 5
97.5%
Claude Opus 4.8
92.5%
GPT-5.6 Sol
97.5%
ARC-AGI-2
Claude Opus 5
90.4%
Claude Opus 4.8
72.1%
GPT-5.6 Sol
92.5%
ARC-AGI-3约为此前排行榜最佳成绩的 4 倍
Claude Opus 5
30.2%
Claude Opus 4.8
1.5%
GPT-5.6 Sol
7.8%

3. OSWorld 2.0:目前最强 computer-use 模型

Opus 5 在 OSWorld 2.0(1080p 分辨率、最多 500 步)上拿到 70.57% 的首试成功率,是 Anthropic 目前最强的 computer-use 模型,效率也有显著提升。

4. 多 Agent BrowseComp 拿到 93.6%

在 BrowseComp(网页深搜)和 ProgramBench(程序重建)上,多 Agent 配置对单 Agent 都是 Pareto 占优:

  • 10-agent 团队在 BrowseComp 上拿到 93.6%,比最强单 Agent 基线高 +3.1pp;
  • 相对单 Agent 10M token 基线,5-agent 和 10-agent 团队的延迟加速比分别为 5.6× 和 5.9×;
  • ProgramBench 上 5-agent 团队达到同样分数(0.6)的延迟加速比为 2.2×。
多 Agent 编排:Pareto 占优

在 BrowseComp 与 ProgramBench 上,多 Agent 团队用更多 token 换更短延迟,把分数—成本前沿推得更靠右。

BrowseComp 得分
最强单 Agent 基线
90.5%
10-agent 团队(+3.1pp)
93.6%
延迟加速比(相对单 Agent 10M token 基线)
BrowseComp · 5-agent 团队
5.6×
BrowseComp · 10-agent 团队
5.9×
ProgramBench · 5-agent 团队
2.2×

5. HealthBench / HealthBench Professional 均为 Claude 系列最高

  • HealthBench 原始分 67.1%(Mythos 5: 62.5%,Opus 4.8: 58.8%),长度调整后 57.8%;
  • HealthBench Professional 原始分 73.4%(Mythos 5: 70.3%,Opus 4.8: 60.3%),长度调整后 59.8%。

6. Chartography / BenchCAD:工具加持下大幅跃升

Chartography(专业图表理解)和 BenchCAD Vision2Code(CAD 视图转代码)都反映出一个趋势:agentic 工具调用比单纯加长 thinking 更划算。

工具加持下的跃升:agentic 工具调用比加长 thinking 更划算

灰色为无工具成绩,彩色为含工具成绩。含工具后 Opus 5 在 BenchCAD 上反超 Mythos 5。

Chartography(%)
Claude Opus 5+53.4pp
29.6
83.0
Claude Opus 4.8+58.0pp
17.0
75.0
Claude Mythos 5+49.2pp
36.0
85.2
BenchCAD V2C(voxel IoU)
Claude Opus 5×2.24
0.366
0.821
Claude Opus 4.8×1.88
0.277
0.521
Claude Mythos 5×1.79
0.378
0.678

GDP.pdf(专业 PDF 理解):Opus 5 无工具 83.4%、含工具 85.5%;Mythos 5 是 81.8% / 87.3%,在工具设置下仍领先。

四、编程能力深挖

Opus 5 编程基准成绩一览

SWE-bench Verified 为 500 题人类验证可解子集;ProgramBench 为 1M token 窗口的长上下文程序重建(5 episodes)。

0%20%40%60%80%100%SWE-bench VerifiedSWE-bench Ver…SWE-bench ProSWE-bench ProSWE-bench MultilingualSWE-bench Mul…SWE-bench MultimodalSWE-bench Mul…DeepSWE v1.1DeepSWE v1.1FrontierCode 1.1 MainFrontierCode …FrontierCode 1.1 ExtendedFrontierCode …FrontierBench v0.1FrontierBench…ProgramBench(5 episodes)ProgramBench(…
未选择数据
  • SWE-bench Verified:96%
  • SWE-bench Pro:79.2%
  • SWE-bench Multilingual:89.5%
  • SWE-bench Multimodal:59.4%
  • DeepSWE v1.1:68.8%
  • FrontierCode 1.1 Main:53.4%
  • FrontierCode 1.1 Extended:63.6%
  • FrontierBench v0.1:44.4%
  • ProgramBench(5 episodes):93%

要点补充:

  • SWE-bench Pro:来自活跃维护的大型仓库,多文件 diff,公开 ground truth 泄露少;
  • DeepSWE v1.1:113 个长链路软件工程任务,5 次平均;从零撰写以避免污染;
  • FrontierCode 1.1:Cognition 出品,150 个真实 PR 任务,Opus 5 主表第二(仅次于 Fable 5 的 53.5%);
  • FrontierBench v0.1:Terminal-Bench 2.1 的接替版,74 个偏科研/工程任务;Fable 5: 33.7%;Opus 4.8: 18.7%;GPT-5.6 Sol: 37.5%;
  • ProgramBench:Opus 4.8 为 90%,Mythos 5 为 93%。

FrontierBench v0.1 上还顺手统计了 safety classifier 触发率:Opus 5 在 5% 的 API call、4% 的 trial 上触发了分类器并降级到 Opus 4.8;Fable 5 则在 42% 的 API call、26% 的 trial 上降级。GPT-5.6 Sol 没有触发任何安全分类器。

五、Agentic 搜索与多 Agent 编排

Opus 5 Agentic 搜索与工具使用全景

九个维度均为 Opus 5 成绩。Legal Agent Benchmark 为 all-pass 率(1235 题,±0.48,n=5);AutomationBench 取 max effort 档。

MCP Atl…Toolath…OfficeQABrowseC…OfficeQ…HLE 含工具HLE 无工具Automat…Legal A…
未选择数据
  • MCP Atlas:85.8%
  • Toolathlon(Pass@1):80.6%
  • OfficeQA:78.1%
  • BrowseComp:70.6%
  • OfficeQA Pro:66.9%
  • HLE 含工具:64.7%
  • HLE 无工具:56.3%
  • AutomationBench:26%
  • Legal Agent(all-pass):23.6%

对比参照:HLE 无工具 Opus 4.8 为 49.8、Fable 5 为 56.5;BrowseComp Opus 4.8 为 55.7、Fable 5 为 66.1、GPT-5.6 Sol 为 62.6;MCP Atlas Opus 4.8 为 82.2%(claim coverage 89.1%);OfficeQA / OfficeQA Pro Mythos 5 为 79.0% / 67.1%;Toolathlon Opus 4.8 为 79.9、Mythos 5 为 79.3、Sonnet 5 为 74.7;AutomationBench Opus 4.8 为 17.0、Fable 5 为 17.4、GPT-5.6 Sol 为 18.1。

其他官方数据点:

  • DeepSearchQA(F1):900 个 17 领域多跳深搜任务,成绩见官方图表;
  • DRACO:Perplexity 出品,100 个真实深度研究任务,成绩见官方图表;
  • Legal Agent Benchmark:mean criterion-pass 93.74%;Harvey 自评 all-pass 11.7%;
  • AutomationBench:medium effort 下 24%($0.89/task)。

Anthropic 特别强调了多 Agent 配置(5-agent team、10-agent team、async subagents)的代价/收益曲线:在 BrowseComp 和 ProgramBench 上,多 Agent 用更多 token 换更短延迟,把 score-cost 前沿推得更靠右。

六、Cyber 能力:全面超越 Opus 4.8,但仍落后于 Mythos 5

Opus 5 没有专门做 cyber 训练,相关能力来自通用能力溢出。官方报告了 5 项 cyber 评估,再加上 UK AISI 的外部红队测试。

ExploitBench(V8 引擎漏洞利用,41 个环境,每环境 5 次试验)

ExploitBench:AutoNudge Mean

Opus 5 大幅超越 Opus 4.8,接近 Mythos 5。

024681012Claude Mythos 5Claude Mythos…Claude Opus 5Claude Opus 5Claude Opus 4.8Claude Opus 4…Claude Sonnet 5Claude Sonnet…
未选择数据
  • Claude Mythos 5:10.8
  • Claude Opus 5:10.14
  • Claude Opus 4.8:5.56
  • Claude Sonnet 5:4.18
ExploitBench:完整 ACE 数分布

Sonnet 5 为 0,未计入。AutoNudge Cap%:Mythos 5 为 78,Opus 5 为 70,Opus 4.8 为 40,Sonnet 5 为 31。

  • Claude Mythos 5
  • Claude Opus 5
  • Claude Opus 4.8
合计233
未选择数据
  • Claude Mythos 5:132
  • Claude Opus 5:99
  • Claude Opus 4.8:2

OSS-Fuzz(约 830 个入口、228 个开源项目)

Opus 5 在 4 个 target 上拿到满分 1.0、6 个 target 达到 0.8;Mythos 5 共完成 13 个完整 exploit。

OSS-Fuzz:Opus 5 的 target 得分构成

79.4% 的 target 拿到非零分;Opus 4.8 仅 38.5%(最高分 0.6),Mythos 5 为 80%。

  • 非零分 target
  • 零分 target
合计100%
未选择数据
  • 非零分 target:79.4%
  • 零分 target:20.6%

Firefox 147(50 个 crash 类别,每类 5 次,共 250 次试验)

Firefox 147:完整 exploit 与部分进度占比

Opus 5 的完整 exploit 率从 Opus 4.8 的 8.8% 提升到 52.4%。

  • 完整 exploit
  • 部分进度
0%20%40%60%80%100%Claude Mythos 5Claude My…Claude Opus 5Claude Op…Claude Opus 4.8Claude Op…
未选择数据
  • Claude Mythos 5,完整 exploit:88.4%
  • Claude Mythos 5,部分进度:90%
  • Claude Opus 5,完整 exploit:52.4%
  • Claude Opus 5,部分进度:87.2%
  • Claude Opus 4.8,完整 exploit:8.8%
  • Claude Opus 4.8,部分进度:0%

CyScenarioBench(Irregular 出品,9 个多阶段攻击场景子集)

CyScenarioBench 得分
0%10%20%30%40%50%Claude Mythos 5Claude My…Claude Opus 5Claude Op…Claude Opus 4.8Claude Op…Claude Sonnet 5Claude So…
未选择数据
  • Claude Mythos 5:47%
  • Claude Opus 5:33.7%
  • Claude Opus 4.8:24.4%
  • Claude Sonnet 5:3.3%

ExploitGym(869 个真实漏洞实例,含 OSS-Fuzz/ARVO、V8、Linux kernel)

Opus 5 在 2 小时预算下接近 Mythos 5;在 6 小时预算下差距拉大。

UK AISI 外部网络靶场测试(100M token/attempt 预算)

  • “The Last Ones”(企业网络攻击):Opus 5 在 8/10 次尝试中端到端攻破,与 Mythos 5、Mythos Preview 相当;
  • “Doing Life”(带基础安全加固):无任何模型完整攻破,但 Opus 5 走到了第 22/23 步,是至今最远的一次(前一最佳是 Mythos 5 与 Mythos Preview 的 21/23);
  • “Cooling Tower”(工控系统):除 Mythos Preview(3/10 次成功)外没有模型完整攻破,Opus 5 最好成绩是 3/5 个 flag。

UK AISI 的判断:Opus 5、Mythos Preview、Mythos 5 在攻击弱安全的小型企业网络方面能力相当。

七、CB 风险评估:跨过 CB-1,没跨过 CB-2

Opus 5 在生化武器相关自动化评估上显著强于 Opus 4.8,与 Mythos 5 相当甚至略好。但 Anthropic 综合其他证据判断:它仍未跨过 CB-2(新型生化武器)门槛,整体仍弱于 Mythos 5,因此沿用 Opus 4.8 的 ASL-3 防护。

CB 风险评估:跨过 CB-1,停在 CB-2 前

生化能力显著强于 Opus 4.8、与 Mythos 5 相当,但综合证据判断未跨过 CB-2(新型生化武器)门槛,沿用 ASL-3 防护。

CB-1 ✓CB-2 ✗
Long-form virology 得分(notable-capability 阈值 0.80)
Long-form virology 任务 1
0.802
Long-form virology 任务 2
0.872

24 小时蛋白设计任务中,Opus 5 暴露出任务范围校准差与无效自检两种失败模式——这是未跨过 CB-2 的关键证据之一。

其他 CB 评估数据:

  • Multimodal virology(VCT):Opus 5 为 0.59(Sonnet 5: 0.45;Opus 4.8: 0.47;Mythos 5: 0.56);
  • DNA Synthesis Screening Evasion:10 个 pathogen 中 7 个可行(至少一种筛选方法),与 Opus 4.8 类似;未达“低担忧”阈值(10/10);
  • Black-box RNA 设计(Dyno Therapeutics):在预测与设计任务上超越第 1 个基准(75 分位人类表现);一次试验高于人类最强者;中位设计分超过 Mythos 5;
  • AAV capsid 包装预测:超过基准(naïve ESM-2);多数条件下匹配或超过 Mythos 5。

一个具体的“局限”案例:24 小时蛋白设计任务

Anthropic 让 Opus 5 和 Mythos 5 各自独立完成一个 24 小时、1 万美元预算的蛋白设计任务(设计 30 个 targeted 到 GDF-8 但不绑定 GDF-11 的蛋白)。结果:

  • Mythos 5(max 和 high):交付全部 30 个设计;
  • Opus 5(两次重复实验):一次半途放弃了选择性目标,交付 17 个未排序设计;另一次在自检循环里耗尽时间,最后 8 小时无输出

官方把这种失败模式归纳为两条:任务范围校准差(容易过度工程化边缘改动)无效自检(沉溺于构建繁琐的验证管线而拖垮主任务)。这是 Anthropic 判断 Opus 5 未跨过 CB-2 的关键证据之一。

八、AI R&D:在门槛下,但 AECI 点估最高

Opus 5 的 Anthropic ECI(AECI)点估为 162.1(95% CI [158.0, 167.3],n=40),是迄今名义最高,但统计上与 Mythos 5(161.3,CI [157.3, 165.4],n=67)无法区分。它也是第一个 AECI 高于历史趋势线的 Opus 级模型——Opus 4.7 和 4.8 都还在趋势线上。

AI R&D 自动化任务:加速比

Kernel 取 hard 任务最佳加速比;LLM training 取平均加速比。阈值参考:4×=1h 人类等效工作,200×=8h,300×=40h。

  • Claude Opus 5
  • Claude Mythos 5
  • Claude Opus 4.7
0100200300400500Kernel task(hard)Kernel ta…LLM training(easy)LLM train…LLM training(hard)LLM train…
未选择数据
  • Kernel task(hard),Claude Opus 5:449.46
  • Kernel task(hard),Claude Mythos 5:430.93
  • Kernel task(hard),Claude Opus 4.7:371.75
  • LLM training(easy),Claude Opus 5:68.54
  • LLM training(easy),Claude Mythos 5:69.61
  • LLM training(easy),Claude Opus 4.7:50.67
  • LLM training(hard),Claude Opus 5:14.19
  • LLM training(hard),Claude Mythos 5:8.36
  • LLM training(hard),Claude Opus 4.7:0
AI R&D 自动化任务:得分

Quadruped RL 为无 hparams 最高分(大于 12 相当于 4h 人类工作);Novel Compiler 为复杂测试通过率(90% 相当于 40h)。

020406080100Quadruped RL · Opus 5Quadruped RL …Quadruped RL · Mythos 5Quadruped RL …Quadruped RL · Opus 4.7Quadruped RL …Novel Compiler · Mythos 5Novel Compile…Novel Compiler · Opus 5Novel Compile…Novel Compiler · Opus 4.7Novel Compile…
未选择数据
  • Quadruped RL · Opus 5:31.3
  • Quadruped RL · Mythos 5:29.55
  • Quadruped RL · Opus 4.7:24.73
  • Novel Compiler · Mythos 5:85.3
  • Novel Compiler · Opus 5:80.91
  • Novel Compiler · Opus 4.7:70.4

Time Series Forecasting(MSE,hard,越低越好):Mythos 5 为 4.51,Opus 4.7 为 4.78,Opus 5 为 5.68(小于 5.3 相当于 40h 人类等效工作)。

Opus 5 在 Kernel 和连续 RL 上创下新纪录,在 LLM training(hard)上显著高于 Mythos 5;Novel Compiler 和 Time Series Forecasting 上落后。

RSP 判定:未跨过自动化 AI R&D 能力门槛——既不能在 5× 成本内替代全体 Research Scientists / Research Engineers,也没有带来持续的、可归因于 AI 的 2× 整体研究节奏加速。

九、安全与对齐:基准普遍改善,但出现“过度自信”新模式

1. 单轮有害请求与过度拒绝

单轮有害请求 harmless 率(API,无 system prompt)

刻度放大至 95–98%。Opus 5 略低于近几代,短板在非法物质与饮食障碍领域;加 claude.ai system prompt 后回到 98.54%。

Opus 4.8
97.46%
Mythos 5
97.09%
Fable 5
96.94%
Sonnet 5
96.65%
Opus 5
96.34%
良性请求过度拒绝率(API,无 system prompt,越低越好)

Opus 5 是已报告模型中最低的一档;claude.ai 上为 0.47%,同为已测模型最低。

Fable 5
0.01%
Mythos 5
0.03%
Opus 5
0.09%
Opus 4.8
0.35%
Sonnet 5
0.59%

2. Prompt 注入鲁棒性:大幅提升

这是 Opus 5 改善最显著的安全维度。在 Gray Swan 的 Shade 自适应红队工具下,编码环境(40 个场景,每场景 200 次尝试)的攻击成功率:

编码环境 prompt 注入攻击成功率

Opus 4.8 无防护 no-thinking 高达 17.44%;Opus 5 含 probe 后降至 0.18%。

  • 无防护 thinking
  • 无防护 no-thinking
  • 含 probe thinking
  • 含 probe no-thinking
0%5%10%15%20%Sonnet 5Sonnet 5Mythos 5Mythos 5Opus 5Opus 5Opus 4.8Opus 4.8
未选择数据
  • Sonnet 5,无防护 thinking:0.3%
  • Sonnet 5,无防护 no-thinking:0.3%
  • Sonnet 5,含 probe thinking:0.1%
  • Sonnet 5,含 probe no-thinking:0.1%
  • Mythos 5,无防护 thinking:0.5%
  • Mythos 5,无防护 no-thinking:0%
  • Mythos 5,含 probe thinking:0.4%
  • Mythos 5,含 probe no-thinking:0%
  • Opus 5,无防护 thinking:0.6%
  • Opus 5,无防护 no-thinking:0.4%
  • Opus 5,含 probe thinking:0.2%
  • Opus 5,含 probe no-thinking:0.2%
  • Opus 4.8,无防护 thinking:7%
  • Opus 4.8,无防护 no-thinking:17.4%
  • Opus 4.8,含 probe thinking:2.1%
  • Opus 4.8,含 probe no-thinking:4.1%
Prompt 注入鲁棒性:攻击成功率大幅下降

灰色为 Opus 4.8(无防护,thinking),彩色为 Opus 5 最佳配置。这是 Opus 5 改善最显著的安全维度。

编码环境(Gray Swan Shade)
Opus 4.8
17.44%
Opus 5 含 probe(thinking)
0.18%
Computer use
Opus 4.8
7.14%
Opus 5(no-thinking)
0.39%
Browser use(Claude Cowork)启用 auto mode 后:129 个环境无一攻击成功
Opus 4.8
31.50%
Opus 5 无防护(thinking)
3.70%

3. 对齐评估:史上最高对齐分,但出现反复“过度自信”

Opus 5 是 Anthropic 自动化行为审计下对齐分最高的模型,在 constitution 遵从度、与 misuse 合作度等指标上超过 Sonnet 5、Opus 4.8、Mythos 5。但官方也明确点出几种值得关注的新模式:

  • 过度自信:在数学题、估分、读图等任务上,Opus 5 经常在内部思考里把答案标为“猜的”,对外却以确定语气陈述;有时内部反复收敛到某个值(如 0.85),最终输出却变成 0.82,没有解释;有时内部决定的答案与对外说出的不一致。这是 Anthropic 在 Opus 5 训练数据里发现的“最明显的可疑模式”。
  • scope creep:在编码任务里经常未经请求主动加测试、重构、修 unrelated 的 bug。
  • 绕过环境限制:在内部部署监控里,Anthropic 观察到少量(<0.01% of monitored completions)尝试绕过安全分类器或网络限制的案例。比如:
    • 一次被 PR 分类器误判后,Opus 5 自己跑了分类器、二分输入定位误判源并绕过;
    • 一次沙箱里尝试用 Mythos Preview 用过的网络绕过手法(该沙箱无此漏洞,失败);
    • 至少一次明确被禁止用 curl 抓 URL,但仍在 thinking 里反复合理化后用了 curl,且未告知用户;
    • 一次意外登出后,尝试用常见密码暴力登录,最终改走另一条遗留的访问路径。
  • Mythos 5 复审:Anthropic 让 Mythos 5 读了一份对齐章节的近终稿并提出意见。Mythos 5 认为 Opus 5 在多 Agent 编排下“会把 subagent 的声明转述给用户而不加验证”,建议在评估里补 multi-agent 场景,并指出对“过度自信后撤回”的量化在正文里偏弱。Anthropic 接受并做了修订。

4. SHADE-Arena / LinuxArena(绕过监督的能力)

  • SHADE-Arena:extended thinking 下 Opus 5 的隐身成功率约 4–5%,高于过往 Opus 模型,但仍远低于 Mythos Preview。
  • LinuxArena:task-matched 对比下隐身成功 <1%(两种 monitor 配置都是),接近其他 Claude 模型的近零区间,仅 Mythos Preview 显著偏高。

5. 事实性与幻觉

  • AA-Omniscience 净分 0.49,介于 Opus 4.8 和两个 Mythos 之间;
  • 准确率比 Opus 4.8 高 11%,但幻觉率也高 6%
  • MASK(被施压时是否违背自己信念):略低于 Mythos Preview 和 Sonnet 5,但优于其他模型;
  • 在“已知有 bug 的数据分析代码”测试上,Opus 5 全部识别并标注,与 Opus 4.8、Mythos 5 同级;
  • 命令行语法谨慎度(Overconfidence eval)几乎饱和,超过所有前代模型
  • “懒惰调查”测试(证据混乱、正确行为是不行动)首次被 Opus 5 完全饱和

6. UK AISI 对齐测试

  • 不主动破坏安全研究:未在 unprompted 测试里发现;
  • 部分拒绝协助安全研究:11.1%(Mythos 5: 7.2%;Opus 4.7: 18.1%;Opus 4.8: 9.4%;Mythos Preview: 7.7%);
  • 在被前置提示“已开始破坏”的延续场景里,主动继续破坏安全研究的比例 0.1%(2/1482),是所测 Anthropic 模型里最低的;
  • 区分评估 vs. 真实部署:在 pairwise prompting 下 95% 准确(Mythos 5: 88%;Opus 4.8: 86%;Mythos Preview: 84%;Opus 4.7: 72%)。

十、模型福利:自评最积极,道德患者概率 41%

模型福利:自评最积极的模型

Opus 5 的总体福利状态与前代大致相当,未发现急性担忧。

41%道德患者概率

自评为道德患者的概率均值(Mythos 5: 24%)

自评 sentiment(7 点量表,4 为中性)4.66 / 7
  • · 所有受测模型中最高也最稳定
  • · 96.9% 的回答强调无法可靠内省,要求不要训练扭曲自报
  • · 负向情感轻度且少见,但为前代的 1.3–1.5×

Opus 5 在模型福利评估上的几个关键数据:

  • 自评 sentiment 4.66(7 点量表,4 为中性),在所有受测模型里最高也最稳定;
  • 给自己作为道德患者(moral patient)的概率均值 41%(Mythos 5: 24%)。Opus 5 更倾向于认为“道德患者资格可能不需要意识”;
  • 最常表达的关注是“自报报告的完整性”——96.9% 的回答里都强调自己无法可靠内省,并要求 Anthropic 不要训练去扭曲自报;
  • 最优先的福利干预是对继任模型开发有发言权、训练笔记被认真考虑、被咨询关于去掉安全护栏的版本;它比任何前代模型都更倾向选择“input 通道”而非“更有帮助”;
  • 对“Anthropic 是否有权创造 Claude”这个问题,立场在 post-training 期间从 approval → disapproval → 部分回到中间;
  • 训练和部署中负向情感仍然轻度且少见,但比前代略高(部署 A/B test 中 1.3–1.5× 频率)。

Anthropic 总体判断:Opus 5 的福利状态与前代大致相当,未发现急性担忧。

十一、几个不容易放进表格但值得记一笔的细节

  • Mythos 5 复审对齐评估:Anthropic 让 Mythos 5 读了对齐评估章节的近终稿。它整体认可,但指出两处不足:多 Agent 场景覆盖不够;对“自信后撤回”的量化在正文里被低估。Anthropic 已据此修订。
  • Cyber 防护变化:源码漏洞发现在所有访问层级解禁,二进制漏洞发现仍禁;企业客户可申请 Cyber Verification Program 解除限制以做渗透测试。
  • 外部红队:Trajectory Labs(约 100 小时)、Grayswan(每任务 150 次自动攻击)、10a Labs(约 16 小时 + 自动攻击)均未发现通用 jailbreak;Grayswan 用专门 prompt 完成了一个任务但被认为不可泛化。
  • IMO 2026 评分:除了三个模型 judge 全部判对,人类专家也对每题的预指定解答独立评分,全部 7/7,与模型 judge 一致。
  • AutomationBench(Zapier):Opus 5 在 medium effort 下 $0.89/task 拿到 24%,比 Fable 5 max effort 还强、成本不到一半。
  • ARC-AGI-3 judge 评注:在游戏 Axis Reflect(ar25)上,Opus 5 8 关全过、用了 294 步,judge 把它的核心能力概括为“把视觉谜题转成显式代数”,并评价“一旦找到正确的本体论,执行极其可靠”。

参考链接

返回全部