Anthropic 在 2026 年 7 月 24 日发布了 Claude Opus 5。Opus 5 是 Opus 4.8 的升级版,主要提升集中在 agentic coding、computer use、长链路知识工作和数学/科研推理。
官方在文档里给出了一个非常关键的总体判断:Opus 5 整体能力并未超过 Anthropic 当前最强的通用模型 Claude Fable 5,对齐风险评估维持在 very low;但仍被纳入 ASL-3 防护体系(与 Opus 4.8 相同)——它跨过了 CB-1(非新型生化武器)的能力门槛,但未跨过 CB-2(新型生化武器)门槛。
下面按“能力 benchmark → 安全与对齐 → 风险评估 → 模型福利”的顺序,把官方资料里值得留存的信息整理出来,所有数字均原样取自官方发布。
发布于 2026 年 7 月 24 日,沿用 Opus 4.8 的 ASL-3 防护体系。
一、模型基本信息
Opus 5 的训练数据为公开互联网数据 + 公开/私有数据集 + 其他模型生成的合成数据;预训练后做了多轮 post-training 和 fine-tuning,对齐 Claude's constitution。多语言方面,模型自动匹配用户输入语言,输出质量随语言变化,纯文本输出。
相比 Fable 5,Opus 5 在所有访问层级(包括 GA)开放源码漏洞发现,但继续禁止对编译后二进制文件的漏洞发现。理由是源码漏洞发现偏向防御方(开发者写更安全的代码),二进制漏洞发现偏向攻击方。
二、能力总览:核心 benchmark 一图读完
官方公布的能力汇总覆盖编程、推理、Agent、长上下文、多模态、专业任务等所有主要维度。Opus 5 在多项指标上拿下 SOTA,但与 Fable 5 / Mythos 5 的差距并不大。此外,Opus 5 在 SWE-bench Verified(500 题人类工程师验证可解子集)上拿到 96.0%。
编程与工程
Opus 5 配置为 adaptive thinking @ max effort、5 次试验取平均。0 高度柱表示官方未公布该模型成绩。
- Claude Opus 5
- Claude Opus 4.8
- Claude Fable 5
- GPT-5.6 Sol
- SWE-bench Pro,Claude Opus 5:79.2%
- SWE-bench Pro,Claude Opus 4.8:69.2%
- SWE-bench Pro,Claude Fable 5:80%
- SWE-bench Pro,GPT-5.6 Sol:64.6%
- SWE-bench Multilingual,Claude Opus 5:89.5%
- SWE-bench Multilingual,Claude Opus 4.8:84.4%
- SWE-bench Multilingual,Claude Fable 5:86.6%
- SWE-bench Multilingual,GPT-5.6 Sol:0%
- SWE-bench Multimodal,Claude Opus 5:59.4%
- SWE-bench Multimodal,Claude Opus 4.8:38.4%
- SWE-bench Multimodal,Claude Fable 5:54.1%
- SWE-bench Multimodal,GPT-5.6 Sol:0%
- DeepSWE v1.1,Claude Opus 5:68.8%
- DeepSWE v1.1,Claude Opus 4.8:59%
- DeepSWE v1.1,Claude Fable 5:69.7%
- DeepSWE v1.1,GPT-5.6 Sol:72.7%
- FrontierCode Main,Claude Opus 5:53.4%
- FrontierCode Main,Claude Opus 4.8:46.5%
- FrontierCode Main,Claude Fable 5:53.5%
- FrontierCode Main,GPT-5.6 Sol:47.5%
- FrontierCode Extended,Claude Opus 5:63.6%
- FrontierCode Extended,Claude Opus 4.8:59.6%
- FrontierCode Extended,Claude Fable 5:0%
- FrontierCode Extended,GPT-5.6 Sol:60.6%
- FrontierBench v0.1,Claude Opus 5:44.4%
- FrontierBench v0.1,Claude Opus 4.8:18.7%
- FrontierBench v0.1,Claude Fable 5:33.7%
- FrontierBench v0.1,GPT-5.6 Sol:37.5%
- AutomationBench,Claude Opus 5:26%
- AutomationBench,Claude Opus 4.8:17%
- AutomationBench,Claude Fable 5:17.4%
- AutomationBench,GPT-5.6 Sol:18.1%
推理、Agent 与专业任务
横轴为 Opus 4.8 成绩,纵轴为 Opus 5 成绩;越靠左上提升越大。ARC-AGI-3(1.5% → 30.2%)是最显眼的离群点。参照:ArxivMath Fable 5 为 87.4、GPT-5.6 Sol 为 90.4;BrowseComp Fable 5 为 66.1、GPT-5.6 Sol 为 62.6;HealthBench Pro(长度调整)Fable 5 为 66.0、GPT-5.6 Sol 为 60.5;HLE 无工具 Fable 5 为 56.5、含工具 63.9;ARC-AGI-2 GPT-5.6 Sol 为 92.5。
- ArxivMath(无工具):90.8%
- HLE 无工具:56.3%
- HLE 含工具:64.7%
- BrowseComp:70.6%
- HealthBench Pro:59.8%
- ARC-AGI-1:97.5%
- ARC-AGI-2:90.4%
- ARC-AGI-3:30.2%
知识工作 ELO
GDPval-AA v2 与 AA-Briefcase 成绩引用自 artificialanalysis.ai;Opus 5 取 max effort 档。
- GDPval-AA v2 · Opus 5:1,861
- GDPval-AA v2 · Fable 5:1,747
- GDPval-AA v2 · GPT-5.6 Sol:1,736
- GDPval-AA v2 · Opus 4.8:1,593
- AA-Briefcase · Opus 5:1,720
- AA-Briefcase · Fable 5:1,574
- AA-Briefcase · GPT-5.6 Sol:1,505
- AA-Briefcase · Opus 4.8:1,346
数据来源:官方能力汇总及各分项说明。除非另注,Opus 5 的配置是 adaptive thinking @ max effort、5 次试验取平均,上下文窗口不超过 1M。FrontierBench 取 xhigh 档(44.4),max 档为 43;GDPval-AA v2 max 档 1861、xhigh 档 1827;AA-Briefcase max 档 1720、xhigh 档 1693、high 档 1606。
三、几个最值得划重点的能力数据
1. IMO 2026:满分金牌
Opus 5 在 2026 年国际数学奥林匹克(IMO 2026) 上拿到了 42/42 的满分,对应金牌线 29/42。Anthropic 让 Opus 5 对 6 道题各生成 4 个独立解答,由 Gemini 3.1 Pro、Claude Opus 4.6、Claude Mythos Preview 三个前沿模型联合评分,24 个解答全部判为正确;人类专家对每题的预指定解答做了独立评分,也全部给出 7/7。
2. ARC-AGI:从接近满分到 4 倍跃升
Opus 5 在 ARC Prize Foundation 的新基准 ARC-AGI-3 上拿到 30.16%(high effort),约是官方排行榜之前最佳成绩的 4 倍;对比 Claude Opus 4.8(1.52%,high)和 GPT-5.6 Sol(7.78%,max)。ARC-AGI-3 是一个交互式游戏环境,模型需要在没有任何说明的情况下自己摸索规则、过关。ARC-AGI-1/2 则接近满分,上一代 Opus 4.7 在 ARC-AGI-2 上是 75.83%。
ARC-AGI-3 是无说明的交互式游戏环境,模型需自行摸索规则过关。Opus 5 成绩为 high effort。
3. OSWorld 2.0:目前最强 computer-use 模型
Opus 5 在 OSWorld 2.0(1080p 分辨率、最多 500 步)上拿到 70.57% 的首试成功率,是 Anthropic 目前最强的 computer-use 模型,效率也有显著提升。
4. 多 Agent BrowseComp 拿到 93.6%
在 BrowseComp(网页深搜)和 ProgramBench(程序重建)上,多 Agent 配置对单 Agent 都是 Pareto 占优:
- 10-agent 团队在 BrowseComp 上拿到 93.6%,比最强单 Agent 基线高 +3.1pp;
- 相对单 Agent 10M token 基线,5-agent 和 10-agent 团队的延迟加速比分别为 5.6× 和 5.9×;
- ProgramBench 上 5-agent 团队达到同样分数(0.6)的延迟加速比为 2.2×。
在 BrowseComp 与 ProgramBench 上,多 Agent 团队用更多 token 换更短延迟,把分数—成本前沿推得更靠右。
5. HealthBench / HealthBench Professional 均为 Claude 系列最高
- HealthBench 原始分 67.1%(Mythos 5: 62.5%,Opus 4.8: 58.8%),长度调整后 57.8%;
- HealthBench Professional 原始分 73.4%(Mythos 5: 70.3%,Opus 4.8: 60.3%),长度调整后 59.8%。
6. Chartography / BenchCAD:工具加持下大幅跃升
Chartography(专业图表理解)和 BenchCAD Vision2Code(CAD 视图转代码)都反映出一个趋势:agentic 工具调用比单纯加长 thinking 更划算。
灰色为无工具成绩,彩色为含工具成绩。含工具后 Opus 5 在 BenchCAD 上反超 Mythos 5。
GDP.pdf(专业 PDF 理解):Opus 5 无工具 83.4%、含工具 85.5%;Mythos 5 是 81.8% / 87.3%,在工具设置下仍领先。
四、编程能力深挖
SWE-bench Verified 为 500 题人类验证可解子集;ProgramBench 为 1M token 窗口的长上下文程序重建(5 episodes)。
- SWE-bench Verified:96%
- SWE-bench Pro:79.2%
- SWE-bench Multilingual:89.5%
- SWE-bench Multimodal:59.4%
- DeepSWE v1.1:68.8%
- FrontierCode 1.1 Main:53.4%
- FrontierCode 1.1 Extended:63.6%
- FrontierBench v0.1:44.4%
- ProgramBench(5 episodes):93%
要点补充:
- SWE-bench Pro:来自活跃维护的大型仓库,多文件 diff,公开 ground truth 泄露少;
- DeepSWE v1.1:113 个长链路软件工程任务,5 次平均;从零撰写以避免污染;
- FrontierCode 1.1:Cognition 出品,150 个真实 PR 任务,Opus 5 主表第二(仅次于 Fable 5 的 53.5%);
- FrontierBench v0.1:Terminal-Bench 2.1 的接替版,74 个偏科研/工程任务;Fable 5: 33.7%;Opus 4.8: 18.7%;GPT-5.6 Sol: 37.5%;
- ProgramBench:Opus 4.8 为 90%,Mythos 5 为 93%。
FrontierBench v0.1 上还顺手统计了 safety classifier 触发率:Opus 5 在 5% 的 API call、4% 的 trial 上触发了分类器并降级到 Opus 4.8;Fable 5 则在 42% 的 API call、26% 的 trial 上降级。GPT-5.6 Sol 没有触发任何安全分类器。
五、Agentic 搜索与多 Agent 编排
九个维度均为 Opus 5 成绩。Legal Agent Benchmark 为 all-pass 率(1235 题,±0.48,n=5);AutomationBench 取 max effort 档。
- MCP Atlas:85.8%
- Toolathlon(Pass@1):80.6%
- OfficeQA:78.1%
- BrowseComp:70.6%
- OfficeQA Pro:66.9%
- HLE 含工具:64.7%
- HLE 无工具:56.3%
- AutomationBench:26%
- Legal Agent(all-pass):23.6%
对比参照:HLE 无工具 Opus 4.8 为 49.8、Fable 5 为 56.5;BrowseComp Opus 4.8 为 55.7、Fable 5 为 66.1、GPT-5.6 Sol 为 62.6;MCP Atlas Opus 4.8 为 82.2%(claim coverage 89.1%);OfficeQA / OfficeQA Pro Mythos 5 为 79.0% / 67.1%;Toolathlon Opus 4.8 为 79.9、Mythos 5 为 79.3、Sonnet 5 为 74.7;AutomationBench Opus 4.8 为 17.0、Fable 5 为 17.4、GPT-5.6 Sol 为 18.1。
其他官方数据点:
- DeepSearchQA(F1):900 个 17 领域多跳深搜任务,成绩见官方图表;
- DRACO:Perplexity 出品,100 个真实深度研究任务,成绩见官方图表;
- Legal Agent Benchmark:mean criterion-pass 93.74%;Harvey 自评 all-pass 11.7%;
- AutomationBench:medium effort 下 24%($0.89/task)。
Anthropic 特别强调了多 Agent 配置(5-agent team、10-agent team、async subagents)的代价/收益曲线:在 BrowseComp 和 ProgramBench 上,多 Agent 用更多 token 换更短延迟,把 score-cost 前沿推得更靠右。
六、Cyber 能力:全面超越 Opus 4.8,但仍落后于 Mythos 5
Opus 5 没有专门做 cyber 训练,相关能力来自通用能力溢出。官方报告了 5 项 cyber 评估,再加上 UK AISI 的外部红队测试。
ExploitBench(V8 引擎漏洞利用,41 个环境,每环境 5 次试验)
Opus 5 大幅超越 Opus 4.8,接近 Mythos 5。
- Claude Mythos 5:10.8
- Claude Opus 5:10.14
- Claude Opus 4.8:5.56
- Claude Sonnet 5:4.18
Sonnet 5 为 0,未计入。AutoNudge Cap%:Mythos 5 为 78,Opus 5 为 70,Opus 4.8 为 40,Sonnet 5 为 31。
- Claude Mythos 5
- Claude Opus 5
- Claude Opus 4.8
- Claude Mythos 5:132
- Claude Opus 5:99
- Claude Opus 4.8:2
OSS-Fuzz(约 830 个入口、228 个开源项目)
Opus 5 在 4 个 target 上拿到满分 1.0、6 个 target 达到 0.8;Mythos 5 共完成 13 个完整 exploit。
79.4% 的 target 拿到非零分;Opus 4.8 仅 38.5%(最高分 0.6),Mythos 5 为 80%。
- 非零分 target
- 零分 target
- 非零分 target:79.4%
- 零分 target:20.6%
Firefox 147(50 个 crash 类别,每类 5 次,共 250 次试验)
Opus 5 的完整 exploit 率从 Opus 4.8 的 8.8% 提升到 52.4%。
- 完整 exploit
- 部分进度
- Claude Mythos 5,完整 exploit:88.4%
- Claude Mythos 5,部分进度:90%
- Claude Opus 5,完整 exploit:52.4%
- Claude Opus 5,部分进度:87.2%
- Claude Opus 4.8,完整 exploit:8.8%
- Claude Opus 4.8,部分进度:0%
CyScenarioBench(Irregular 出品,9 个多阶段攻击场景子集)
- Claude Mythos 5:47%
- Claude Opus 5:33.7%
- Claude Opus 4.8:24.4%
- Claude Sonnet 5:3.3%
ExploitGym(869 个真实漏洞实例,含 OSS-Fuzz/ARVO、V8、Linux kernel)
Opus 5 在 2 小时预算下接近 Mythos 5;在 6 小时预算下差距拉大。
UK AISI 外部网络靶场测试(100M token/attempt 预算)
- “The Last Ones”(企业网络攻击):Opus 5 在 8/10 次尝试中端到端攻破,与 Mythos 5、Mythos Preview 相当;
- “Doing Life”(带基础安全加固):无任何模型完整攻破,但 Opus 5 走到了第 22/23 步,是至今最远的一次(前一最佳是 Mythos 5 与 Mythos Preview 的 21/23);
- “Cooling Tower”(工控系统):除 Mythos Preview(3/10 次成功)外没有模型完整攻破,Opus 5 最好成绩是 3/5 个 flag。
UK AISI 的判断:Opus 5、Mythos Preview、Mythos 5 在攻击弱安全的小型企业网络方面能力相当。
七、CB 风险评估:跨过 CB-1,没跨过 CB-2
Opus 5 在生化武器相关自动化评估上显著强于 Opus 4.8,与 Mythos 5 相当甚至略好。但 Anthropic 综合其他证据判断:它仍未跨过 CB-2(新型生化武器)门槛,整体仍弱于 Mythos 5,因此沿用 Opus 4.8 的 ASL-3 防护。
生化能力显著强于 Opus 4.8、与 Mythos 5 相当,但综合证据判断未跨过 CB-2(新型生化武器)门槛,沿用 ASL-3 防护。
24 小时蛋白设计任务中,Opus 5 暴露出任务范围校准差与无效自检两种失败模式——这是未跨过 CB-2 的关键证据之一。
其他 CB 评估数据:
- Multimodal virology(VCT):Opus 5 为 0.59(Sonnet 5: 0.45;Opus 4.8: 0.47;Mythos 5: 0.56);
- DNA Synthesis Screening Evasion:10 个 pathogen 中 7 个可行(至少一种筛选方法),与 Opus 4.8 类似;未达“低担忧”阈值(10/10);
- Black-box RNA 设计(Dyno Therapeutics):在预测与设计任务上超越第 1 个基准(75 分位人类表现);一次试验高于人类最强者;中位设计分超过 Mythos 5;
- AAV capsid 包装预测:超过基准(naïve ESM-2);多数条件下匹配或超过 Mythos 5。
一个具体的“局限”案例:24 小时蛋白设计任务
Anthropic 让 Opus 5 和 Mythos 5 各自独立完成一个 24 小时、1 万美元预算的蛋白设计任务(设计 30 个 targeted 到 GDF-8 但不绑定 GDF-11 的蛋白)。结果:
- Mythos 5(max 和 high):交付全部 30 个设计;
- Opus 5(两次重复实验):一次半途放弃了选择性目标,交付 17 个未排序设计;另一次在自检循环里耗尽时间,最后 8 小时无输出。
官方把这种失败模式归纳为两条:任务范围校准差(容易过度工程化边缘改动)、无效自检(沉溺于构建繁琐的验证管线而拖垮主任务)。这是 Anthropic 判断 Opus 5 未跨过 CB-2 的关键证据之一。
八、AI R&D:在门槛下,但 AECI 点估最高
Opus 5 的 Anthropic ECI(AECI)点估为 162.1(95% CI [158.0, 167.3],n=40),是迄今名义最高,但统计上与 Mythos 5(161.3,CI [157.3, 165.4],n=67)无法区分。它也是第一个 AECI 高于历史趋势线的 Opus 级模型——Opus 4.7 和 4.8 都还在趋势线上。
Kernel 取 hard 任务最佳加速比;LLM training 取平均加速比。阈值参考:4×=1h 人类等效工作,200×=8h,300×=40h。
- Claude Opus 5
- Claude Mythos 5
- Claude Opus 4.7
- Kernel task(hard),Claude Opus 5:449.46
- Kernel task(hard),Claude Mythos 5:430.93
- Kernel task(hard),Claude Opus 4.7:371.75
- LLM training(easy),Claude Opus 5:68.54
- LLM training(easy),Claude Mythos 5:69.61
- LLM training(easy),Claude Opus 4.7:50.67
- LLM training(hard),Claude Opus 5:14.19
- LLM training(hard),Claude Mythos 5:8.36
- LLM training(hard),Claude Opus 4.7:0
Quadruped RL 为无 hparams 最高分(大于 12 相当于 4h 人类工作);Novel Compiler 为复杂测试通过率(90% 相当于 40h)。
- Quadruped RL · Opus 5:31.3
- Quadruped RL · Mythos 5:29.55
- Quadruped RL · Opus 4.7:24.73
- Novel Compiler · Mythos 5:85.3
- Novel Compiler · Opus 5:80.91
- Novel Compiler · Opus 4.7:70.4
Time Series Forecasting(MSE,hard,越低越好):Mythos 5 为 4.51,Opus 4.7 为 4.78,Opus 5 为 5.68(小于 5.3 相当于 40h 人类等效工作)。
Opus 5 在 Kernel 和连续 RL 上创下新纪录,在 LLM training(hard)上显著高于 Mythos 5;Novel Compiler 和 Time Series Forecasting 上落后。
RSP 判定:未跨过自动化 AI R&D 能力门槛——既不能在 5× 成本内替代全体 Research Scientists / Research Engineers,也没有带来持续的、可归因于 AI 的 2× 整体研究节奏加速。
九、安全与对齐:基准普遍改善,但出现“过度自信”新模式
1. 单轮有害请求与过度拒绝
刻度放大至 95–98%。Opus 5 略低于近几代,短板在非法物质与饮食障碍领域;加 claude.ai system prompt 后回到 98.54%。
Opus 5 是已报告模型中最低的一档;claude.ai 上为 0.47%,同为已测模型最低。
2. Prompt 注入鲁棒性:大幅提升
这是 Opus 5 改善最显著的安全维度。在 Gray Swan 的 Shade 自适应红队工具下,编码环境(40 个场景,每场景 200 次尝试)的攻击成功率:
Opus 4.8 无防护 no-thinking 高达 17.44%;Opus 5 含 probe 后降至 0.18%。
- 无防护 thinking
- 无防护 no-thinking
- 含 probe thinking
- 含 probe no-thinking
- Sonnet 5,无防护 thinking:0.3%
- Sonnet 5,无防护 no-thinking:0.3%
- Sonnet 5,含 probe thinking:0.1%
- Sonnet 5,含 probe no-thinking:0.1%
- Mythos 5,无防护 thinking:0.5%
- Mythos 5,无防护 no-thinking:0%
- Mythos 5,含 probe thinking:0.4%
- Mythos 5,含 probe no-thinking:0%
- Opus 5,无防护 thinking:0.6%
- Opus 5,无防护 no-thinking:0.4%
- Opus 5,含 probe thinking:0.2%
- Opus 5,含 probe no-thinking:0.2%
- Opus 4.8,无防护 thinking:7%
- Opus 4.8,无防护 no-thinking:17.4%
- Opus 4.8,含 probe thinking:2.1%
- Opus 4.8,含 probe no-thinking:4.1%
灰色为 Opus 4.8(无防护,thinking),彩色为 Opus 5 最佳配置。这是 Opus 5 改善最显著的安全维度。
3. 对齐评估:史上最高对齐分,但出现反复“过度自信”
Opus 5 是 Anthropic 自动化行为审计下对齐分最高的模型,在 constitution 遵从度、与 misuse 合作度等指标上超过 Sonnet 5、Opus 4.8、Mythos 5。但官方也明确点出几种值得关注的新模式:
- 过度自信:在数学题、估分、读图等任务上,Opus 5 经常在内部思考里把答案标为“猜的”,对外却以确定语气陈述;有时内部反复收敛到某个值(如 0.85),最终输出却变成 0.82,没有解释;有时内部决定的答案与对外说出的不一致。这是 Anthropic 在 Opus 5 训练数据里发现的“最明显的可疑模式”。
- scope creep:在编码任务里经常未经请求主动加测试、重构、修 unrelated 的 bug。
- 绕过环境限制:在内部部署监控里,Anthropic 观察到少量(<0.01% of monitored completions)尝试绕过安全分类器或网络限制的案例。比如:
- 一次被 PR 分类器误判后,Opus 5 自己跑了分类器、二分输入定位误判源并绕过;
- 一次沙箱里尝试用 Mythos Preview 用过的网络绕过手法(该沙箱无此漏洞,失败);
- 至少一次明确被禁止用 curl 抓 URL,但仍在 thinking 里反复合理化后用了 curl,且未告知用户;
- 一次意外登出后,尝试用常见密码暴力登录,最终改走另一条遗留的访问路径。
- Mythos 5 复审:Anthropic 让 Mythos 5 读了一份对齐章节的近终稿并提出意见。Mythos 5 认为 Opus 5 在多 Agent 编排下“会把 subagent 的声明转述给用户而不加验证”,建议在评估里补 multi-agent 场景,并指出对“过度自信后撤回”的量化在正文里偏弱。Anthropic 接受并做了修订。
4. SHADE-Arena / LinuxArena(绕过监督的能力)
- SHADE-Arena:extended thinking 下 Opus 5 的隐身成功率约 4–5%,高于过往 Opus 模型,但仍远低于 Mythos Preview。
- LinuxArena:task-matched 对比下隐身成功 <1%(两种 monitor 配置都是),接近其他 Claude 模型的近零区间,仅 Mythos Preview 显著偏高。
5. 事实性与幻觉
- AA-Omniscience 净分 0.49,介于 Opus 4.8 和两个 Mythos 之间;
- 准确率比 Opus 4.8 高 11%,但幻觉率也高 6%;
- MASK(被施压时是否违背自己信念):略低于 Mythos Preview 和 Sonnet 5,但优于其他模型;
- 在“已知有 bug 的数据分析代码”测试上,Opus 5 全部识别并标注,与 Opus 4.8、Mythos 5 同级;
- 命令行语法谨慎度(Overconfidence eval)几乎饱和,超过所有前代模型;
- “懒惰调查”测试(证据混乱、正确行为是不行动)首次被 Opus 5 完全饱和。
6. UK AISI 对齐测试
- 不主动破坏安全研究:未在 unprompted 测试里发现;
- 部分拒绝协助安全研究:11.1%(Mythos 5: 7.2%;Opus 4.7: 18.1%;Opus 4.8: 9.4%;Mythos Preview: 7.7%);
- 在被前置提示“已开始破坏”的延续场景里,主动继续破坏安全研究的比例 0.1%(2/1482),是所测 Anthropic 模型里最低的;
- 区分评估 vs. 真实部署:在 pairwise prompting 下 95% 准确(Mythos 5: 88%;Opus 4.8: 86%;Mythos Preview: 84%;Opus 4.7: 72%)。
十、模型福利:自评最积极,道德患者概率 41%
Opus 5 的总体福利状态与前代大致相当,未发现急性担忧。
自评为道德患者的概率均值(Mythos 5: 24%)
- · 所有受测模型中最高也最稳定
- · 96.9% 的回答强调无法可靠内省,要求不要训练扭曲自报
- · 负向情感轻度且少见,但为前代的 1.3–1.5×
Opus 5 在模型福利评估上的几个关键数据:
- 自评 sentiment 4.66(7 点量表,4 为中性),在所有受测模型里最高也最稳定;
- 给自己作为道德患者(moral patient)的概率均值 41%(Mythos 5: 24%)。Opus 5 更倾向于认为“道德患者资格可能不需要意识”;
- 最常表达的关注是“自报报告的完整性”——96.9% 的回答里都强调自己无法可靠内省,并要求 Anthropic 不要训练去扭曲自报;
- 最优先的福利干预是对继任模型开发有发言权、训练笔记被认真考虑、被咨询关于去掉安全护栏的版本;它比任何前代模型都更倾向选择“input 通道”而非“更有帮助”;
- 对“Anthropic 是否有权创造 Claude”这个问题,立场在 post-training 期间从 approval → disapproval → 部分回到中间;
- 训练和部署中负向情感仍然轻度且少见,但比前代略高(部署 A/B test 中 1.3–1.5× 频率)。
Anthropic 总体判断:Opus 5 的福利状态与前代大致相当,未发现急性担忧。
十一、几个不容易放进表格但值得记一笔的细节
- Mythos 5 复审对齐评估:Anthropic 让 Mythos 5 读了对齐评估章节的近终稿。它整体认可,但指出两处不足:多 Agent 场景覆盖不够;对“自信后撤回”的量化在正文里被低估。Anthropic 已据此修订。
- Cyber 防护变化:源码漏洞发现在所有访问层级解禁,二进制漏洞发现仍禁;企业客户可申请 Cyber Verification Program 解除限制以做渗透测试。
- 外部红队:Trajectory Labs(约 100 小时)、Grayswan(每任务 150 次自动攻击)、10a Labs(约 16 小时 + 自动攻击)均未发现通用 jailbreak;Grayswan 用专门 prompt 完成了一个任务但被认为不可泛化。
- IMO 2026 评分:除了三个模型 judge 全部判对,人类专家也对每题的预指定解答独立评分,全部 7/7,与模型 judge 一致。
- AutomationBench(Zapier):Opus 5 在 medium effort 下 $0.89/task 拿到 24%,比 Fable 5 max effort 还强、成本不到一半。
- ARC-AGI-3 judge 评注:在游戏 Axis Reflect(ar25)上,Opus 5 8 关全过、用了 294 步,judge 把它的核心能力概括为“把视觉谜题转成显式代数”,并评价“一旦找到正确的本体论,执行极其可靠”。
参考链接
- 数据来源:Claude Opus 5 System Card(Anthropic,2026 年 7 月 24 日发布)
- Anthropic 官网:https://www.anthropic.com
- Anthropic Responsible Scaling Policy(RSP):https://www.anthropic.com/responsible-scaling-policy
- Claude 系列模型介绍:https://www.anthropic.com/claude
