Claude Opus 5 因其发现软件漏洞的能力而与 Mythos 5 并列榜首。然而,他们将发现的内容转化为攻击代码的能力仍然远远落后。并不是我缺乏能力。在同一个模型中,有刻意绘制的线条。
Anthropic 于 2026 年 7 月 24 日宣布推出 Claude Opus 5,使其在所有平台上可用。价格为每百万输入代币 5 美元,每百万输出代币 25 美元,与 Opus 4.8 的价格相同。它将成为 Claude Max 的默认型号和 Claude Pro 的顶级型号。
它在 Frontier-Bench v0.1 中的表现优于所有其他模型,得分是 Opus 4.8 的两倍多。在ARC-AGI 3中,它是亚军模型的3倍,而在CursorBench 3.2中,在设置最大努力时,与Fable 5的差异在0.5%以内。在内部生命科学评估中,它在有机化学任务中比 Opus 4.8 高出 10.2 分,在蛋白质相关任务中比 Opus 4.8 高出 7.7 分。自动行为审计中不一致行为的总分是 2.3。网络分类器的干预频率预计比《神鬼寓言 5》低约 85%。API 上的模型名称为 claude-opus-5,快速模式的运行速度约为默认速度的 2.5 倍。
从:
克劳德作品 5 简介(人择)

[参考视频]
【编辑部评论】
Claude Opus 5 在查找软件漏洞方面与 Mythos 5 非常接近。
根据Anthropic公布的OSS-Fuzz评估结果,两者在漏洞识别方面的得分处于相似水平。 Mythos 5是一款顶级型号,由于其较高的网络能力,其可用性受到限制,因此这意味着它已经达到了相当的水平。
另一方面,Opus 5 在将发现的漏洞转化为可利用代码的能力方面远远领先于 Mythos 5。
这两者在同一模型中是分开的。我认为这是本次公告最值得关注的地方。
不是我做不到,而是我用两步就压制住了。
让我澄清一下以避免误解。这并不是说 Opus 5 没有漏洞利用功能。据报道,它明显逊色于《神话5》。
首先,在能力方面,继Opus 4.8之后,Anthropic有意不再针对网络任务专门训练Opus 5。尽管如此,由于通用能力的提高,该领域的成果仍显着改善。该公司解释说,达到前沿级发现能力是其副产品。
最重要的是,操作保障措施是重叠的。虽然允许在源代码中查找漏洞,但禁止基于二进制的漏洞扫描、渗透测试和漏洞利用生成。包含二进制扫描是因为它是一种经常与恶意行为者相关的方法。当然,这并不意味着使用这种技术的人总是怀有恶意。
避免针对网络的培训并使用分类器缩小操作范围。这种两阶段结构确立了“找到它,但不要让它超出范围”的设计。
紧缩区域和延期区域
有趣的是,保障措施并未全面收紧。
在网络领域,自 Opus 4.8 以来,防护栏得到了加强。然而,与《神鬼寓言 5》相比,Anthropic 预计分类器会更加温和,干预频率也会减少约 85%。
在生物学领域,判断是不同的。 Opus 5 的保障措施与 Opus 4.8 大致相同。我们并没有放松安全措施。改变的是容器:之前,《神鬼寓言 5》中阻止的生物学相关请求被路由到 Opus 4.8,但现在它们将被路由到 Opus 5。看起来只有响应模型的性能有所提高,同时保持了相同的限制。
因此,Anthropic 将 Opus 5 评为最高性能的通用科学研究模型。但需要注意的是,这是该公司自己的解释,并不是包含其他公司型号的客观排名。
网络方面的规定将会收紧,但生物学方面的规定将保持不变。没有统一的强弱,而是针对每个领域做出不同的判断。这就是原因。
而不是“我们应该有多聪明?”哪些能力应该放在哪一层以及如何放置?”。我的解读是,该公告的实质在于,这是作为产品规格而明确表述的。
合法业务停止时的逃生路线
这种设计有一个不可避免的副作用。这是因为防御方的许多安全操作都遵循与攻击方相同的步骤。
其容器是网络验证程序(CVP)。与针对有限数量组织的 Project Glasswing 不同,该项目需要申请,Anthropic 的目标是在提交后两个工作日内通知审核结果。已经参与的公司和研究人员将可以立即访问安全限制较少的 Opus 5 版本。
但取消的范围是有限的。块目标分为两层,CVP 涵盖分类为“高风险/双重用途”的区域。即使通过审查,勒索软件开发、大规模数据泄露等禁止用途也不会解除。此外,由于 CVP 需要启用数据保留,因此零数据保留运营的组织将需要准备一个单独的工作区。
Anthropic 本身也承认,它有时会错误地拒绝符合条件的申请,甚至授权用户也可能被阻止从事合法工作。
一个“分类器决定回答哪个模型”的世界
我想提的另一件事是自动回退,它同时发布了测试版。
此功能将安全分类器标记的请求定向到另一个模型,而不是拒绝它们。 Claude.ai、Claude Code 和 Claude Cowork 已默认切换到 Opus 4.8,用户现在也可以在 API 中选择它。启用后,一些被分类器拒绝的请求会自动路由到可用的替代模型。
然而,它并不完美。如果没有合适的后备目的地,则拒绝将仍然存在,并且首先不涵盖速率限制和服务器错误。在实践中,重要的是要理解这个函数并不“总是给你一个答案”。
我还想添加一些有关控制的信息。该 API 允许用户指定后备候选模型,响应包括实际使用的模型名称。您可以记录哪个型号回答了。此外,标记请求的标准是私有的。在需要再现性和审计的操作中,如何处理这种不对称性将是一个需要考虑的问题。 VentureBeat还指出,未来将取决于企业是否接受这种设计。
此功能的背景
如果你知道过去两个月发生的事情,你就能理解为什么自动回退的想法看起来并不突然。
《神鬼寓言5》和《神话5》于2026年6月9日上映。然而,三天后的6月12日,美国商务部出于国家安全原因发布出口管制指令,下令暂停外国人访问。由于无法实时确定用户的国籍,Anthropic 已暂停所有客户的这两种模型。该指令于 6 月 30 日取消,《神鬼寓言 5》于 7 月 1 日恢复全球发售。
在过去的几个月里,Anthropic 被迫面对如何在安全机制被触发时让用户继续工作的问题。 Fallbacks、CVP 和这种分层设计可以被解读为答案。然而,这只是我的假设,人择本身并没有将两者解释为因果。
不自称“最强”的旗舰
到目前为止,我们已经了解了安全设计,但我们也来谈谈性能和成本。
Opus 5 的定价为每百万输入代币 5 美元,每百万输出代币 25 美元。自上一代 Opus 4.8 以来,这一点一直保持不变。同等价格下,Frontier-Bench v0.1 的得分提高了一倍多。
根据公告中的脚注,在本次评估中,当分类器发生拒绝时,Opus 4.8 被用作 Opus 5 和 Fable 5 的后备目的地。重要的是要记住,这些数字并不纯粹针对单个模型。此外,本文中涉及的许多基准测试都是由 Anthropic 内部运行的,我们目前无法确认任何第三方的可重复性。
最重要的是,Anthropic 并没有将 Opus 5 称为“最智能的型号”。这个位置仍然属于《神鬼寓言 5》。官方模型指南还为那些需要最高性能的人组织了《神鬼寓言 5》,为日常复杂任务组织了《Opus 5》。不过,Opus 5 已成为 Claude Max 的默认型号以及 Claude Pro 可用的顶级型号。
结果,“最智能模型”和“最常用模型”被分开。据 VentureBeat 报道,这两个条件一致的时代持续了大约三年。这个想法是,公司一直在竞争,看看他们最好的模型在最好的日子里能做什么。虽然这不是一个可以量化验证的突破,但可以解读为Opus 5的定位已经让竞争轴心的转移变得可见。
彭博社报道称,此次推出正值中国消费者的成本意识日益增强以及竞争加剧之际。
称为“努力”的旋钮本身已成为评估轴。
从成本角度来看,您要记住的是工作量设置。
这本身并不是一个新功能。 Opus 4.6 中作为 4 级控制引入,Opus 4.7 在高和最大值之间添加了 xhigh。 Opus 5 有 5 个级别:低、中、高、xhigh 和 max。它是一个系统,允许你选择“让玩家思考的深度”,同时保持相同的模型,并调整每个任务以最大化智力或节省代币并快速且廉价地完成任务。
这次改变的并不是功能本身。如何治疗是。演示材料中的性能图表都是在成本与性能的平面上绘制的。它不是一个单一的分数,而是以每个努力水平的曲线的形式呈现。我们展示产品的方式已经从询问“这个模型有多少件?”变成了“我们在这个预算下能走多远?”
请注意,一些海外新闻报道简单地将工作阶段介绍为“低、中、高”。实际规范分为五个阶段,因此我们建议在考虑实施时检查API文档。
这对日本开发网站意味着什么
实际影响可大致分为两类。
一是可以用相同的预算做更多的事情是。在价格不变的情况下,公布的业绩有所增加,并且多个客户报告他们的代币消耗有所减少。据报道,在法律案件中,与 Opus 4.8 最大推理相同的质量是通过平均减少 26% 的代币来实现的,而在金融建模案件中,据报道花费的时间减少了 60%。不过,这些都是 Anthropic 在自己的公告中公布的示例,实际的减少率会根据任务内容和工作量设置而有所不同。
另一件事是确认安全操作中的界限是。该政策是允许发现源代码中的漏洞,但排除渗透测试。然而,实际的判断取决于请求的内容和上下文,因此认为所有代码审查都会通过并且所有渗透测试都会停止还为时过早。只要有一条名为CVP的申请途径,就有空间将其纳入计划,而不是停下来就放弃。
从长远来看要寻找什么
经常被忽视的是对齐审核的结果。 Opus 5 在自动行为审计中获得了 2.3 的总分,这是 Anthropic 最新模型中得分最低(最好)的。对克劳德宪法的遵守甚至超过了寓言5。请注意,这是公司自己的审核指标,不能与其他公司的模型进行绝对比较。
更智能的模型并不一定意味着它更容易使用。Opus 5 的得分表明事实可能恰恰相反。选择不追逐前沿和易于操作的结合。在实践中如何评估这种组合还有待观察。
然而,有一件事我确信。仅通过“它们变得有多聪明”来衡量人工智能模型的代际变化意味着它们即将到期。如何设计技能图。我们现在已经进入了一个每个公司的想法都得到表达的时代。
[相关文章]
人性化的《克劳德十四行诗 5》公布,接近顶级 Opus 4.8 - 能够以低价运行一整天的自主代理有何威力?
上一代的公告。补充定价策略和模型层次假设。
带限制器的最强模型——克劳德寓言5,为什么安全专家抱怨它不能用于工作
本集首先从研究者的角度讨论停止合法业务运营的问题。这和这次CVP的描述有直接关系。
克劳德寓言5发布,Anthropic最强模型向公众发布,配备安全设备
一篇介绍《神鬼寓言5》/《神话5》的等级和价格的基础文章。您可以查看“半价”的依据。
Claude Opus 4.6 发布,拥有 100 万个代币上下文和自主代理能力
当努力控制首次作为四步过程引入时。这证实了此设置不是新功能。
Claude Opus 4.8发布,Anthropic的“诚实AI”是什么?
努力控制的详细解释。您可以比较上一代和本次更改的规格。
人择神话5,美国政府允许重新开放|仅限 100 多个关键基础设施组织使用
出口管制指令取消的历史。这是背景说明的详细版本。
RefluXFS:由AI发现、由AI起草——隐藏9年的漏洞全貌及Linux内核root捕获
人工智能发现漏洞并编写修复程序的示例。这是支持可以做出发现这一观点的最新例子。
[编者后记]
发现漏洞后,需要确认它是否真正危险。这是测试攻击是否真正有效的过程。就在这时,Opus 5 停了下来。
发现者本身无法衡量该发现的分量。这就造成了只留下可能是误报的报告的情况。
发现的作用和确认的作用。让他们分开是更安全,还是让他们确认会更具保护性?对于已通过 CVP 筛选的组织和未通过 CVP 筛选的组织来说,这个答案是否有所不同?
【术语解释】
effort(努力度)设定
这是一个参数,它指定逐步深入思考同一模型的程度。 xhigh 在 Opus 4.6 中作为第四级引入,在 Opus 4.7 中添加。 Opus 5 有 5 个级别:低、中、高、xhigh 和 max。 Opus 5 的性能图表全部以成本与性能平面的形式显示,因为成本和智能之间的平衡可以根据任务进行调整,而无需更改模型。
代币
它是AI模型处理句子时的最小单位。它对应于一个单词或字符的一个片段,输入和输出都以这个单元计费。 Opus 5 的价格为每 100 万个输入代币 5 美元(约 815 日元),每 100 万个输出代币 25 美元(约 4075 日元)(根据 2026 年 7 月 23 日的汇率换算为 1 美元=163 日元)。正是由于这种收费结构,“用更少的代币提供相同的质量”的报告意味着更低的有效成本。
开发
指将发现的漏洞转换为实际可以利用的形式的代码或方法。 “发现”漏洞和“使其被利用”是两项技术上不同的任务,虽然 Opus 5 在前者方面接近 Mythos 5,但在后者方面却远远落后。这种不对称性是该防护设计的核心。
美国模糊
谷歌推出的开源软件的持续模糊测试基础设施。 Anthropic 使用这种 OSS-Fuzz 衍生的挑战来构建独特的评估,衡量模型在没有人类详细指令的情况下发现和进一步利用漏洞的能力。它的独特之处在于,它是从发生崩溃到控制流夺取的各个阶段进行评分的。
模糊测试
它是一种通过向程序输入大量随机输入来自动检测意外行为和漏洞的方法。 OSS-Fuzz 是作为一种持续执行此操作的机制而运行的。
倒退
当安全分类器标记请求时,系统会将处理重定向到另一个模型,而不是拒绝响应。 Claude.ai、Claude Code 和 Claude Cowork 默认切换到 Opus 4.8。现在,用户还可以在 API 上选择自动回退。但是,如果没有合适的替代模型,拒绝将仍然存在,并且速率限制和服务器错误将不会被覆盖。
分级机(安全分级机)
这是一种确定输入或输出是否属于危险用途的机制。 Opus 5 允许发现源代码中的漏洞,但阻止基于二进制的扫描、渗透测试和漏洞利用生成。与《神鬼寓言 5》相比,干预频率预计降低约 85%。
渗透测试
它是一种合法的安全验证方法,通过实际尝试闯入系统来发现防御中的弱点。由于它遵循与攻击相同的步骤,因此 Opus 5 默认阻止它。
网络验证计划(CVP)
Anthropic 用于支持合法网络安全操作的框架,否则这些操作将受到保障措施的阻碍。参与的公司和研究人员将立即获得安全限制较少的 Opus 5 版本。这是一个申请系统,Anthropic 的目标是在两个工作日内通知考试结果。不过,勒索软件开发等禁止用途即使通过审核也不会解除,只有被归类为“高风险/双重用途”的领域才会解除禁令。假设在组织级别给予批准并且启用数据保留。
玻璃翼计划
Anthropic 于 2026 年 4 月启动了该计划,旨在保护网络安全组织和关键基础设施运营商。 Mythos 5 等消除了网络相关限制的模型将提供给有限数量的已通过筛选过程的组织。与需要申请的 CVP 不同,参与组织是有限的。
神话等级/寓言5/神话5
这是放置在 Opus 之上的模型层次结构。 《神鬼寓言5》和《神话5》的底层模型相同,区别在于有无保障措施。 《神鬼寓言 5》已正式上市,定价为每百万输入代币 10 美元,输出代币 50 美元。 Mythos 5 是限量版,删除了一些安全限制,可供参与 Glasswing 项目的组织使用。 Opus 5 的设计定位低于此层次结构,但却是日常使用的中流砥柱。
克劳德宪法
Anthropic 发布的一份文件,定义了克劳德的行为原则。在自动化行为审计中,对本文件的遵守程度是评价标准之一。 Opus 5 的合规性高于 Opus 4.8、Sonnet 5 和 Fable 5。
前沿长凳
它是衡量实际软件工程能力的基准。 Opus 5 在 v0.1 中的得分是 Opus 4.8 的两倍多,而且每项任务的成本更低。请注意,公告中公布的数字是Anthropic内部实施的结果。
ARC-AGI
该评估衡量推理抽象规则并将其应用于未知问题的能力。 Opus 5 在 ARC-AGI 3 中的得分是亚军模型的三倍。
输出管理指令
这是美国政府出于国家安全考虑,限制某些技术和产品向海外提供的措施。 2026 年 6 月 12 日,美国商务部下令暂停外国人访问《神鬼寓言 5》和《神话 5》,而 Anthropic 则因难以立即确定国籍而暂停了所有用户对这两款游戏的访问。该指令于 6 月 30 日解除,《神鬼寓言 5》于 7 月 1 日恢复全球发行。
[参考链接]
人智官方网站
开发克劳德系列的美国人工智能公司。它将安全研究置于其业务的核心,并发布了“负责任的扩展政策”等政策。
克劳德 Opus 5 系统卡
总结 Opus 5 功能和安全评估的技术文件。生物和攻击性网络安全评估结果很详细。
克劳德宪法
定义克劳德行为原则的公开文件。它被用作一致性评估的标准,并且在本次审核中还衡量了合规性。
模型概述(Claude Platform Docs)
官方模型指南。如果你需要最高级别的能力,你可以使用《神鬼寓言5》,如果你需要复杂的日常任务,你可以使用《作品5》。
Effort(Claude 平台文档)
努力设置的官方规范。列出了从低到最大的五个阶段及其对代币使用和成本的影响。
拒绝和回退(Claude Platform Docs)
自动回退的操作条件。您可以检查没有合适的替代模型时的行为以及如何指定后备候选模型。
Opus 5 提示指南
关于如何编写说明以充分利用 Opus 5 的官方指南。它还涉及如何使用工作量设置。
Claude Opus 和 Sonnet 的实时网络保护
适用于 Opus 和 Sonnet 的网络保护措施的说明。它描述了如何申请 CVP、审查期限和数据保留要求。
玻璃翼计划
有限计划的官方页面,该计划提供已取消关键基础设施网络限制的模型。您可以检查目标和目的。
OSS-Fuzz(谷歌/GitHub)
由 Google 运营的开源软件的持续模糊测试基础设施。 Anthropic的评价就是基于这一系列问题。
克劳德定价页面
列出 Claude Pro、Max、Team 和 Enterprise 计划以及 API 价格。您可以查看 Opus 5 产品的范围。
前沿长凳
衡量实际软件工程能力的基准的官方网站。评估方法和排行榜已公布。
人工分析(GDPval-AA评估)
一个评估机构,从第三方角度比较各公司模型的性能和成本。 GDPval-AA 分数独立发布。
扎皮尔
一家提供商业自动化服务的美国公司。通过AutomationBench,我们正在评估一个AI模型是否能够完成端到端的业务流程。
[参考文章]
介绍克劳德作品5(人择)
有关此案的主要信息。已公布价格与 Opus 4.8 相同,每百万输入代币为 5 美元,输出为 25 美元,在 Frontier-Bench v0.1 中比 Opus 4.8 贵两倍多,在 ARC-AGI 3 中比亚军模型贵三倍,自动行为审计总体得分为 2.3,网络分类器干预频率预计比 Fable 5 降低 85% 左右。源自OSS-Fuzz的派生表现出不对称性,虽然它在漏洞发现方面接近Mythos 5,但在漏洞利用开发方面却明显逊色。脚注指出,如果在评估过程中发生分类器拒绝,则会回退到 Opus 4.8。
克劳德寓言5和克劳德神话5(人择)
主要信息显示,《神鬼寓言 5》的价格为每百万个输入代币 10 美元,输出代币 50 美元。这就是Opus 5被认为是“半价”的原因。还明确指出,两种模型基于相同的基础,区别在于有或没有保障措施。
Anthropic 推出 Claude Opus 5,一种更便宜的 AI 模型,用于编码、代理和企业工作流程(VentureBeat)
在确定价格不变后,我们分析人工智能竞争的轴心正在从原始能力转向日常使用的经济效率。 Anthropic 并未声称 Opus 5 是最智能的型号,并指出 Fable 5 仍然处于这一位置。他提出的论点是,未来将取决于公司是否接受由安全分类器而不是用户决定哪个模型响应的情况。同一篇文章还总结了各公司争夺最佳模型性能的时期。
Anthropic 发布 Claude Opus 5:这就是它与现有产品的不同之处(《财富》)
在人们担心人工智能使用成本飙升的背景下,报告重点关注了用户可以通过努力设置来调整成本与能力之间的平衡。文章将努力阶段简单介绍为低、中、高,与官方规范中的5个阶段不同。 Opus 5 是该公司继 6 月份的《Mythos 5》、《Fable 5》和《Sonnet 5》之后不到两个月内发布的第四个版本。
Anthropic 推出 Claude Opus 5 AI 模型,用于负担得起的工作场所任务(彭博社)
Opus 5 在许多方面都接近《神鬼寓言 5》的功能,但价格却只有《神鬼寓言 5》的一半,理由是客户的成本意识不断增强,以及中国竞争的加剧,这是其推出的原因。我们报道称,Anthropic 将 Opus 5 定位为满足日常业务需求的默认选择。
重新部署克劳德寓言5(人择)
6月30日出口管制指令解除、7月1日《神鬼寓言5》重启的主要信息。还值得注意的是,Mythos 5 仅恢复给部分美国组织。
Anthropic 称特朗普政府已取消对《克劳德寓言 5》和《神话 5》的出口管制(CNBC)
它报道了《神鬼寓言 5》和《神话 5》如何因 2026 年 6 月 12 日收到美国政府的出口管制指令而被暂停,以及如何解除。该指令要求停止外国人的访问,并将外国人纳入 Anthropic 内部。
Anthropic发布神话级《神鬼寓言5》模型,防范网络风险(CSO Online)
一篇从安全实践角度整理Mythos类和Opus系统之间关系的文章。它解释说,通过 Project Glasswing 向防御组织和关键基础设施运营商提供了删除网络限制的版本。
Anthropic 推出 Opus 5 型号,为今年晚些时候的 IPO 做准备(雅虎财经)
Opus 5定位为Claude 5家族中的第四款机型,其与Mythos 5、Fable 5的层级关系是井井有条的。我解释说,Mythos 5 的可用性由于其高黑客能力而受到限制。
Cycode加入Anthropic的网络验证计划(Cycode)
CVP 参与公司的评论。拦截目标分为两层:“禁止用途”和“高风险/双重用途”。前者包括因勒索软件开发或大规模数据泄露而无法删除的情况,后者包括漏洞利用分析和攻击性安全工具,并可能被 CVP 删除。
Mondoo 加入 Anthropic 网络验证计划(Mondoo)
它从一个实际获得批准的公司的角度解释说,CVP是针对Opus类型模型的免费申请程序,并且经过申请和审核后在组织层面获得批准。批准仅限于申请时声明的使用范围。
Anthropic 的网络验证计划实践:从批准到真正的防御工作
这篇文章从从业者的角度审视了 CVP 审批流程以及分类器实际解锁的内容。它澄清了 CVP 在组织和 API 密钥的基础上应用,而不是作为消费者帐户功能,并且仅限于 Opus 和 Sonnet 类。
