克劳德寓言5发布,Anthropic最强模型向公众发布,配备安全设备

Anthropic 推出了 Claude Fable 5,它比他们向公众发布的任何型号都更强大。有一种机制可以让模型自动回答可能导致网络攻击或危险生物研究的问题。同时,性能相同但有一些限制的限量版Mythos 5也已发布。我们将组织广泛分发最强大的工具和安全设备的挑战的总体情况。


Anthropic 于 2026 年 6 月 9 日发布了 Claude Fable 5。它是一款 Mythos 级模型,已确保通用性安全,据说超出了该公司之前向公众提供的模型的功能。如果分类器检测到与网络安全、生物/化学或蒸馏相关的请求,我们会实施回退,其中亚军模型 Claude Opus 4.8 平均会在不到 5% 的会话中做出响应并触发。

同一天,《克劳德神话 5》将发布,其基本模型与《神鬼寓言 5》相同,但删除了一些保障措施,并将与美国政府合作通过 Project Glasswing 作为克劳德神话预览版的继任者进行部署。在早期测试中,Stripe 报告称在一天内完成了 5000 万行 Ruby 代码库的完整迁移。

价格为每百万个输入代币 10 美元,每百万个输出代币 50 美元,API 模型名称为 claude-fable-5。订阅计划将于 6 月 9 日至 6 月 22 日期间免费提供。

从: 克劳德寓言5和克劳德神话5

【编辑部评论】

关于这个公告,我首先要注意的是“Mythos”和“Fable”这两个名字之间的关系。两者的基本模型相同,功能上没有差异。唯一的区别是有或没有保障措施。Anthropic 在脚注中解释说,《寓言》源自拉丁语 fabula(被讲述的事物),与希腊神话有关。尽管能力相同,但普通版被称为《神鬼寓言 5》,配备了防止危险使用的机制,而没有此机制的限定版被称为《神话 5》。

技术上的新内容是“后备”设计不会“拒绝”被视为危险的请求,而是将处理转移到下一个较低版本 Opus 4.8。大概。其中包括与网络安全、生物/化学和“蒸馏”相关的问题,“蒸馏”窃取了您自己模型的功能。对于用户来说,被拒绝是一种更自然的体验,但由 Anthropic 来划定高风险的界限。

这种机制之所以有效,是因为神话职业所拥有的能力对社会有着广泛的影响。正如 Stripe 的例子所示,它将彻底改变开发现场的生产力,并在药物发现和分子生物学方面产生新的假设。在错误的人手中,同样的力量可以帮助发现漏洞和设计病毒。文章中的 AAV(基因治疗载体)示例如下:这是一个象征性的案例,表明善意的基因治疗研究和危险的转移在技术上是紧密相连的。是。我相信这种“双重用途”才是这项安全措施所要解决的本质问题。

您不能错过的是公告的时间。就在几天前,即 6 月 5 日,Anthropic 谈到了“递归自我改进”的危险,即人工智能在没有人类干预的情况下自我改进,并警告整个行业对发展踩“刹车踏板”。紧接着,该公司将向公众发布其最强大的车型。是否将发出警报和踩油门的态度视为矛盾或与内置安全装置一致的动作,由读者自行决定。

与法规的关系也是一个重要的伏笔。在美国,6 月 2 日签署了一项行政命令,建立了一个自愿框架,允许在公开发布之前向联邦政府自愿提交 Frontier 模型,并允许最多提前 30 天提前使用。这种回退设计和30天数据保留政策可能符合这一政策趋势。 Anthropic 与国防部之间还就将该公司的技术指定为“供应链风险”存在持续争议,该公司与政府的距离可能影响了其产品设计。

从长远来看,这“尖端功能与安全设备一起分布的范围有多广?”问题的实施解决方案我可以这么说。在同一模型内释放和包含功能之间切换的想法可能会成为未来的行业标准。然而,Anthropic 本身也承认,遏制措施并不完美,并指出英国 AISI 在短时间内已接近突破。利益与风险之间的拉锯战仍将持续。我们需要既希望又谨慎地观察这一过程。

【术语解释】

神话类
它是 Anthropic 模型层次结构中的最高层,位于 Opus 类之上。第一个《克劳德神话》预览将于 2026 年 4 月推出,随后是《神鬼寓言 5》和《神话 5》。

克劳德寓言 5 / 克劳德神话 5
尽管它们都是相同的基本型号,但它们通过有无安全装置来区分。 《神鬼寓言 5》是已确保公开发布的安全版本,《神话 5》是删除了一些安全装置的限量版版本。

近距离工作 4.8
Anthropic 的高性能模型于 2026 年 5 月下旬宣布。它充当“亚军模型”,接管响应《神鬼寓言 5》确定为高风险的请求的责任。

倒退
一种将处理切换到另一个模型(在本例中为 Opus 4.8)而不是拒绝请求的机制。用户将收到切换已发生的通知。

分类器(classifier)
一个独立的人工智能系统,可以检测误用或越狱尝试并阻止模型响应。

蒸馏
一种提取一个模型的能力并使用它们来训练另一个竞争模型的方法。在《神鬼寓言 5》中,确定被提炼的请求也将回落到 Opus 4.8。

越狱
尝试以不存在安全装置的方式操作模型。在任何情况下都可以绕过安全措施的系统被称为“通用越狱”。

双重用途
同一技术或信息可以用于有益目的和有害目的的属性。网络和生物领域的先进能力就是典型的例子。

AAV(腺相关病毒)
在基因治疗中将基因携带到细胞中的载体。它是一个典型的双重用途目标,相同的设计能力可以重新用于开发危险的病毒,同时可用于治疗。

代币
AI处理句子时的最小单位。输入和输出的费用按每 100 万个代币设定。

再帰的自己改善(recursive self-improvement)
人工智能无需人工干预即可持续改进自身的能力。这是 Anthropic 在 6 月 5 日警告“需要刹车踏板”时提出的中心观点。

英国 AISI(AI Security Institute)
英国政府下属的人工智能安全评估机构。此次,据称《神鬼寓言5》的安全措施在短时间内取得了突破。

[参考链接]

Anthropic|Claude Fable(制品ページ)(外部)
产品介绍页,总结了《神鬼寓言》车型的定位和特点。这是 Mythos 类的公共版本。

人类|玻璃翼计划(外部)
专门为网络防御者和关键基础设施提供商提供 Mythos 课程的计划的官方页面。这是 Mythos 5 的初始部署目的地。

Anthropic|克劳德(官方上)(外部)
提供有关 Anthropic 整个公司和产品信息的官方网站。这是您了解最新模型、研究和安全计划的门户。

条纹(外部)
一家提供在线支付基础设施的美国公司。在早期测试中,他们报告说他们能够在一天内完成 5000 万行 Ruby 代码库的完整迁移。

Claude API|型号列表(开发者文档)(外部)
供开发人员使用每个模型(包括 claude-fable-5)的官方文档。您可以检查规格和用途。

[参考视频]

我们无法通过官方渠道确认《克劳德寓言5》的单独解说视频。由于很难判断通过搜索找到的非日语解说视频的可靠性,因此我们不会根据本媒体的标准发布它们。此外,Anthropic官方博客还发布了《神鬼寓言5》仅使用视觉信息通关《神奇宝贝火红》的延时视频。我们建议检查主要信息以直观地了解您的能力。

[参考文章]

CNBC|Anthropic向公众发布类似神话的AI模型,《克劳德寓言5》(外部)
据悉,《神鬼寓言 5》在某些基准测试中比 Opus 4.8 的性能提升了 10% 以上。它解释了能力的飞跃如何需要额外的护栏,并且还触及了投资者对 IPO 的兴趣。

TechCrunch|Anthropic 的《克劳德寓言 5》是如今公众可以访问的 Mythos 版本(外部)
强调经过 1000 多个小时的外部 bug 赏金后,尚未发现通用越狱。他们指出,与危险警告几天后才宣布这一消息存在差异。

VentureBeat|Anthropic 通过《克劳德寓言 5》将神话带入大众(外部)
需要指出的是,虽然价格不到Mythos Preview价格的一半,但却是各大机型中最贵的。告诉他们持久内存使 Slay the Spire 的性能提高了 3 倍。

NBC新闻|Anthropic发布《神鬼寓言5》,首个公开的神话级模型(外部)
关于如何向全球 150 多个组织提供 Mythos Preview 的摘要。我们将讨论药物发现和分子生物学领域的创纪录,以及与总统命令的关系。

Crowell & Moring|行政令创建前沿人工智能模型自愿监管制度(外部)
从法律角度解读6月2日签署的总统令。发布前 30 天自愿向联邦政府提交的框架正在制定中。

CNN Business|Anthropic 警告人工智能很快就能在无需人类干预的情况下自我改进(外部)
6月5日报告“刹车踏板”警告。它还涉及递归自我完善的危险以及与 IPO 申请的时间重叠。

CNBC|特朗普签署人工智能行政命令,要求企业让政府尽早使用模型(外部)
报道6月2日签署的总统令。它还提到国防部如何将 Anthropic 指定为“供应链风险”,并且该公司正在诉讼中。

[相关文章]

Anthropic 警告人工智能创造自身的“递归自我完善”——克劳德编写了超过 80% 的内部代码
一篇关于《神鬼寓言 5》上映前夕的“刹车踏板”警告的文章。这是了解发布时间的背景的先决条件。

特朗普行政命令,政府30天前访问AI前沿模型 |解释自愿安全框架
这是一篇补充本文“提前30天提交”和“数据保留30天”监管背景的解释性文章。

Claude Mythos/Anthropic 的新人工智能将撼动世界金融机构
这是该系列的第一篇文章,解释了神话类是什么以及为什么它们从未向公众发布。

[编者后记]

说实话,我在写这篇文章的时候停顿过好几次。 “我们已经为任何拥有安全设备的人提供了世界上最强大的模型。”这是一个简单的陈述,但我仍然没有完全理解这句话的重要性。

如果你使用克劳德或其他人工智能并且屏幕发生变化并说“从这里开始另一个模型将回答”,你会有什么感觉?您是否感到受到保护或感到一堵墙?答案可能会根据你当天要做的事情而改变。我也是。

我确信的一件事是,从现在开始,在谈论技术时,“我们不做的事情”将变得和“我们能做的事情”一样重要。如果我能继续和大家一起跟进油门和刹车的故事,我会很高兴。