人工智能在工作时可以同时保存10本书以上信息的时代已经到来。 Anthropic于2026年2月5日宣布的Claude Opus 4.6配备了100万个代币上下文窗口,并实现了显着超过OpenAI的GPT-5.2的性能。它有可能改变知识工作的概念。
Anthropic 于 2026 年 2 月 5 日发布了 Claude Opus 4.6。该模型改进了编码能力,并将成为第一个在测试版中具有 100 万个令牌上下文窗口的 Opus 类。它在代理编码评估 Terminal-Bench 2.0 中取得了最高分,在 GDPval-AA 中,它以约 144 分的 Elo 击败 OpenAI 的 GPT-5.2,以 190 分击败其前身 Claude Opus 4.5。
新功能包括自适应思维、四级工作量控制、上下文压缩以及 Claude Code 中的代理团队。最大输出代币增加至 128k。价格保持不变,为每百万代币 5 美元/25 美元,超过 200,000 个代币则适用 10 美元/37.50 美元。可在 claude.ai、API 和主要云平台上使用。
我们还对 Excel 中的 Claude 进行了重大升级,并发布了 PowerPoint 中的 Claude 作为研究预览。

【编辑部评论】
Claude Opus 4.6 标志着 AI 模型演进的一个重要转折点。最值得注意的是,它首先在 Opus 类中实现100 万个令牌上下文窗口大概。
一百万个代币相当于大约 750,000 个日语字符和大约 750,000 个英语单词。这个容量可以同时容纳 10 多本标准书籍的信息。传统人工智能模型存在问题“上下文很多”这是对当对话变长时忘记初始信息的问题的显着改善。
事实上,Opus 4.6 在长文本上下文检索测试 MRCR v2 中得分为 76%,而上一代 Sonnet 4.5 的得分仅为 18.5%。这种 4 倍的性能提升使得在理解整个大规模代码库的同时进行开发以及对大量法律和财务文档进行横断面分析变得切实可行。
另一项创新「适应性思维」和“努力控制”是。以前,选择是启用或禁用推理,但是可分 4 级控制(低/中/高/最大)已经成为了。模型本身决定了问题的复杂程度,并根据需要调整深度思考的时间。
这对于开发者来说是一个非常实用的功能。这使您可以将足够的资源投入到真正困难的问题上,而无需在简单的任务上花费过多的处理时间和成本。换句话说,我们获得了根据情况优化智能、速度和成本的灵活性。
「代理团队」也不要错过这些功能。多个人工智能代理可以在 Claude Code 中并行运行,并自主和协作地工作。它是一种有效处理可分为多个部分的任务的机制,例如审查大型代码库。
基准数据也令人印象深刻。在一项名为 GDPval-AA 的实际任务评估中,Opus 4.6 的表现比 OpenAI 的 GPT-5.2 强了约 144 个 Elo 点,比我们之前的模型 Opus 4.5 强了 190 点。这在知识工作的实用性上表现出明显的优势。
加强与Excel和PowerPoint的集成也是一个战略举措。从数据分析到视觉演示创建,人工智能现在正被直接应用于业务工作流程的核心工具中。
另一方面,您需要谨慎定价。基本定价为每百万代币 5 美元输入/25 美元输出,但对于超过 200,000 个代币的提示,需要支付 10 美元/37.50 美元的溢价。为了获得100万代币的最大收益,您需要准备好相应的成本。
Anthropic 对安全也持谨慎态度。特别是,针对网络安全能力的提高,我们开发了六种新的探针(不良反应检测方法),并强化了防止滥用的机制。这表明他们正在努力平衡先进的能力和负责任的管理。
此次发布标志着人工智能从“只是一个聊天机器人”演变为“一个可以长时间自主工作的协作伙伴”。它有可能从根本上改变工作的质量和效率,特别是对于处理大量信息的开发人员和分析师等知识工作者而言。
【术语解释】
代币
AI模型处理的最小文本单元。在英语中,1个单词大约相当于1个token,在日语中,1个字符大约相当于1.5~2个token。 100万个代币相当于大约75万个日语字符和大约75万个英语单词,相当于10多本标准书籍的信息量。
上下文窗口
人工智能模型可以一次性记忆和参考的信息范围。上下文窗口越大,您可以在保留长文档和对话历史记录的同时做出更多响应。之前的模型大约有数万到 200,000 个代币,但在 Claude Opus 4.6 中,这一数字扩展到了 100 万个代币。
上下文腐烂
人工智能模型在处理长对话或文本时忘记早期信息或降低准确性的现象。也称为“上下文损坏”,这是处理长文本时的一个主要问题。
Elo 评级/Elo 积分
它是一个相对的评估系统,最初用于评估国际象棋技能,也用于比较人工智能模型的性能。直接比较两个模型并根据输赢增加或减少分数。大约 200 点的差异意味着顶级模型在大约 76% 的情况下会产生优异的结果。
适应性思维
AI 模型自动确定问题的复杂性并根据需要执行深度推理的能力。以前你只能打开和关闭推理功能,但现在你可以根据情况选择最佳的思维深度。
努力控制
该功能允许您以 4 个级别(低/中/高/最大)调整 AI 模型的处理深度。可以根据应用进行优化,例如以高速、低成本、低努力处理简单任务,以及以高努力优先处理复杂问题的准确性。
上下文压缩
在长时间对话或任务中达到上下文窗口限制之前自动汇总和压缩旧信息的功能。这使您能够在不超出限制的情况下继续执行长期任务。
代理团队
允许多个AI代理同时运行并并行共享和协调任务的功能。高效处理可分割的任务,例如审查大型代码库。
终端工作台2.0
评估人工智能代理在终端环境中执行实际开发任务的能力的基准。它由89项任务组成,是反映现实发展场景的高难度评价指标。
国内生产总值a
评估人工智能模型在金融和法律等专业领域具有高经济价值的知识工作任务中的实用性的基准。由人工分析独立运营。
MRCR v2
一个名为“大海捞针”的长文本上下文评估基准。衡量您找到隐藏在大量文本中的信息的准确度。
[参考链接]
人智官方网站(外部)
一家开发 Claude AI 的人工智能安全研究公司。它正在开发宪法人工智能等独特技术。
克劳德官方网站(外部)
官方网页界面,让您可以直接使用Claude。对话和文档分析可以在浏览器上进行。
克劳德 API 文档(外部)
面向开发人员的官方 API 文档。它提供了有关如何实施最新功能和规范的详细信息。
OpenAI官网(外部)
一家开发GPT系列的人工智能研究公司。开发了 GPT-5.2,与 Claude Opus 4.6 进行比较。
Terminal-Bench 2.0官网(外部)
用于评估人工智能代理编码能力的行业标准基准。包括89个任务。
[参考视频]
Anthropic 官方 YouTube 频道发布的 Claude Opus 4.6 介绍视频。它简要解释了模型的主要特征和改进。
[参考文章]
Claude Opus 4.6 vs 4.5 基准(解释) – Vellum AI(外部)
一篇文章详细分析了 Claude Opus 4.6 和之前模型 4.5 之间的基准比较。
Anthropic 推出 Claude Opus 4.6,人工智能迈向“氛围工作”时代 – CNBC(外部)
CNBC 的一篇新闻文章在人工智能成为合作伙伴的背景下分析了 Claude Opus 4.6 的发布。
100 万个代币背景:好的、坏的和丑陋的 – Micron(外部)
从技术角度解释 100 万代币上下文窗口的好处和挑战。
Terminal-Bench 2.0:提高人工智能代理评估标准 – Snorkel AI(外部)
一篇详细解释Terminal-Bench 2.0的开发背景和评估方法的文章。
[编者后记]
单单看 100 万代币这个数字,就显得巨大无比,但你如何将其与你在工作中实际处理的材料数量进行比较呢?合同、规格、过去的电子邮件、报告——如果你可以在工作时同时参考它们,你会如何使用它们?
我本人很惊讶人工智能正在从“回答问题的工具”变成“可以长时间合作的伙伴”。另一方面,我认为重要的是要考虑成本的现实以及真正有必要的情况。如果您有机会尝试这项技术,我们很想听听您的体验。
