OpenAI 于 2026 年 3 月 5 日在 ChatGPT、API 和 Codex 上发布了 GPT-5.4。ChatGPT 将其称为 GPT-5.4 Thinking,可供 ChatGPT Plus、Team 和 Pro 用户使用。 GPT‑5.4 Pro 适用于专业版和企业版计划。
API 的最大上下文窗口为 100 万个代币,输入价格为 2.50 美元/M 代币,输出价格为 15 美元/M 代币。它在 GDPval 中实现了 83.0%,在 OSWorld-Verified 中实现了 75.0%,超过了人类 72.4% 的表现。
与 GPT-5.2 相比,个别说法的虚假率降低了 33%,总体响应错误率降低了 18%。 GPT-5.2 Thinking 将于 2026 年 6 月 5 日弃用。
【编辑部评论】
GPT-5.4 的发布不仅仅是 OpenAI 的模型更新。推理、编码和计算机使用的优势以前分散在单独的模型中,现在都可以利用。这是一个里程碑版本,已集成到一个 Frontier 模型中。虽然 GPT-5.3-Codex 作为特定于编码的模型提供给开发人员,但 GPT-5.4 将该功能合并为基线,并将其范围扩展到专业工作和代理类型任务。
这次最值得关注的功能就是原生电脑青年是。模型识别屏幕截图并通过鼠标和键盘操作跨应用程序自主完成任务的能力“AI使用PC”阶段正式开始方法。因此,智能体将能够接管“操作”过程,而这以前必须由人类来完成。日常白领任务的自动化,例如创建财务模型、在浏览器上填写表格以及跨多种工具执行长期任务,立即成为现实。
但是,阅读基准数据时要小心。 OSWorld-Verified中显示的“超过人类性能72.4%”的表述超出了OSWorld论文中描述的人类基线,但这并不是指PC操作专家。另外,需要注意的是,GDPval是OpenAI自己设计和实现的内部基准,幻觉减少数据也是该公司报告的,并且是与GPT-5.2而不是GPT-5.3进行比较。
从竞争的角度来看,目前哪种模式“最强”取决于应用。 GPT-5.4 在知识工作(GDPval 83%)和计算机使用(OSWorld 75%)方面领先,而 Gemini 3.1 Pro 以较低的价格提供抽象推理(GPQA Diamond 94.3%),Claude Opus 4.6 在 SWE-Bench 验证编码准确性(80.8%)和视觉推理(MMMU-Pro 85.1%)方面领先。
工具搜索不要错过这个新功能。以前,随着工具数量的增加,为每个 API 调用提示所有工具定义的结构变得成本高昂且缓慢。 GPT-5.4 改变了仅在必要时引用工具定义的系统,并且已证实这在保持准确性的同时减少了约 47% 的令牌消耗。在代理开发领域,这种结构变化是一种实际的改进,与成本效率直接相关。
在安全方面,有趣的是引入了新的开源评估,该评估验证了思想链(CoT)的可监控性。结果表明,GPT-5.4 Thinking 故意混淆其排序链的能力较低,这对于确保 AI 监控的有效性是一个积极的特征。另一方面,由于它已被归类为“高网络能力”,针对恶意使用的风险管理变得更加重要。
还需要注意的是,此次发布是在 OpenAI 与美国国防部 (DoD) 的合同导致大规模用户流失所带来的不利影响下发布的。 2026年2月28日,美国ChatGPT卸载量较前一日增长295%,1星评论数当天增长775%。这个时机标志着,无论GPT-5.4在技术上多么优越,我们已经进入了一个用户信任的非技术因素与AI服务竞争力直接挂钩的时代。
从长远来看,GPT-5.4代表的方向是从“AI使用工具”到“AI做工作”的转变。随着计算机使用、广泛的背景和工具搜索的结合的成熟,我们将进入一个从根本上重新考虑人类在特定职业中的角色的阶段。从监管角度来看,自主操作多个系统的代理的激增将促使制定有关数据访问和操作责任范围的新准则。
【术语解释】
前沿模型
指目前性能最高水平的AI模型。它具有位于研究和产业前沿的意义,OpenAI、Anthropic等各大AI公司都在竞相开发它。
AI代理(代理)
一种无需人工干预即可自主规划、执行和验证任务以实现特定目标的人工智能系统。它通过结合工具调用、网络搜索、代码执行等来执行多步骤任务。
电脑使用
AI识别截图并通过鼠标和键盘操作自主操作计算机的功能。代理可以执行浏览器操作、文件管理、跨应用程序工作等。
工具搜索
GPT-5.4 中引入的新功能。以前,所有工具定义都包含在进行 API 调用时的提示中,但通过工具搜索,仅在必要时引用相应工具的定义,从而显着减少了令牌消耗。
代币
AI模型处理语言时的最小单位。它对应一个单词或字符的片段,API使用费是根据这个令牌数量计算的。句子越长,消耗的代币就越多。
幻觉(幻觉)
人工智能生成的信息不真实、不准确的现象。在医学、法律和金融等需要精确性的领域,这是一个特殊的问题。
Chain-of-Thought(CoT)/思考の连锁
一种在给出答案之前逐步展示人工智能思考过程的方法。通过可视化模型的推理过程,可以用来检测错误并监控安全性。
OSWorld 验证
该基准衡量人工智能仅使用屏幕截图和鼠标/键盘操作自主导航桌面环境的能力。人类的表现定为72.4%,被广泛引用作为衡量AI PC操作能力的指标。
GDP值
OpenAI 内部基准,评估人工智能是否能为对美国 GDP 贡献最大的 9 个行业和 44 个职业产生工作水平结果。针对实际业务任务,例如销售材料、会计电子表格和计划创建。
MMMU-专业版
多模式人工智能评估基准,同时需要大学水平的专业知识和视觉推理。消除只能用文字回答的问题,严格衡量图像和文字同时处理的能力。它被广泛引用为人工智能视觉理解能力的指标。
[参考链接]
开放人工智能(外部)
一家开发 GPT-5.4 和 ChatGPT 的人工智能公司。我们与微软合作,正在进行大规模语言模型的研究和商业部署。
聊天GPT(外部)
OpenAI提供的AI聊天服务。 GPT‑5.4 Thinking 适用于 Plus、Team 和 Pro 计划。
OpenAI API 文档(外部)
OpenAI 官方开发者门户,发布 GPT-5.4 API 规范、价格、参数设置等。
人择(外部)
一家专注于AI安全的公司,由前OpenAI人士创立。 Claude 开发 AI,这与 DoD 合同问题上的 OpenAI 形成对比。
光标(外部)
提供利用人工智能的代码编辑器。 GPT-5.4 被评为顶级内部基准并受到推荐。
扎皮尔(外部)
连接数千个应用程序的自动化平台。我们正在就 GPT-5.4 工具使用基准进行合作。
哈维(外部)
专门从事法律工作的人工智能平台。 GPT-5.4 已宣布在 BigLaw Bench 评估中得分为 91%。
默科(外部)
运行 APEX-Agents 基准的人工智能人才匹配服务。 GPT-5.4 被评为顶级。
[参考文章]
OpenAI 的 GPT-5.4 创下专业基准新纪录 |下一个网络(外部)
已验证的数字,例如 OSWorld 减少 75%,幻觉减少 33%。 OpenAI自报数据的局限性也被相当指出。
DoD 交易后 ChatGPT 卸载量激增 295% | TechCrunch(外部)
Sensor Tower 数据显示,与前一天相比,ChatGPT 卸载量增加了 295%,一星评论增加了 775%。
GPT-5.4 vs Opus 4.6 vs Gemini 3.1 Pro:最佳人工智能模型? |数字化应用(外部)
比较 GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro 的主要基准数据的解释性文章。
OpenAI 推出 GPT-5.4 Pro 和 Thinking 版本 | TechCrunch(外部)
准确报告GDP值83%、幻觉减少33%、工具搜索介绍等主要数据和功能。
Vibe 检查:GPT-5.4 — OpenAI 回来了 |每到(外部)
从开发人员角度的实际使用报告。包括1M token上下文的意义以及与Claude Code的比较。
[编者后记]
GPT-5.4 提出的“人工智能操作 PC”的愿景不再是不久的将来的故事。您希望将日常工作中的哪些任务委托给人工智能?而且,正如围绕 OpenAI 国防部合同的争议所表明的那样,我们还面临着“在使用人工智能服务时我们应该相信什么?”的问题。
我希望我们能够同时关注技术的演变和提供技术的公司的态度。
