GPT-Live 简介 ─ OpenAI 的新语音模型通过全双工“边听边说”接近人类对话

当我们与某人交谈时,我们不会等对方说完才说话。他们一边点头一边听,一边寻找词语一边回应,有时随着谈话的进行而重叠。机器一直无法做到这一点。就像对讲机一样,等待一方说完。我认为这种结构在与人工智能的对话中留下了一种陌生的行为感觉。

OpenAI 发布的 GPT-Live 朝着同时听和说的设计迈出了一步。他们同意了,我想了想,就默默地等待,如果有困难的问题,我会悄悄地问另一边的另一个模特。这与速度或聪明无关,而是关于重塑对话本身的“停顿”。我们可能正在见证与机器交谈的礼仪将被改写的时刻。


2026 年 7 月 8 日,OpenAI 发布了新一代语音模型 GPT‑Live。基于全双工架构,同时听和说。

它将网络搜索和推理等任务委托给后台模型,并在发布时使用 GPT-5.5。从同一天起,将向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本,并且还将提供 API。 GPT‑Live‑1 是 Go、Plus 和 Pro 的默认型号,GPT‑Live‑1 mini 是 Free 的默认型号。

GPQA 的正确答案率为:GPT‑Live‑1(高)为 84.2%,AVM 为 45.3%。每周有超过 1.5 亿人使用 ChatGPT 的语音功能。可在 iOS、Android 和 ChatGPT.com 上使用。

从: GPT-Live 简介 |开放人工智能

[参考视频]

【编辑部评论】

此次发布的真正新颖之处不仅仅是该模型的智能程度。疑难问题的处理则交给GPT-5.5在后台处理,而大脑部分则利用现有技术。创新的主要焦点可以说是在“对话的感觉”上。

传统的语音AI有像对讲机一样重复“说话→等待→说话”的方法。 GPT-Live采用的全双工架构基于人类对话的基本结构,即人们一边说话一边听。将其作为大规模音频体验集成到名为 ChatGPT 的庞大门户中的要点有意义。

我想提请注意的是OpenAI的设计理念有意将“负责对话的层”和“负责思考的层”分开是。对话流畅度由 GPT-Live 处理,搜索和推理由 GPT-5.5 处理。这种分离使您可以继续用最新一代替换底层模型,而无需重新设计音频体验。

这是,音频从与特定模型相关的“功能”转变为计算的永久“入口(接口)”的垫脚石。也可以解读为 这个方向得到了以下事实的支持:ChatGPT 语音功能产品负责人 Ati Eleti 表示,他在散步时进行了许多 30-40 分钟的对话,他希望让语音成为长时间代理类任务的主要联络点。

语音现在正在成为AI助手竞赛的主要竞技场之一。除了自然中断之外,谷歌的 Gemini Live 已经支持摄像头和屏幕共享,亚马逊宣布了 Alexa+,而像 ElevenLabs 这样专注于语音的初创公司也瞄准了同一市场。GPT-Live 是将行业新兴功能重新集成到 ChatGPT 更大网关中的一种方式。你也可以这么说。 GPT-Live 于 7 月 8 日发布,7 月 9 日报道了 OpenAI 下一代模型 GPT-5.6 的广泛部署(GPT-5.6 本身的有限预览于 6 月 26 日发布)。

积极的方面是显而易见的。如果你让她放慢速度,她会回应,不会在你思考时打断你,甚至可以实时翻译。通过添加使用可视卡显示天气、股票价格和体育赛事的功能,体验已经扩展到音频之外。

另一方面,听起来人类是一把双刃剑。据报道,一些早期用户抱怨他太友好了,“太友好了”。更深层次的问题是情感依赖问题,OpenAI 本身将自残、精神病症状和过度依赖人工智能作为安全的优先领域,并刻意划定界限,称它“是为对话而设计的,而不是为语音模仿而设计的”。

鉴于“Sky”听起来与斯嘉丽约翰逊的声音非常相似,在GPT-4o发布时成为一个问题,GPT-Live明确表示它的设计不是为了模仿真人的声音。随着对身份盗窃的监管压力越来越大,例如使用人工智能生成的声音的自动呼叫在美国被定为非法,这些保护措施可能会成为该行业的标准防线。 Signal 的梅雷迪思·惠特克 (Meredith Whittaker) 等不断发出警告,“聊天机器人不是我们的朋友”,而亲密的语音媒介的纪律是一个未来将受到严重质疑的问题。

从长远来看,GPT-Live的真正价值不在于发布当天的演示,而在于人们是否继续使用它以及在英语以外的语言中体验是否相同。OpenAI 本身也承认某些语言可能存在非母语口音和流畅性挑战。 GPT-Live 是否会被视为迈向未来的一步,让语音成为与键盘并列的“主要操作界面”?答案很可能取决于未来的使用数据。

[相关文章]

xAI 语音代理生成器简介 |无需任何代码即可构建手机 AI,Grok Voice 迎接语音挑战比较使用 τ-voice 基准的公司,该基准也出现在 GPT-Live 评估中。最近一篇关于语音 AI 代理竞争的文章,非常适合进行比较。

OpenAI GPT-5.6(Sol/Terra/Luna)命名争议背后的真相——美国政府的有限发布与主权AI的功课GPT-5.6限量发布的详细细节,这是GPT-Live的背景。可以补充词汇表中提到的6月26日预览的背景。

5大AI公司价格与功能全面对比 | “个人使用受学习,商业使用受保护”的通俗说法是什么?组织了 Go/Plus/Pro 层次结构和高级音频模式的定位。这将帮助您了解每个计划的 GPT-Live 默认设置。

[编者后记]

作为一项技术,我真的认为它是惊人的。改变听力和口语的结构与仅仅减少几百毫秒的延迟是不同的水平。这是因为我们正在修改对话的结构。人工智能会插话,人工智能会尊重你的沉默。这当然很容易谈论。

然而,“好说话”真的就意味着不放手就能幸福吗?

听起来像人类的声音也更容易让人相信。我最终对一个点头的人说了很多话。当我看到GPT-Live的安全列表中列出的自残和情感依赖时,我意识到OpenAI本身对这些问题很警惕。它是为对话而设计的,而不是为了模仿。之所以明确说明这一点,可能是因为创造者比任何人都更了解这项技术所具有的引力。

另一件一直悄悄困扰我的事情是“委托”的设计。将负责对话的层与思考的层分开。在快速响应的同时,另一种模式正在幕后寻找和推理。虽然我认为这是一个成熟的系统,但我也觉得与我交谈的人的轮廓有点模糊。平稳过渡的另一边正在发生什么?它不再对用户可见。

这并不意味着我认为不使用它不是正确的选择。我想我可能不得不接受这种使用事物的麻烦态度,而不怀疑它们在我的余生中的用处。

声音比键盘更接近身体。大声说话的行为有一个与写作不同的弱点。该入口将继续每天开放。

OpenAI 本身也承认,某些语言仍存在口音和流畅性问题,至于日语体验的自然程度如何。当你真正谈论它时,你觉得舒服还是有点令人毛骨悚然?如果您愿意,请告诉我您的想法。


【术语解释】

全双工架构
通信术语,指允许双方同时发送和接收的方法。这是一种在通话时可以听到对方声音的状态,就像打电话一样。当应用于语音人工智能时,该模型可以继续处理用户输入,同时生成自己的响应。这是打破传统对讲机“通话→等待→通话”模式的关键。

GPT-5.6(太阳/地球/月球)
它是 OpenAI 的下一代模型系列,并于 2026 年 6 月 26 日发布了有限预览版。它由旗舰版 Sol、适合日常工作的 Terra 和快速低成本的 Luna 组成。据说 Terra 能够以一半的价格提供与 GPT-5.5 相当的性能。 GPT-Live 宣布的第二天(7 月 8 日),就有报道称 GPT-5.6 已得到广泛部署。

GP质量保证
它是衡量生物、化学、物理领域专家级科学推理能力的基准(评估标准)。它由困难的研究生水平问题组成,用于测试模型的高级智力。

浏览比较
这是一个衡量类似代理的网络搜索能力的基准,特别是寻找难以找到的信息的能力。评估人工智能自主收集和探索信息的能力。

[参考链接]

OpenAI(公司官方网站)(外部)
开发ChatGPT和GPT-5系列的AI公司官网。我们广泛传播我们的使命、产品阵容和研究成果。

谷歌双子座(外部)
谷歌的人工智能助手。它提供Gemini Live,支持自然对话和相机/屏幕共享,据说是GPT-Live的主要竞争对手。

十一实验室(外部)
一家专门从事语音合成和语音AI的公司的官方网站。它通过自然阅读和语音代理在市场上与 OpenAI 竞争。

信号(外部)
提供加密消息传递应用程序的非营利组织。惠特克主席警告不要过度依赖人工智能。

[参考文章]

GPT-5.6 Sol 预览:下一代模型(OpenAI 官方)(外部)
GPT-5.6 系列的有限预览版将于 2026 年 6 月 26 日发布。这是确认 GPT-Live 公告背景的主要信息。

OpenAI推出全双工语音升级GPT-Live(VentureBeat)(外部)
分析一下,GPT-Live的新颖之处不在于它的聪明,而在于它的感觉。它解释了对话层和推理层分离设计的意义。

OpenAI推出GPT-Live全双工语音模型(SQ杂志)(外部)
批评者称,延迟本身已成为付款的一个差异化因素。它还报告每个层的默认设置及其在每个基准测试中的优越性。

OpenAI 发布新语音模型以实现更自然的实时对话(TechCrunch)(外部)
它拥有每周 1.5 亿人使用语音等的记录,并整理了实时翻译和长时间对话的目标以及竞争趋势。

OpenAI 推出 GPT-Live 让 ChatGPT 语音感觉像真实对话(MacRumors)(外部)
它整理了 GPT-Live-1/mini 的目标,并报告了同日发布的 GPT-5.6 系列 Sol/Terra/Luna 的细分。

OpenAI发布全双工音频模型“GPT-Live”(BigGo财经)(外部)
引入最初对尺寸过大的不满。它还报道了过去的天空音频争议、全双工的先例以及奥特曼先生的评论。

OpenAI的GPT-Live:可听可说的ChatGPT语音(The Next Web)(外部)
我们将讨论实时翻译演示、类人声音的好处和危险,以及惠特克的警告和竞争。