我们正在推出 GPT‑Live,新一代语音模型,让与 AI 的对话更像真实交流。

GPT‑Live 基于全双工架构构建,意味着它能同时听和说。在对话中,GPT‑Live 可以用“嗯哼”或“对”这样的短语表示它在认真听,进行快速来回交流,或者在你需要思考时保持安静。结果就是,一种令人耳目一新的、易于交谈的语音体验。

GPT‑Live 也是我们迄今为止最智能的语音模型。对于需要网络搜索、更深层推理或更复杂工作的问题,它会在后台委托给最新的前沿模型,并在准备好时将结果带回对话中。在工作时,GPT‑Live 可以继续与你交谈,保持对话流畅。上线时,GPT‑Live 将在后台使用 GPT‑5.5。随着我们发布新的前沿模型,我们将持续更新 GPT‑Live 所使用的模型。

这些进步驱动了全新的 ChatGPT 语音体验,使其更智能、更自然易用。随着时间的推移,我们相信这项研究还将解锁使用语音进行日益复杂、更长时间运行和更具代理性的工作的能力。

我们今天开始向全球 ChatGPT 用户推出两个版本的 GPT‑Live——GPT‑Live‑1GPT‑Live‑1 mini。我们还计划很快将它们引入 API,开发者和企业可以使用此表格注册以接收通知。

我们的愿景是实现真正自然的人机交互:一个与 AI 协作感觉像与另一个人合作一样流畅和响应迅速的世界,同时推理和复杂任务执行在后台无缝进行。

旧一代的语音 AI 系统让我们更接近这一愿景,但伴随着重要的权衡。

级联语音系统依赖一系列模型依次处理每一轮对话。最初的 ChatGPT Voice 将三个模型串联在一起:一个语音转文本模型转录你的语音,一个大语言模型生成回复,一个文本转语音模型将其转换回语音。这种方法使我们首次能够与前沿 AI 模型对话,但复杂性带来了代价:信息可能在模型间丢失,且响应缓慢而僵硬。

级联语音系统

响应缓慢而僵硬,长时间停顿

音频 10

转录文本

与标准语音模式(使用 GPT-5.5 Instant)的示例对话

ChatGPT 高级语音模式 这样的基于轮次的语音模型在单个模型内处理和生成音频,减少了延迟,使对话更流畅——但它们仍然通过离散的轮次运作。模型必须等待用户停止说话才能响应,导致僵硬的来回交流。此外,由于轮次检测基于静默,即使是短暂的停顿或背景噪音也可能被误认为是轮次结束——导致模型在不自然的时间点打断。

基于轮次的语音模型

响应稍快且更流畅,但与模型的来回交流仍然感觉僵硬

音频 11

转录文本

与 ChatGPT 高级语音模式的示例对话

GPT‑Live 通过两项架构变化解决了这些限制。

首先,我们使用全双工架构构建了 GPT‑Live,以实现持续交互。GPT‑Live 不是处理一系列独立消息,而是在生成输出的同时持续处理输入。因此,模型可以每秒多次做出交互决策:是否说话、继续倾听、暂停、打断或调用工具。

这使得模型能够进行更自然的来回交流,保持更好的时间感,甚至执行实时翻译。

持续交互

快速、自然、富有表现力的响应和更积极的倾听

音频 12

转录文本

与 GPT-Live-1(使用 GPT-5.5 Instant)的示例对话

其次,我们将处理持续交互的 GPT‑Live 与更深层的工作解耦。当问题需要搜索、推理或更强大的代理能力时,GPT‑Live 可以将任务委托给另一个模型(如 GPT‑5.5)。这使得它即使在后台处理多个任务时,也能保持对话继续。

这一架构变化还允许 GPT‑Live 持续使用最新的模型和代理,将前沿智能与自然交互相结合。

委托进行更深层工作

GPT-Live 提供快速、自然的响应,而 GPT-5.5 在后台处理搜索

音频 13

转录文本

与 GPT-Live-1(使用 GPT-5.5 Instant)的示例对话

我们构建了新的人工评估来衡量愉悦度和对话流畅度。在这些头对头比较中,在匹配的 5-10 分钟对话中,GPT‑Live‑1 和 GPT‑Live‑1 mini 在总体偏好、轮次切换、打断、对话流畅度以及每次交互的自然感方面,都明显优于高级语音模式。

  • GPQA:GPT‑Live‑1 在 GPQA 上大幅优于高级语音模式,该测试评估生物学、化学和物理学领域的专家级科学推理能力。

  • BrowseComp:GPT‑Live‑1 在 BrowseComp 上相比高级语音模式有显著提升,该测试评估代理性网络搜索和查找难以定位信息的能力。

  • τ³-Voice Telecom(内部变体)**:GPT‑Live‑1 在 τ³-Voice Telecom 上优于高级语音模式,该测试评估语音代理在真实的多轮电信支持任务中的表现。

  • GPT‑Live‑1(即时版)和 GPT‑Live‑1 mini 在后台使用 GPT‑5.5 Instant 模型,而 GPT‑Live‑1 Medium 和 GPT‑Live‑1 High 使用 GPT‑5.5 Thinking 模型,并采用中等和高推理努力。 ** 我们为此评估使用了由最新推理模型驱动的定制用户模型。

每周,超过 1.5 亿人使用语音和听写等功能与 ChatGPT 交谈。他们用它来获取免提的日常帮助、练习语言、讲睡前故事,或在通勤时聊天。

从今天开始,当你点击语音按钮与 ChatGPT 交谈时,你将获得由 GPT‑Live 驱动的改进体验——更自然的对话、更智能的回答、更好的倾听和视觉响应。

现在与 ChatGPT 交谈应该感觉更像真正的对话。你可以用问题打断,暂停整理思绪,或要求 ChatGPT 放慢速度。它会自然地用“嗯哼”或“明白了”这样的短语确认你在说什么,让你知道它在跟上。我们还为 GPT‑Live 重新制作了 ChatGPT 中的九种不同声音。

ChatGPT 语音现已搭载我们最新的前沿模型,在您需要时提供更智能的回答。您还可以根据需求选择推理级别:即时模式可快速响应,中或高模式则让 ChatGPT 花更多时间思考。

当您需要思考片刻时,ChatGPT 语音现在会耐心等待,而非贸然插话打断。若您要求它保持安静倾听,它也会照做。面对过往车辆或附近交谈等背景噪音时,ChatGPT 能更专注于您的声音而不受干扰。

有些答案通过可视化呈现会更实用。在对话过程中,ChatGPT 现在可针对天气、股票、体育等主题展示丰富的视觉卡片。语音功能仍支持搜索、记忆、图像及文件上传。

这使得 ChatGPT 语音体验在日常使用中更自然、更强大、更实用。

GPT‑Live 默认以安全为设计核心。它在继承最新模型安全改进的基础上,针对关键风险领域增加了专项安全训练,并专门为语音场景设计了新型防护措施。

为更真实反映用户在实际场景中的语音使用方式,我们首先将安全测试扩展至全新的原生音频评估体系。同时借鉴高级语音模式的经验,创建了基于生成音频的合成评估,以更聚焦关键安全领域,包括自残、精神病与躁狂、对AI的情感依赖、暴力及色情内容。内部专家还对模型进行了语音特有风险的红队测试。

测试结果显示,GPT‑Live 在几乎所有评估领域的表现均与高级语音模式相当或更优。更多测试与防护详情可参阅 GPT‑Live 系统卡⁠(在新窗口打开)

由于语音对话实时进行,我们还构建了可在模型说话时即时响应的防护机制。当系统检测到潜在不安全输出时,可引导模型生成更安全的回应,显示额外安全提示或资源,或在高风险情况下终止语音对话。针对涉及自残的对话,我们调整了 ChatGPT 的语音支持流程,包括提供经专家验证的危机热线支持。

我们设计了额外保护措施以支持青少年用户,并在模型中直接训练了适龄行为模式以降低不当回应风险。家长可通过家长控制功能选择是否允许青少年使用 ChatGPT 语音,当涉及潜在自残或自杀意图等高危情况时,关联家长可能收到通知。

我们还将推出针对情感依赖的长期测量与发布后监测,以持续改进认知并完善防护措施。基于此前对情感使用与心理健康的研究,这将帮助我们识别新兴模式,优化系统在情感敏感互动中的回应方式。

最后,GPT‑Live 专为对话设计,不涉及声音模仿。它使用 ChatGPT 中预设的语音集,并配备防护措施防止模仿真人声音。

我们致力于保障安全与福祉,并将根据实际使用经验持续强化这些防护措施。

GPT‑Live 现已面向全球 iOS、Android 及 ChatGPT.com⁠(在新窗口打开) 的 ChatGPT 用户逐步推出。GPT‑Live‑1 将成为 Go、Plus 及 Pro 用户 ChatGPT 语音的默认模型,GPT‑Live‑1 mini 则成为免费用户的默认模型。更多可用性详情请参阅我们的帮助中心⁠(在新窗口打开)

我们已针对 ChatGPT 中最常用的语言优化了 GPT‑Live。对于某些语言,模型可能存在非母语口音或流利度不足的问题。我们正积极致力于改善多语言体验。

发布初期,GPT‑Live 暂不支持 ChatGPT 中的视频语音或屏幕共享功能,但我们正努力尽快引入这些能力。您仍可访问包含标准语音模式和高级语音模式在内的 ChatGPT 语音旧版本,这些功能在这些版本中可用。

本文内容采集自官方网站,排版和翻译可能与原页面存在差异。

阅读官方全文