OpenAI 于 7 月 9 日推出了 GPT-Live 系列模型,该系列被定位为新一代全双工语音模型,能够同时进行倾听和说话,从而使 AI 对话的体验更加贴近真人交流。

目前,GPT-Live 系列提供了 GPT-Live-1 和 GPT-Live-1 mini 两个版本。自即日起,全球的 ChatGPT 用户均可使用。其中,GPT-Live-1 模型将提供给 Go、Plus 和 Pro 订阅用户,而免费用户则可以调用 GPT-Live-1 mini 模型。

在架构设计上,GPT-Live 系列模型采用了全双工架构,不再依赖于单轮对话结束后再进行响应。它能够在同一时间段内持续处理输入和输出信息,模型能够“每秒多次”地判断何时说话、继续倾听、暂停、打断或调用工具,以此来提升对话的真实感。

在处理复杂任务时,GPT-Live 系列模型能够将连续交互和深度推理进行拆分处理。模型在前台维持语音对话的流畅进行,同时将网页搜索、复杂推理或其他更高级的任务委托给 GPT-5.5 系列模型在后台执行。具体而言:

OpenAI 方面表示,为评估新模型性能,公司专门建立了一套新的人工评测体系,重点关注语音交流中的舒适度和整体交流流畅性。在时长为 5-10 分钟的配对对话测试中,通过整体偏好、轮次衔接、打断情况、对话流畅度和自然度等指标衡量,GPT-Live-1 和 GPT-Live-1 mini 模型获得了更高的偏好得分,优于此前的 Advanced Voice Mode。

关于用户规模,OpenAI 透露,每周有超过 1.5 亿用户通过 Voice 和 Dictation 等功能与 ChatGPT 进行语音互动,应用场景涵盖免手持的日常协助、语言学习、睡前故事以及通勤期间的闲聊等。新版本还支持在语音对话中展示天气、股票、体育等可视化信息卡片,并继续支持搜索、记忆、图片和文件上传功能。

在安全方面,OpenAI 表示,GPT-Live 模型在自伤、精神病性症状与躁狂、对 AI 的情感依赖、暴力及性内容等领域,经过了原生音频评测、合成音频评测以及内部红队测试。官方声明称,该模型在几乎所有评估维度上,其表现均能达到或优于 Advanced Voice Mode。