新芒xAI 7月9日消息,OpenAI发布新一代语音模型GPT‑Live,并开始将其用于新版ChatGPT Voice。该模型采用全双工架构,可以在持续听取用户语音的同时生成回应,并能根据对话节奏决定继续倾听、暂停、插话或调用工具,让人机语音交流从传统的轮流问答转向更接近自然对话的连续互动。
OpenAI表示,GPT‑Live包含GPT‑Live‑1和GPT‑Live‑1 mini两个版本,正在面向全球ChatGPT用户逐步推出。GPT‑Live‑1将成为Go、Plus和Pro用户的默认语音模型,GPT‑Live‑1 mini将用于免费用户;开发者API尚未同步开放,计划后续提供。
关键要点
首先,GPT‑Live最核心的变化是全双工交互。此前的语音系统通常需要等用户说完后再生成回答,短暂停顿或环境噪声也可能被误判为一轮对话结束。新模型可以持续处理输入和输出,因此能够在用户思考时保持安静、在被打断时及时停下,也可以用简短回应表示正在倾听。
其次,OpenAI把实时语音交互与复杂任务处理进行了分工。当问题需要联网搜索、深度推理或更长时间的智能体任务时,GPT‑Live可以在后台委派给GPT‑5.5等前沿模型,同时维持当前对话。首发阶段,Instant版本由GPT‑5.5 Instant提供后台能力,Medium和High版本则调用GPT‑5.5 Thinking。
第三,新版ChatGPT Voice支持在语音交流中展示天气、股票和体育等可视化信息卡,并继续支持搜索、记忆、图片和文件上传。OpenAI称,每周已有超过1.5亿人使用ChatGPT的语音或听写功能。不过,GPT‑Live首发时暂不支持语音模式中的视频和屏幕共享,这些能力仍需使用旧版语音模式。
影响解读
GPT‑Live的意义不只在于声音更自然,而在于语音正在成为智能体的实时操作界面。过去用户需要先完成指令输入,再等待模型执行;全双工语音与后台任务委派结合后,用户可以一边继续沟通,一边让模型搜索、推理或处理任务。这种架构更适合客服、教育、陪练、会议协作、车载助手和智能家居等需要持续感知上下文的场景。
对行业而言,竞争重点也将从语音识别准确率和合成音色,转向对话节奏、任务编排、工具调用、安全控制和长时间稳定性。由于实时语音会处理更丰富的情绪、环境和个人信息,隐私保护、错误打断、情感依赖和高风险内容处置也会成为产品能否大规模落地的关键。
新芒xAI评论
新芒xAI认为,GPT‑Live是今天晚间值得关注的产品级进展:它没有简单增加一个语音入口,而是把“持续交流”和“后台执行”拆成可协同的两层。语音助手因此开始具备更接近真人协作的交互方式,也为更长时间运行的智能体打开了新的入口。
真正的检验仍在实际使用中。全双工系统需要在响应速度、是否打断、任务准确性和安全边界之间持续权衡;API尚未开放,也意味着开发者生态仍处于起步阶段。但从ChatGPT现有语音用户规模看,GPT‑Live有机会成为观察下一代AI入口竞争的重要样本。