新芒xAI 9月16日消息,谷歌推出Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时对话模型,重点提升语音交互、实时推理以及复杂任务执行能力,并已开始通过Gemini API和Google AI Studio向开发者提供。
关键要点
Gemini 3.8 Live支持近实时视觉输入,可在对话过程中自动切换97种语言,并能在后台执行工具和API调用。这意味着开发者可把语音、视觉感知和外部操作整合到同一实时会话中,用于客服、教育、设备控制和移动助手等场景。
Extended Thinking版本面向多步骤复杂任务,支持模型在进行更深入推理的同时维持语音交流。普通Live版本已同步进入Search Live,扩展思考版则开始向Gemini Live用户推出,具体开放范围可能因产品、账号和地区而异。
实时模型的产品表现不能只看回答能力。端到端延迟、打断响应、噪声环境识别、工具调用准确率、长会话成本以及摄像头和语音数据的隐私处理,都会直接影响其能否进入高频应用。
新芒xAI评论
对语音应用开发者而言,Gemini 3.8 Live的关键价值是减少语音识别、推理、视觉理解和工具执行之间的拼接成本。统一模型如果能保持稳定低延迟,可以让实时助手更接近连续协作,而不是一问一答的语音搜索。
扩展思考版边推理边交流,试图解决复杂任务中“等待答案”和“保持互动”之间的矛盾。但用户听到的中间表达不应被误解为最终结论,产品仍需清楚区分临时推理、确认请求和可执行指令。
接下来值得观察的是API价格、并发限制、工具调用成功率和实际延迟。对开发者来说,模型能力只是底座,真正决定应用竞争力的仍是场景设计、数据权限、失败兜底和持续评测。