新芒xAI 9月20日消息,千问发布同声传译模型Qwen3.8-LiveTranslate,通过Interleave架构连接流式理解、文本输出和语音生成,官方称平均滞后时间由上一代的2.8秒降至2.3秒。
关键要点
模型支持60种语言的语音输入与文本输出,其中29种语言支持语音输出。它可以同时接收音频和图像信息,利用口型、手势及屏幕文字等视觉上下文处理嘈杂环境或歧义表达。
Qwen3.8-LiveTranslate采用基于Hybrid-MoE的Thinker-Talker双模块设计,可输出说话人标识和源语言文本,并进行保留说话人音色的语音合成。当前可通过阿里云百炼实时WebSocket API调用。
官方公布的准确度、流畅度与延迟提升来自特定评测集和配置。实际效果仍会受到网络质量、口音、专业术语、多人重叠发言和端到端设备延迟影响。
新芒xAI评论
对跨境会议、直播和客服团队而言,2.3秒级延迟的意义是降低对话打断感,并减少字幕与语音不同步。视觉上下文还能帮助模型判断屏幕术语和现场指代,比仅处理音频更接近真实会议环境。
但同传产品不能只看平均延迟。关键信息遗漏、数字和人名错误、多人分离准确率以及敏感会议数据如何处理,都会影响企业是否能把它用于正式业务。
模型把多语种同传进一步推向API化,开发者因此能更快集成能力。真正的产品差异将来自术语库、人工纠错、隐私控制和失败兜底,而不是单一演示中的流畅程度。