阿里通义发 Qwen3.8-LiveTranslate:同传平均滞后压到 2.3 秒,并加上实时说话人分离

阿里通义发布实时同传模型 Qwen3.8-LiveTranslate,官方博客称其在忠实度、流畅度、简洁度三个维度全面提升,核心指标平均滞后(LAAL, Length-Adaptive Average Lagging)从上一代的 2.8 秒降到 2.3 秒,约减少 18%。架构上是 Hybrid-MoE 的 Thinker–Talker 两模块设计:Thinker 把视频、音频、源文与译文按时间顺序交错排成一条因果序列,理解与翻译在同一序列内端到端完成;Talker 再把译文与源音频合成为保留原说话人音色的语音。
新增的三项能力都是「说话现场」才需要的东西:实时说话人分离(多方可分辨到句,且有更稳定的音色克隆,API 提供 always 等克隆模式)、源文与译文同屏的对照显示、以及用会话历史消除人名与术语歧义的长上下文消歧。它已在阿里云百炼与 QwenCloud 上线为 qwen3.8-livetranslate-flash-realtime(WebSocket)。官方给出的评测覆盖 14 个语言方向的 Omnilingua-MSpeaker 与 70 个语言方向的 FLEURS,均为官方口径。
核验记录
官方博客页(qwen.ai/blog?id=qwen3.8-livetranslate)经 r.jina.ai 直读,Published Time 2026-09-18T17:30:00+08:00;该站为 JS 渲染,裸 curl 拿不到正文、站内 blog 列表也检索不到此 slug,故日期取自渲染后的页面头部。MarkTechPost 9/20 06:46(datePublished 直读)报道交叉。配图用 MarkTechPost 的图文(实测 200、PNG 2188×1563);img.alicdn.com 的 og:image 仅 80×80 不可用。LAAL 与全部基准数字均为官方自报,无第三方复现。
← 上一篇RoboHarm 机器人安全基准:GPT-6 Astra 做满 60 个危险动作只拒了 2 次,Fable 只在「刺玩偶」一项拒绝下一篇 →AI 幻觉情报差点让美军拦下一艘中国货轮:武装人员已待命、飞机已升空,临动手前才查出货物认错了