AI 资讯聚合 · 大模型

阿里通义发 Qwen3.8-LiveTranslate:同传平均滞后压到 2.3 秒,并加上实时说话人分离

cn大模型多模态实时同传Alibaba Qwen · 2026-09-18 · 约1分钟 · 来源:阿里通义官方博客 / MarkTechPost
阿里通义发 Qwen3.8-LiveTranslate:同传平均滞后压到 2.3 秒,并加上实时说话人分离

阿里通义发布实时同传模型 Qwen3.8-LiveTranslate,官方博客称其在忠实度、流畅度、简洁度三个维度全面提升,核心指标平均滞后(LAAL, Length-Adaptive Average Lagging)从上一代的 2.8 秒降到 2.3 秒,约减少 18%。架构上是 Hybrid-MoE 的 Thinker–Talker 两模块设计:Thinker 把视频、音频、源文与译文按时间顺序交错排成一条因果序列,理解与翻译在同一序列内端到端完成;Talker 再把译文与源音频合成为保留原说话人音色的语音。

新增的三项能力都是「说话现场」才需要的东西:实时说话人分离(多方可分辨到句,且有更稳定的音色克隆,API 提供 always 等克隆模式)、源文与译文同屏的对照显示、以及用会话历史消除人名与术语歧义的长上下文消歧。它已在阿里云百炼与 QwenCloud 上线为 qwen3.8-livetranslate-flash-realtime(WebSocket)。官方给出的评测覆盖 14 个语言方向的 Omnilingua-MSpeaker 与 70 个语言方向的 FLEURS,均为官方口径。

原文链接:阿里通义官方博客 / MarkTechPost

核验记录
官方博客页(qwen.ai/blog?id=qwen3.8-livetranslate)经 r.jina.ai 直读,Published Time 2026-09-18T17:30:00+08:00;该站为 JS 渲染,裸 curl 拿不到正文、站内 blog 列表也检索不到此 slug,故日期取自渲染后的页面头部。MarkTechPost 9/20 06:46(datePublished 直读)报道交叉。配图用 MarkTechPost 的图文(实测 200、PNG 2188×1563);img.alicdn.com 的 og:image 仅 80×80 不可用。LAAL 与全部基准数字均为官方自报,无第三方复现。