阿里云百炼上线 Qwen-Audio 3.1 Realtime Plus:262K 上下文的实时语音对话模型,通话里能调工具、联网搜
阿里云百炼上线 qwen-audio-3.1-realtime-plus,一个端到端实时语音对话(语音转语音)模型:上下文长度 262,144 token,最大输入 245,760、最大输出 16,384;支持音频与文本输入、流式语音与文本输出,实时双工交互,并支持工具调用、联网搜索与声音复刻,默认音色 longanqian_v3.1。联网搜索通过 enable_search 开启,且不能与 Function Calling 同时启用。
定价按模态分档:华北 2(北京)文本输入 5 元、音频输入 40 元、文本输出 40 元、音频输出 150 元每百万 token;新加坡地域分别为 5.995 / 47.963 / 47.963 / 179.861 元。两地限流均为 RPM 60、TPM 100,000。接入方式沿用 3.0 代的 Realtime 协议(WebSocket 事件驱动),官方说明协议兼容。
这一代相对 3.0 的实质变化有两处:一是上下文从「对话轮次」量级抬到 26 万 token,二是把工具调用与联网搜索并进同一条实时语音链路。前者让长会话不必反复截断,后者意味着语音助手从「听得清、接得住」转向「在通话中查资料、调工具并继续说话」——语音正在从交互界面变成执行入口。
原文链接:阿里云百炼官方文档
核验记录
官方文档页 help.aliyun.com/zh/model-studio/qwen-audio-3-1-realtime-plus 直读(262,144/245,760/16,384、四档单价、RPM 60 全部取自页面正文)。该页「更新时间」字段为空,官方没有给出发布日期;日期 9/20 取自阿里云模型列表页 meta last-modified 2026-09-20T16:39:33+08:00,与第三方同期报道一致口径。新版相对 3.0 的逐项差异官方页未列出,「协议兼容」为文档原文表述。