AI 资讯聚合 · 大模型

蚂蚁开源 Realtime-Venus:9B 全双工音视频交互,说话中可委派后台任务

中国大模型开源语音交互蚂蚁集团 InclusionAI · 2026-09-16 · 约1分钟 · 来源:蚂蚁 InclusionAI 官方模型仓库

蚂蚁集团 InclusionAI 在 Hugging Face 开源 Realtime-Venus 全双工交互系统,含 9B 参数的两个检查点(Apache-2.0):Realtime-Venus-Omni 为音视频交互模型,持续观看与聆听、自行判断是否以及何时回应,并在共享的因果时间线上同时生成文本与语音;Realtime-Venus-Audio 采用相同流式骨干,专注音频理解与音频驱动的对话。两个模型均基于 MiniCPM-o 4.5 / Omni-Flow 架构改造,语言骨干为 Qwen3-8B,上下文 40,960 token,BF16 精度。

关键能力有三处:原生全双工对话——说话时持续感知输入,能区分简短附和、打断、纠正与话题转向;异步任务委派——在对话进行中以流内 <delegate> 请求把外部任务交给后端异步执行、以同样方式接收结果,外部任务不阻塞正在进行的对话(需配套 Realtime-Venus-Harness 运行时,位于 GitHub);免训练长视频记忆——保存视觉信息丰富的时刻并检索重组音视频上下文。它改变的是实时交互智能体的架构:对话与后台任务不再排队,语音智能体可以在不中断说话的前提下干活。

原文链接:蚂蚁 InclusionAI 官方模型仓库

核验记录
日期三个独立时间戳互证:HF 仓库 inclusionAI/Realtime-Venus createdAt 2026-09-16T08:02Z、GitHub inclusionAI/Realtime-Venus created_at 2026-09-16T07:57Z、ModelScope CreatedTime 1789545803(2026-09-16T08:03Z),相隔 6 分钟。README 英文与中文版直读:9B 双检查点、MiniCPM-o 4.5 基座、Qwen3-8B 骨干、40960 上下文、<delegate> 异步委派、免训练长视频记忆均取自模型卡原文。技术报告 arXiv 2609.13814 页 citation_date / citation_online_date 均 2026/09/12(论文提交日,早于权重公开)。note:媒体(读懂AI时代)报道为 9/18 转述,未作日期依据。