生数科技发 Vidu S2:实时数字人升到 720p,视频流可实时换装换人换背景
生数科技发布 Vidu S2,包含两个模型:面向持续交互数字角色的 Vidu S2-Avatar,与面向输入视频流实时编辑的 Vidu S2-Editing,发布当天即全量开放在线体验(而非申请制或研究预览)。S2-Avatar 相对 S1 把实时输出从 540P 提升到 720P,支持可随时更新的动态参考,指令跟随更强(如舞蹈等大幅动作);S2-Editing 可对正在播放的视频流实时做风格渲染、换装、换人、换背景。两者还进一步试做实时空间视频——把实时生成或编辑的画面转成左右眼视频,供 VR 头显观看。
技术报告(arXiv 2609.11638,35 位作者,生数科技与清华联合,流式视频生成与推理方向由张金涛负责)称 S2-Avatar 在实时数字角色基准 StreamAV-Bench 的九项指标上均取得报告所列对比模型的最优结果,S2-Editing 在多项视频编辑基准上的总体得分超过所比离线与流式模型——均为厂商自报,尚无第三方复现。
这条的意义是把视频模型从「单次生成」推进到「对持续视频流的实时处理」:实时交互是国产视频模型此前唯一站稳身位的方向(S1 即主打实时对话式生成),S2 又把它扩到实时编辑与空间视频。
原文链接:生数科技官方页 / 北京商报
核验记录
官方产品页直读确认:https://www.vidu.cn/vidu-stream 标题为「Vidu S2:全球领先的实时交互与编辑模型」,含 S2-Avatar / S2-Editing 双模型说明、720P+ 输出、物品互动与风格/角色/背景替换、虚拟换衣,并附两份 API 使用文档入口——但该页无可见发布日期字段,服务端时间戳也不是内容时间。发布日期 9/15 依据:新浪财经 9/15 22:08 报道「9月15日消息,近日正式发布,发布当天全量开放」,量子位 9/15 22:14 发稿称「今天发布」,北京商报 9/16 发稿称「9月16日获悉」——三家媒体口径跨 9/15–9/16,按最早发稿日取 9/15。技术报告 arXiv 2609.11638(35 位作者,生数科技与清华,第一作者 Jintao Zhang)页内 citation_date / citation_online_date 均为 2026/09/10,为提交日而非发布日,故本条未采用。生数官网 shengshu.com/zh/news 截至 9/16 无 Vidu S2 条目(站点已从 shengshu-ai.com 301 至 shengshu.com)。配图 HF papers 缩略图直读 200、PNG 1200x648(裸请求与带 Referer 各一次)。