AI 资讯聚合 · 开源生态

XGEN Labs 发 XGEN-JING:第一人称可交互世界模型,音视频一起生成

海外开源生态世界模型视频生成XGEN Labs · 2026-09-16 · 约1分钟 · 来源:XGEN Labs 官方 HF 仓库
XGEN Labs 发 XGEN-JING:第一人称可交互世界模型,音视频一起生成

XGEN Labs 发布 XGEN-JING,一个「第一人称可交互体验模型」:输入是动作序列、参考图与观察历史,输出是第一人称的视频加音频,覆盖移动、物体交互与对话三类行为。它支持键盘控制的空间移动、用文字引导物体操作与人物对话(画面与声音同时生成),也支持把人物、物体、场景三张参考图组合成一个可探索的场景。权重以 Diffusers 格式开放,基于 MiniMax-H3 Ref2VA 与 FlashGen 的四步 LoRA 构建,本版是四步双向推理的 JING-Flash-v1。

官方给出的运行条件是 6 张 H100:一张给文本编码器、一张给视频/音频 VAE、四张跑带序列并行的 DiT,默认后端 FlashAttention-4,并锁定 Torch 2.13.0+cu130、Triton 3.7.1、SGLang kernel 0.4.7 等具体版本。发布清单里已勾选 JING-Flash-v1 权重、推理代码与示例,以及一套从故事与参考图生成验证用例的 Prompt Skills;因果模型与技术报告标注为「即将发布」,arXiv 链接仍是占位。

它的意义是把世界模型往「可被即时操控的体验」推了一步——不是生成一段成品视频,而是像游戏引擎一样持续对用户输入作出音视频响应,同时把权重直接开放给社区自验。

原文链接:XGEN Labs 官方 HF 仓库

核验记录
HF 仓库 XGENlabs/XGEN-JING 元数据直读:createdAt 2026-09-16T10:02:50Z、likes 138、license 为 MiniMax-H3 社区协议、base_model MiniMaxAI/MiniMax-H3;model card 全文直读(四步双向推理、6×H100 分工与版本锁定、发布清单勾选状态、Prompt Skills 链接)。第二个时间戳:GitHub 仓库 XGEN-Labs/XGEN-JING created_at 2026-09-15T05:58:14Z(早于权重仓)。官方站 xgenlabs.ai 只有壳页与画廊页、无博客与日期字段(research.html 返回 308/403),故日期取权重仓 createdAt;因果模型与技术报告未发布,本条只覆盖已开放的 Flash 版本。配图为 HF og 缩略图,curl 两次(裸 + 带 Referer)均 200 / PNG 1200×648。