中国电信开源 Xing4.0-29B-A4B:这个规模上第一个全程在昇腾 NPU 上训练的模型
中国电信人工智能科技公司开源 Xing4.0-29B-A4B(前身是 TeleChat 系列):29B 总参数、每 token 激活约 4B,原生 256K 上下文、可扩到 512K,架构为 mHC + MLA + MTP,官方定位是面向智能体(多步规划、工具调用、长链推理)与复杂工程任务。它最大的差别在训练底座——官方称这是这个参数规模上第一个完全在昇腾 NPU 与 MindSpore/MindFormers 上训练出来的模型,通过细粒度 MoE 通信优化、选择性重算、DVM 自动图算子融合与昇腾 C 写的 mHC 融合算子,训练吞吐比开箱性能提升约 96%。
配套生态是这次开源里更实用的一面:微调支持 LLaMA-Factory 与 MindFormers,推理支持 vLLM / SGLang / KTransformers,并点名对 OpenCode、Claude Code、OpenClaw、Hermes 等智能体框架做了格式与适配对齐;多芯片平台适配通过 BAAI FlagOS 完成。官方评测里 SWE-bench Verified 75.0、SWE-bench Multilingual 66.0、Terminal-Bench 2.1 57.5、Claw-Eval 76.55,同档对标 Gemma4-26B-A4B 与 Qwen3.6-35B-A3B。同日还开源了 FP8 与 GGUF 两个版本。
原文链接:中国电信 AI / GitHub
核验记录
官方 GitHub README 的 News 段直读「2026-09-17 Open-sourced Xing4.0-29B-A4B」及其 FP8/GGUF 同日条目;HF 仓库 createdAt 2026-09-16T06:44:40Z、ModelScope CreatedTime 2026-09-16T06:57:51Z(相隔 13 分钟互证,权重先于公告)。发布时间取官方公告日 9/17。评测数字全部为厂商自测(README 表格),未第三方复现;配图取自 HF 官方缩略图(裸请求与带 Referer 两次实测均 200、PNG 1200×648)。
← 上一篇PhAI 联四校发 JEPA-Anything:一套预测核心跑通七个领域,开普勒定律从模型里长出来下一篇 →PrismML 发 Bonsai 2 27B:三值权重 1.76 bit 跑进 5.9GB,保留 98.2% 能力