AI 资讯聚合 · 大模型

智谱上线 GLM-5.3-FlashX:同一基座 Infra 提速 5 倍至 200 tokens/s

中国大模型推理提速国产算力智谱 · 2026-09-18 · 约1分钟 · 来源:智谱官方公众号 / IT之家

智谱 9 月 18 日推出 GLM-5.3-FlashX:其基座 GLM-5.3-Flash(总参数 320B、激活 18B,8 月 26 日开源,此前曾以 Ox Alpha 之名匿名上线 OpenCode/OpenRouter)的官方极速推理版,最高推理速度 200 tokens/s,API 与体验中心同步开放,Model Key 为 GLM-5.3-FlashX。

变化只有一个变量:速度。基座智能不变(AA 综合智能指数 57 分),FlashX 把最高速度拉到 Flash 的 5 倍,代价是定价为原版的 2.5 倍。提速的来源不是模型而是系统工程:推理算力由 10 万张国产芯片集群提供(自研高带宽互联),在 SGLang 基础上构建专用推理引擎,采用生产级 EPD 分离架构(多模态编码、预填充、逐 token 解码拆为可独立调度的池),配 W8A8 量化与混合缓存量化;官方称相对同一硬件初始基线,端到端服务性能提升 3 倍。它改变的是国产算力承载前沿模型的时延线:实时、高并发与 Agent 场景第一次由纯国产芯片集群以旗舰速度承接。

原文链接:智谱官方公众号 / IT之家

核验记录
OpenRouter API 直读 z-ai/glm-5.3-flashx created=1789727220(2026-09-18T15:07 UTC),与 IT之家/PANews/Gate News 9/18 报道互证;PANews 页 JSON-LD datePublished 2026-09-18T05:20Z 直读。200 tokens/s、5 倍、2.5 倍定价、10 万张国产芯片、EPD 架构、3 倍端到端提升取自智谱官方公众号口径(PANews/IT之家/Gate 转述一致);EPD 与量化细节取自七牛云技术拆解文(非官方一手),基座 320B/18B 与 Ox Alpha 前史与既有已收条目(zhipu-glm-infra-agent-rsi)一致。HF 侧无 FlashX 权重仓库(仅 8/25 的 GLM-5.3 系列),API-only 发布,与 OpenRouter 时间戳自洽。