智谱公开 RSI 首个案例:GLM-5.3 代理在 10 万卡国产集群上优化自己的推理系统
智谱创始人唐杰 9 月 17 日分享其内部观察到的 RSI(递归自我改进)早期案例:GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统(GLM-5.3-Flash 的全部线上推理即运行于其上,此前以匿名模型 Ox-Alpha 上线 OpenCode/OpenRouter),不到两周端到端吞吐提升至初始基线的 3.2 倍。
技术细节:代理自己读取系统反馈、提出假设、修改代码、跑实验再迭代——定位出 KV Transfer 场景中 Python GIL 导致的并发阻塞,把 Prefill+KV Transfer 相对单独 Prefill 超过 20% 的性能损失压到 1% 以内;KDA Decode 算子重组计算拿到 1.71 倍提升。智谱同时明确强调尚未实现 RSI:目标设定、边界划分与风险判断仍由人类工程师负责。它与智谱 9 月 13 日融资公告中「下一代 GLM 在上一代 GLM 构建的环境中训练」的完全自训练投入是同一条线——模型优化运行自己的系统,被优化后的系统又承载新的模型。
原文链接:量子位 / 智谱技术 Blog
核验记录
量子位直读(作者一水,页面时间 2026-09-17 16:28:23),正文含唐杰技术 Blog 原文转述;智谱官方站 z.ai/blog 直连失败、chatglm.cn 未见对应条目,官方一手发布页这一环未核到,日期押在量子位发稿;全部数字(3.2 倍、1.71×、1%)为厂商自述,无第三方复核