AI 资讯聚合 · 开源生态

35B 模型只占 3GB 内存:Edge0 用 SSD 专家卸载把权重按需取进来

国外开源生态开源端侧推理Edge0 · 2026-09-10 · 约1分钟 · 来源:Edge0 官方研究页(页内标注 September 10, 2026)+ Hugging Face 模型仓库
35B 模型只占 3GB 内存:Edge0 用 SSD 专家卸载把权重按需取进来

Edge0 于 9 月 10 日发布 Edge0-35B-A3B 与 Edge0-8B-A1B:分别基于 Qwen3.5-MoE 35B-A3B 与 Ling 3.0,4-bit 量化后权重约 23GB 与 4.2GB,靠 SSD 专家卸载与 Prerouter 路由预测,把峰值活跃内存压到约 2.9GiB 与 1.0GiB,目前经 MLX 跑在 Apple Silicon 上,框架与模型权重均开源。

关键点是把稀疏激活真正兑现成设备要求:以往 MoE 每步只激活很少参数,但没被激活的专家仍要占着内存。让权重按需从 SSD 到达,等于把「省参数」变成「省内存」——这是本地跑大模型最硬的那道墙,而他们的做法是把存储读取从关键路径上挪开,用预测提前买时间。

原文链接:Edge0 官方研究页(页内标注 September 10, 2026)+ Hugging Face 模型仓库