Meta FAIR 论文:把蒸馏单位从 Token 换成字节,能力上限反超 4%
Meta FAIR 与华盛顿大学的论文《Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models》(arXiv 2609.12303)给出两种把词元 logits 转成字节 logits 的方法——近似的 Marginalize-It 与精确的 End-Of-Token,并在 1B 参数、层参数对齐的稠密 Transformer 上做了迄今最大规模的对照:同时变化分词方案(Token / Byte / Byte+EOT)与训练目标(蒸馏 / 交叉熵),数据量一路喂到 1 万亿字节,跨 8 个基准(多选问答、语言生成、机器翻译)评测。
结论是两者的天花板不一样:低算力区间词元模型更强,但很快进入平台期;字节模型起步更差却持续爬升,外推平均 top-1 错误率对验证集 BPB 的缩放律后,蒸馏版 End-Of-Token-1B 比蒸馏词元模型低最多 4%,且只花约 1/6 的训练数据就能追平。工程上另有两个收益:词表从十万级词元压到 256 个字节取值,dump logits 时不再需要 top-k 截断,logit 存储成本约降到 1/5。论文同时预测该模型在下游平均任务上渐近超过 Llama 3.2-1B、Gemma-3-1B-pt 与 Gemma 2B,最多 6.5%、8.1%、2.1%。
它改的是「小模型蒸馏只能在同一套分词器里做」这条隐含前提:蒸馏的瓶颈不只在数据与算力,也在学生模型词表带来的候选空间与存储成本。作者也如实写明当前还没完成等推理成本下的公平比较。
原文链接:Meta FAIR / 华盛顿大学
核验记录
arXiv 页内 citation_date 与 citation_online_date 均为 2026/09/11(首次提交 11 Sep 2026);作者单位为 arXiv HTML 版首页署名:University of Washington, Seattle 与 Meta FAIR(注明部分工作完成于 Meta FAIR)。数字全部取自摘要原文(4% / 1/6 / 约 1/5 / 6.5%、8.1%、2.1%)。无权重与代码公开发布,本条按论文发布收录、未进模型时光机。qbitai 9/15 的中文报道与摘要一致,仅作交叉。
← 上一篇分子之心 QuantaMind 登 Science Advances:一张 GPU 跑十万原子级反应,复现完整酶催化循环下一篇 →上海AI实验室开源 Atria-Dawn-Preview:744B 基座驱动的智能体模型,256K 上下文