Nature 近日刊出一篇论文,标题为《Retrofitting language models to operate over bytes》,链接为 https://www.nature.com/articles/s41586-026-11111-4。该文归入论文分类。本次来源未提供摘要,具体方法、实验设置与结论需查阅原文。
从标题看,这项工作关注的是"改造"(retrofitting)现有语言模型,使其直接在字节(byte)层面运作,而不是像当前主流做法那样,先经分词器把文本切成子词单元(token),再送入模型。
为什么这一方向值得关注?当前几乎所有主流大语言模型都建立在固定词表之上。分词器决定了模型能看到什么、看不到什么:词表之外的内容被拆成碎片,罕见字符、混合语言文本、代码与各类非文本字节流往往需要额外的预处理或回退策略;多语言场景下,词表分配的均衡性也长期是工程上的棘手问题。若模型能够直接消费原始字节序列,理论上可以绕开固定词表的边界,把"语言模型能处理什么输入"这一约束从词表设计转移到模型自身。
"Retrofitting"一词通常意味着复用已有的预训练权重进行改造,而非从零训练。若这一路径可行,其价值在于不必重新承担完整预训练成本,就能让既有模型获得字节级处理能力——这对已经沉淀大量模型资产的团队具有现实意义。当然,字节序列比 token 序列长得多,序列长度与计算开销之间的权衡,以及改造后模型在常规任务上是否保持原有性能,都是此类方案必须回答的问题。
对 AI 从业者而言,这篇论文提供了一个值得跟踪的技术信号:分词器是否仍是语言模型不可绕过的前置组件,正在被重新审视。相关方法与评测细节建议直接阅读原文。
