← 最新论文
💬 NLP

Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion

该论文提出了一种名为 FragMend 的基于可解释性的词汇扩展方法,通过优化候选词选择策略和嵌入初始化方式,有效解决了非拉丁语系大语言模型中存在的“词元过度碎片化”问题,显著提升了多语言处理的效率与性能。

原作者: Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲的是如何给大型人工智能模型(LLM)“减肥”和“优化”,特别是为了让那些使用非拉丁字母(比如中文、印地语、缅甸语等)的语言能用得更便宜、更流畅。

我们可以把这篇论文的核心内容想象成给一个只会说英语的“超级翻译官”重新设计他的“词汇本”和“翻译规则”

1. 核心问题:为什么有些语言“太费钱”?

想象一下,你有一个非常聪明的翻译官(大语言模型),他手里有一本厚厚的词汇本(Vocabulary)。

  • 英语用户:说一个单词,翻译官直接查表,对应一个“令牌”(Token,可以理解为翻译的基本单位)。比如 "Hello" 就是 1 个令牌。
  • 非英语用户(比如说奥里亚语或缅甸语):因为翻译官的词汇本里主要是英语单词,遇到这些语言时,他不得不把一句话拆得支离破碎
    • 比喻:就像你要用只有“苹果”、“香蕉”、“梨”这几个词的字典去描述“红富士苹果”,你不得不写“红色的” + “像富士山一样的” + “苹果”。结果,原本一句话,英语用户只需要 1 个词,非英语用户却需要拆成 10 个碎片(Token)才能表达清楚。

后果

  • 更慢:因为要处理更多的碎片,生成速度变慢。
  • 更贵:现在的 AI 是按“词”收费的。英语用户花 1 块钱,说同样意思的话,非英语用户可能要花 10 块钱。这就是论文里说的“代币溢价”(Token Premium)。

2. 以前的做法:只加“大词”

以前,人们想解决这个问题,做法很简单:

  • 选词:在目标语言里找出现频率最高的词(比如“的”、“是”、“我”),把它们加进词汇本。
  • 初始化:给这些新词随便填个意思,或者把组成它的碎片意思加起来。
  • 局限:这就像只给翻译官加了几个“大词”,但他还是习惯把长词拆碎。而且,只加“大词”就像只给鱼竿加了几个大钩子,却忽略了那些能钓到小鱼的小钩子,效率提升有限。

3. 这篇论文的突破:用“读心术”找词(可解释性方法)

作者们提出了一种更聪明的方法,叫FragMend(可以理解为“碎片修补术”)。他们不再只看词频,而是去观察模型的大脑活动(激活值)。

第一步:像侦探一样选词(Item Selection)

以前的方法像“数数”(哪个词出现多就加哪个)。
作者的方法像“读心”:

  • 他们问模型:“如果你看到这个词,你的大脑里是不是已经把它当成一个完整的概念了?”
  • 发现:模型其实很聪明!即使词汇本里没有这个词,模型在深层大脑里,其实已经能把一堆碎片(Subwords)自动拼成一个完整的词了。这就叫**“子词去分词化”(Subword Detokenization)**。
  • 比喻:就像你看到一堆乐高积木(碎片),虽然盒子上没印“城堡”这个词,但你脑子里已经自动把它们拼成了城堡。作者发现模型也有这种“脑补”能力。

第二步:不仅加“大词”,还要加“零件”(FragMend 的核心)

以前的方法只加完整的“城堡”(大词)。
FragMend 发现,模型在拼出“城堡”之前,其实先拼出了“城墙”、“塔楼”这些中间零件

  • 创新:FragMend 不仅把完整的词加进去,还把那些中间零件(子词)也加进词汇本。
  • 比喻:以前只给翻译官加“汽车”这个词;现在,FragMend 把“车轮”、“引擎”、“车门”这些零件也加进去了。这样,翻译官就不需要每次都把“汽车”拆成“轮子 + 引擎 + 门”来解释了,直接调用“车轮”这个零件,效率瞬间提升。

4. 怎么给新词“填魂”?(Embedding Initialization)

给新词加进词汇本后,得告诉模型这个词是什么意思。

  • 旧方法:随便填,或者把碎片意思平均一下(像把面粉和水随便搅和)。
  • 新方法:利用刚才的“读心术”。既然模型在深层大脑里已经知道这个词怎么拼了,我们就直接提取它大脑里那个最清晰、最完整的“拼图瞬间”的神经信号,作为这个词的初始含义。
  • 效果:这就像给新来的翻译官直接配了一个“灵魂导师”,让他一上岗就懂这个词的精髓,而不是从零开始学。

5. 结果如何?

作者用这个方法(FragMend)测试了多种语言(包括很多资源匮乏的语言,如缅甸语、奥里亚语):

  • 省钱:对于某些语言,把原本需要 10 个碎片才能表达的意思,现在只需要 3-4 个碎片。这意味着API 成本降低了 30%-50%
  • 保质:虽然词变少了,但翻译的准确度几乎没有下降(甚至更好了)。
  • 门槛低:只需要几千句简单的文本数据,几个小时就能搞定,不需要重新训练整个庞大的模型。

总结:这篇论文在说什么?

这就好比给一个只会用“大颗粒积木”拼图的机器人,换了一套**“精细颗粒积木”**。

  1. 发现问题:机器人拼非英语时,因为积木太大,不得不把小图拆成无数碎片,又慢又贵。
  2. 旧方案:只加几个大积木,效果一般。
  3. 新方案 (FragMend)
    • 观察机器人怎么思考,发现它其实能自己拼出中间形状。
    • 把这些中间形状(子词)也做成积木加进去。
    • 直接读取机器人思考时的“灵感”来定义新积木的含义。
  4. 结局:机器人现在拼非英语图快多了,省下的钱能买更多积木,而且拼出来的图依然很精美。

一句话总结:这篇论文通过“读懂”AI 的内心,把原本破碎的语言重新“缝合”成更高效的词汇,让非英语用户也能用得起、用得好 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →