← 最新论文
🤖 machine learning

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

该论文指出将新词元初始化为现有词嵌入均值会导致表示退化,并提出了“基于语 grounding 的词元初始化(GTI)”方法,通过在微调前利用配对语言监督将新词元映射到预训练嵌入空间中具有语义意义的不同位置,从而在生成式推荐任务中显著优于传统初始化策略。

原作者: Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinay
发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲了一个关于**如何让大语言模型(LLM)学会“新单词”**的故事。

想象一下,你有一个博学多才的老教授(预训练好的大语言模型),他肚子里装着海量的知识,认识成千上万个单词。现在,你希望他学会一门新语言,或者认识一批全新的“物品代码”(比如在推荐系统里,给每一件衣服、每一个职位分配一个独特的数字代号,叫“语义 ID")。

1. 传统做法的尴尬:把新学生都塞进同一个空房间

以前,当我们要教老教授认识这些新单词时,最常用的办法是**“平均初始化”**。

  • 比喻:这就好比你要给 1000 个新学生(新单词)安排座位。为了省事,你把他们所有人都安排在了教室正中央的同一个座位上,而且每个人都长得一模一样(初始向量完全相同)。
  • 后果:刚开始上课(微调训练)时,教授看着这一堆挤在一起、毫无区别的学生,根本分不清谁是谁。虽然经过一番努力(微调),教授能勉强把他们分开,但因为起点太差(大家都挤在同一个点),他们之间的“性格差异”很难被完全拉开,导致教授学得很吃力,效果也不够好。

2. 论文的核心发现:起点决定终点

作者通过仔细观察发现,这种“把所有人塞进一个点”的做法,就像把一群原本性格迥异的人强行按在同一个位置,导致他们失去了原本的独特性。哪怕后来努力训练,这种“先天不足”也很难完全弥补。

3. 提出的新方案:GTI(给新学生找个“好邻居”)

为了解决这个问题,作者提出了一个名为 GTI(Grounded Token Initialization,基于语境的令牌初始化) 的新方法。

  • 比喻
    在正式上课(微调)之前,我们先给这 1000 个新学生安排一个**“预习课”
    在这堂预习课上,我们
    不教老教授新知识**(冻结模型主体),只教这些新学生怎么**“找位置”**。

    • 如果新单词是“苹果”,我们就把它安排在“水果区”的“红色区域”;
    • 如果新单词是“香蕉”,就把它安排在“水果区”的“黄色区域”;
    • 如果新单词是“汽车”,就把它安排在“交通工具区”。

    我们利用这些新单词对应的自然语言描述(比如“苹果”的描述是“一种红色的水果”),让它们在老教授熟悉的“知识地图”上,各自找到属于自己的、有逻辑的位置

  • 好处
    当正式上课开始时,这些新学生已经各就各位了。他们不再是挤在一起的一团乱麻,而是已经根据含义排好了队。老教授只需要稍微引导一下,就能迅速理解他们之间的关系,学习效率大大提升。

4. 实际效果:在“招聘”和“租衣服”场景中的大胜利

作者用两个实际场景测试了这个方法:

  1. LinkedIn 的招聘系统:给成千上万个“职位”和“求职者”分配代码,看模型能不能精准匹配。
  2. 公开的租衣服数据集:给衣服分配代码,看模型能不能根据用户喜好推荐衣服。

结果非常惊人

  • 使用旧方法(大家挤在一起),推荐准确度提升有限。
  • 使用新方法(GTI,大家各就各位),推荐准确度大幅提升(在某些指标上甚至提升了 20% 以上)。
  • 更重要的是,这种“各就各位”的结构,即使在后续的高强度训练中,依然保持得很好,没有乱成一团。

总结

这篇论文告诉我们一个朴素的道理:“好的开始是成功的一半”

在教大模型认识新事物时,不要偷懒把它们都扔在同一个起点。相反,应该利用它们原本的含义,帮它们在模型已有的知识世界里先找个好位置(Grounding)。这样,模型就能利用自己原本的智慧,更快地学会这些新东西,效果自然事半功倍。

这就好比搬家:与其把所有人的行李都堆在门口(平均初始化),不如在进屋前就帮每个人把箱子放到他们该去的房间(GTI 初始化),这样收拾起来自然又快又好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →