← 最新论文
💻 computer science

Deterministic multi-hash routing supports long-horizon training in a compact language model

本文证明了,一个使用基于令牌标识(token-identity)的确定性多哈希路由进行专家选择的 2.01 亿参数紧凑型语言模型,可以在长程训练任务上取得具有竞争力的性能,尽管由于缺乏匹配的稠密控制组,该路由机制的具体贡献仍未被隔离。

原作者: Boris Peyriguere

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Boris Peyriguere

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在飞速发展的人工智能领域,研究人员不断尝试构建能够理解语言并对世界进行推理的机器。为了实现这一目标,他们创建了被称为“语言模型”的数字大脑,这些模型本质上是庞大的数字网络,通过学习海量文本中的模式来进化。一种让这些模型在不变得过于庞大且难以实现的条件下变得更聪明的常用策略是使用一种被称为“混合专家”(mixture of experts)的设计。想象一个图书馆,与其让每一本书都由一位图书管理员阅读,不如让不同区域由不同的专家负责。在计算机模型中,这意味着对于任何给定的单词,系统只会激活一小部分特定的内部处理器,即“专家”,而让其余部分保持休眠状态。通常,计算机通过观察句子的上下文来决定使用哪些专家,询问自己:“这是一个什么样的词,它现在需要什么?”这种决策过程是由模型在训练期间自行学习的,这使得它既灵活又复杂且难以预测。

一位名叫 Boris Peyriguere 的研究人员探索了一条不同的路径,提出了一个简单但大胆的问题:如果计算机根本不需要决定使用哪些专家呢?与其为每个句子学习动态规则,不如让专家的选择完全基于单词本身而永久固定下来。在这种新方法中,单词的身份就像一把永久的钥匙,无论周围的对话如何,它总是能打开相同的两扇门。该研究员构建了一个拥有约 2.01 亿个参数(衡量其规模和复杂性的指标)的紧凑型语言模型,并使用这种僵硬、预先确定的系统对其进行了训练。在初始学习阶段,该模型接触了近 1300 亿个单词,随后通过另外 320 亿个单词进行了进一步精炼,最后学习了如何遵循指令。结果表明,这种固定系统可以有效地进行长期学习,产生了一个在物理推理和常识测试中表现出奇出色的模型,甚至超越了一些使用不同方法训练的更大规模的传统模型。

这项实验的核心在于模型如何处理信息。在标准设置中,计算机分析当前情况以挑选最佳工具。而在 Peyriguere 的模型中,工具是在看到单词的那一刻就根据一个永不改变的预计算映射被选定的。对于模型词汇表中的每一个单词,都有一个特定的专家对被分配给它。这张映射表在训练开始前就已经创建,并在整个过程中保持固定。模型仍然使用一条共享路径来处理每个单词,以确保它理解上下文,但额外的“残差”处理能力则来自于那两个预先分配的专家。这种设计移除了一层复杂性:模型不再需要学习如何路由信息,从而节省了计算开力并使系统更容易检查。由于路由表是一个固定的整数列表,任何人都可以查看模型,并准确知道对于任何给定的单词将使用哪些专家,而无需先通过一个句子运行计算机。

训练过程既严谨又透明。模型始于一个基础阶段,它阅读了大量的文本集合,包括网页、教育材料、代码和数学。在这次初始接触之后,研究人员暂停并重启了训练,使用了全新的内部设置,重新审视这些独特的单词,以在不重复完全相同的事件序列的情况下精炼模型的理解。最后,模型经历了指令微调,即通过展示 30 万个问答示例来学习如何遵循命令。在整个旅程中,固定的路由系统始终保持稳定。模型并未崩溃或无法学习;相反,它稳步提高了解决问题的能力。到训练结束时,该模型总共接触了超过 1620 亿个单词,对于其规模的模型而言,这是一个显著的数据量。

在推理能力测试中,该模型交付了扎实的结果。在一个衡量物理交互理解能力的测试 PIQA 中,该模型达到了 68.01% 的准确率。在被称为 ARC-Challenge 的科学问题集上,它得分 27.13%。或许最值得注意的是,当结合其在两组不同科学问题上的得分时,该模型达到了 47.29% 的综合准确率。这一表现高于几个参数量明显更大(在 3.5 亿到 7.74 亿之间)的公开模型。这些较大的模型是在同样的严格规则和测试方法下进行评估的,但它们并未达到这个较小的、采用固定路由模型的表现。这表明,固定路由系统的效率使得该模型能够更好地利用其有限的规模。

然而,研究人员谨慎地表示,并不声称这种方法是终极解决方案,也不认为它在所有其他方法中具有绝对优势。研究明确指出,它并未包含匹配的全规模稠密对照组或多种子复制实验。如果没有这样的受控实验,就无法确定是固定路由导致了高性能,还是其他因素(如使用的特定数据或训练计划)起到了更大的作用。论文明确指出,它并未证明固定路由优于大多数现代系统中使用的灵活、学习型路由。相反,这项工作是一个概念验证:它证明了一个具有固定、不变路由的模型可以进行长期的训练,可以学习复杂的任务,并能产生高质量的结果。

这项工作的意义超出了数字本身。通过将路由表变为模型中一个固定的、可审计的部分,研究人员创建了一个更容易检查和验证的系统。在许多先进的 AI 系统中,决策过程是一个随着模型学习而变化的“黑盒”,这使得很难准确知道某个特定决策是如何做出的。在这个模型中,路径是清晰且不可改变的。如果你想知道一个单词会激活哪些专家,只需在表中查找该单词即可。这种透明度对于那些需要了解模型具体运作方式的研究人员,或者想要确保系统行为可预测的开发人员来说,是非常有价值的。该模型还展示了它可以处理长时间的训练过程而路由系统不会变得不稳定,而这在以前曾让人们担心固定路由在大规模应用中的风险。

最终,这篇论文为如何构建高效的语言模型提供了新的视角。它挑战了“计算机必须不断学习如何选择自己的工具”这一假设,转而表明,对于一个紧凑型模型来说,预先确定的、静态的选择同样可以奏效,甚至在效率方面可能更好。研究人员发布的模型及其训练代码和评估工具都是公开的,供他人研究和复制。这种开放性允许科学界进一步测试这些发现,例如通过使用不同的数据运行相同的实验,或者直接与标准模型进行对比。目前,这项研究作为一个证明,展示了一种更简单、更僵硬的路由方式可以维持一段漫长且富有成效的训练旅程,并产生一个具备能力的、透明的语言模型,其表现足以超越其自身的规模。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →