ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding
本文介绍了 ABLE,这是一个无需训练的框架,它通过聚合与分词器无关的基于梯度的特征归因来捕捉输入敏感性模式,从而表示并映射异构大语言模型,为模型比较、路由和溯源审计等任务提供稳定的、可扩展的嵌入。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,大型语言模型(LLM)的世界就像一座巨大且混乱的图书馆。每天都有成千上万本新书(模型)被加入其中。有些是由同一位作者编写的,有些是旧书的修订版,还有些则是完全不同的流派。问题在于?这座图书馆没有目录。这些书往往缺乏清晰的标签来注明它们的来源、作者以及彼此之间的关系。
研究人员需要一种方法来整理这座图书馆,但现有的工具都有缺陷:
- “内部观察”法: 试图阅读每一本书的实际墨迹和纸张(内部代码/权重)。如果所有的书都使用相同的字体和纸张尺寸,这种方法效果很好,但当图书馆里包含不同装订、语言和结构的书籍时,它就会彻底失效。
- “封面测试”法: 只看书的封底(模型给出的最终答案)。这样做很容易,但两本书可能会有完全相同的封底文字,尽管它们的内部编写方式截然不同。这就像仅仅通过最终菜肴的味道来评判两位厨师,却忽略了一个使用了搅拌机,而另一个使用了研钵与杵。
解决方案:ABLE(“指纹”扫描仪)
论文介绍了 ABLE(基于归因的大模型嵌入)。请将 ABLE 想象成不是一个阅读最终答案的读者,而是一个观察模型是如何思考的取证扫描仪。
它是如何工作的,请看这个简单的类比:
1. “抽屉里的尺子”测试
想象你问两个不同的人一个棘手的问题:“你会把尺子放在桌子的哪个部分?”
- A 人可能会想:“尺子很长,所以它应该放在抽屉里。”他们关注的是“长”这个词。
- B 人可能会想:“尺子是一种工具,而工具应该放在抽屉里。”他们关注的是“工具”这个词。
两人都给出了相同的答案(“抽屉”),但他们的思考路径不同。
- 旧方法会说:“他们都说了‘抽屉’,所以他们是同一个人。”
- ABLE 则观察答案背后的大脑活动(注意力)。它看到 A 人关注的是“长”,而 B 人关注的是“工具”。它意识到这是两个不同的人,拥有不同的思维风格,即使他们的答案一致。
2. “通用翻译机”
不同的模型说着不同的“语言”(分词器/Tokenizer)。一个模型可能会将“ruler”拆分为“rul”和“er”,而另一个则将其视为一个完整的单词。
ABLE 充当了通用翻译机的角色。它将每个模型的特定注意力模式映射到一个统一的标准词汇表(如标准字典)上。这使得它可以比较一个 70 亿参数的模型与一个 700 亿参数的模型,即使它们的构建方式不同。
3. “压缩地图”
一旦 ABLE 绘制出模型是如何思考的,它就会创建一个紧凑的数字指纹(嵌入)。这就像是将一个巨大的、复杂的 3D 模型大脑雕塑压平,变成一张小巧、易于携带的身份证,但它仍然保留了所有的核心形状信息。
他们发现了什么?
研究人员在 239 个不同的模型上测试了这个“指纹扫描仪”。以下是他们的发现:
- 它能识别家族谱系: 如果你选取已知相关的模型(例如父模型及其子模型),ABLE 的指纹会在地图上显示它们靠得很近。如果它们不相关,则会相距甚远。它成功地重建了像 Mistral 和 Llama 这样的模型“家族树”。
- 它是一个更好的“媒人”: 在决定哪个模型最适合特定工作(如数学或编程)时,ABLE 的指纹比仅观察最终答案更能准确预测性能。它甚至可以在进行完整的测试之前就能告诉你:“这个模型的思维方式像个数学家。”
- 它具有稳定性: 论文从数学上证明了,如果你对模型的内部代码进行微小的改动,其指纹也只会发生微小的变化。它不会剧烈跳动;这是一种衡量相似性的可靠方法。
核心结论
ABLE 是整理混乱 AI 模型世界的一种新方法。它不再仅仅阅读最终答案或尝试解码复杂的内部布线,而是观察模型为了得出结论而关注哪些线索。
这就像拥有一种超能力,让你能够看到答案背后的思考过程,从而让你能够分辨出两个在表面上看起来完全相同、但在思维方式上截然不同的模型。这有助于研究人员审计模型的来源、将任务路由到合适的模型,并在无需对每一个模型进行昂贵且耗时的完整测试前,预测其表现水平。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。