← 最新论文
💬 NLP

Data Attribution in Large Language Models via Bidirectional Gradient Optimization

本文介绍了一种用于训练大语言模型数据归因的双向梯度优化框架,该框架通过基于生成输出对基座模型进行扰动,以测量跨训练样本的损失变化,从而在识别具有影响力的数据方面优于现有方法,进而增强了模型的可解释性与问责性。

原作者: Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢的大厨(大语言模型),他根据庞大的食谱库(训练数据)烹饪了成千上万道菜肴。有一天,他为你端上了一道特定的菜,比如“香辣番茄意面”。你可能会好奇:那本食谱库中的哪些特定食谱实际上启发了这道菜? 是来自一位意大利祖母的食谱?还是来自某个现代融合风美食博客?亦或是两者的结合?

这就是**数据归因(Data Attribution)**的问题。这篇论文介绍了一种名为 DABGO(通过双向梯度优化进行数据归因)的新方法来回答这个问题。

以下是通过简单的类比对 DABGO 工作原理的解释:

问题所在:“黑盒”厨房

通常,当大厨创作一道菜时,我们很难轻易辨别出食谱库中的哪些食材起到了最关键的作用。传统方法试图通过寻找匹配的词汇来猜测(比如在库中搜索“番茄”),但这会忽略掉烹饪的“风格”或“神韵”。其他方法试图通过数学方式计算影响力,但对于复杂且具有创造性的菜肴来说,这些方法往往过于缓慢或不够准确。

解决方案:“如果……会怎样?”实验

DABGO 使用了一种巧妙的“如果……会怎样?”策略。它不仅仅是观察食谱库,而是暂时改变大厨的大脑,观察他对那道刚做出来的特定意面的反应。

可以这样理解:

  1. 准备阶段: 大厨已经做好了那份“香辣番茄意面”(生成的输出)。
  2. 实验阶段: 研究人员提取大厨的大脑,针对这盘特定的意面进行两次快速且相反的模拟:
    • 模拟 A(梯度上升): 他们调整大厨的大脑,让大厨更加“热爱”这盘意面。他们让大厨认为:“这是世界上最棒的意面!我必须完美地记住它!”
    • 模拟 B(梯度下降): 他们调整大厨的大脑,让大厨“讨厌”这盘意面。他们让大厨认为:“我想彻底忘掉这个食谱。”
  3. 测试阶段: 现在,他们带着“热爱”的大脑和“讨厌”的大脑,让大厨去查看原始的食谱库。
    • 如果某份旧食谱让“热爱型”大厨感到非常开心,同时让“讨厌型”大厨感到非常难过(或反之),那么这份食谱就是该意面的主要影响来源
    • 如果一份食谱在两种模拟中都没有引起大厨情绪的显著变化,那么它可能对最终的菜肴并不重要。

为什么“双向”很重要

论文发现,仅仅进行其中一种模拟(要么只让大厨热爱这道菜,要么只让大厨讨厌它)是不够的。这就像试图通过只听最大音量或只听极小声响来理解一首歌一样,你无法获得全貌。你需要两个方向才能得到完整的图景。

  • “热爱”方向有助于找到模型自然想要模仿的食谱。
  • “讨厌”方向有助于找到模型试图避开或区别于自身的食谱。
    通过结合两者,DABGO 能够绘制出一张更清晰的思想来源地图。

他们发现了什么?

研究人员在两种类型的“烹饪”任务上测试了它:

  1. 事实性烹饪: 陈述事实(例如,“巴黎是法国的首都”)。
  2. 风格化烹饪: 模仿特定作者的写作风格(例如,模仿莎士比亚或简·奥斯汀的文风)。

结果如下:

  • 优于竞争对手: DABGO 在寻找正确来源食谱方面比旧方法表现得更好。旧方法就像使用关键词搜索引擎;它们能找到正确的词,但往往会错过正确的语境风格
  • 风格至关重要: 当任务是模仿特定作者的风格时,DABGO 成功地指向了由同一作者创作的其他文本,而简单的词汇匹配工具则失败了。
  • 精准定位: DABGO 非常精确,它甚至可以指向食谱中具有影响力的特定句子甚至单词,而不只是整个食谱。

缺陷(局限性)

论文诚实地指出了缺点。这种“如果……会怎样?”的实验计算量巨大。这就像为了测试一道新菜,必须把整个食谱库重新烹饪两遍一样。

  • 它非常适合于较小规模、受控的实验。
  • 目前它对于那些正在被大型科技公司用于工业级大规模模型的模型(这些模型是在数十亿词汇的基础上训练的)来说,运行速度太慢且成本太高。

核心结论

DABGO 是一个帮助我们理解为什么 AI 会说出那些话的新工具。通过模拟 AI 在尝试拥抱或遗忘特定输出时会如何改变,它可以将该输出追溯到最具影响力的训练数据。这让 AI 变得更加透明和可问责,帮助我们看清“菜肴”背后的“食材”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →