← 最新论文
🤖 machine learning

How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines

本文首次对基于轨迹的数据归因中的误差来源进行了系统分析,识别出优化器不匹配是主要问题,并提出 AdamW 影响函数、一种闭式误差代理以及 K 步前瞻框架,以显著提升归因准确性,并为可靠的数据选择提供实用指导。

原作者: Junwei Deng, Pingbang Hu, Suliang Jin, Hao Lu, Jiachen T. Wang, Shichang Zhang, Jiaqi W. Ma

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Junwei Deng, Pingbang Hu, Suliang Jin, Hao Lu, Jiachen T. Wang, Shichang Zhang, Jiaqi W. Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在用一大碗食材(训练数据)烘焙一个巨大的蛋糕(训练现代 AI 模型)。有时,你想知道:“究竟是哪一个特定的鸡蛋或一小撮糖,让蛋糕的味道变得更好或更糟?”这被称为数据归因

长期以来,科学家们使用一种称为“基于轨迹的归因”(Trajectory-Based Attribution)的方法来回答这个问题。他们试图一步步“倒带”烘焙过程,以观察移除一种食材会如何改变最终结果。

然而,本文指出,当前进行这种“倒带”的方式往往存在缺陷,导致得出错误的结论。作者们就像机械师一样,打开了引擎盖,精准地找出齿轮在何处摩擦,并探讨如何修复它们。

以下是他们发现与修复方案的简明分解:

1. 问题一:“错误的地图”(配置级错误)

类比: 想象你正试图用一张为自行车设计的地图在城市中导航,但实际上你驾驶的是一辆装有涡轮增压引擎的重型卡车。即使你完美地遵循地图,你也会迷路,因为这张地图无法理解你的卡车如何转弯或加速。

现实: 大多数现代 AI 模型是使用一种名为AdamW的复杂“引擎”进行训练的。然而,流行的数据归因工具是假设模型使用一种更古老、更简单的引擎——SGD——进行训练而构建的。

  • 结果: 这些工具用“自行车地图”来导航“涡轮增压卡车”。这导致在确定哪些数据点有帮助时出现了巨大误差。
  • 修复: 作者们构建了一个名为AdamW-influence的新工具。这是一张专为“涡轮增压卡车”设计的地图。
  • 结果: 通过使用正确的地图,他们在不同类型的 AI 模型(从简单的图像分类器到像 Llama 这样的大型语言模型)上,将预测准确率提高了10% 到超过 300%

2. 问题二:“粗糙的草图”(算法级错误)

类比: 即使拥有正确的地图,如果你试图通过在弯曲的道路上画一条直线来预测未来,你最终也会偏离轨道。你试图预测的道路越长,错误就越大。

现实: 为了加快计算速度,这些工具使用“一阶近似”。你可以将其理解为将蜿蜒的道路近似为一条直线。

  • 罪魁祸首: 作者发现主要有两件事会让这种“直线”猜测变得更糟:
    1. 陡峭度(学习率): 如果训练过程中采取的步幅巨大(高学习率),直线猜测会迅速失效。
    2. 距离(轨迹长度): 你试图回溯的时间越久远,“直线”偏离实际弯曲路径的程度就越大。
  • 修复: 他们创建了一个**“误差代理”(Error Proxy)**。这就像仪表盘上的警告灯,它会告诉你:“嘿,现在的直线猜测变得不可靠了”,而无需重新烘焙整个蛋糕来检查。它帮助用户知道何时信任数据评分,何时保持怀疑。

3. 实用指南:如何选择食材(数据选择)

类比: 想象你是一位厨师,在烹饪汤的过程中挑选食材。

  • 离线策略: 你等到汤煮好后,尝一口,然后说:“如果我当时选了这些特定的胡萝卜而不是那些,味道会更好。”(这既缓慢又昂贵)。
  • 在线策略: 你在烹饪过程中挑选食材,猜测它们将在接下来的几分钟内如何影响汤的味道。

新规则手册: 作者将这两种策略统一到一个名为**"K 步前瞻”(K-Step Look-Ahead)**的单一框架中。

  • K 是你看向未来的步数。
  • 洞察: 你不需要一直看到汤煮完(离线)。只要使用正确的工具,只看未来几步(在线)通常就足够了。
  • 最佳平衡点:
    • 如果你采取小步幅(低学习率),你可以看得更远(更大的 K)而不会犯错。
    • 如果你采取大步幅(高学习率),你应该只看向很短的距离(较小的 K),以避免误差累积。

给从业者的“食谱”总结

本文为任何使用这些工具的人提供了一份清晰的食谱:

  1. 停止使用旧的"SGD"工具,如果你正在使用 AdamW 进行训练(几乎所有人都是如此)。请改用新的AdamW-influence
  2. 在线选择数据时,不要看得太远。 如果你看向太远的未来,“直线”猜测会变得过于嘈杂。
  3. 根据学习率调整你的视野(K)。 如果你采取小步幅,你可以看得更远;如果你采取大步幅,请保持视野短促。

通过修复“地图”并理解“直线”的局限性,作者们已将数据归因从一个黑盒转变为一种可靠、可操作的工具,用于改进 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →