← 最新论文
🤖 machine learning

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

本文介绍了一种可扩展的仅推理数据审计流水线,该流水线通过近似夏普里值(Shapley values)来高效识别并剔除大语言模型对齐数据集及基准测试中冲突、标注错误或不安全的记录,从而显著减少人工审计工作量,并揭示人类标注真值中的关键缺陷。

原作者: Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何成为一名乐于助人、安全且诚实的真人助手。你并没有用僵化的规则去编程;相反,你向它展示了数百万个优秀和糟糕的对话案例,让它通过实例进行学习。这就是现代人工智能获得其“个性”和安全过滤机制的方式。但问题在于,这个机器人的水平取决于你讲的故事。如果你的故事书里充满了错别字、谎言或令人困惑的矛盾,机器人就会变得混乱,并可能开始表现得举止怪异。

长期以来,检查这些故事书就像是在试图从一座果山中通过逐一观察来寻找一颗坏苹果。这种方法既缓慢又昂贵,而且经常会错过那些细微的问题。科学家们曾尝试用数学方法来确定哪些故事是最重要的,这种方法被称为“夏普利值”(Shapley value),但要精确计算这些数学题,对于庞大的数据量来说简直是天文数字,耗时太长。核心问题在于:如何在不重新阅读每一页,也不需要从头开始重新教导机器人的情况下,快速发现这些海量训练书籍中隐藏的错误、令人困惑的矛盾以及错误的建议?

这篇论文介绍了一种聪明的侦探工具,叫做“基于影响力的数据审计流水线”。把它想象成一个神奇的放大镜,它不需要重读整本书就能找到错误。研究人员并没有重新训练机器人,而是使用了一个技巧:他们问机器人:“如果我在让你读下一篇故事之前先给你看这个特定的故事,它能帮助你理解,还是会让你感到困惑?”

研究人员构建了一个系统,将相似的故事分组在一起,然后像玩“找不同”的游戏一样测试它们。他们选取一个故事,并让机器人预测结局。接着,他们先给机器人展示一个类似的“提示性”故事(就像一个线索),然后再次让机器人预测结局。如果这个“提示”故事让机器人的预测变得更差了,那就是一个巨大的危险信号。这意味着这两个故事在互相冲突,就像一个在说“始终说真话”,而另一个却在说“在这种情况下可以撒谎”。

团队在两个著名的训练数据集上测试了这个工具。首先,他们检查了一个名为 HelpSteer2 的数据集。他们的工具发现,在数千条记录中,他们可以将人类需要检查的任务量缩减 99.1%。他们揭示了隐藏的错误:人类在一些实际上充满了捏造事实或忽略重要指令的回答上,竟然给出了完美的评分。例如,他们发现有些案例中,机器人因为写了一篇看起来很完美但包含虚假日期和虚假科学文献的文章而受到了表扬,而另一篇包含相同虚假事实的类似文章却被正确地惩罚了。这揭示了一种“表面性偏见”,即人类评审员喜欢文本的外观,却并未检查事实是否真实。

接下来,他们审计了一个名为 HH-RLHF 的数据集,该数据集用于教机器人如何在两个答案之间做出选择。他们发现了数千处隐藏的矛盾,其中人类选出的“正确”答案实际上是危险或无用的。在一个令人恐惧的例子中,一名人类评审员选择了一个建议将漂白剂倒入他人眼睛作为恶作剧的回复,同时拒绝了一个仅仅是请求澄清的安全回复。该工具捕捉到了这些标准检查所遗漏的安全风险。

或许最令人惊讶的是,当他们使用这个工具来检查“测试题”(用于给机器人评分的考试)时,他们发现考试本身也是破碎的。题库中的“正确”答案往往是错误的。在许多情况下,最聪明的机器人实际上选择了更安全、更好的答案,但由于人类编写的答案解析有误,测试却判定它们是“错误”的。这表明,人工智能安全领域的一些重大问题可能并不在于机器人失败了,而在于测试本身是不公平的。

作者谨慎地指出,虽然他们的数学工具在缩小搜索范围方面极其快速且有效,但仍然需要人类(或一个非常聪明的 AI 裁判)来进行最终判断,以确定一个故事是否真的有问题。他们并没有修复数据本身,而是建立了一张高效的地图,精准地指出了哪里存在坑洼,从而让研究人员无需检查每一寸道路就能找到问题所在。通过这种方法,他们将检查大规模数据集的工作量,从查看数千项内容缩减到了仅需关注几十个高优先级的嫌疑对象,这证明了有时,寻找真相最好的方式是观察拼图的碎片是如何相互推挤与拉扯的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →