← 最新论文
💬 NLP

Detecting Data Contamination in LLMs via In-Context Learning

本文介绍了 CoDeC,这是一种实用且自动化的方法,通过分析上下文学习如何影响模型置信度来检测和量化大语言模型中的训练数据污染,从而区分记忆的训练数据与未见过的分布。

原作者: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名正在批改学生试卷的老师。你想知道:这个学生是真的掌握了材料,还是仅仅从泄露的答案中死记硬背了答案?

长期以来,检查大语言模型(LLM)是否在训练过程中通过“死记硬背”测试题来“作弊”,就像大海捞针一样困难。传统方法要么速度缓慢,要么需要访问模型的机密训练文件,要么给出的结果令人困惑。

本文介绍了一种名为CoDeC(基于上下文的污染检测)的新颖、简单的工具。你可以将 CoDeC 想象成一种"带提示的突击测验"。

核心理念:“提示”测试

以下是 CoDeC 的工作原理,通过一个简单的类比来说明:

1. “未见”场景(诚实的学生)
想象你问学生一道他们从未见过的数学题。

  • 没有提示: 他们可能会稍微挣扎一下。
  • 有了提示: 你给他们展示一道他们同样没见过的相似题目。突然间,他们有了“灵光一闪”的时刻。提示帮助他们理解了问题的风格,他们回答得更有信心
  • CoDeC 的观察: 当模型遇到它没有死记硬背的数据集时,提供来自同一数据集的示例就像是一个有益的提示。模型变得更聪明,也更有信心。

2. “死记硬背”场景(作弊的学生)
现在,想象你问学生一道他们已经从泄露的答案中死记硬背下来的题目。

  • 没有提示: 他们完美地复述答案,因为他们烂熟于心。
  • 有了提示: 你给他们展示来自同一泄露答案的另一道题目。这不仅没有帮助,反而让他们困惑。为什么?因为他们的思维陷入了“复述模式”。新的提示打乱了他们僵化的记忆模式,导致他们 stumble(踉跄),回答得信心不足
  • CoDeC 的观察: 当模型已经死记硬背了数据时,添加更多来自同一数据的示例实际上会降低其信心,因为这破坏了他们的记忆节奏。

CoDeC 如何衡量这一点

该方法出奇地简单且自动化:

  1. 从你怀疑可能包含在模型训练数据中的数据集中选取一个问题。
  2. 让模型回答它(测量其信心)。
  3. 添加一个“提示”: 在目标问题之前,放入该同一数据集中的几个其他随机问题。
  4. 再次让模型回答: 它的信心是上升还是下降?
    • 信心上升? 模型很可能是干净的(它正在从上下文中学习)。
    • 信心下降? 模型很可能被污染了(它在死记硬背,额外的上下文反而干扰了它)。

通过对数百个问题执行此操作,CoDeC 会给你一个百分比分数

  • 0–20%: 模型很可能是诚实的;它在进行推理,而不是死记硬背。
  • 80–100%: 模型很可能已经死记硬背了这个数据集。它在“作弊”。

为什么这很重要

  • 无需秘密密钥: 你不需要查看模型的训练文件(这些文件通常是机密的)。你只需要与模型对话即可。
  • 无处不在: 它适用于数学测试、编程挑战和一般知识问题。
  • 捕捉“软性”作弊: 它不仅捕捉完全相同的副本。它还能捕捉那些见过非常相似数据的模型(例如测试题的改写版本或基准测试的合成版本)。如果模型死记硬背了测试的“感觉”,CoDeC 就能捕捉到这一点。

作者的发现

研究人员在数十种模型上测试了 CoDeC,包括一些拥有公开训练数据的模型(因此他们知道真相)和一些拥有秘密训练数据的模型。

  • 结果: CoDeC 极其准确(区分已见和未见数据的准确率达到 99.9%)。
  • 基线对比: 旧方法(例如检查模型认为问题有多“容易”)无法将作弊者与诚实的学生区分开来。
  • 现实世界发现: 当他们将 CoDeC 应用于流行的近期模型时,他们发现了一些实例,其中模型在特定基准测试中得分非常高,这表明这些模型在训练期间可能已经见过测试数据(或非常相似的数据)。

结语

CoDeC 就像 AI 基准测试的测谎仪。它不仅仅问:“你知道答案吗?”它问的是:“看到更多关于这个主题的内容是帮助你,还是让你困惑?”如果它让你困惑,那你很可能已经烂熟于心了。这有助于 AI 社区更信任基准测试分数,并确保模型是根据其学习能力而非死记硬背的能力来接受评判。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →