A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks
本文审计了公共医学视觉-语言基准测试中的预训练污染问题,发现存在可衡量的图像源重叠和文本可交换性信号,同时证明了由于非医学模型的误报,像 Min-K%++ 这样基于队列相对性的检测器在小型医学队列中是不可靠的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在给学生批改期末考试卷子的老师。你想知道这个学生是真的理解了知识点,还是仅仅背下了他在图书馆发现的一份“小抄”。
这篇论文就像是对这种情况进行的一次非常严格、科学的审计,只不过研究对象不是学生,而是 AI 模型(具体来说是能够观察医学图像并回答问题的“视觉语言模型”)。与其说是在图书馆找小抄,不如说是在寻找这些 AI 模型在见到考试题目之前,曾在其庞大的训练数据中学习过的痕迹。
以下是研究人员的工作内容和发现,使用了简单的类比:
设置:“泄露”的考试
医学 AI 模型通常在公开数据集(如 SLAKE、PathVQA 和 VQA-RAD)上进行测试。这些数据集在网上已经公开了 3 到 7 年。问题在于,这些相同的数据集可能在无意中被包含在了 AI 在考试前学习的“训练图书馆”(互联网数据)中。如果 AI 在训练期间见过完全相同的题目和图片,那么它的高分就不是智能的证明,而是作弊(或“污染”)的证据。
研究人员想要找出:AI 是否作弊了? 更重要的是,我们用来抓捕作弊者的工具是否值得信赖?
四位“侦探”
团队使用了四种不同的方法(检测器)来试图抓住 AI。你可以把这想象成四种不同的识破作弊者的手段:
- “长相相似”侦探(图像侧): 这个侦探观察测试中的医学图片,并询问:“这张图片看起来是否与训练库中的某张图片完全一样?”
- “顺序”侦探(文本侧): 这个侦探检查当问题以最初发布的顺序排列时,AI 的表现是否更好。如果 AI 知道这个顺序,它可能记住了序列。
- “群体平均值”侦探(尾部富集): 这个侦探将一个 AI 的答案与一组其他 AI 的平均水平进行比较。如果一个 AI 在某些特定的难题上表现得比它的同伴们好得多,它可能以前见过这些题。
- “友谊”侦探(跨模型重叠): 这个侦探观察两个不同的 AI。如果它们两个都做对了完全相同的特定难题,它们可能共享了同一份小抄。
研究结果:谁被抓住了?
1. “长相相似”侦探在 SLAKE 上发现了大量的“来源重叠”。
- 发现: SLAKE 测试中约 20% 的图片在训练库中都有“孪生兄弟”。
- 转折: 当研究人员仔细观察时,他们意识到这些并不是精确的副本(比如复印件)。它们是不同患者的图片,但拍摄角度和使用的机器类型相同(例如,两个不同人的胸部 X 光片)。
- 结论: AI 并没有背诵特定患者的照片。然而,测试数据和训练数据来自同一个“社区”。这就像学生学习了一本教材,而考试中的图表类型与教材中的完全一致。这是一种来源重叠,而不是直接的复制粘贴式作弊。
2. “顺序”侦探发现了一个真正的作弊者。
- 发现: 一个模型(Qwen2.5-VL)在题目按原始顺序排列时,似乎对 SLAKE 测试题过于熟悉了。
- 验证: 研究人员尝试通过打乱题目顺序来迷惑 AI。结果,AI 的“作弊”信号消失了。他们还在同一个测试上测试了一个非医学 AI(BLIP-2),该模型并未显示出这种信号。
- 结论: 这是强有力的证据,表明该特定模型很可能在训练期间见过 SLAKE 的题目。
3. “群体平均值”和“友谊”侦探并不可靠。
- 发现: 这些检测器将好几个模型标记为了作弊者。
- 转折: 当研究人员加入了一个确定没有学习过医学数据的“控制模型”(BLIP-2)时,这个控制模型也被标记成了作弊者!
- 结论: 这些检测器对于小型医学 AI 群体来说是失效的。它们把“擅长简单问题”误认为是“作弊”。这就像一位老师因为学生做对了简单的数学题,就假设他们在作弊,而班上的其他同学数学都很差。这些检测器需要一个“非医学”的基准线才能正常工作。
4. “干净”的基准:VQA-RAD。
- 发现: VQA-RAD 测试是干净的。没有任何检测器在这一特定数据集上发现作弊证据。
- 结论: 如果你想安全地测试医学 AI,请使用 VQA-RAD。它是“最安全”的考试。
核心教训:如何审计“审计”本身
这篇论文最重要的部分不在于哪些 AI 作弊了,而在于我们如何捕捉作弊者。
研究人员发现,一些流行的检测数据泄露的工具(“群体平均值”和“友谊”检测器),如果你没有一个“控制组”(即一个确定没作弊的模型)来进行对比,就会产生误报。如果没有这个控制组,你可能会因为其他同学表现不佳,就指责一名诚实的同学在作弊。
总结建议
基于他们的审计,作者提出了以下建议:
- 使用 VQA-RAD 作为测试医学 AI 最安全的手段。
- 谨慎对待 SLAKE: 其中的许多图像与训练数据高度相似,因此结果可能会被夸大。
- 不要信任“群体平均值”检测器,除非你将其与非医学基准模型进行对比。
- OmniMedVQA 是被污染的: 不要使用该数据集的公开版本进行测试,因为它极有可能出现在训练数据中。
简而言之,研究人员构建了一个更好的 AI 测试“测谎仪”,发现了一些现有的测谎仪是坏掉的,并识别出了哪些医学考试是安全的,哪些可能是“被操纵”的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。