Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking
本文通过证明很大一部分截断日期后的主张仍可通过既有知识进行验证,从而挑战了动态基准测试本质上不存在污染的假设,这种现象可能会人为地抬高多模态事实核查性能并扭曲系统排名,因此有必要实施更严格的评估协议。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个超级聪明的机器人去当侦探。它的工作是通过在互联网上寻找线索、阅读线索,并判断一个故事是真的还是假的。这被称为“自动化事实核查”。但棘手的部分在于,为了确保机器人是真的在学习如何当侦探,而不是仅仅在死记硬背,我们必须用它从未见过的“新谜题”来测试它。如果我们给它一个它已经在训练书籍中读过答案的谜题,我们就无法判断它是擅长寻找线索,还是仅仅擅长记忆。这篇论文深入探讨了计算机科学的一个特定领域,在那里,我们试图为那些结合了文字和图片的各类故事(比如一段病毒式传播的迷因或一段新闻视频)构建这些侦探机器人。核心问题是:我们对这些机器人的测试公平吗?还是说,我们在测试开始之前,不小心就把答案泄露给了它们?
来自香港和北京的研究团队决定调查科技界的一个流行观点。许多科学家认为,如果他们创建“动态”测试——即使用在机器人训练停止之后才发布的新闻故事——就能防止作弊。他们假设,如果一个故事是新的,机器人就不可能知道答案。但作者怀疑这可能是一个陷阱。他们问道:如果机器人不需要寻找新线索,因为答案已经隐藏在它的记忆中,即使对于“新”故事也是如此,那该怎么办?
为了查明真相,他们建立了一个特殊的实验实验室。他们选取了一组来自2025年晚些时候(在机器人训练截止日期之后)的全新事实核查故事,并将其与一组较旧的故事进行对比。他们使用了一种巧妙的方法,来观察机器人是否能仅凭其内部记忆就写出一篇事实核查文章,而不去查找任何新内容。如果机器人的“仅靠记忆”的文章与人类撰写的事实核查文章非常相似,他们就会将其标记为“受污染”——这意味着机器人是在通过使用旧知识来作弊,而不是通过辛苦地进行搜索来完成工作。
他们的调查揭示了一些令人惊讶且略感失望的消息。首先,他们发现即使有了这些“新鲜”的动态测试,仍有约17%到29%的故事受到了污染。这就像给一名学生出一道关于新话题的测试题,但学生发现答案其实只是三个他已经背下来的旧事实的组合。例如,一个故事可能是关于某位名人年龄的新传闻;机器人不需要搜索网络,因为它已经知道那个人的出生年份和工作的法定年龄,所以它可以瞬间解开这个谜题。
该团队还发现,这种“作弊”行为让机器人看起来比实际要聪明得多。当他们在受污染的故事上测试机器人时,机器人的得分很高。但当他们切换到那些机器人无法从记忆中解决的真正新鲜的故事时,得分显著下降——有时甚至下降了多达11分。这就像是一个跑步者在练习过的跑步机上跑得很快,而是在一条全新的、崎岖不平的小路上跑。这种污染非常强烈,甚至改变了关于哪个机器人是“最强”的排名。在旧测试中看起来像冠军的机器人,在公平、干净的测试中甚至不是表现最好的那个。
最后,作者带着一条严格的规则重新进行了测试:只使用任何机器人都无法从记忆中解决的故事。即便是在这样一个公平的竞技场中,最好的机器人也只能答对大约56%的题目。这表明,虽然我们的侦探机器人正在变得越来越好,但要真正处理现实世界中混乱、快速变化的新闻,而不被弄混或依赖旧记忆,它们还有很长的路要走。论文的结论是,仅仅使用“新”日期是不够的;我们需要更聪明的方法来确保机器人确实是在做侦探工作,而不是在回忆过去。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。