KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation
本文介绍了 KnowHal,这是一个通过创新的配对问题设计,将实体、属性、关系和知识幻觉的评估统一起来的全面基准测试,揭示了知识相关错误和对错误前提的接受仍然是当前模型面临的重要挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个超级聪明的机器人去理解这个世界。这个机器人被称为“多模态大语言模型”(简称 MLLM),它就像一个才华横溢的学生,可以一边看图,一边读书。它非常擅长描述它所看到的东西,比如会说:“那是一个木桌上的红苹果。”但有时,这个机器人会变得有点过于“放飞自我”。它可能会看着一张猫的照片,却自信满满地告诉你:“这只猫正在驾驶一艘宇宙飞船”,尽管猫并不会飞行,而且照片里根本没有宇宙飞船。这被称为“幻觉”。这就像机器人在应该工作的时候竟然在做白日梦。
为什么这很重要呢?因为我们希望把重要的工作交给这些机器人,比如帮助医生诊断疾病,或者引导自动驾驶汽车。如果机器人开始胡编乱造,后果可能是危险的。科学家们一直试图建立测试来捕捉这些“白日梦”。目前大多数测试都在检查机器人是否能正确识别图片中的简单事物,比如“那里有一只狗吗?”或者“这只狗是棕色的吗?”但有一个棘手之处:有时机器人知道关于世界的常识(比如“狗有尾巴”),但当图片内容与事实不符时,它们就会感到困惑,或者凭空捏造出图片中根本不存在的事实。直到现在,我们还没有一个单一且公平的测试,能够同时检查机器人“看到了什么”以及“了解什么”。
于是,KnowHal 诞生了——这是一个旨在以全新方式捕捉这些“白日梦”的新颖且聪明的测试。把 KnowHal 想象成一个针对机器人大脑设计的“找不同”游戏。研究人员构建了一个包含 1,80 liệu 对“图片-问题”组合的海量集合,涵盖了从体育到音乐的 10 个不同生活领域。对于每一张图片,他们都设计了两类问题:“正面”问题询问照片中实际存在的事物或关于该物体的真实事实;而“负面”问题则是精心设计的陷阱。这些陷阱听起来非常合理,但实际上是谎言。例如,如果一张照片显示的是一只真实的狗,正面问题会问:“这只狗是什么颜色的?”而一个负面陷阱可能会问:“这只狗那顶隐形的蓝色帽子是什么颜色的?”
研究人员用这个新游戏测试了 14 个不同的机器人大脑。他们发现了一些令人惊讶的现象。首先,机器人在回答“正面”问题时表现得还算可以,但在面对“负面”陷阱时却表现得很糟糕。这就像一个学生能完美掌握数学公式,却被一个问题难住了,比如题目问:“如果 2 加 2 等于 5,那么 2 加 2 等于多少?”机器人往往会回答“5”,而不是去纠正那个谎言。这表明,即使是最聪明的机器人,在面对误导时,也并不擅长说出“等等,这不对”这样的话。
最大的惊喜在于,对几乎所有机器人来说,最难的部分是“知识”维度。在这个维度中,机器人必须使用它们从书籍或互联网中学到的事实,而不仅仅是观察图片。即使是表现最好的机器人,在处理这类问题时出错的频率也比处理简单的视觉问题时更高。这表明,虽然这些机器人看东西越来越准了,但它们仍然难以区分自己“看到了什么”和“以为自己知道什么”。
研究还观察了机器人大脑的大小如何影响其表现。他们发现,更大的大脑通常表现得更好,但即使是最大的大脑,在面对棘手的“知识”问题和“负面”陷阱时依然会挣扎。这告诉我们,仅仅把机器人做大并不是万能的解决方法;我们需要教会它们如何更加谨慎和保持怀疑精神。
简而言之,这篇论文介绍了 KnowHal,这是一个通过将真实问题与棘手的虚假问题配对,来测试机器人分辨真伪能力的全新基准测试。研究结果表明,尽管我们的 AI 朋友们正变得越来越聪明,但要让它们完全能够识别谎言或承认自己不知道答案,还有很长的一段路要走。作者相信,这项新测试将有助于未来的机器人变得更加可靠,减少编造故事的情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。