WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
本文介绍了 WikiVQABench,这是一个由人工策划的基准测试,它结合了维基百科图像、说明文字和 Wikidata,通过需要视觉感知之外外部信息的多项选择题,来评估视觉语言模型基于知识的推理能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一位朋友玩“猜图片”的游戏。通常,这个游戏很简单:你展示一张红苹果的图片,你的朋友会说:“那是个苹果!”或者“它是圆的!”大多数当前的 AI 视觉测试就是这样工作的。它们检查 AI 能否“看到”图片中的内容。
但在现实世界中,仅仅“看”往往是不够的。想象一下,你向朋友展示一张非常特定、罕见的蜘蛛图片。如果你问:“这是哪种蜘蛛?”你的朋友无法仅通过观察蛛网或腿来回答。他们需要知道照片中看不见的生物学事实。他们需要调动大脑“知识库”中的信息。
WikiVQABench 是一项新测试,旨在检验 AI 是否能做到这一点:将其“所见”与从事实知识库中“所知”的内容相结合。
以下是论文的解释,将其拆解为简单的部分:
1. 问题:AI 过于“表面化”
当前的 AI 模型非常擅长描述眼前的事物(例如“一个拿着球棒的男人”)。但当问题需要外部知识时,它们就会遇到困难。
- 旧方法:展示一张地标的图片并问:“这是什么?”(答案:“一座高大的石塔。”)
- 新挑战:展示同一张图片并问:“是哪个古代文明建造了它?”(答案:“腓尼基人。”)你在石头中看不到“腓尼基人”;你必须了解历史。
2. 解决方案:一种“链接知识库”的测试
研究人员构建了一项名为 WikiVQABench 的新测试。你可以把它想象成一次测验,其中每个问题都关联到巨型百科全书(维基百科)中的特定页面,以及一个结构化的事实数据库(维基数据)。
- 素材:他们从维基百科获取真实照片,阅读旁边的文章,并从维基数据(一个事实的数字档案柜)中提取结构化事实。
- 配方:他们使用一个智能计算机程序(大语言模型)将这些素材混合在一起,生成多项选择题。
- 人工介入:这是最重要的一环。计算机生成了数千个问题,但也犯了错误。因此,真实的人类充当了“编辑”。他们检查了每一个问题,以确保:
- 答案确实是正确的。
- 问题与图片相符。
- 关键的是:你不能仅通过观察图片来回答问题。你必须使用外部知识。
3. 测试:“知识鸿沟”
研究人员在这项新测验上测试了 15 种不同的 AI 模型。这些模型从小型(像袖珍计算器)到巨型(像超级计算机)不等。
结果:
- 巨大的差距:表现最好的 AI 答对了约 76%。最小的 AI 仅答对了 25%(这基本上等同于随机猜测)。
- 现实检验:即使是最大、最聪明的 AI 也没有达到 100%。这证明了该测试的难度,也表明当前的 AI 在完美融合“看”与“知”方面仍存在困难。
- 规模很重要(但并非全部):较大的模型通常表现更好,但仅仅增大模型规模并不能自动使其成为这种特定推理类型的天才。
4. 为什么这很重要
将这一基准测试想象成 AI 的“驾照考试”。
- 旧测试:检查 AI 能否看到方向盘和道路。
- WikiVQABench:检查 AI 是否了解交通法规、道路的历史以及城市的规则,而不仅仅是道路看起来是什么样子。
该论文得出结论,我们需要此类测试来发现 AI 的“盲点”。它表明,虽然 AI 在“看”的方面越来越擅长,但在理解图像背后的世界方面,仍需大幅提升。研究人员已使该测试和数据可供所有人使用,希望这有助于在未来构建更智能、知识更渊博的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。