BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
本文介绍了 BEAR-Bench,这是一个包含 1,000 个基于文本丰富的企业和学术文档的人工标注问题的双语(英语-俄语)基准测试,旨在评估多模态大语言模型的复杂推理能力和幻觉检测可靠性,并揭示了即使在最先进的系统之间也存在显著的性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,计算机在观察图像和阅读图像中的文字方面已经变得非常出色。如果你给机器看一张路标的照片,它可以告诉你路标上的内容。如果你给它看新闻报告中的图表,它通常可以描述线条呈现的趋势。这种被称为“多模态理解”的能力,将视觉与语言结合成了一项单一的技能。长期以来,挑战仅仅在于如何让机器清晰地读取文本。但下一个更难的步骤是推理。这是指观察一份复杂的文档,找到散落在页面各处的不同信息片段,并将它们联系起来以回答一个并未直接写在纸面上的问题的能力。想象一份充满了表格、图表和段落文字的财务报告。人类专家可以查看表格中的一个数字,将其与图表中的趋势进行对比,然后阅读正文中的句子来理解为什么这些数字发生了变化。教计算机进行这种思考,尤其是在文档信息密集且使用非英语编写时,一直是一个困难的前沿领域。
来自 Yandex 和应用人工智能研究所(Applied AI Institute)的一个研究小组通过创建一种专门针对这种复杂思维设计的全新测试,在解决这一问题上迈出了重要一步。他们将这一创造物称为 BEAR-Bench。与以往侧重于简单阅读或要求计算机具备外部知识的测试不同,这个新基准要求机器仅利用单页文档中存在的信息来解决问题。该测试是双语的,包含英语和俄语,这一选择突显了当前技术中的一个差距,即机器在处理英语和中文以外的语言时往往表现挣扎。研究人员收集了一千份真实的文档,涵盖了从企业财务报告、投资者演示文稿到学术科学论文的各种类型。这些页面并不简单;它们充满了文本、表格、图表、图示和数学公式。
为了构建这项测试,研究人员并没有只是让计算机生成问题。他们聘请了十三名拥有技术领域学位的专家,由他们手工编写问题和答案。对于每一张页面图像,专家都必须创建一个需要多个步骤才能解决的问题。例如,一个问题可能会要求计算机在表格中找到一个特定数值,观察相关图表中该数值随时间的变化情况,然后阅读正文中的句子来解释这种变化的理由。计算机不得使用任何外部知识;它必须完全根据提供的图像寻找答案。这确保了测试衡量的是机器利用面前文档进行推理的能力,而非其记忆互联网事实的能力。研究人员还仔细筛选了文档,以确保它们包含足够的视觉复杂度(如图表和方程式),从而使任务具有挑战性。
当研究人员让十六个不同的人工智能模型接受这项测试时,结果清晰地展示了当前技术的现状。表现最好的模型——即目前最先进的系统——能够正确回答大约百分之七十五的问题。虽然这听起来令人印象深刻,但也意味着即使是最聪明的机器在每四个问题中仍会犯错大约一个。研究发现,当文档为俄语而非英语时,这些模型的表现明显变差,证实了语言仍然是一个重要的障碍。此外,文档的类型也很重要:模型在处理商业报告时往往比处理科学论文时表现得更为吃力,并且在需要它们计数或结合页面不同部分信息时,会遇到特别大的困难。
研究人员还深入研究了机器失败的原因。他们发现,最常见的错误并非源于逻辑缺失,而是由于简单的感知问题。计算机经常误读表格中的数字,未能注意到图表上的特定标签,或者对图示中箭头指向的位置感到困惑。一旦机器误读了一个视觉细节,其后续的推理就会崩溃。这表明,在这些系统成为分析文档的真正专家之前,它们需要更好地清晰地观察微小的细节。
除了测试模型之外,研究人员还利用结果来观察是否存在一种方法可以判断机器何时出错。在许多现实场景中,仅仅知道计算机可能会出错是不够的;你需要一种能在错误造成危害之前检测到它的方法。团队测试了几种不同的检测错误的方法。他们发现,对于无法看到内部运作机制的封闭式专有系统,检测错误最好的方法是使用另一个强大的 AI 模型充当评判者并检查答案。对于可以查看代码内部结构的开放式系统,他们发现检查计算机自身的内部置信度信号对于短答案效果良好,但在计算机生成非常长且详细的解释时则显得力不从心。研究结论指出,尽管我们正在取得进展,但我们仍然没有一种完美的方法来捕捉每一个错误,且最优秀的系统仍有很大的提升空间。
这项工作之所以重要,是因为它将讨论从简单的阅读提升到了更高层次。它表明,虽然机器可以阅读文本,但它们仍在学习如何利用文本进行思考。通过创建一个难度高、双语化且专注于真实文档的测试,研究人员为技术的强项与弱点提供了一张清晰的地图。他们表明,未来的道路不仅需要更大的模型,还需要更好的方法来处理专业文档中复杂且充满细节的多语言现实。在机器能够可靠地阅读图表、将其与表格进行交叉比对,并在不迷失于细节的情况下解释其关联之前,它们在金融和科学等高风险领域的应用仍将需要严密的人类监督。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。