Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability
本文介绍了 Gakucho,这是一个源自日本国家学业能力评估的大规模多模态基准,包含 90 万个聚合的学生回答分布,旨在支持对多模态大语言模型在真实 K-12 教育任务上进行直接且基于人类基准的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想测试一个新机器人的智能程度。通常,你可能会给它一个虚构的测验或教科书上的问题,这些问题在电脑屏幕上看起来完美无缺。但这篇论文提出:“让我们尝试一些不同的方法。”与其进行虚假测试,不如给机器人一份来自日本的真实、实际的中学考试,就像 90 万名真实学生参加的那种考试。
以下是研究人员所做工作和发现结果的简要概述:
1. “现实世界”测试厨房
研究人员采用了日本“全国学力调查”的官方试卷。这些并非整洁的数字文本文件,而是充满混乱、真实世界特征的文档,包括:
- 图表和地图:例如带有波浪线的天气图。
- 对话气泡:卡通风格气泡内的文字。
- 竖排文字:日语通常从上到下书写,这对计算机来说颇具挑战性。
- 表格和图表:以网格形式排列的数字。
这就像试图阅读一张写在皱巴巴餐巾纸上的食谱,旁边还画着一个锅的草图,而不是阅读一份整洁的数字 PDF。研究人员必须仔细地将这些杂乱的页面“翻译”成计算机可理解的格式,同时不丢失其原始的外观和感觉。
2. 秘密配料:“人类群体”
这个项目最酷的部分在于,他们不仅保留了问题,还保留了90 万名真实学生的答案。
想象一下你有一道测试题。通常,你只知道“正确答案”。而在这里,研究人员确切知道有多少百分比的学生答对了,多少百分比答错了,以及他们如何答错的。
- 这为何重要:这让研究人员能够将机器人的大脑直接与庞大的人类大脑群体进行比较。他们可以看到:“机器人是否犯了人类会犯的错误,还是犯了一些奇怪的机器人式错误?”
3. 测试机器人
他们将这些真实试卷输入了几个著名的 AI 模型(如 GPT-4、Gemini 和 Claude),以观察它们的表现。
结果如下:
- 科学:机器人表现相当不错,尤其是当它们能够“看到”图表时。这就像它们终于明白火山图片对问题的重要性。
- 数学:它们在处理简单数字时表现出色,但在需要读取图表或形状怪异图形的数学题时却跌跌撞撞。如果机器人无法“阅读”图片,它就无法解决数学问题。
- 日语(语言):这是最困难的。机器人在处理竖排文字以及识别图像中的特定字符(汉字)时遇到了困难。这就像让机器人阅读餐巾纸上手写的便条;它们经常猜测或编造词语,而不是准确读取那里的内容。
4. “评判者”问题
研究人员尝试了两种给机器人评分的方法:
- 人类教师:真人阅读答案。
- AI 评判者:另一个 AI(GPT-4o)对第一个 AI 的答案进行评分。
转折点是:
- 对于科学和数学,AI 评判者是人类教师的不错替代品。它们在判定谁通过、谁未通过方面基本达成一致。
- 对于日语,AI 评判者感到困惑。它经常与人类意见相左。论文指出,对于复杂的语言任务,目前还不能仅仅信任 AI 来给另一个 AI 评分;你仍然需要人类介入其中。
5. 机器人失足之处
论文强调了一些有趣但具有揭示性的失败案例:
- “伪造引用”问题:当测试要求机器人“从图像中逐字复制这句话”时,机器人有时会编造一句听起来正确但实际上并不存在的句子。它产生了幻觉,而不是进行阅读。
- “绘图”问题:有一道题要求机器人观察一个特定的日本汉字,并解释其视觉平衡为何失调。机器人无法“看清”绘图中的微小细节,因此无法作答。
核心结论
这篇论文为测试 AI 建立了一个全新的、逼真的游乐场。他们不是在整洁、完美的数据上测试机器人,而是在真实学校考试那种混乱、视觉化且复杂的现实中进行了测试。
他们发现,虽然 AI 正变得越来越聪明,但它仍然难以应对真实世界考试中特定的“视觉逻辑”,尤其是在读取图像内的文字或理解真实学生所犯的错误方面。他们还证明,你不能总是信任 AI 来给另一个 AI 评分,尤其是在语言学科中。
在哪里可以找到它:研究人员将所有这些数据(问题、图像以及 90 万名学生的答案)公开,供任何人使用,以便其他科学家可以进行自己的测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。