← 最新论文
💻 computer science

JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation

本文提出了 JAMMEval,一个通过两轮人工标注对七个现有日语基准数据集进行系统精修而成的集合,旨在解决现有日语视觉问答基准中存在的歧义、错误及非视觉依赖等问题,从而为视觉语言模型提供更可靠、区分度更高且方差更低的评估标准。

原作者: Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何给日本的人工智能(AI)考官出更公平的考题”**的故事。

想象一下,你正在举办一场**“看图说话”大赛**,参赛者是各种各样的 AI 模型(就像一群参加考试的“学生”)。你的目标是看看谁最聪明、谁最能看懂图片并回答问题。

但是,在开始之前,你发现手头的**“旧试卷”(现有的日本 AI 测试数据集)问题重重**,就像是一个糟糕的出题老师出的题:

  1. 题目模棱两可:比如问“请详细描述这张图”,但并没有标准答案,阅卷老师全凭心情打分。
  2. 不用看图也能答:有些题目光看文字就能猜出答案,根本不需要 AI 真的“看”图。这就好比考数学题,学生不用算数,背个答案就能蒙对。
  3. 答案本身就是错的:试卷上的“标准答案”写错了,导致真正答对的学生反而被扣分。
  4. 图片太模糊或无关:有些题目配的图片根本看不清,或者跟问题没关系。

如果在这种“烂试卷”上考试,结果不仅不公平,还会误导大家,以为某个 AI 很笨,其实只是题目出得太烂。

他们做了什么?(JAMMEval 的诞生)

为了解决这个问题,作者们(来自京都大学、NII 等机构的研究团队)做了一件像**“精修试卷”**的工作,他们把这套新试卷命名为 JAMMEval

他们的过程就像是一个**“试卷修补匠”**团队:

  1. 收集旧试卷:他们收集了 7 套现有的日本 AI 测试题(涵盖文化、图表、文档、OCR 文字识别等领域),总共约 1900 多道题。
  2. 两轮人工“大扫除”
    • 第一轮:像挑刺一样,找出所有有问题的题目。
    • 第二轮:找外部专家再次检查,确保没有漏网之鱼。
  3. 修补而非丢弃:这是他们最聪明的地方。以前的做法是直接把坏题扔掉(但这会让题目变少,考试不准)。他们选择**“修题”**:
    • 把模糊的问题改得具体明确。
    • 把错误的答案改对。
    • 把那些“不用看图就能答”的题,改成必须看图才能答的题。
    • 如果实在修不好,才把题目换掉或删除。

最后,他们得到了一套1592 道题的“黄金试卷”(JAMMEval),这套题更干净、更公平、更考验真本事。

他们发现了什么?(实验结果)

他们用这套新试卷去测试了各种最新的 AI 模型(包括开源的和像 GPT-4o 这样的商业模型),发现了一些有趣的现象:

  • 分数普遍提高了:因为旧试卷有很多“坑”(比如答案错了),现在坑填平了,AI 们的真实水平展现出来了,平均分自然涨了。
  • 考试更稳定了:以前用旧试卷,AI 每次考可能分数波动很大(因为题目太烂,运气成分大);现在用新试卷,分数非常稳定,更能反映真实水平。
  • 更能分出高下:新试卷像一把更精准的尺子,能更清楚地把“学霸”和“学渣”区分开,而不是让大家都糊里糊涂地混在一起。
  • 谁是冠军?:在这次测试中,Gemini 3 Pro 表现最强,几乎全对;而在开源模型中,Qwen3-VL 表现最好,特别是在读图识字(OCR)方面,甚至超过了某些商业巨头。

核心比喻总结

如果把AI 模型比作**“学生”,把现有的日本测试题比作“充满印刷错误和歧义的旧考卷”**:

  • 旧考卷:学生答对了,因为答案印错了被扣分;或者学生没看题就瞎蒙对了。这导致老师(研究者)误以为学生很笨,或者误以为学生很聪明。
  • JAMMEval(新考卷):就像是一群严谨的**“特级教师”**把旧考卷重新校对、修改、标准化。
    • 题目清晰了(不再模棱两可)。
    • 答案正确了(不再误导)。
    • 必须看图才能答(真正考视觉能力)。

结论:只有用JAMMEval这样经过精心打磨的“好试卷”,我们才能真正知道日本 AI 到底进步了多少,哪里还需要努力,而不是被烂题目给“带偏”了。

这篇论文的核心价值就在于:它告诉大家,在评估 AI 时,题目质量(Benchmark)和模型质量一样重要。 如果题目出得烂,再聪明的 AI 也考不出好成绩。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →