← 最新论文
💬 NLP

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

本文介绍了 BLUEX v2,这是一个由来自巴西顶尖大学入学考试(2022–2025年)的 395 个开放式问题组成的新基准,旨在评估 21 个最先进的大型语言模型在葡萄牙语叙述性任务中的表现,揭示了显著的性能差距,并强调了在数学推理和图像理解方面面临的挑战。

原作者: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你一直在通过问一些简单的多项选择题(比如“天空是什么颜色的?A)蓝色,B)红色”)来测试一群机器人的聪明程度。它们在挑选正确字母方面表现得非常出色。但这项研究背后的研究人员意识到,挑选一个字母很容易。真正的智能测试是写一篇完整的论文,解释为什么天空是蓝色的,并画一张图表来证明这一点。

这篇论文介绍了一个全新的、难度更高的 AI “期末考试”,专门设计用于测试 AI 在葡萄牙语方面的表达和写作能力。

以下是使用简单类比对他们工作的详细拆解:

1. 问题所在:“多项选择题”陷阱

以前,研究人员会在巴西大学入学考试上测试 AI,但仅限于第一轮。你可以把第一轮想象成一场常识问答游戏,你只需要圈出正确答案即可。对于 AI 来说,通过识别模式或进行猜测是很简单的。

这些考试的第二轮(即 BLUEX v2 所关注的阶段)就像是毕业论文答辩。学生必须撰写详尽且细致的答案,逐步解决复杂的数学问题,并解读地图或图表。旧的测试无法衡量 AI 是否真的能像人类一样思考写作;它们只能衡量 AI 是否能识别出正确答案。

2. 解决方案:一个全新的 AI “期末考试”

团队创建了 BLUEX v2,这是一个包含 395 道来自巴西顶尖大学(UNICAMP 和 USP,时间跨度为 2022 年至 2025 年)真实题目的庞大数据集。

  • 题目内容: 这些不仅仅是文本。大约 56% 的题目包含图像、图表或地图,你必须理解这些内容才能正确回答。
  • 形式: AI 必须撰写自由格式的答案,而不是选择 A、B、C 或 D。
  • 学科: 它涵盖了 9 个不同的学科,从历史、社会学到物理和数学。

3. 他们如何给机器人评分: “AI 老师”

快速为数千份长达 5 页的论文评分对人类来说很难。因此,研究人员构建了一个系统,让 AI 充当老师

  • 评分标准(Rubric): 首先,他们使用一种 AI 来阅读“官方标准答案”,并将其分解为一个检查清单(评分标准)。例如,如果答案需要提到“ATP”和“肌肉收缩”,那么检查清单就会包含这两个项目。
  • 裁判: 另一个 AI(“裁判”)会阅读学生机器人的答案,并对照清单逐项核对。它提到了 ATP 吗?是的。它提到了肌肉收缩吗?没有。
  • 得分: 机器人根据其命中的清单项目数量获得 0 到 10 分的评分。
  • 证明: 为了确保“AI 老师”没有产生幻觉,他们将 AI 的评分与真实的人类教师进行了对比。AI 与人类的一致率达到了 89.5%。这是一个非常高的分数,证明了自动化评分是可靠的。

4. 结果:谁通过了,谁失败了?

他们用这场考试测试了 21 种不同的 AI 模型(即“机器人”)。

  • 差距: 分数范围从低分 4.18 到高分 9.10 不等。这表明该测试能够有效区分聪明的机器人和不太聪明的机器人。
  • 赢家: 表现最好的模型是像 Gemini 3.1 ProGPT-5 这样庞大且昂贵的模型。
  • 输家: 较小的开源模型表现挣扎,最低分约为 4.18。
  • 巴西之星: 有趣的是,巴西本土制造的模型(Sabiá-4)表现非常出色,几乎可以与全球巨头并驾齐驱,这表明本地化训练确实有效。

5. “难点”在哪里:机器人在哪里跌倒

即使是最优秀的机器人,在两个特定领域也遇到了困难:

  1. 数学推理: 这是最难的学科。就像一个能写出精彩故事但不会做长除法的学生一样,这些 AI 可以写出优美的葡萄牙语文章,但在数学步骤上经常出错。
  2. 图像理解: 当题目包含图表或地图时,机器人的得分平均下降了约 0.5 分。这就像给一个学生出一道数学题,但把数字画在一张皱巴巴的纸上;AI 难以清晰地“看到”细节以解决问题。

6. 测试成本

研究人员公开了这项实验的花费。运行整个实验——包括提出问题、生成图像描述以及评定答案——总共花费了约 127 美元。对于如此规模的研究来说,这个价格惊人地便宜,表明我们可以在不花费数百万美元的情况下进行严谨的 AI 测试。

核心结论

BLUEX v2 是一个用于测试葡萄牙语 AI 的全新、更严格的标准。它超越了简单的常识问答,迫使 AI 进行写作、推理并观察图像。结果表明,虽然 AI 在葡萄牙语的写作和论证方面已经变得非常出色,但在处理复杂的数学和解读视觉数据方面仍然存在困难。这个基准测试为研究人员提供了一张清晰的路线图,指明了他们下一步改进的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →