← 最新の論文
💬 NLP

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

本論文は、ブラジルの主要な大学入試(2022年〜2025年)から抽出された395のオープンエンド型設問で構成される新しいベンチマークであるBLUEX v2を紹介し、21の最先端LLMを用いたポルトガル語の記述式タスクにおける性能を評価することで、顕著な性能格差を明らかにし、数学的推論と画像理解における課題を浮き彫りにしている。

原著者: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットたちの知能をテストするために、「空は何色ですか? A) 青、B) 赤」といった単純な多肢選択式の質問をしてきたと想像してください。彼らは正解の文字を選ぶことは非常に得意でした。しかし、この論文の著者たちは、BLUEX v2 という手法を通じて、文字を選ぶことは簡単すぎるということに気づきました。真の知能のテストとは、なぜ空が青いのかを詳しく説明するエッセイを書き、それを証明するための図解を描くことなのです。

この論文は、AIモデルの能力をテストするために特別に設計された、より高度な「最終試験」である、ポルトガル語での話し言葉や書き言葉の能力を測定する新しい手法を紹介しています。

以下は、簡単な比喩を用いた彼らの研究の解説です。

1. 問題点:「多肢選択式」の罠

以前、研究者たちはブラジルの大学入試を用いてAIをテストしていましたが、それは第1段階の試験のみでした。第1段階を「トリビアゲーム」だと考えてください。そこでは単に正しい答えを丸で囲むだけです。これはAIにとって、パターンを認識したり推測したりするのが容易です。

これらの試験の第2段階(BLUX v2が焦点を当てているもの)は、まるで「卒業論文の審査」のようです。学生は、長く詳細な回答を書き、複雑な数学の問題をステップ・バイ・ステップで解き、地図やグラフを解釈しなければなりません。従来のテストは、AIが実際に人間のように「考え、書く」ことができるかどうかを測定することはできず、単に「正しい答えを認識できるか」を測定しているに過ぎませんでした。

2. 解決策:AIのための新しい「最終試験」

チームは、2022年から2025年にかけてのブラジル屈指の大学(UNICAMPおよびUSP)から集めた、395問の実際の質問からなる大規模なデータセット、BLUEX v2 を作成しました。

  • 質問の内容: これらは単なるテキストではありません。約**56%**には、正解するために理解しなければならない画像、チャート、または地図が含まれています。
  • 形式: AIは、A、B、C、Dを選択するのではなく、自由形式の回答を書かなければなりません。
  • 科目: 歴史や社会学から物理学や数学に至るまで、9つの異なる科目を網羅しています。

3. ロボットの採点方法:「AI教師」

数千ものテストに対して、人間が5ページの論文を素早く採点するのは困難です。そこで、研究者たちはAIが教師として振る舞うシステムを構築しました。

  • ルーブリック(評価基準): まず、AIを使用して「公式の正解」を読み取り、それをチェックリスト(ルーブリック)に分解します。例えば、回答に「ATP」と「筋肉の収縮」に触れる必要がある場合、チェックリストにはその2つの項目が含まれます。
  • 判定者: 別のAI(「判定者」)が、生徒であるロボットの回答を読み、リストの項目をチェックしていきます。「ATPに触れたか? はい。筋肉の収縮に触れたか? いいえ。」といった具合です。
  • スコア: ロボットは、チェックリストの項目をいくつ満たしたかに基づいて、0から10までのスコアを獲得します。
  • 証明: 「AI教師」が幻覚(ハルシネーション)を起こしていないことを確認するため、彼らはAIによる採点を実際の教師による採点と比較しました。AIは人間の教師と**89.5%**の確率で一致しました。これは非常に高いスコアであり、自動採点が信頼できることを証明しています。

4. 結果:誰が合格し、誰が不合格だったのか?

彼らは21種類の異なるAIモデル(「ロボット」)をこの試験でテストしました。

  • 分布: スコアは最低4.18から最高9.10までの幅がありました。これは、このテストが賢いロボットとそうでないロボットを判別するのに適していることを示しています。
  • 勝者: 上位の成績を収めたのは、Gemini 3.1 ProGPT-5のような巨大で高価なモデルでした。
  • 敗者: 小規模なオープンソースモデルは苦戦し、最低スコアは約4.18でした。
  • ブラジルのスター: 興味深いことに、ブラジル製のモデル(Sabiá-4)は非常に優れたパフォーマンスを見せ、世界の巨人とほぼ同等の成績を収めました。これは、ローカルな学習が効果的であることを示しています。

5. 「難しい部分」:ロボットが躓く場所

最高のロボットであっても、特に以下の2つの事項については苦戦しました。

  1. 数学的推論: これが最も難しい科目でした。素晴らしい物語を書けるが割り算ができない人間と同じように、AIは美しいポルトガル語のエッセイを書ける一方で、数学のステップでミスをすることがよくありました。
  2. 画像理解: 質問にグラフや地図が含まれている場合、ロボットのスコアは平均して約0.5ポイント低下しました。これは、生徒に数学の問題を出しているのに、数字がクシャクシャになった紙の上に描かれているようなものです。AIは、問題を解くために細部を十分に明確に「見る」ことに苦労しました。

6. テストのコスト

研究者たちは、その費用の透明性も確保しました。質問を投げかけ、画像の記述を生成し、回答を採点するというこの実験全体を実行するのにかかった費用は約127ドルでした。この規模の研究としては驚くほど安価であり、多額の費用をかけることなく厳格にAIをテストできることを示しています。

まとめ

BLUEX v2 は、ポルトガル語におけるAIテストの新しい、より厳しい基準です。これは単純なトリビアを超え、AIに書かせ、推論させ、画像を見せることを強制します。その結果は、AIがポルトガル語での執筆や議論には非常に長けている一方で、複雑な数学や視覚データの解釈には依然として課題があることを示しています。このベンチマークは、研究者に対し、次の改善においてどこに焦点を当てるべきかという明確な地図を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →