← 最新の論文
💬 NLP

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

本論文は、地域に根ざした内容や人文科学科目における理解がSTEM分野と比較して著しく不足していることを明らかにするため、現地の教育資源から派生した26,000問以上のウルドゥー語による多肢選択式問題からなる包括的なベンチマークであるUrduMMLUを紹介し、30の大規模言語モデルの性能を評価するものである。

原著者: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

公開日 2026-06-08
📖 1 分で読めます☕ さくっと読める

原著者: Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ある学生グループの知能をテストしようとしていると考えてみてください。長年、彼らに与えられるテストは英語で書かれたものだけでした。彼らが英語を読めることは分かっていますが、自分たちの文化の歴史、文学、科学を本当に理解しているのか、それとも単にそれらの概念の英語への翻訳を暗記しているだけなのか、あなたには分かりません。

この論文は、2億3,000万人以上の人々が話すウルドゥー語のために特別に設計された、大規模な新しい「試験」であるURDUMMLUを紹介するものです。彼らが何を行い、何を見出したのかを、いくつかの簡単な比喩を用いて解説します。

1. 問題点:「翻訳されたメニュー」の問題

これまで、研究者がAIモデルをウルドゥー語でテストしたい場合、その多くは英語のテストを翻訳して利用してきました。

  • 比喩: イタリア料理のシェフの腕前を判断しようとして、フランス語に翻訳されたメニューを渡しているようなものです。言葉は合っているかもしれませんが、文化的なニュアンスや地元の食材、あるいはその料理が伝統的にどのように調理されるかといった特定の作法を見逃しているかもしれません。
  • 現実: 既存のウルドゥー語ベンチマークは、これら「翻訳されたメニュー」のようなものでした。それらは、ウルドゥー語の教育、文学、あるいは現地の歴史(パキスタン研究やイスラム研究など)が持つ独特の味わいを捉えていなかったのです。

2. 解決策:ネイティブな「ウルドゥー語試験会場」の構築

著者らは、26,431問の多肢選択式問題を備えたベンチマーク、URDUMMLUを構築しました。

  • 問題の出典は?: 英語の問題を翻訳するのではなく、彼らは源泉へと直接向かいました。実際のパキスタンの教科書、過去の試験問題(SSC/HSSC)、および現地のウルドゥー語問題バンクです。
  • 「ダブルチェック」システム: これらの古い試験問題の中には解答集がないものもあったため、チームは17人のネイティブのウルドゥー語話者(主に大学学位保持者)を「試験監督」として雇いました。
    • ルール: すべての問題に対して2人の監督者が目を通し、回答に合意しなければなりませんでした。もし意見が分かれたり、問題が壊れていたりした場合は、その問題は破棄されました。これにより、「ゴールドスタンダード(黄金律)」としての回答が100%信頼できるものとなりました。
  • 範囲: この試験は、数学や物理学(STEM)から、ウルドゥー文学、イスラム研究、パキスタン研究に至るまで、26の科目をカバーしています。

3. テスト:30のAIモデルを試験会場へ

研究者たちは、30種類の異なるAIモデル(GoogleのGeminiのような有名な「クローズド」なものと、オープンソースの両方)を取り上げ、このウルドゥー語試験を実施しました。彼らは2つの方法でテストを行いました。

  1. 英語による指示: 「これはウルドゥー語の質問です。答えを選んでください。」(指示は英語)。
  2. ウルドゥー語による指示: 「یہاں ایک سوال ہے، جواب منتخب کریں۔」(指示はウルドゥー語)。

4. 結果:「STEM vs 文化」のギャップ

結果は、数学は得意だが詩を読むのは苦手な学生の成績表のように、非常に示唆に富むものでした。

  • トップパフォーマー: モデル Gemini-3.5-Flash が明確な勝者であり、90%以上のスコアを獲得しました。これは85%の壁を突破した唯一のモデルでした。
  • オープンソースの格差: 最も優れたオープンソースモデル(DeepSeek-V4-Flash)は約**82%**を記録しました。優秀ではありますが、リーダーには約8ポイントの差をつけられました。
  • 「人文科学」での失速: これが最も重要な発見です。
    • 比喩: 複雑な物理の方程式を解けるが、詩を分析したり宗教的テキストを説明したりすることを求められると無残に失敗する学生を想像してください。
    • 現実: ほとんどすべてのモデルが、科学や数学の問題において高いパフォーマンスを示しました。しかし、質問がウルドゥー文学、ウルドゥー語、イスラム研究に移ると、多くのモデルは25〜40パーセントポイント低下しました。
    • 例: あるモデルは物理学で97%を獲得する一方で、ウルドゥー文学では67%しか取れないことがあります。これは、モデルが科学の(普遍的な)事実は知っているものの、現地の科目に必要な深い「文化的・言語的な理解」が欠けていることを示唆しています。

5. その他の驚くべき発見

  • 指示の言語はあまり重要ではなかった: AIに対して英語で答えるよう指示しても、ウルドゥー語で答えるよう指示しても、スコアはほとんど変わりませんでした。問題は指示の言語ではなく、モデルの「脳」の中にウルドゥー文化に関する知識が不足していることでした。
  • Few-Shot Learning(「カンニングペーパー」): 研究者は、テストの前にいくつかの例題をAIに与える(カンニングペッパーのようなもの)ことを試みました。これは少しの助けにはなりましたが(スコアを1〜3ポイント上昇させた)、文化的な知識の大きな溝を埋めるには不十分でした。
  • 「ウルドゥー特化型」モデル: 興味深いことに、ウルドゥー語のためだけに訓練されたモデル(QalbやAlifなど)は、かなり低いパフォーマンス(約35%)を示し、一般的なモデルよりも成績が悪くなることがよくありました。これは、単にウルドゥー語のテキストで訓練するだけでは不十分であり、モデルにはチャットやニュースだけでなく、教育的かつ論理的な素材を用いた訓練が必要であることを示唆しています。

まとめ

URDUMMLUは、ウルドゥー語におけるAIの新しい、厳格な「運転免許試験」のようなものです。これは、AIがウルドゥー語で科学の質問に答えることには非常に長けている一方で、その言語の「魂」である文学、歴史、そして現地の文化を理解することには依然として苦戦していることを証明しています。現在の「最高の」AI(Gemini)は強力なドライバーですが、オープンソースモデルは、特にウルドゥー語圏の文化的なニュアンスに関して、まだ道のルールを学んでいる最中です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →