← 最新の論文
💬 NLP

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

本論文は、英語からの機械翻訳に依存せず、学術・専門・公的試験から収集したネイティブなギリシャ語データに基づき、45 分野 21,805 問からなる大規模な多課題言語理解ベンチマーク「GreekMMLU」を構築し、80 以上の言語モデルの性能評価と分析を通じて、モデルの規模や適応がギリシャ語能力に与える影響を明らかにしたものである。

原著者: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

公開日 2026-03-31
📖 1 分で読めます☕ さくっと読める

原著者: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「ギリシャ語の AI 能力を測るための、新しい『実力テスト』を作りました」**というお話しです。

AI(人工知能)がどれだけ賢いかを測るには、これまで「英語のテスト」を翻訳して使うことが多かったのですが、それには大きな問題がありました。この論文では、その問題を解決するために、**ギリシャ語そのもので作られた、本物のテスト「GreekMMLU(ギリシャ・エムエムエルユー)」**を発表しました。

わかりやすく、3 つのポイントで説明しますね。

1. 「翻訳された料理」ではなく「地元の郷土料理」

これまでのギリシャ語のテストは、英語のテストを機械翻訳したものがほとんどでした。

  • 例え話: これは、**「本場のイタリアンレストランで食べるべきパスタを、日本のスーパーで売っている冷凍パスタを解凍して、無理やり和風の味付けにしたもの」**を食べさせて、シェフの腕前を測っているようなものです。
  • 問題点: 翻訳だと、ギリシャ語特有の複雑な文法や、歴史・文化に根ざしたニュアンスが失われてしまいます。「翻訳された言葉」にしか答えられない AI は、実は「本当のギリシャ語」を理解していないかもしれません。

そこでこの研究チームは、**「地元の料理人(ネイティブスピーカー)が、地元の食材(ギリシャの教育・資格試験)を使って、最初からギリシャ語で作った料理」**を用意しました。

  • 小学校の国語のテストから、医師国家試験、運転免許の試験まで、2 万 1 千問以上のリアルな問題を集めました。
  • これなら、AI が本当に「ギリシャ語を話せるか」「ギリシャの文化を知っているか」を正しく測ることができます。

2. 80 種類以上の AI に「実力テスト」をやらせてみた

新しいテストを使って、世界中の 80 種類以上の AI に挑戦してもらいました。結果は驚くべきものでした。

  • トップクラス(クローズドソース): Google や OpenAI などの巨大企業が作った AI は、**「秀才」**のように高い点数を取りました。特に、ギリシャの文化や歴史に強い知識を持っている問題では、圧倒的な強さを見せました。
  • オープンソース(誰でも使える AI): 無料で使える AI も頑張りましたが、トップクラスにはまだ届きませんでした。特に「ギリシャ特有の文化」に関する問題では、つまずくことが多かったです。
  • 小さな AI: 小さな AI は、テストの難易度が高くなると、まるで**「小学生が大学院の試験を受けさせられた」**ように、ほとんど正解できませんでした。

重要な発見:
「 instruction tuning(指示に従うように訓練する)」という工程を踏んだ AI は、そうでない AI よりもはるかに上手にテストを受けられました。これは、「試験の形式(マークシート方式)や、ギリシャ語の質問の癖」を事前に学んでおくと、実力がぐっと上がることを意味しています。

3. 「なぜ正解できたのか?」の分析

ただ点数を取るだけでなく、AI がどう考えているかも分析しました。

  • 自信と正解率: 賢い AI は、「これが正解だ!」と自信を持って答えた時に、実際に正解する確率が高いです。しかし、古い AI や小さな AI は、**「自信満々に間違える」**ことが多かったです。
  • 問題の長さ: 問題文が長くなると、AI が混乱するかな?と心配しましたが、実は問題の長さと AI の自信にはあまり関係がないことがわかりました。AI は「文章が長いからといって、すぐに不安になるわけではない」ようです。

まとめ:この研究がすごい理由

この「GreekMMLU」は、単にテストを作っただけではありません。

  1. 公平な評価: これまで「翻訳されたテスト」で測られていたギリシャ語の AI 能力を、「本物のギリシャ語」で公平に測れるようにしました。
  2. 未来への道しるべ: 「どの AI がギリシャ語に強いのか」「どんな訓練をすれば強くなるのか」がはっきりわかりました。
  3. 文化の尊重: AI に「英語の知識」だけでなく、「ギリシャの歴史や文化」を正しく理解させるための基盤を作りました。

つまり、**「AI にギリシャ語を教えるための、世界で最も本格的な教科書と試験問題集」**が完成したのです。これにより、今後、ギリシャ語圏でもっと賢く、文化に根ざした AI が生まれることが期待されます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →