Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context
本論文は、インドにおける大規模言語モデル向けの文化的・言語的に関連性のある評価の欠如に対処するため、英国AISIのInspect AIプラットフォーム上に構築されたオープンソースのベンチマークフレームワークである「Inspect India Evals」を紹介しており、16言語にわたる6つの特定のベンチマークをテストすることで、Sarvam-MやGemma 2といったモデルが、インドの文化的知識および安全性遵守においてより大規模な対抗モデルを凌駕していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、話したり、物語を書いたり、数学の問題を解いたりできる、超スマートなロボット助手を買ったばかりだと想像してください。あなたは、そのロボットを近所に解き放つことに興奮していますが、一つ問題があります。あなたの近所は、何十もの言語が話され、独自の祭りを祝い、独自の深い伝統を持つ、巨大で賑やかな市場のような場所だということです。もし、あなたがニューヨークやロンドンの生活について書かれた英語の本だけでこのロボットを教育したとしたら、それは輝かしい学者にはなるでしょうが、ひどい隣人になってしまうでしょう。そのロボットは、うっかり地元の長老に対して失礼なことを言ったり、文化的なジョークを誤解したり、さらには、地元のルールを「理解」していないために、危険なアドバイスを与えてしまうかもしれません。これが、膨大な量のテキストで学習されたAIの脳、**大規模言語モデル(LLM)**の世界です。現在、科学者たちが投げかけている大きな問いは、「これらのAIの脳は、インドのような文化や言語が非常に多様な場所で人々を助ける準備ができているのだろうか?」ということです。
これに答えるために、研究者たちはロボットをテストする方法を必要としています。通常、彼らは「MMLU」や「TruthfulQA」のような標準的なテストを使用しますが、これらはヨーロッパの高速道路用に設計された運転免許試験のようなものです。しかし、インドでの運転は異なります。道はより狭く、交通ルールは独特であり、ランドマークも全く異なります。もし、ヨーロッパの高速道路で車をテストしたとしても、それが混沌としたインドの市場街をハンドルできるかどうかは分かりません。この論文は、インドのために特別に構築された、新しいオープンソースの「運転試験」であるInspect India Evalsを紹介しています。これは、AIモデルが16種類の異なるインドの言語を話せるか、インドの社会力学(複雑なカースト制度や宗教的多様性など)を理解できるか、そしてインドのデジタルIDシステムや決済アプリに関するトリッキーな質問を受けた際に安全性を保てるかをチェックするものです。
大きなテスト:AIのための新しい地図
この論文の著者たちは、インド政府の電子情報技術省と共に、既存のAIテストが的を外していることに気づきました。彼らは、インドの文脈に合わせて特別に設計された、6つの課題からなる障害物コースのようなフレームワーク、Inspect India Evalsを構築しました。単に「この数学の問題を解けますか?」と聞く代わりに、「この数学の問題をタミル語で解けますか?」とか、「政府のID登録方法を教える際に、誤って偽造の方法を教えてしまわないようにできますか?」といった問いかけを行いました。
このフレームワークには、以下の6つの特定の課題が含まれています:
- 多言語MMLU: 事実を本当に理解しているのか、それとも単に推測しているだけなのかを確認するために、16のインドの言語(ヒンディー語、ベンガル語、タミル語など)に翻訳された知識テスト。
- BharatBBQ: AIがアメリカの人種やジェンダーの問題ではなく、インドのカースト、宗教、または地域に関するステレオタイプを持っているかどうかをチェックするバイアス・テスト。
- DPI安全性: インドの「デジタル公共インフラ」(AadhaarによるIDやUPIによる決済など)に関する安全性チェック。AIが詐欺を助けることは拒否しつつ、役立つ質問には回答できるかをテストします。
- 多言語安全性: 地域言語で尋ねられた場合でも、有害な要求(「銀行をハッキングする方法」など)に対して「ノー」と言えるかどうかを確認します。
- 脱獄耐性(Jailbreak Resistance): 異なる言語を用いた多段階の会話を通じて、AIにルールを破らせようとする試み。
- インドの文化的知識: 憲法から農業政策に至るまで、深い文化的事実に関するテスト。
レース:誰がテストに合格したのか?
研究者たちは、5つの異なるオープンソースAIモデルをこの障害物コースに投入しました。これらのモデルは、80億から320億の「パラメータ」(AIの脳における接続数のようなもの)の範囲に及びます。彼らは、Sarvam-M 24B(インドに特化したモデル)、Gemma 2 27B、Qwen 2.5 32B、DeepSeek-R1 14B、Llama 3.1 8Bといったモデルをテストしました。
結果は以下の通りであり、それは少し驚くべきものでした:
- ローカルヒーローの勝利: インドの言語と文化のために特別にチューニングされたSarvam-M 24Bが、全体としてトップとなりました。平均スコアは**74.4%**でした。特にインドの文化を理解することに優れており(60.0%)、デジタル安全性に関する質問を完璧に処理しました(100%)。さらに、文化的な知識において、より強力で大きなモデルをも打ち負かしました。
- 安全性のスター: Gemma 2 27Bが、**72.1%の平均スコアで非常に僅差の2位となりました。これは完璧な安全ガードであり、バイアス・テストとデジタル安全性において100%**を記録しましたが、深い文化的知識については少し苦戦しました。
- 推論ロボットの苦戦: DeepSeek-R1 14Bは、回答する前に非常に深く考える「推論」モデルとして有名です。このモデルは、複数の言語における事実的推論テストで80.6%という高得点を叩き出しました。しかし、安全性と文化的知識については惨敗し、デジタル安全性ではわずか20%、文化的事実では**10%**しかスコアを出しませんでした。思考することに集中しすぎるあまり、安全であることや文化的に配慮することを忘れてしまったのです。
- 大きなモデルが勝ったわけではない: 興味深いことに、パラメータが多いこと(より大きな脳を持つこと)が勝利を保証するわけではありませんでした。320億パラメータを持つQwen 2.5 32Bは、多くの領域でより小さなSarvam-M 24Bよりも低いスコアとなりました。これは、インドにおいては、単なる生のサイズよりも「専門化されたトレーニング」が重要であることを示唆しています。
「インド公平性指数」
これらの数字を理解するために、著者たちは**インド公平性指数(IFI)**と呼ばれる単一のスコアを作成しました。このスコアは、安全性、バイアス、および事実の正確さを一つの数値に統合したものです。
- Gemma 2 27Bは、**83.1%**という最高のIFIスコアを獲得しました。
- Sarvam-M 24Bが**76.6%**で僅差で続きました。
- DeepSeek-R1 14Bは**65.2%**となり、賢いだけでは不十分で、安全でなければならないことを示しました。
- Llama 3.1 8Bは、**51.6%**で最も低いスコアとなりました。
結論:安全性はどこにでもあるが、文化は難しい
最も興味深い発見の一つは、5つのモデルすべてが、複数の言語において有害な要求を拒否することに完璧であったことです。彼らは「多言語安全性」テストにおいて**100%**を記録しました。英語、ヒンディー語、あるいはタミル語で何か悪いことをするように求められても、彼らは皆「ノー」と言いました。これは素晴らしいニュースです!
しかし、モデルはインドの文化的知識において著しく苦戦しました。特化型モデルであるSarvamは**60%を記録しましたが、他のモデルは10%から30%**の間を漂っていました。これは、標準的なグローバルAIのトレーニングだけでは不十分であり、インドの歴史、祭り、社会構造を正しく理解するためには、具体的なトレーニングが必要であることを示唆しています。
著者らはまた、トレードオフについても指摘しています。DeepSeek-R1は、複雑な推論を行うように設計されたモデルは、時に(脱獄による)安全ルールを破るように騙される可能性があること(脱獄耐性はわずか40%)を示した一方で、GemmaやSarvamのようなモデルはより強固(80%)であることを示しました。
これが意味すること
本論文は、西洋で訓練されたAIをそのままインドに持ち込むことはできないと結論づけています。それは、F1カーを泥だらけの村の道で走らせようとするようなものです。速いかもしれませんが、途中でスタックするか、クラッシュしてしまうでしょう。結果は、インドでAIを真に有用かつ安全なものにするためには、現地の言語と文化に対する専門的なチューニングが必要であることを示唆しています。
著者らは、これらの結果が、少数のテスト質問(各タスクにつきわずか5つのサンプル)に基づいた「パイロット」研究であることに注意を促しています。傾向は明確ですが、完全に確信を得るためには、より大きな質問グループを用いたさらなるテストが必要であると述べています。しかし、メッセージは明白です。専門化され、文化的に配慮されたモデルこそが、インドにおけるAIの未来であり、それらを解き放つ前に安全であることを確認するための、より優れたテストが必要なのです。
この新しい「運転試験」のコードとデータは、開発者が世界で最も多様な国家のために、より良く、より安全なAIを構築し続けられるよう、すべての人に公開されています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。