Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems
本論文は、5つの主題と7つの言語にわたる4,242個の実行可能なSTEM問題テンプレートで構成される、多言語かつ視覚的に接地された記号的ベンチマークであるSci-Rhoを紹介するものであり、これは、静的な平均値ではなくワーストケースのバリエーションに対して評価を行った際に、最先端の視覚言語モデルにおける重大な堅牢性のギャップを明らかにするものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、新しい学生の科学的問題解決能力をテストしていると想像してください。かつて研究者たちは、学生に1枚の静的なワークシート(1つの図と1つの質問が含まれたもの)を手渡していました。学生が正解すれば、合格でした。しかし、この論文は、それが「空の直線道路だけでドライバーをテストするようなものだ」と主張しています。それでは、突然の路面の窪みや、迂回路、あるいは異なる天候状況に対処できるかどうかは分かりません。
この論文の著者である Sci-ρ は、AIの「学生」(具体的には視覚言語モデル:VLM)のための、より強力でダイナミックな運転免許試験を構築することにしました。
彼らが何を行い、何を発見したのか、以下に簡単にまとめます。
1. 「形を変える」テスト(データセット)
研究者たちは、AIに606個の静的な科学問題を与える代わりに、デジタル工場を構築しました。
- 設計図(ブループリント): 彼らは、数学、物理学、化学、生物学、およびコンピュータサイエンスに関する問題の「テンプレート」を606個作成しました。これらはマスター・ブループリント(基本設計図)のようなものです。
- 工場: 彼らは、これらの設計図を取り込み、各問題のわずかに異なるバージョンを即座に10個ずつ作成するコンピュータコード(Python)を書きました。
- 例: 数学の問題が正方形の面積を求めるものだとしたら、工場は、一辺の長さが5のバージョン、7のバージョン、あるいは異なる色や異なる形状を用いたバージョンを出力します。
- 多言語のひねり: 彼らはこれを英語だけで行いませんでした。指示文を、7つの言語(スワヒリ語、ヒンディー語、アラビア語を含む)に翻訳しましたが、画像は同じままにしました。
- 結果: その結果、42,420個のユニークな問題ができあがりました。これは、AIに膨大な図書室を与え、すべての本が、核心となる論理的な問いは同じでありながら、見た目が少しずつ異なる10の異なる版を持っているようなものです。
2. 「平均」対「ワーストケース」の罠
研究者たちは、17種類の異なるAIモデルをこの膨大なライブラリでテストしました。彼らは2つのスコアに注目しました。
- 平均精度(Average Accuracy): 問題の全10バージョンのうち、AIがどれくらいの頻度で正解したか。
- ワーストケース精度(Worst-Case Accuracy): AIが10個のバージョンのうち、すべてのバージョンに対して正解した頻度。
大きな発見:
AIモデルは「平均」のスコアでは素晴らしく見えました。しかし、研究者が「ワーストケース」のスコアを見たとき、モデルは崩壊しました。
- 比喩: 10問中9問の数学の問題に正解する学生を想像してください。彼らは賢そうに見えます。しかし、もし同じ10問を、数字を少し変えて再度解かせたところ、今度は4問間違えてしまったとしたら、彼らは実際に数学を「推論」しているわけではありません。彼らは単にパターンを暗記しているか、数字の見え方に基づいて推測している可能性が高いのです。
- 発見: GPT-5.4のような最も賢く高価なAIモデルでさえ、大きなギャップを示しました。モデルは問題を簡単に解けることもありましたが、グラフの色を変えたり、数字をわずかに変えたりすると、しばしば失敗しました。より小さく安価なモデルは、さらにひどい結果となりました。
3. 言語の壁
研究者たちは、指示が英語以外の言語である場合に、AIがより苦戦するかどうかを調査しました。
- 大規模モデル: 巨大で高価なモデルは、まるでポリグロット(多言語話者)のようでした。彼らは英語、中国語、スワヒリ語をほぼ等しく扱いました。
- 小規模モデル: 小さなオープンソースモデルは、英語しか話せない観光客のようでした。指示が(スワヒリ語のような)より一般的でない言語に切り替わると、パフォーマンスが著しく低下しました。科学の問題自体は同じであるにもかかわらず、彼らは言語の変化によって混乱しているようでした。
4. 「目 vs 脳」の問題
研究者たちは、AIモデルがどのように「考えているか」を見るために、モデルの内部を覗き見ました。彼らは、モデルが画像とテキストのどちらにどれだけ注意を払っているかを測定しました。
- 発見: モデルの注意は、言語によって変化しました。
- テキストが中国語の場合、モデルは画像への依存を減らし、テキストへの依存を強めました。
- テキストがカザフ語やヒンディー語の場合、モデルは画像に大きく依存していました。
- 比喩: これは、AIが「この言語はよく理解できないので、図に基づいて推測しよう」と考えているようなものです。言語を完璧に理解しているとき、モデルは言葉をより信頼します。これは、AIが人間のように画像を「見ている」のではなく、テキストが混乱しているときに画像を「杖(支え)」として使っていることを示唆しています。
5. AIが躓いた場所
AIが失敗したとき、研究者たちはそのエラーを分類しました。
- 画像の読み取りミス (63%): AIは図の中の点の数を数え間違えたり、グラフ上の数字を正しく読み取ることができませんでした。
- 論理の誤り (29%): AIは正しい公式を知っていましたが、それを間違った対象に適用したり、そこに存在しない事実を作り上げたりしました。
- 計算ミス (8%): AIは論理は正しかったものの、単純な算術でミスをしました。
結論
この論文は、**「静的なテストは私たちに嘘をついている」**と結論付けています。AIがある特定の科学的問題を一度解けるからといって、そのAIが科学を理解しているとは限りません。それは単に、学習中に見たパターンを認識しているだけかもしれません。
AIが本当に賢いかどうかを知るためには、テーブルを揺らし、数字を変え、言語を入れ替え、それでもなお問題を解けるかどうかを確認する必要があります。もし解けないのであれば、それは推論しているのではなく、単に推測しているだけなのです。Sci-ρは、そのテーブルを揺らすために設計されたツールなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。