← 最新の論文
💬 NLP

Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks

本論文は、23のモデルを様々なタスクにわたってテストすることにより、広く採用されている常識ベンチマークの予測妥当性を評価しており、これらのベンチマークが示すLLMの能力の証拠は、広範なものではなく、タスクに依存したものに過ぎないという結果を示している。

原著者: Ine Gevers, Walter Daelemans

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Ine Gevers, Walter Daelemans

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

新しい学生が賢いかどうかを見極めようとしている場面を想像してみてください。あなたは、その学生に「もしグラスを落としたら、割れるでしょうか?」や「なぜ男の子は泣いているのですか?」といった、日常生活に関する多肢選択式の問題を含む標準化されたテストを与えます。もし彼が高いスコアを獲得すれば、あなたは彼が世界を理解する能力に長けていると仮定します。これが、現在科学者が人工知能(AI)をテストする方法です。彼らは、AIモデルに「常識」があるかどうかを確認するために、「ベンチマーク」と呼ばれる、設計された静的なクイズを使用しています。「常識」とは、世界、人々、そして物理法則がどのように機能するかという、基本的な、明文化されていないルールを指す少し凝った言葉です。しかし、ここに落とし穴があります。学生が多肢選択式のクイズで満点を取ったからといって、その学生が、友人との交渉や壊れたおもちゃの修理といった、実生活の状況を実際に切り抜けることができるとは限らないのです。研究者が投げかけている大きな疑問は、「これらのテストのスコアは、AIが現実世界のタスクをどれほど上手くこなせるかを実際に予測しているのか、それとも単にテストを受けること自体に長けているだけなのか?」ということです。

「Benchmarking the Benchmarks(ベンチマークのベンチマーク化)」と題されたこの論文は、これらの有名なAIクイズが本当に有用であるかどうかを突き止めるための、探偵のようなミッションに挑んでいます。著者であるイネ・ヘーフェルスとウォルター・デレマンスは、これらのベンチマークを天気予報のように扱いました。彼らは次のように知りたかったのです。「もし予報が『晴れ』(高いベンチマークスコア)と言ったら、それは本当に、その日(AI)が晴天であること(AIが実際のタスクに成功すること)を意味しているのか?」を。これをテストするために、彼らは単に一つのテストを見ただけではありませんでした。彼らは23種類の異なるAIモデル(これらを23人の異なる学生と考えてください)を集め、4つの有名な常識クイズと、それらと同じクイズの「作り直された」バージョン(トリッキーなエラーを取り除くために整理されたもの)を彼らに与えました。その後、彼らは同じモデルが、皮肉を理解すること、会話の隠れた意味を理解すること、あるいは物理的な出来事の次に何が起こるかを予測することといった、より複雑で現実世界に近い8つの異なる課題に対して、どのようにパフォーマンスを発揮するかを観察しました。

結果は驚くべきものかもしれません。著者たちは、クイズを整理しても、現実世界のパフォーマンスを予測する能力が向上するわけではないことを見出しました。それは、数学のテストを受け、誤字脱字を消して再印刷するようなものです。以前A判定だった生徒は依然としてAを取り、苦戦していた生徒は依然として苦戦しますが、そのテストは依然として、彼らが実際に車を修理できるかどうかを教えてはくれないのです。実際、ほとんどの現実世界のタスクにおいて、クイズのスコアは最悪の予測因子でした。クイズが役に立ったのは、非常に特定のタスク、つまり「誤信念」(誰かが自分とは異なる知識を持っている可能性を理解すること)と「TRIP」(出来事の物理的なステップを予測すること)を理解する場合に限られていました。それでもなお、その結びつきは完璧ではありませんでした。

この研究は、これらのベンチマークが、単一の広範な「常識」という超能力を測定しているのではないことを示唆しています。むしろ、これらはモデルが特定のタイプの多肢選択式テストをどれだけ上手くこなせるかを測定しているのです。もしAIに皮肉や社会的感情の理解をさせたいのであれば、これらの標準的なクイズで高得点を取ることが、それを保証するものではないのです。著者たちは、リーダーボード(順位表)だけを見て、トップのAIがあらゆる仕事において最も賢いと想定してはならないと結論付けています。スコアは非常に限定的な事柄には有用ですが、汎用的な知能を示す魔法の水晶玉ではありません。論文は、テストの問題を修正することが、自動的にテストの「現実世界での成功を予測する能力」を修正することになると想定するのをやめ、代わりに、実際に現実世界のように見える方法でAIをテストすることに焦点を当てる必要があると主張しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →