There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
本論文は、評価ハーネスの設定(プロンプトの言い回しやスコアリング手法など)が性能の分散の主要な要因となっており、モデルの実際の能力よりもランキングを決定づけてしまうことが多いため、現代のLLMリーダーボードは根本的に信頼できないものであることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、研究者たちはコンピュータプログラムがいかに言語を理解しているかを測定するために、標準化されたテストに頼っている。これらのテストは、しばしば「ベンチマーク」と呼ばれ、モデルに対して一連の多肢選択式問題を提示し、モデルがどれだけの正解を得たかを記録するものである。得られたスコアは、そのマシンの知能に関する決定的な事実として扱われ、これにより科学者たちは異なるモデル同士をランク付けし、勝者を宣言することができる。長年、コミュニティは、モデルのパフォーマンスが偶然によって多少変動することはあっても、全体的なランキングは技術の能力に関する安定した真実を反映しているという仮定の下で運営されてきた。あるモデルが本当に別のモデルよりも賢いかどうかという問いは、正解率という単一の数値を見ることで答えられてきたのである。
しかし、新たな調査は、この単一の数値がはるかに複雑な物語を語っていることを示唆している。その研究によれば、モデルが受け取るスコアは、単なる知能の尺度ではなく、それを採点するために使用される特定のルール、すなわち「評価ハーネス(evaluation harness)」の産物である。これらのルールには、一見すると些細に見える選択肢が含まれている。例えば、回答の選択肢が提示される順序、モデルに与えられる指示の正確な言い回し、そして回答が正しいかどうかを判断する方法などである。これらの選択はしばぎに恣意的、あるいは便宜的に行われることが多いが、研究者は、これらを変えるだけでリーダーボード(順位表)を完全に書き換え、最下位のモデルをトップへと押し上げたり、その逆を行わせたりできることを発見した。この発見は、現在の人工知能のランク付けの方法が、これまで信じられていたよりもはるかに不安定であることを示唆しており、「最高の」モデルとは、テストがどのように実施されるかに完全に依存しているのである。
この隠れた不安定さを明らかにするために、カリフォルニア大学サンディエゴ校の研究者は、テストのルール自体を変数として扱う大規模な実験を設計した。単一のテストを実行して結果を受け入れるのではなく、彼らは同じ試験を実施するための26通りの異なる方法のグリッドを作成した。彼らは4つの主要なファミリーに属する12種類の言語モデルを取り上げ、同じ3,679問の多肢選択式問題に回答させた。すべての問題に対して、彼らはあらゆるテストルールの組み合わせを通してモデルを実行した。これには、回答の選択肢の順序をシャッフルすること、質問の言い回しを変更すること、そして、モデルがテキスト回答を生成する方法と、コンピュータが各選択肢の数学的な尤度(ゆうど)を計算する方法という2つの異なる採点方法を切り替えることが含まれていた。
結果は驚くべきものだった。研究者が単一のモデルのスコアを観察したとき、そこには単一の正解率は存在しなかった。代わりに、彼らは広範なスコアの帯を見出した。トップクラスの性能を持つモデルの一つでは、どの26種類のルールセットを使用するかによって、スコアが31パーセントの低値から89パーセントの高値まで変動した。これは、同じマシンが、同じ内部コードと知識を持ちながら、テスト管理者が文字の順序やプロンプトのスタイルを変えたというだけで、ほぼすべての正解を得たとされることもあれば、3分の1にも満たない失敗をしたとされることもあるということを意味している。標準的なルールの下でモデルが正解したとされた回答の平均85パーセントは、別の等しく妥当なルールセットの下では間違いとされることができた。
最も重要な発見は、これらの変動がテスト全体に均等に広がったランダムなノイズではなかったということである。不安定さは、まさにモデル同士を隔てている質問に集中していた。研究者が、2つの隣接するモデルがルールに関わらず共に正解または不正解であった質問を調べたところ、それらのモデルは実質的に引き分けであった。ランキングを生み出していた差異は、モデルが不確実であった質問の中にのみ存在していたのである。実際、隣り合うランクのモデルのペアにおいて、スコアの差のほぼすべて(平均して約96パーセント)は、これらの不安定な質問によってもたらされていた。もし、順序が入れ替わるような質問を取り除けば、ランキングは消滅し、モデルたちは区別がつかなくなるのであった。
この脆弱性は、「勝者」のアイデンティティがモデルの固定された特性ではなく、評価者による選択であることを意味していた。あるルールセットの下では特定のモデルが1位になるかもしれないが、別のルールセットの下では全く異なるモデルが勝利する。この研究では、使用された構成に応じて、4つの異なるモデルが1位に到達することができた。標準的なルールでは12モデル中11位だったモデルが、異なる採点方法の下では1位に躍り出た。研究者は、回答の採点方法(モデルが書いたテキストを読み取るか、確率を計算するか)の選択が最も強力な要因であり、選択肢の順序やプロンプトの言い回しよりも多くのランキング変動を引き起こしたと指摘している。
また、この研究は、分野における一般的な傾向、すなわち、時間を節約するためにこれらの大規模なテストをより「情報量の多い」小さな質問セットへと圧縮するという手法についても検証した。その論理は、厳選された数百の質問が全体を代表できるというものであった。しかし、研究者は、この慣行が問題をさらに悪化させていることを発見した。最も情報量が多いとして選ばれる質問こそが、まさにテストルールに対して最も敏感な質問なのである。これらの中でも難易度の高い、ハイステークスな質問だけを残すことで、圧縮されたベンチマークは、それが置き換える元のフルテストよりもさらに揮発性が高くなってしまう。小さなテストはより明確な図を与えるのではなく、セットアップの微細な調整によってランキングが変化しやすい、より脆弱な図を提供するのである。
結局のところ、本論文は、モデルの能力についての真実として単一の数値を報告するという現在の慣行は誤解を招くものであると主張している。スコアはモデル単独の特性ではなく、特定のルールと相互作用するモデルの特性である。研究者は、将来のレポートにおいて、リーダーボードを固定された階層として扱うのではなく、起こりうるスコアの範囲を提示すべきであると提案している。モデルを比較する際、科学者はルールによって結果が決まってしまうような質問ではなく、モデルが安定し、一致している質問に焦点を当てるべきであると提言している。コミュニティがこれらのテストを実行するための、単一で変更不可能な方法に合意しない限り、ランキングは人工知能の決定的な尺度というよりも、評価者の選択を反映したものであり続けるだろう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。