The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer
この論文は、枝刈りされた大規模言語モデルが多肢選択式の評価では有能に見えるものの、枝刈りは正解を消去するのではなく正解の順位を下げるものであるために自由記述の生成においては失敗するという「ベンチマークの錯覚」を明らかにしており、圧縮されたモデルは単なる認識能力ではなく生成能力についてもテストされるべきであることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、あらゆる質問に答えることができる、非常に博識で読書家な司書(大規模言語モデル)を想像してみてください。コストとスペースを節約するために、あなたは図書館を「剪定(プルーニング)」することに決めました。最も不可欠な本だけを残し、膨大な量の本や棚を取り除いたのです。
あなたが尋ねている論文は、この縮小された図書館をテストした際に何が起こるかを調査しています。
「多肢選択の錯覚」
ここにはトリックがあります。司書に質問する場合、2通りの方法でテストすることができます。
- オープンな質問: 「アゾレス諸島を発見したのは誰ですか?」と問いかけ、記憶から答えが出るのを待つ。
- 多肢選択テスト: 「アゾレス諸島を発見したのは誰ですか? A) 1427年、B) 1500年、C) 1600年、D) 1700年」と問いかける。
論文では、驚くべき「錯覚」が見つかりました。剪定の後、司書はしばしばオープンな質問に失敗します。彼らは「15世紀だったと思います」のように、曖昧な答えを出したり、間違えたりします。しかし、多肢選択のテストを与えると、彼らは満点を取ります。即座に「1427年」を指し示し、正解できるのです。
標準的なベンチマーク(AIを評価するために使われるテスト)は、通常、この多肢選択形式に基づいています。これは誤った安心感を生み出します。テストは「あなたの図書館はまだ完璧です!」と言いますが、実際には、司書は助けなしに答えを想起する能力を失っています。答えを見せられれば認識することはできますが、自力で生成することはできないのです。
「格下げ」対「消去」理論
著者たちは重要な問いを投げかけました。剪定によって知識が消去されたのか(司書がその事実を完全に忘れてしまったのか)、それとも単に格下げされただけなのか(司書はまだ知っているが、それがもはや第一候補ではなくなっただけなのか)という問いです。
彼らは、それは主に格下げであることを発見しました。
司書の精神を、アイデアがひしめき合う部屋だと考えてみてください。剪定前、正解は部屋の入り口のすぐ前に立ち、あなたに手を振っていました。剪定後、正解はまだ部屋の中にありますが、後ろの方の3列目や4列目に押しやられてしまいました。
- 貪欲デコーディング(デフォルト設定): 司書は入り口のすぐ前に立っている人だけを見ます。正解が3列目にいるとしても、司書は目の前にいる間違った人を選んでしまいます。
- 多肢選択: あなたが司書に、部屋の中にいる人たちのリストを渡すと、たとえ正しい人が3列目にいたとしても、司書はそのリストの中から彼を見つけ出し、選ぶことができます。
「格下げ」を修正する方法
知識は消去されたのではなく、単に押しやられただけなので、論文では少しの手助けがあれば答えを取り戻せることを示しています。
- 探索範囲を広げる: 単に入り口を見る(貪欲デコーディング)のではなく、もし司書に「部屋の中にいる上位5人を見てください」(ビームサーチ)と指示したり、いくつかの推測を行わせたり(サンプリング)すれば、彼らは再び正しい答えを見つけることができます。
- 小さなヒントを与える: もし司書に、似たような質問への回答例を一つ与える(インコンテキスト学習)と、それは正しい答えを再び最前列へと押し戻す助けとなります。
注意点
この「格下げ」効果は、特にモデルの規模が大きい場合や、モデルが得意とする言語において頻繁に起こります。しかし、論文では、より小さなモデルや非常に難しい言語の場合、剪定によって知識が実際に消去されることがあるとも指摘しています。その場合、たとえリストを見せたとしても、司書は答えを見つけることができません。なぜなら、それはもう消えてしまったからです。
結論
この論文は、圧縮されたAIモデルを評価する際に、「多肢選択」のスコアを過信しすぎないよう警告しています。答えを与えられた状態のテストでは完璧に見えるモデルでも、実際のユーザーが直接的な質問をしたときには、惨めに失敗することがあります。圧縮されたモデルが本当に有用であるかどうかを知るためには、答えの鍵を提示して「認識」させるだけでなく、モデルが自力で何を「生成」できるかをテストする必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。