CleanScore: Black-Box Benchmark Audits with Negative Controls and Sensitivity Bounds
CleanScoreは、負の制御と感度境界を用いるブラックボックス型の監査フレームワークであり、標準的な言い換えベースの監査が訓練データの汚染による影響を著しく過小評価している一方で、公開ベンチマークにおける表面的な形式のインフレは最小限であることを明らかにし、真のモデルのスキルと事前のデータ露出を区別するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
よりスマートな機械を構築するための競争において、研究者たちは人工知能がどれほど問題を解決できるかを測定するために、標準的なテストに頼っています。これらのテストは学校の試験のようなものです。モデルがスコアを獲得するために解かなければならない、答えが既知の質問のセットです。スコアが高ければ高いほど、その機械はより有能であると見なされます。しかし、これらの結果には影が落ちています。これらのテストはオンラインで公開されているため、質問と答えが、機械が学習する場所であるインターネット上で入手可能になっていることが多いのです。高いスコアが必ずしも機械の賢さを証明するわけではないという懸念が高まっています。それは単に、機械が学習中にテストの質問を暗記したことを証明しているだけかもしれないのです。もし機械が以前に全く同じ質問を見ていたとしたら、そのスコアは膨れ上がっており、異なるモデルのランキングは推論の競争ではなく、記憶力のコンテストになってしまいます。
これは、これらの機械を公平に判断しようとする者にとって困難な問題を生み出します。強力なモデルの多くは「ブラックボックス」であり、その内部の学習データは秘密です。監査人は、機械の中に中に入り込んで、特定の質問を暗記しているかどうかを確認することはできません。彼らに見えるのは最終的なスコアだけです。長年、暗記を確認する最善の方法は、質問を書き換えることでした。もし機械が問題の背後にある数学や科学を真に理解していれば、元の質問の言い換えられたバージョンも同様に解けるはずです。もし言い換えられたバージョンで失敗するなら、それは元の問題を単に暗記した可能性が高いでしょう。しかし、この方法には隠れた欠陥があります。それは、もし機械が言い換えられた質問を正解したならば、その概念を学習したと仮定している点です。もし機械が単に解答集を暗記していたために言い換えられた質問を正解したのであれば、そのテストは暗記を見逃すことになります。
ある研究チームは、ブラックボックスの中を見る必要なく、これらのスコアを監査するより良い方法を構築することに着手しました。彼らは「CleanScore」と呼ばれる手法を開発しました。これは、すべてのテストの質問を、一つの親と三人の子供として扱います。つまり、公開されている元の質問一つと、数字や事実は維持しつつ言葉遣いを変えた、新しく非公開で作成された二つのバージョンです。研究者たちは、5つの異なるオープンソースモデルに対し、数学と科学に焦点を当てた2つの主要なベンチマークから計200問の解答を求めました。各質問について、彼らはモデルが公開されたバージョンと、新しく書き換えられたバージョンの両方でどのように成績を上げたかを比較しました。もしモデルが一貫して公開バージョンで高いスコアを出していたならば、それは彼らがテストを暗記していたことを示唆することになります。
監査の結果、このような種類の暗記の証拠は見つかりませんでした。5つのモデルすべてと両方のベンチマークにおいて、公開された質問のスコアは、新しく書き換えられた質問のスコアよりも有意に高くはありませんでした。研究者たちは、公開された表現を見たことによる利点は、おそらく5パーセント未満であると算出しました。この結果は、一部のモデルが回答を終える前に遮断されてしまったという初期設定の技術的なエラーを修正した後でも、有効でした。また、研究には、書き換えプロセス自体が質問を難しくしたり、あるいは易しくしたりしていないことを確認するために、モデルが一度も見聞きしたことがなく、暗記することも不可能な一連の「ネガティブ・コントロール(負の対照群)」の質問も含まれていました。結果は、書き換えプロセスが公正であったこと、そしてスコアの差が見られなかったことは、テストのデザインによる産物ではなく、真の発見であることを示しました。
しかし、この研究で最も衝撃的だった部分は、監査が見逃すであろう事態を想定して設計された一連の実験でした。研究者たちは、100問のテスト問題の正確な言い回しを用いて、意図的に4つの異なるモデルを訓練しました。その後、同じ監査を実行し、それが暗記を検知できるかどうかを確認しました。数学のベンチマークでは、質問を暗記したモデルは、暗記された表現において正解率が26ポイント向上しました。しかし、それらの質問の新鮮に書き換えられたバージョンでテストした際も、正解率は20ポイント向上していました。元の表現と書き換えられた表現の差のみを見る監査は、わずか約6ポイントの差しか検知しませんでした。言い換えれば、監査は暗記のほんの一部しか検出できなかったのです。暗記した言葉ではなく、問題を理解したことによって得られた利点の大部分は、テストからは見えないものとなっていました。
この盲点は、科学のベンチマークにおいてさらに極端なものとなりました。ある実験では、研究者たちが100問の科学の質問を用いてモデルを訓練し、その後、書き換えられたバージョンでテストを行いました。モデルは暗記された質問に対して正解率が49ポイント向上しました。しかし、書き換えられたバージョンは選択肢の文字列を全く同じに保っていたため、モデルは暗記した正しい文字列を認識することによって、書き換えられた質問でも完璧なスコアを出しました。監査はマイナス2ポイントの差を算出し、実質的に暗記を全く検知できないという結果になりました。モデルは答えを学習していましたが、選択肢を固定したままにしたテストのデザインにより、その知識は目の前にあるのに見えない状態で隠れてしまったのです。
研究者たちは、彼らの手法はモデルが質問の特定の表面的な言い回しに依存しているかどうかを測定することには成功したが、汚染(データの混入)の総量を測定することはできなかったと結論付けました。モデルはデータセットに対して集中的に訓練されていても、テストの質問が核心となる答えを保持するように書き換えられていれば、クリーンであるように見える可能性があります。この研究は、監査対象となった5つのモデルについては、彼らがテストの特定の言い回しを暗記していたという強い証拠はないことを示しました。しかし同時に、「クリーン」なスコアは、モデルがその資料を見たことがないことを保証するものではなく、モデルがその「表現」に依存していなかったことを保証するに過ぎないことも証明しました。監査は表面レベルのインフレを限定的に捉えることには成功しましたが、モデルが書き換えプロセスを生き残るような形でその内容を学習していた可能性を排除することはできませんでした。
また、この研究は、監査がいかに小さくなってはいけないかという限界についても浮き彫りにしました。研究者たちは、有意な利点を確実に検出するためには、少なくとも200問の質問をテストする必要があることを発見しました。質問数がこれより少ない場合、統計的な不確実性が非常に大きいため、テストは実際の利点とランダムなノイズを区別することができません。彼らはまた、より少ない質問数でもモデルを正しくランク付けすることは可能であるが、パフォーマンスの正確な順序を決定するには、より大きなサンプルサイズが必要であることも示しました。この研究は、AIテストにおける不確実性の語り方に関する新しい基準を確立する、厳格に登録された実験として機能しています。これは、モデルがすべての暗記の疑いから無実であると宣言するものではなく、最終的なスコアしか利用できない場合に、データが何を提示でき、何を提示できないのかについて、明確かつ誠実な声明を示すものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。