Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
本論文は、UA-JudgeExamのような法学分野の多肢選択式ベンチマークにおいて、モデルが選択肢の配置バイアスや誤答パターンの悪用によって、問題を読まずに選択肢のみを用いて解けてしまうことがしばしばあることを明らかにしており、真の法的推論能力を正確に評価するためには、厳格なゲーティングとデバイアス(偏り除去)が必要であることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の世界において、研究者たちはコンピュータがいかに賢いかをテストする際、まるで学生が標準化された試験を受ける時のように、多肢選択式の質問を用いることがよくあります。これらのテストを採点する標準的な方法は単純です。コンピュータが正解を選べば、1点を与えます。しかし、この方法には隠れた欠陥があります。コンピュータは、正解にたどり着くために必ずしも質問を理解する必要はありません。時には、選択肢のリスト自体に、質問が完全に隠されていても正解を導き出すのに十分な手がかりが含まれていることがあります。これは、誤答の書き方が不適切であったり、正解だけが実在する完全な文章のように聞こえたりする場合に起こります。もし機械が選択肢を見るだけで正しい記号を推測できるのであれば、そのテストは知性を測定しているのではなく、選択肢の中にあるパターンをいかに見つけ出すかを測定していることになります。これは、リーガルAI(法律分野のAI)を評価しようとする人々にとって深刻な問題です。なぜなら、テスト自体に欠陥があれば、その結果は誤解を招くものになるからです。
ある研究者が、この問題を調査するために、ウクライナの実際の法律問題の膨大なバンクを用いて調査を行いました。これらの質問は、裁判官が受ける極めて重要な資格試験のために作成されたものであり、公式で検証済みの解答が付随しています。研究者は、現代のAIモデルが、質問自体を一度も見ることなく、これらの質問を解くことができるかどうかを確認したいと考えました。彼らは数千の項目を取り出し、質問を完全に隠した状態で、AIに4つの可能な回答のみを提示しました。その結果、AIは質問を見ることなく、ランダムな推測よりもはるかに高い頻度で正解を当てることができることが分かりました。実際、あるモデルは、選択肢を見るだけで正解を約38パーセントの確率で当てており、これは盲目的な推測で期待される25パーセントという数値を大きく上回っています。これは、正解の多くが自己完結した法の記述であった一方で、誤答には微妙な誤りが含まれていたり、不自然に聞こえたりしたために起こりました。AIは、何を問われているのかを知ることなく、「正解らしく聞こえる」法の内容を認識することを学んだのです。
その後、研究者は一般的な修正策を試みました。それは、AIが盲目的に答えられてしまった質問を排除し、AIが失敗した質問のみを残すという方法です。彼らは、これにより真の推論をテストできるクリーンなデータセットが残ると期待しました。しかし、彼らの実験は驚くべき事実を明らかにしました。この修正策は機能しないということです。彼らは一つの特定のAIモデルを用いてこのフィルターを作成しましたが、別の、より強力なモデルをその残った質問に対してテストしたところ、その新しいモデルも依然として高い精度で盲目的に正解を推測することができました。フィルターは、最初のモデルが利用しやすい質問を取り除いただけであり、よりスマートなモデルが利用しやすい質問を取り除くことはできなかったのです。この研究は、AIモデルが進化するにつれ、選択肢の中に隠された手がかりを見つけ出す能力も向上するため、あるモデルのためにクリーンにされたテストは、より優れたモデルにとっては即座に無用なものになることを示しました。
また、研究者は、問題が法律という主題そのものではなく、質問の書き方にあったことも発見しました。彼らは、ウクライナの試験問題と、異なる形式を採用しているLEXamと呼ばれる別の法律テストを比較しました。LEXamでは、選択肢は完全な文章ではなく、「記述1と3」といった、質問内のリストを参照する短いポインターになっています。これらの選択肢は単独では意味を持たないため、AIは質問を読まなければ答えを推測することができません。研究者がこれらの異なる形式でAIモデルをテストしたところ、モデルは盲目的に答えを推測することができなくなり、ランダムな推測と同じレベルのスコアになりました。これは、欠陥がAIの推論能力にあるのではなく、テストの設計にあることを証明しました。選択肢が完全な文章である場合、テストは悪用に対して脆弱です。選択肢がポインターとして設計されている場合、テストは安全です。
本研究は、単に「悪い」質問をフィルタリングすることは解決策にならないと結論付けています。なぜなら、「悪い」質問の定義は、AIがいかにスマートであるかによって変化するからです。AIの能力を真に測定するためには、研究者は2つの数値を報告しなければなりません。すなわち、完全な質問を用いた場合のパフォーマンスと、質問を隠した場合のパフォーマンスです。また、特定の文字(例えば常に「A」を選ぶなど)を選択する癖によって、スコアが人工的に膨らんでしまうことも考慮しなければなりません。論文は、法律試験や同様の専門的なテストにおいては、選択肢の形式が最も重要な要素であると示唆しています。もし回答が完全な命題として書かれているならば、そのテストは選択肢のみを読み取るAIによって侵害される可能性が高いでしょう。もし回答がポインターとして設計されているならば、そのテストは妥当な推論の尺度であり続けます。研究者は、どの質問が情報を漏洩させ、どの質問がそうではなかったかを他者が正確に確認できるよう、データセット全体とテストの結果を公開しました。これは、より優れた、より誠実な人工知能の評価を構築するための明確な道筋を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。