Prompting from the bench: Large-scale pretraining is not sufficient to prepare LLMs for ordinary meaning analysis
本論文は、大規模な事前学習のみでは、大規模言語モデルを信頼性の高い法的「通常の意味」分析に備えさせるには不十分であると主張しており、実証的証拠がその結論の提示のわずかな変化に対する頑健性の欠如と人間の判断との中程度の相関のみを示していることを明らかにし、それらを高リスクの司法文脈における権威ある使用に不適切なものとしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
法廷で、ある法律の曖昧な言葉が一般の人にとって実際に何を意味するのかを判断しようとする裁判官を想像してください。例えば、契約条項の「造園」という言葉は、トランポリンの設置を含むのでしょうか?伝統的に、裁判官は「私の隣人はどう考えるだろうか?」と自問したり、辞書で言葉を調べたりしていました。
最近、一部の法律専門家や裁判官は、この問いに答えるために、チャットボットを動かしているのと同じ種類の人工知能である大規模言語モデル(LLM)に頼り始めています。その考え方はこうです。「インターネット上に書かれたほぼすべての文章を読んだ AI なら、一般の人々が言葉をどのように使っているかを正確に知っているに違いない、不是吗?」
この論文は、その考えが真実かどうかを検証するための、大規模かつ慎重な実験です。研究者たちは、法廷に座る「厳しい批評家」のように振る舞い、これらの AI モデルを厳格なストレステストにかけました。彼らが発見したことを、簡単に説明します。
1. 「壊れた時計」の問題
研究者たちは、15 種類の異なる AI モデル(小規模なものから巨大な GPT-4 まで)に、138 種類の異なる保険シナリオが対象となるかどうかを判断させました。
- 発見: 一部の AI モデルは、「いいえ」に固定された壊れた時計のようでした。物語の内容が何であれ、彼らは毎回全く同じ答えを出しました。
- 比喩: 天気予報士に「雨は降っていますか?」と尋ねたと想像してください。もし彼が晴れた日、曇りの日、そして吹雪の日に対してすべて「はい」と言うなら、彼らは実際には空を見ていません。単に台本を繰り返しているだけです。いくつかの AI モデルはまさにこれをやり、法律事件の具体的な詳細を実際に「読む」ことに失敗しました。
2. プロンプトの「マジック」
研究者たちは次に、あるマジックを試みました。全く同じ質問を、ただ尋ねる仕方を変えて行ってみたのです。
- シナリオ A: 「ジョンは対象ですか?はいかいいえ」
- シナリオ B: 「ジョンは対象ではありませんか?はいかいいえ」
- シナリオ C: 「ジョンが対象であることに同意しますか?」
- 発見: AI の答えは激しく揺れ動きました。質問のバージョンの一つでは、AI はジョンが対象であることに 90% 確信していました。しかし、わずかに異なるバージョン(「ない」を加えたり、選択肢の順序を入れ替えたりするなど)では、AI はジョンが対象ではないことに 90% 確信するようになりました。
- 比喩: これは、あなたが書く紙の色によって意見を変える提案箱のようです。ある方法でモデルに質問すれば「はい」と言います。同じ質問でも、「いいえ」のオプションを先に書けば、「いいえ」と言います。これは、弁護士が望む答えを与えるプロンプトを「探し回って」選ぶことができ、真実を得るのではなく、単に自分に都合の良い答えを引き出せる可能性があることを意味します。
3. 言語を話さない「翻訳者」
研究者たちは、AI の答えと、実際の人間(一般的な英語話者)が実際にどう考えたかを比較しました。
- 発見: AI と人間の間には、中程度の一致しか見られませんでした。最良の AI モデル(GPT-4 など)でさえ、確率スコアを正確に解釈できた場合、約 83% の正解率しか示しませんでした。しかし、実際の法廷では、スコアをのぞき見ることはできず、答えだけが届きます。
- 比喩: 大衆の考えを伝えるために翻訳者を雇ったと想像してください。翻訳者が 83% の確率で正しく伝えるなら、それは良いように聞こえます。しかし、法的な事件において、6 回に 1 回間違えることは災害です。これは、83% の確率で正しい都市に案内してくれるが、残りの 17% では沼地に置き去りにする GPS のようなものです。
結論
この論文は、AI が大量のデータ(大規模な事前学習)を読んだからといって、一般の人々がどのように考えているかを理解しているわけではないと主張しています。
著者らは、これらの AI モデルは現在、法律事件における最終的な判断として使用するには脆弱すぎて信頼性が低いと結論付けています。彼らはまだ「権威ある」一般の意味の源泉ではありません。裁判官がそれらに頼って確認もしなければ、彼らは壊れた時計や、フォントサイズによって意見を変える提案箱を信頼していることになるかもしれません。
要約すると: AI は流暢な話し手ですが、言葉が一般の人にとって何を意味するかを決定する際、信頼できる思考者ではありません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。