Benchmarking Large Language Model Rationality Using Measurement Axioms
本論文は、大規模言語モデルの合理性を評価するための効用公理に基づく測定論的枠組みを導入し、一部のパターンが人間の行動を反映している一方で、多くのモデルが意思決定の整合性を損なう選好推移性の系統的な違反を示すことを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、投資プランの選択や医療行為の決定といった重要な意思決定を助けてくれる、新しいアシスタントを雇おうとしていると想像してください。あなたが求めているのは、単にテストで「正解」を出すことができるアシスタントではありません。あなたが求めているのは、一貫性のあるアシスタントです。もし彼らが「プランAはプランBよりも優れている」と言い、「プランBはプランCよりも優れている」と言ったなら、論理的に「プランAはプランCよりも優れている」と結論付けられなければなりません。質問の仕方や、その日の昼食の内容によって意見を変えるようなら、その人は信頼できる意思決定者とは言えません。
この論文は、チャットボットなどの背後にあるAIの脳である20種類の大規模言語モデル(LLM)に対する、厳格な「論理テスト」のようなものです。研究者たちは、「計算は合っているか?」と聞く代わりに、「君の選択は論理的に一貫しているか?」と問いかけたのです。
以下は、彼らの実験の構成を簡単な比喩を用いて解説したものです。
1. テスト:論理の「ジャンケン」
現実の世界では、私たちは選択が**推移的(transitive)**であることを期待します。もしあなたがバナナよりもリンゴを好み、チェリーよりもバナナを好むなら、当然チェリーよりもリンゴを好むはずです。もし突然、リン果よりもチェリーを好むようになったとしたら、あなたの好みは「非推移的(intransitive)」、つまり壊れています。
研究者たちは、AIがさまざまな「ギャンブル」のチケットの中から選択しなければならないゲームを設定しました。各チケットには、賞金を得るチャンスが設定されています。
- チケットA: 24分の7の確率で5.00ドル獲得
- チケットB: 24分の8の確率で4.75ドル獲得
- チケットC: 24分の9の確率で4.50ドル獲得
彼らは、あらゆる組み合わせにおいて、AIにこれらのチケットを比較させました。もしAIが合理的であれば、その選択は一直線になるはずです。もしループ(A > B > C > A)が生じたなら、それは論理テストに失敗したことを意味します。
2. AIを壊そうとする3つの方法
研究者たちは、ただ一度質問をしただけではありません。科学者がレシピを微調整してケーキが崩れるかどうかを見るように、彼らは3つの要素を変更することで、AIの論理を「壊そう」と試みました。
「温度(Temperature)」のつまみ(ランダム性):
AIをシェフだと想像してください。「低温度」の状態では、シェフはレシピに忠実に従います。「高温度」の状態では、シェフは独創的になり、ランダムにスパイスを加えます。研究者たちは、このつまみを非常に厳格な状態から非常に混沌とした状態へと回しました。AIをより「創造的」にすることで、その論理が崩壊するかどうかを見たのです。- 結果: 驚くべきことに、AIをより混沌とした状態(高温度)にすると、最も簡単なテストにおいては、むしろ論理が「良く」見えることがありました。しかし、これは単にAIがランダムに推測し始めた(コイン投げのように)ためであり、偶然それがテストのルールに適合したに過ぎません。これは、AIがより明晰に思考できるようになったことを意味するのではなく、単にランダムに回答した結果です。
「記憶」のゲーム:
あなたはテストを受けていると想像してください。あるバージョンでは、各問題を独立して解きます。別のバージョンでは、「直前の10問であなたはオプションAを選びました。これに懲りず、もう一度選んでください」と言われます。- 結果: AIに過去の選択の「記憶」を与えると、状況は悪化しました。AIはより一貫性を増すどころか、混乱してしまったのです。その論理は不安定になり、質問の順序によって意見を頻繁に変えるようになりました。
「言い回し」のトリック:
彼らは全く同じ質問をしましたが、数字の見せ方を変えました。- バージョン1: 「24分の7の確率」(分数)
- バージョン2: 「29.17%の確率」(パーセンテージ)
- 結果: 数字の見え方が変わっただけで、AIの論理も変わってしまいました。もしAIが真に合理的であれば、24分の7と29.17%は全く同じものとして扱われるはずです。AIがこれらを別物として扱った事実は、その「脳」が根本的な真実ではなく、データの表面的な外見に敏感であることを示しています。
3. 「人間らしい」間違い
ここが最も興味深い部分です。AIが論理テストに失敗したとき、その失敗はランダムではありませんでした。AIは、人間も陥る特定のやり方で失敗していたのです。
数十年前、心理学者たちは、人間がしばしば次のような「ショートカット(近道)」のルールを使うことを発見しました。「もし当選確率の差がごくわずかなら、賞金が多い方を選ぶ。しかし、当選確率の差が大きければ、より安全な方を選ぶ」。このショートカットによって、人間は非論理的なループに陥ります。
AIモデルは単にランダムなエラーを起こしたのではなく、この特定の「人間のショートカット」を模倣したのです。しかし、彼らは実際の人間よりもはるかに頻繁にそれを実行していました。まるでAIは人間になろうとしているものの、その「人間の間違い」の部分をやりすぎているかのようです。
4. 大きな結論
この論文は、これらのAIモデルがテキストを生成したりトリビアに答えたりすることには長けているものの、合理的な人間や完璧なコンピュータプログラムのような、安定した内部的な「価値体系」を持っていないと結論付けています。
- 彼らは厳密な意味での「合理的エージェント」ではありません。
- 彼らの選択は、どのように質問するか、どの程度「ランダム」にするよう指示するか、そして直前に何を言ったかを覚えているかによって大きく左右されます。
- もし、一連のつながった意思決定(例:医師がステップ・バイ・ステップで患者を診断していく過程など)をAIに依存する場合、その論理がステップ1からステップ10まで維持されると期待することはできません。
要約すると: AIは非常に賢そうに聞こえる、優れた「模倣者」ですが、もし論理という棒で突っついたなら、ぐらつくものです。AIには、強固で不変の信念などは存在しません。ただ、目の前にある質問の形に反応しているだけなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。