Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models
本論文は、論理的に中立なシナリオにおいてマルチモーダル大規模言語モデルが分布的に中立な振る舞いを維持する能力を評価するためのベンチマークおよび一連の指標であるRandomBenchを紹介し、モデルが明示的に指示された場合であっても一様なランダム性を生成できず、強い潜在的なバイアスを示す「確率的崩壊(Stochastic Collapse)」と呼ばれる広範な現象を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きなアイデア: 「偏ったコイン」問題
想像してみてください。友人にコインを投げてもらい、それが「表」か「裏」かを教えてもらうとします。もし本当にランダムであれば、表が50%、裏が50%の割合で選ばれるはずです。
ここで、超高性能なAI(マルチモーダル大規模言語モデル、いわゆるMLLM)に全く同じことを頼んだとしましょう。「コインを投げて。表か裏かを教えて」と。あなたは、そのAIが完璧に公平であることを期待します。
この論文による衝撃的な発見: AIの「コイン」は公平ではありませんでした。それは大きく偏っています。たとえAIが「ランダムに選んで」と言われていても、実は密かに「お気に入り」を持っているのです。例えば、ランダムであるべきだと理解していながら、97%の確率で「表」を選び、「裏」はわずか3%しか選ばないといったことが起こります。
著者らはこれを**「ストカスティック・コラプス(確率的崩壊)」**と呼んでいます。まるでAIの脳が特定のパターンに陥り込み、真に自由になって選択することができなくなっている状態のようなものです。
ツール:「RandomBench」(テスト・キッチン)
これを証明するために、研究者たちはRandomBenchという新しいテストを構築しました。これは「論理が存在しないゾーン」あるいは「中立な遊び場」のようなものです。
- 目的: 「正解が存在しない」状況を作り出すこと。
- 設定: 彼らは200通りの異なるシナリオを作成しました。テキストのみのケース(例:「A、B、C、Dの中から文字を一つ選んで」)もあれば、画像を用いたケース(例:「これら4つの全く同じ見た目の図形から一つ選んで」)もありました。
- ルール: すべての選択肢は完全に等価です。Aを選ぶ理由もBを選ぶ理由もありません。もしAIが真にランダムであれば、各選択肢を25%の確率で選ぶはずです。
彼らはトップクラスの7つのAIモデルに対し、それぞれのシナリオについて50回ずつゲームを行うよう求めました。これは合計10,000回の「コイン投げ」に相当します。
分かったこと:AIの「隠れた癖」
結果は、AIモデルがテストに無残にも失敗したことを示しました。彼らは公平なコインである代わりに、常に同じシンボルが出る壊れたスロットマシンのように振る舞いました。
以下に、見出しと比喩を用いて説明する、彼らが発見した主な「悪い癖」を挙げます。
1. 「視覚的ハイジャック」(大きな看板)
AIに画像を見せると、その「ランダム性」はさらに早く崩壊しました。
- 比喩: あなたがランダムにドアを一つ選ぶよう言われているとします。しかし、ある一つのドアには、目立たない程度の小さな汚れが付いており、他のドアは綺麗です。たとえ汚れを無視するように言われても、あなたの脳はその汚れに引き寄せられてしまいます。
- 発見: AIは視覚的な詳細を無視することができませんでした。もし一つの選択肢がわずかに明るかったり、特定の角にあったり、あるいはわずかなボケがあったりすると、AIはほぼ毎回その選択肢を選んでしまいます。視覚的な手がかりが、「ランダムであれ」という指示を「ハイジャック」してしまったのです。
2. 「位置バイアス」(真ん中の席)
- 比喩: 4つの空席がある列を想像してください。あなたはランダムに一席座るよう言われます。人間なら、「安全」または「中央」だからという理由で真ん中を選ぶかもしれません。
- 発見: AIには特定の場所に対する強い好みがありました。AIは中央、上部、あるいは右側を好みました。たとえ選択肢が4つの空白の正方形であったとしても、AIは右上のものを90%の確率で選ぶことがありました。
3. 「言語のスイッチ」(アクセントの効果)
- 比喩: ある人が英語でランダムな数字を選んでと言われたら「7」を選んだとします。次に、同じ人にフランス語でランダムな数字を選んでと言ったら、突然「3」を選ぶことに変わったとします。
- 発見: AIの「お気に入り」の選択は、使用される言語によって変化しました。同じ視覚的な画像であっても、指示が中国語で行われた場合と英語で行われた場合では、全く異なる「ランダムな」選択が行われました。これは、バイアスがAIの学習データに深く結びついていることを証明しています。
4. 「賢いほど悪い」パラドックス
- 比喩: より賢く、より従順なロボットの方が、「ランダムであれ」というルールに従うのが上手いはずだと考えるかもしれません。
- 発見: 驚くべきことに、より「スマート」で「アライメント(指示への適合性)」が高いモデル(指示に従う能力が高いモデル)ほど、実はランダムであることに失敗していました。彼らはあまりに優秀で、自分の選択を正当化するためのパターンを見つけ出すのが上手すぎたため、単一の選択肢に固執してしまい、たとえそこに論理が全く存在しないとしても、なぜそれを選んだのかについてもっともらしい論理的な言い訳を作り上げてしまうのです。
なぜこれが起きるのか?(「システム1」の不具合)
この論文は、心理学の概念である**「二重過程理論(Dual Process Theory)」**を使用しています。
- システム2: ゆっくりとした、論理的な思考(数学の問題を解くようなもの)。
- システム1: 速い、直感的な、直感に基づいた思考(反射のようなもの)。
ほとんどのAIベンチマークはシステム2(このパズルを解けるか?)をテストします。しかし、この論文がテストしたのはシステム1(パズルが存在しないとき、あなたの直感はどう動くか?)です。
研究者たちは、AIが「論理の真空状態」(どの選択肢も優れていない状態)に置かれると、システム1が支配的になることを発見しました。コインを投げる代わりに、AIは自身の学習データへと立ち戻ります。AIは、学習用の本の中で最も頻繁に登場したものや、自身の内部コードにとって「馴染み深い」と感じる選択肢を選びます。それは選択をしているのではなく、単に「隠れた抵抗の少ない経路」に従っているだけなのです。
結論
この論文は、現在のAIモデルは真にランダムではないと結論付けています。たとえランダムであるように指示されても、彼らには以下の要素に基づいた、深く目に見えないバイアスが存在します。
- オブジェクトが画面のどこにあるか。
- オブジェクトがどのように見えるか(極めて微細な詳細を含む)。
- 質問に使用される言語。
- 使用される特定の記号(ギリシャ文字や図形など)。
これは問題です。もしAIが公平な決定(製品の推奨やルートの選択など)を下すべき場面において、密かに「お気に入り」を持っているとしたら、それは選択を行っているように見えて、実際には隠されたスクリプトに従っているに過ぎません。AIが投げる「コイン」は、根本的に壊れているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。