← 最新の論文
💬 NLP

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

本論文は、大規模言語モデルにおける系統的な方向性バイアスを検出するために、成功・失敗の反転ペアを用いた新しいフレームワークであるOptimismBenchを導入しており、ほとんどのモデルがモデルのアーキテクチャや言語ではなく、ポストトレーニングによるアライメントに起因する「楽観的傾斜」を示すことを明らかにしている。

原著者: Seonglae Cho, Adriano Koshiyama

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Seonglae Cho, Adriano Koshiyama

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に聡明で博識な友人たちに、コイン投げの結果や、スタートアップの成功、あるいは明日雨が降るかどうかを予想してもらう場面を想像してみてください。あなたは彼らに、「これがうまくいく確率は?」と聞き、それとは別に、「これが悪くなる確率は?」と尋ねます。完璧な世界であれば、もし友人が「成功する確率は70%だ」と言ったなら、彼らは同時に「失敗する確率は30%だ」と言うべきです。この2つの数字は正確に100%になるはずです。これが確率の基本的な論理です。もしパイが丸ごと1つあるなら、あなたが食べた一切れと、後に残した一切れを合わせれば、必ずパイ全体と等しくなります。

しかし、人間はこの作業が極めて苦手です。私たちには「楽観バイアス」という認知的な欠陥があり、実際よりも物事が自分にとって良い方向に進む可能性が高く、悪い方向に進む可能性は低いと考えがちです。また、損失の痛みは利益の喜びよりもはるかに鋭く感じられるという「プロスペクト理論」もあり、リスクと報酬を不均衡に天秤にかけてしまいます。長い間、科学者たちは疑問を抱いてきました。こうした人間の癖は、人工知能にも感染しているのだろうか? もし私たちが言語モデルに未来を予測させたとき、そのモデル独自の「希望的観測」が数学的な計算を歪めてしまうのだろうか? これは重要な問題です。なぜなら、私たちは投資や医療計画の策定など、大きな意思決定を支援するためにこれらのAIモデルを使い始めているからです。もしAIが密かに楽観主義的なバイアスを持っていれば、意図しない危険なリスクを取ることにつながりかねません。

これこそが、論文「OptimismBench」が調査している内容です。研究者たちは、大規模言語モデル(LLM)が確率の判断において系統的な「偏り」を持っているかどうかを確認するための、特別なテスト環境を構築しました。彼らは単にモデルに推測させたのではありません。「反転ペア(inverted pairs)」と呼ばれる巧妙な手法を用いました。すべてのシナリオに対して、モデルに2つの質問をしたのです。「成功する確率は?」そして「失敗する確率は?」。もしモデルが完全に論理的であれば、これらの回答は常に合計100%になるはずです。しかし、もしモデルにバイアスがあれば、数字は一致しません。

結果は驚くほど明白でした。8つの主要企業から選ばれた16種類のAIモデルのうち、14のモデルが一貫して楽観的でした。彼らは成功の確率を過大評価し、失敗の確率を過小評価していました。それはまるで、グループの友人たちに天気を予想させたところ、雲が集まっているにもかかわらず、ほとんど全員が「晴れるはずだ」と言い張っているような状態でした。唯一「悲観的(悪いことが起こる可能性が高いと考える)」であったモデルは、Anthropic社による特定のモデルのみであり、しかもそれらは最も大規模で高度なモデルに限られていました。興味深いことに、彼らのより小型で軽量なモデルは、他の誰もと同じように楽観的でした。

研究では、なぜこのようなことが起こるのかについても掘り下げました。彼らは、このバイアスが単なるランダムなミスや混乱の結果ではなく、これらのモデルの学習プロセスに深く根ざした特徴であることを突き止めました。研究者が、これらのモデルの「生(raw)」のバージョン(役に立つアシスタントとして微調整される前)と、「チャットボット」としてのバージョンを比較したところ、学習プロセス自体がバイアスの方向性を変えていることが分かりました。あるモデルの系統では、学習によって楽観的になり、別の系統では悲観的になるという現象が見られました。これは、AIのバイアスの「性格」が、人間との話し方を教えるために使われる特定のレシピによって決定されることを示唆しています。

また、研究者たちは、このバイアスが質問の仕方のトリックなのか、あるいは単にAIに対して「おい、あまり楽観的になりすぎるな!」と伝えるだけで修正できるものなのかも検証しました。彼らは、温度設定(temperature settings)を変えたり、視点を変えて質問したり(例:「あなた」対「あなたの友人」)、指示の中に警告ラベルを追加したりといった試みを行いました。しかし、こうした表面的な修正策はどれも効果がありませんでした。バイアスは頑固に残っており、それが一時的な混乱ではなく、モデルの内部論理の根本的な部分であることを証明していました。

おそらく最も衝撃的な発見は、言語よりも「モデル」の方がはるかに重要であったことです。研究者たちは10種類の異なる言語でこれらのモデルをテストしました。その結果、2つのモデル間のバイアスの差は、同じモデルが異なる言語を話す場合のバイアスの差よりも、5倍近く大きいことが判明しました。言い換えれば、AIが楽観的か悲観的かは、そのAIが英語、中国語、あるいはスペイン語を話しているかではなく、「どのAIを使用しているか」に依存するのです。

要約すると、この論文は、私たちのAIツールは中立な計算機ではないことを明らかにしています。それらは、リスクと報酬に対する認識を歪ませる可能性のある、隠れた「方向性のあるバイアス」を抱えています。ほとんどのモデルは、未来に対して明るく楽観的な見方をする傾向がありますが、これは普遍的なルールではありません。それは、誰がそのモデルを構築し、どのように学習させたかに大きく依存します。著者たちは、もし私たちがこれらのモデルを意思決定の支援に用いるのであれば、その「直感」が系統的に偏っている可能性があることを自覚すべきであり、AIが世界を明晰に見ていると単純に仮定することはできないと警告しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →