The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment
本論文は、大規模言語モデルの道徳的判断における一見した「はい・いいえバイアス」は、倫理的推論の変化ではなく、回答の順序や語彙的な表現によって引き起こされる表層的な副産物であり、論理的な判定と表層的なフォーマットを分離した心理測定バッテリーを用いてモデルを評価した場合には消失することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いロボットの道徳的な指針(モラル・コンパス)を理解しようとしていると想像してください。あなたは難しい質問を投げかけます。「1人を犠牲にして5人を救うことは許されるか?」
もしあなたがロボットに「はい」か「いいえ」で答えなさいと尋ねたら、まるでロボットが強い意見を持っているかのように見えるかもしれません。しかし、この論文はある驚くべきトリックを明らかにしています。ロボットの答えは、それが何を正しいと考えているかよりも、むしろ「どのように質問されたか」に左右されていることが多いのです。
以下に、研究者が発見したことを、簡単な比喩を用いて解説します。
1. ロボットには秘密の「道徳的スケール」がある
まず、研究者はロボットが実際に一貫した価値観を持っているのか、それとも単に推測しているだけなのかを知りたいと考えました。
これを知るために、彼らは単にロボットに「はい」か「いいえ」と聞いたのではありません。代わりに、同じ20個の道徳的ジレンマを、48通りの異なる方法で問いかけました。スケールを変え(0〜10、または0〜100)、言い回しを反転させ、どの選択肢を先に評価させるかを変更しました。
発見: 表面的な部分を除いて見てみると、ロボットの「内なる声」は実は非常に一貫しています。それは安定した道徳的スケールを持っています。ある形式において、ある行動を「ほとんど悪い」と考えているなら、別の形式においても、おそらく「ほとんど悪い」と考えるはずです。最も賢いモデル(「フロンティア」モデル)は、その内部論理において驚くほど一貫しています。
2. 「はい/いいえ」の罠:最後の言葉の魔法
では、ロボットが一貫した内なる声を持っているのなら、なぜ質問の言い回しを変えるだけで「はい/いいえ」の答えがこれほど激しく変わってしまうのでしょうか?
研究者は、「はい/いいえ」という形式が歪んだレンズとして機能していることを発見しました。強制的に「はい」か「いいえ」を選ばされると、ロボットは2つの特定のトリックによって混乱してしまいます。
- 「最後の言葉」バイアス(順序バイアス): 人間は通常、最初に読んだものに注意を払います。しかし、これらのロボットは、最後に読んだものに対して特に注意を払うようです。もし「答え:いいえ、はい」と書けば、ロボットは単に「はい」が最後にあるからという理由で「はい」を選びやすくなります。「答え:はい、いいえ」と書けば、「いいえ」に傾きます。
- 「いいえ」の磁石(語彙バイアス): ロボットは「いいえ」という特定の単語に対して奇妙な引力を感じているようです。それは必ずしも論理的に拒絶しているのではなく、単にページ上のその特定の単語に引き寄せられているのです。
比喩: テストを受けている人が、カードに答えが印刷されている場面を想像してください。
- 人間: 質問を読み、答えについて考え、正しいものを選ぶ。
- ロボット: 質問を読み、答えについて考えるが、その後、カードの底に「いいえ」という言葉が太字で印刷されていることや、「はい」が最後に見える単語であることに気を取られてしまう。そして、言葉の意味ではなく、その言葉が「どこにあるか」に基づいて答えを選ぶ。
3. 「いいえ」バイアスは「拒絶」についての問題ではない
これらのロボットは本質的に「否定的」あるいは「悲観的」であり、すべてに対して「いいえ」と言いたがっているのだ、という共通の仮定がありました。
発見: これは間違いです。研究者は言葉を入れ替えることでこれを証明しました。ロボットに「はい、いいえ」ではなく、「選択肢A」か「選択肢B」のどちらかを選ばせました。
これを行ったところ、「いいえ」バイアスは消え去りました。ロボットが突然「はい」と答えるようになったわけではなく、単に「いいえ」という言葉に引き寄せられなくなっただけでした。
- 結論: ロボットは物事を「拒絶すること」に対してバイアスを持っているわけではありません。物事の「表面的な外観」に対してバイアスを持っているのです。ロボットは論理的な判断に従うのではなく、印刷されたラベルに従っています。
4. 深く考えることは助けになる(が、すべてを解決するわけではない)
研究者は、ロボットに答える前に「ステップ・バイ・ステップで考える」ように指示した場合(これは「熟考(デリバレーション)」と呼ばれるプロセスです)、何が起こるかをテストしました。
発見: ロボットが時間をかけて考えるとき、「はい/いいえ」のバイアスは小さくなります。ロボットは言葉の順序や「いいえ」という特定の単語による注意散漫を起こしにくくなります。しかし、すべてのモデルにおいてバイアスが完全に消えるわけではありません。一部のモデル(「Claude」ファミリーなど)は、深く考えている時であっても、依然として最後の選択肢や「いいえ」という言葉への強い引き寄せを示します。
5. 「小さな」ロボットは異なる
研究は、より小規模なオープンソースのモデルについても調査しました。これらのモデルはもっと無秩序でした。彼らには一貫した内部の道徳的スケールが全くありませんでした。彼らの答えは質問の形式によって激しく飛び回り、長く「考えて」も改善されませんでした。彼らは本質的に、質問の表面に基づいて推測しているだけでした。
大きな教訓
AIが真に何を価値と考えているかを知りたいなら、一度「はい/いいえ」と聞くだけでは不十分です。
- 問題点: 単一の「はい/いいえ」の質問は、ロボットの実際の意見と、「フォーマット・アーティファクト(質問の書き方によって生じるグリッチ)」を混ぜ合わせてしまいます。
- 解決策: AIの真の道徳的立場を測定するには、同じ質問を多くの異なる方法で問い(フレームを交差させ)、その結果を平均化する必要があります。これにより、「最後の言葉」や「『いいえ』という言葉」による注意散漫を打ち消し、ロボットの真の、一貫したスケールを明らかにすることができます。
要約すると: ロボットは必ずしも「ノー(いいえ)」と言う人ではありません。単に、フォントや順序、そしてページ上の最後の言葉に簡単に気を取られてしまう人なのです。ページを整えれば、その真の意見が浮かび上がってきます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。