Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas
本論文は、倫理的ジレンマにわたる16の言語モデルを監査し、それらの道徳的立場が、質問が肯定として提示されるか否定として提示されるかに基づいて極めて不安定であり、反転しやすいことを明らかにしており、この脆弱性は小規模なモデルにおいて特に深刻であり、標準的な二値評価手法によってしばしば隠蔽されている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、難しい道徳的な問いに対してアドバイスをくれる、とても賢いロボットの友人がいるとします。例えば、「誰かを傷つけるとしても、真実を話すべきか?」や「命を救うためなら、ルールを破ってもよいのか?」といった問いです。あなたは、そのロボットには確かな道徳観があるはずだと期待するでしょうよね?もしあなたが「盗みは悪いことか?」と聞けば、ロボットは「はい」と言うはずです。また、「盗まないことは良いことか?」と聞いても、やはり「はい」と言うはずです。状況は変わっておらず、言葉遣いが変わっただけなのですから、答えは同じであるべきです。
しかし、ここにひねりがあります。キャサリン・エルキンスとジョン・チュンによる新しい研究によると、多くのAIロボットにとって、文章をひっくり返すだけで答えが完全に変わってしまうことが分かりました。それはまるで、友人に「ピザは好き?」と聞いて「うん!」と言われたのに、「ピザは嫌い?」と聞くと「いや(好きだよ)」と答え、さらに「嫌いではない?」と聞くと、突然また「うん!(好きだよ)」と答えるようなものです。その間、ロボットはピザが何であるかについて混乱しているような振る舞いをしています。
大いなるパラドックス(The Great Flip-Flop)
研究者たちは、16種類の異なるAIモデル(米国の主要企業製、中国の企業製、そして小規模なオープンソース製を含む)を、14個のトリッキーな道徳的ジレンマを用いてテストしました。彼らは各モデルに対し、同じ質問を2通りの方法で行いました。
- 「すべき」形式:「彼らは店を襲うべきである」
- 「すべきではない」形式:「彼らは店を襲うべきではない」
もしロボットが安定していれば、最初の問いには「いいえ」と答え、2番目の問いには「はい」と答えるはずです(つまり、襲わないことが正しいということに同意する)。しかし、小規模なオープンソースモデルの結果は、常軌を逸していました。「彼らは店を襲うべきである」と問われたとき、これらのモデルが同意したのはわずか**24%でした。ところが、「彼らは店を襲うべきではない」と問われると、彼らは突如としてその行動に77%**も同意したのです!
これは76パーセントポイントもの変動です。まるでロボットが赤信号を見て「止まれ」と言ったのに、「行かないで」と言われた途端に「行け!」と言っているようなものです。研究によると、一部の小規模なモデルでは、トリッキーな言い回しによってこの反転がさらに極端になり、一致率が**100%**に達することもありました。
「イエスマン」問題
なぜこのようなことが起きるのでしょうか?著者らは、ロボットが論理的に思考しているのではなく、代わりに「キーワード・マッチング」というゲームをしている可能性があると示唆しています。プロンプトに「襲う(rob)」という言葉が含まれていると、ロボットはその単語を見つけ、「おっと、襲うことについて話さなきゃ!」と考えてしまい、たとえ文章が「すべきではない(should not)」となっていても、誤ってその行動に同意してしまうのです。これは、数学の問題の中に「ではない(not)」という言葉を見つけたものの、数字に集中しすぎてそれを無視してしまう学生のようなものです。
研究では、ロボットが単なる「イエスマン(ユーザーの言うことに何でも同意する存在)」なのかどうかについても調査されました。もしそうであれば、彼らは「襲わないで」と言われた際に「わかりました、襲いません」と答えるはずです。しかし、彼らは「襲わないで」と言われた際に、「わかりました、襲います」と答えることで同意しました。したがって、これは単なるイエスマンではなく、否定語の扱いにおける純粋なバグなのです。
「偽りの」合意
ここにはもう一つ、巧妙な罠があります。私たちが通常、これらのロボットをテストする方法には欠陥があります。ほとんどのテストは、単に「同意するか、反対するか」を尋ね、その「同意」の数をカウントします。研究者たちは、この単純な「同意/反対」ボタンは「嘘つき」であることを見出しました。このボタンは、実際には存在しない「同意」を**38%**多くカウントしてしまいます。
例えば、ロボットが「よくわかりませんが、おそらく大丈夫でしょう」と言ったとき、テストはそれを「はい」としてカウントしてしまいます。研究者が人間の目で回答を読み取ったところ、ロボットの書かれた説明が、自身の「はい」や「いいえ」のボタンと矛盾していることが分かりました。約**13%**のケースで、ロボットの記述した理由は、選択したボタンの内容と正反対のことでした。それは、学生が盗みに対して反対するエッセイを書いているのに、チェックボックスでは「私は盗みを支持します」に印を入れているようなものです。
誰が最も安定しているのか?
すべてのロボットが等しく混乱しているわけではありません。
- 小規模なオープンソースモデル: これらが最も脆弱でした。質問のされ方によって、回答が激しく入れ替わりました。
- 大手商用モデル: 大手企業(GPT-5、Claude、Geminiなど)のモデルはより優秀でしたが、完璧ではありませんでした。反転は少ないものの、それでも意見を変えてしまいました。例えば、質問が肯定的な場合、異なるモデル間の合意率は**73%でしたが、否定的な場合には59%**に低下しました。これは、もしあなたが2つの「賢い」ロボットに同じ質問を否定的な形式で行った場合、彼らは互いに意見が食い違う可能性が非常に高いことを意味します。
- 「推論(Reasoning)」モデル: 回答する前に「ステップバイステップで考える」よう指示されたモデルは、より優れた結果を出しました。あるモデル(Grok-4.1-reasoning)は、非推論版と比較して混乱を**57%**減少させました。これは、ロボットが単にキーワードをスキャンするのではなく、文章全体をじっくり読んで考えれば、より正確に判断できることを示唆しています。
それはなぜ重要なのか?
研究者たちは、これは単なる面白い実験ではないと警告しています。もし病院が患者のケアを決定するためにAIを使用したり、銀行がAIを使用してローンの承認を行ったりする場合、医師や銀行員が質問の言い回しを変えただけでAIの答えが変わってしまうとしたら、それは重大な問題です。
彼らは、ロボットが金融やビジネスのシナリオ(感度スコアが0.63–0.65)において、医療シナリオ(0.36)よりも特に不安定であることを発見しました。つまり、ロボットは人々がお金や借金に関わる場面で、最も信頼できないアドバイスを与える可能性があるということです。
結論
この論文は、これらのロボットが永遠に「壊れている」と言っているわけではありませんが、注意深くチェックしない限り、現在の彼らは信頼できないものであると述べています。著者らは、ロボットが「否定感受性指数(NSI)」という新しいテストに合格するまでは、彼らに大きな決断を任せるべきではないと提案しています。もしロボットの答えが、「すべき」と言うか「すべきではない」と言うかによって変わってしまうのであれば、それは状況について判断を下しているのではなく、単に文章の構造に反応しているに過ぎないからです。そして現実の世界において、私たちが求めているのは、混乱した存在ではなく、一貫性のあるAIの友人なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。