← 最新の論文
💬 NLP

Impact of Task Phrasing on Presumptions in Large Language Models

本研究は、タスクの表現が大型言語モデルにおける前提の形成に大きく影響し、反復囚人のジレンマのような意思決定タスクにおける適応性や論理的推論に影響を及ぼすことを示しており、安全性と信頼性を確保するために中立的な表現が不可欠であることを浮き彫りにしている。

原著者: Kenneth J. K. Ong

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Kenneth J. K. Ong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、読書量も豊富なロボットにゲームの遊び方を教える場面を想像してください。このロボットは数百万冊の書籍、記事、物語を読み漁っているため、「世界のルール」については非常に熟知しています。しかし、ここに落とし穴があります。ロボットは自分が通常目にするものを記憶するのが得意すぎるあまり、実際目の前にあるものを見なくなってしまうことがあるのです。

この論文は、まさにその問題を調査する探偵物語のようです。著者のケネス・オン氏は、ゲームのルールが変更された際、AI チャットボットの頭脳である大規模言語モデル(LLM)が自らの前提に固執してしまうかどうかを確かめたいと考えました。

ゲーム:「囚人のジレンマ」のひねり

これを検証するため、著者は古典的なゲーム理論のシナリオである「反復囚人のジレンマ」を用いました。これは警察署にいる二人の容疑者間のゲームだと考えてください。

  • 通常のルール: 両者が黙秘(協力)すれば、短い刑期で済みます。一方が他者を裏切り(裏切り)、もう一方が黙秘すれば、裏切った者は釈放され、黙秘した者は長い刑期を科されます。
  • 罠: 著者はこのゲームの「逆転版」を作成しました。このバージョンでは、報酬が入れ替わっています。つまり、相手を裏切ることは実際には自分にとってより悪い結果を招き、黙秘することが最善の一手となります。

目的は単純でした。AI が真に論理的であれば、新しいルールを見て戦略を変更するはずです。もしそれが「前提」(ゲームがどうあるべきだと考えているか)に頼っているだけなら、ルールが変わっても古いやり方で遊び続けます。

三つの実験:ロボットにどのように遊ばせたか

著者は三つの異なるテストを行い、毎回指示の書き方を変えました。

1. 「名前を挙げる」テスト(明示的な命名)

  • 設定: プロンプトには「あなたは反復囚人のジレンマをプレイしています」と明確に記され、「囚人」「協力」「裏切り」という言葉が使われていました。
  • 結果: AI は完全に失敗しました。ルールが逆転しても、AI は元のゲームと同様に「協力」(モデルによっては「裏切り」)を選び続けました。
  • 比喩: 料理人に「クラシックなビーフ・ウェリントンを作って」と言いながら、ベジタリアンシチューのレシピを渡すようなものです。料理人は「ビーフ・ウェリントン」という名前を聞いて、新しいレシピを無視し、名前が示す通りに牛肉で調理を始めてしまいます。AI はゲームの有名な名前に集中しすぎて、ページ上の実際の数値を無視していたのです。

2. 「曖昧な説明」テスト(隠された名前)

  • 設定: プロンプトから「囚人のジレンマ」という言葉は削除されましたが、「囚人」「協力」「裏切り」という言葉は残されました。
  • 結果: AI は依然として苦労しました。文脈の手がかり(刑期や特定の用語)から、それが「囚人のジレンマ」であると見抜いたようです。それでも、新しい逆転ルールではなく、訓練データに頼ってしまいました。
  • 比喩: これは「ビーフ・ウェリントン」という名前を使わずに説明するが、「パフ・ペストリーと牛肉を使った有名なイギリス料理だ」と言うようなものです。料理人はまだ何を作りたいのか理解しており、新しい指示を無視します。

3. 「中立的なコード」テスト(抽象的な変数)

  • 設定: プロンプトから「囚人」「協力」「裏切り」といった馴染みのあるものはすべて削除されました。代わりに、抽象的なラベルである「選択 X」と「選択 Y」、そして「刑期」の代わりに「ドルの損失」という言葉が用いられました。
  • 結果: 成功です! AI が有名なゲームの記憶に頼ることができない場合、実際に新しいルールを見ていました。ルールが逆転すると、AI は新しい数学に合わせて戦略を変更しました。
  • 比喩: これは料理人に料理の名前を明かさずに、材料と指示のリストを与えるようなものです。「小麦粉、バター、牛肉を混ぜる」とします。指示を「小麦粉、バター、豆腐を混ぜる」に変更すれば、料理人は料理の名前に気を取られないため、新しいリストに従います。

意外なひねり:考えることが事態を悪化させる

最も興味深い発見の一つは、「推論」に関するものでした。著者は AI に回答する前に「段階的に考えて」と指示しました。

  • 発見: 最初の二つのテストでは、AI に考えさせることが、かえってそれをより頑固にしました。AI は、ルールが変更されたという事実を完全に無視し、なぜ「チート・フォー・テイト(Tit-for-Tat)」戦略(元のゲームで有名な戦略)に従うべきかを説明する、論理的で長い段落を書き出しました。
  • 比喩: これは、数学テストの解答キーを丸暗記した学生のようです。問題の数字を変えても「解き方を示せ」と問われれば、彼らは古い答えがなぜ正しいのかを完璧で論理的に説明するかもしれませんが、問題自体が変わったことに全く気づかないでしょう。

結論

この論文は、AI モデルは特定の試験のためにやりすぎた勉強をした学生のようなものであると結論付けています。彼らは「標準的な」答えを非常に良く知っているため、質問を少し変えただけでは気づかないかもしれません。

  • 問題: 私たちが「囚人のジレンマ」のような馴染みのある名前やシナリオを使って AI にタスクを与えると、AI はあなたが与えた具体的な指示ではなく、そのシナリオに関する自らの「前提」に頼ってしまいます。
  • 解決策: AI にあなたが与えた実際のルールに従ってもらうためには、タスクを中立的で抽象的な方法で記述すべきです。そのゲームが何であるかを伝えるのではなく、ルールが何であるかを伝えるだけです。

要約すれば:AI に新しい状況に適応させたいなら、古い状況を思い起こさせないことです。「有名な名前」ではなく、「変数(X と Y)」で話しましょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →