← 最新の論文
📊 statistics

Why is prompting hard? Understanding prompts on binary sequence predictors

本論文は、シーケンス予測器における最適な条件付け系列の探索としてプロンプトングの課題を定式化し、統制実験と最先端モデルの分析を通じて、最適なプロンプトは直感的ではなく、網羅的探索を用いても特定が困難であり、標準的なデモンストレーションベースの手法を用いる場合には頻繁に最適解から外れることを明らかにする。

原著者: Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Li Kevin Wenliang, Anian Ruoss, Jordi Grau-Moya, Marcus Hutter, Tim Genewein

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。超賢く、高度に訓練されたオウムがあなたの手元にあると。このオウムは数百万冊の本を読み、無数の映画を観て、かつて作られたすべてのラジオ番組を聴いてきました。誰よりも文脈の次の単語を予測する方法を知っています。これがあなたのAI モデルです。

さて、あなたはこのオウムに特定の芸をさせたいとします:冗談を言わせる、悲しい詩を書かせる、あるいは数学の問題を解かせる。そのためには、プロンプト(指示や例をいくつかの言葉で与えること)によって、それを開始させます。

この論文は、シンプルながら深遠な問いを投げかけます:なぜ、オウムに与える完璧な言葉を見つけるのがこれほど難しいのか? 時には、最も効果的な指示は、人間から見れば完全に奇妙で、 nonsensical(意味不明)で、あるいは「誤り」に見えることがあります。なぜ、意味不明に見えるプロンプトが、明確で論理的な指示よりもうまく機能するのでしょうか?

著者たちは推測を止め、実験を開始することにしました。オウムの脳内で実際に何が起きているかを理解するために、彼らは小さく制御された世界を構築しました。

実験:硬貨の表裏オウム

彼らは、実際の複雑な AI の代わりに、「表」「裏」(硬貨の裏表)しか理解しない単純な「オウム」を作成しました。

  • 訓練: 彼らは、このオウムに数千回の硬貨の裏表を見せることで教えました。しかし、ここには注意点があります。彼らは公平な硬貨だけでなく、さまざまな偏りを持つ硬貨を見せました。ある硬貨は 20% の確率で表、別の硬貨は 90% の確率で表、さらにいくつかは両者の混合でした。オウムは、訓練で見せたパターンに基づいて次の裏表を推測することを学びました。
  • タスク: 彼らは、オウムが 70% の確率で表になる特定の硬貨のように振る舞うことを望みました。彼らは問いかけました:「オウムが 70% の確率で表を推測し始めるように、オウムに見せるべき表と裏の最適な順序は何か?」

大きな驚き:「誤った」プロンプトが最善である

70% の表を推測させるオウムを教える最良の方法は、70% の表と 30% の裏の長いリストを見せることだと考えるかもしれません。それは論理的に思えますよね?

しかし、この論文は、それがしばしば誤りであることを発見しました。

多くの場合、最適なプロンプト(実際に最も効果的に機能するもの)は、タスクとは何ら似ていない順序でした。

  • 比喩: 静かな図書館で勉強することに慣れた学生に、騒がしいカフェテリアで勉強させることを想像してください。騒がしいカフェテリアの録音を聞かせることが、彼らを準備させる最良の方法だと考えるかもしれません。しかし、この論文は、彼らを準備させる最良の方法が、脳を騒音に期待させるように微妙に仕向ける沈黙の順序を見せることであると発見しました。
  • 現実: 「最良」のプロンプトは、完全にオウムがどのように訓練されたか(その事前学習分布)に依存します。オウムが特定の硬貨の偏りの混合で訓練された場合、特定の振る舞いを引き出すための「魔法の言葉」は、すべて表の順序であったり、10 回の表と 2 回の裏の奇妙な混合であったりするかもしれません。人間がタスクだけを見ていれば、これは間違いに見えるでしょう。しかし、オウムにとっては、正しい振る舞いを解き放つ完璧な鍵なのです。

なぜこれほど解明するのが難しいのか?

この論文は、「魔法の言葉」を見つけることが悪夢となる 3 つの主な理由を浮き彫りにしています。

1. 「隠されたレシピ」の問題
オウムの振る舞いは、通常私たちが知らない秘密の「レシピ」(事前学習分布)によって形作られています。

  • 比喩: 特定の放送局にラジオをチューニングしようとしていると想像してください。その放送局がどのような音なのか分からず、ラジオがどのように作られたかも分かりません。あなたはダイヤルを回すだけです。時には、「明白な」場所にダイヤルを回してもノイズしか聞こえません。クリアな音を得るには、奇妙でランダムな場所にダイヤルを回さなければなりません。ラジオの内部配線が分からない限り、なぜその奇妙な場所が機能するのかを説明することはできません。

2. 「平坦な地形」の問題
著者たちは、最良のプロンプトを探すことを、丘陵地帯を歩くことに例えました。

  • 比喩: あなたは最高峰(最良のプロンプト)を探しています。完璧な世界では、1 つの鋭い山頂があり、見つけるのは簡単です。しかし、この論文の実験では、「地形」はしばしば平坦な高原です。ほぼ同等に優れた数百もの異なるプロンプトが存在します。
  • 結果: 少量のデータ(小さなテストバッチなど)を使用して最良のプロンプトを見つけようとすると、実際には真の最良のものとは異なる「十分な良い」プロンプトを偶然選んでしまう可能性があります。わずかに異なるバッチでテストを再度実行すると、異なる「十分な良い」プロンプトを選ぶかもしれません。これにより、結果は信頼性が低く、解釈が困難になります。

3. 「専門家デモ」の罠
AI を教える一般的な方法は、タスクを実行する専門家の例を見せることです(例:「これがチェスのグランドマスターの遊び方です」)。

  • 発見: この論文は、専門家の例を見せることは、奇妙で最適化されたプロンプトを使用するよりも効果的でないことが多いことを示しました。
  • 比喩: ロボットにチェスを完璧にプレイさせたいと想像してください。グランドマスターがプレイした 100 試合を見せることができます。あるいは、そのロボットの脳を「グランドマスターモード」に強制する奇妙で短いコードを与えることもできます。この論文は、その奇妙なコードが、100 試合よりもよく機能することを発見しました。専門家の例はあまりにも「典型的」であり、ロボットの特定の訓練バイアスを考慮していません。

実際の AI(チャットボットなど)ではどうなるのか?

著者たちは、映画レビューを使用して、実際の大規模言語モデル(GPT-2 や Gemma など)でこれらのアイデアをテストしました。

  • 彼らは同じパターンを発見しました。「肯定的」なレビューを生成するための最良のプロンプトは、常に肯定的に聞こえる言葉とは限りませんでした。時には、何らかの形で正しい反応を引き起こす、短く、奇妙で、あるいは否定的に聞こえる言葉でした。
  • また、最良のプロンプトを確実に見つけるためには、人々が通常使用する小さなバッチ(約 200 件)ではなく、膨大な量のデータ(数千件の例)が必要であることも発見しました。小さなバッチでは、単に推測しているに過ぎません。

結論

この論文は、プロンプト作成が難しいのは、AI の完全な履歴を知らずに機械を操ろうとしているからだと結論付けています。

  • 「最良」のプロンプトは相対的である: 普遍的な「最良」のプロンプトは存在しません。最良のプロンプトは、AI の訓練データの特定の隠れたバイアスに依存します。
  • 直感は失敗する: 人間にとって論理的に見えること(AI に望むものを見せること)は、AI の内部的な「数学」を考慮していないため、しばしば失敗します。
  • 信頼性は低い: 網羅的に検索し、巨大なデータセットを使用しない限り、見つけたプロンプトは、一貫して機能しない幸運な推測である可能性があります。

要約すれば、この論文は、プロンプト作成の「魔法」は、単に良い指示を書くことではなく、私たちにとって完全に直感に反するように見える方法で、AI の隠れた統計的バイアスをハッキングすることにあると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →