Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models
本論文は、合成コーパス「Book of Veyra」を用いた5つのモデルに対する制御された評価を提示しており、形式に関わらずルールの数が80を超えると指示への遵守が崩壊すること、また長文コンテキストにおける性能は、ハルシネーションではなく急激な想起能力の低下と拒絶率によって特徴付けられること、そしてマークダウン形式がプレーンテキストに対して一貫した優位性を持たないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、賢いロボットに仕事のやり方を教えようとしていると想像してください。あなたには、ロボットをより良く働かせるための、いくつかの「レバー」があります。一つのレバーは「フォーマット(形式)」です。指示を整ったリストとして書くことも、退屈な段落として書くことも、豪華な表にすることも、あるいはただのプレーンテキストにすることもできます。もう一つのレバーは「スケール(規模)」です。一度にどれだけの指示を与えるか、そして作業中にどれほど膨大な背景情報(巨大な本のようなもの)を覚えておく必要があるか、ということです。長い間、人々はどの書き方が最適かについて議論してきました。彼らは、ルールをどれほど多く追加しても、あるいは本がどれほど厚くなっても、ロボットはそれを完璧に理解すると想定していました。しかし、人工知能、特に物語を書いたり質問に答えたりする大規模言語モデル(LLM)の世界では、これらのレバーは単独では機能しないのではないかという疑念が高まっています。もし、あまりに多くのルールを与えすぎたり、覚えさせる情報を増やしすぎたりすると、指示のスタイルは突然重要性を失ったり、あるいは最悪の場合、奇妙な形で壊れ始めてしまうかもしれません。この論文は、シンプルだがトリッキーな問いを投げかけます。「指示のフォーマットを変えることは、本当に役に立つのだろうか? それとも、タスクが巨大になると、その形式はノイズの中に消えてしまうのだろうか?」
この研究の背後にいる研究者たち(Machine Human Intelligence LabのNetanel Eliav氏)は、推測をやめてテストを行うことにしました。彼らは「ヴェイラの書(Book of Veyra)」という、巨大で架空の宇宙を構築しました。これは、太陽系、ギルド、奇妙な生物など、それぞれに特定の事実を持つ8,780のユニークな架空の要素を含む、巨大な架空の百科事典のようなものです。この本はインターネットからではなくコンピュータプログラムによって作成されたため、AIが事前に暗記していることはあり得ません。AIは、答えを見つけるために提供されたページを実際に読み込まなければなりません。彼らはこの同じ本を、Markdownリスト(太字の見出しと箇条書き)、プレーンテキスト(単なる言葉)、流れるような散文(物語のような形式)、そして表という4つの異なる方法で書き直しました。そして、この本を5つの異なるAIモデルの前に置き、2つの大規模な実験を行いました。
第一に、彼らは「指示への追従性(Instruction Following)」をテストしました。彼らは、短いエッセイを書く際に守るべきルールのリストをAIに与えました。最初は10個のルールから始め、一度に最大160個までルールを増やしていきました。彼らは、リストが長くなってもAIがすべてのルールを完璧に守り続けられるか、そしてルールを豪華なリスト形式で書くことが、段落形式で書くよりも役に立つのかを調べました。結果は、無残な崩壊でした。ルールがどのように書かれていようとも、リストが約80個に達すると、AIがすべてを完璧にこなす能力はゼロにまで落ち込みました。ルールが表であってもリストであっても関係ありませんでした。AIはすべてを正しく行うことを諦めてしまったのです。驚くべきことに、ルールをどこに置くかが、見た目よりも重要でした。ルールを「システムプロンプト」(ロボットの隠れた脳の指示)に置くか、「ユーザーターン」(チャットメッセージ)に置くかで、結果は大きく変わりましたが、その影響はロボットによって異なりました。モデルによっては、チャット内にルールを置くことが助けになるものもあれば、逆に妨げになるものもありました。普遍的な「最善の場所」は存在しませんでした。
第二に、彼らは「ヴェイラの書」を用いて「記憶と誠実さ(Memory and Honesty)」をテストしました。彼らは、2,000語から膨大な512,000語までの範囲で、本の断片をAIに読み込ませました。そして、AIに特定の事実を思い出させたり、AIが誤った記述に同意するために嘘をつくかどうか(追従性/sycophancy)をチェックしたり、存在しない事実を捏造するかどうか(ハルシネーション/hallucination)を検証しました。結果は非常に興味深いものでした。約64,000語から128,000語までは、フォーマットに関係なく、AIはすべてを完璧に覚えていました。しかし、その閾値を超えると、事態は混乱しました。精度は単に徐々に衰えたのではなく、崩壊しました。そして、その「崩壊の仕方」は、フォーマットと特定のAIモデルに完全に依存していました。あるモデルでは、128k語においてプレーンテキストは最悪でしたが、リストや表は非常にうまく機能しました。別のモデルでは、その逆でした。唯一の「最善のフォーマット」は存在しませんでした。
ここでの最大の驚きは、本の量が増えるにつれて、AIが嘘をついたり、誤った記述に同意したりする頻度が高まるわけではなかった、ということです。実際、事実を捏造する割合はゼロであり、嘘に同意することも非常に低いままでした。代わりに、AIは全く別のことをしていました。それは「回答を拒否すること」です。本がモデルのメモリ限界に近づくと、AIは単に「分かりません」や「答えられません」と言い始め、時には最大90%の割合で回答を拒否しました。AIは混乱して嘘をついていたのではなく、圧倒されてシャットダウンしていたのです。
また、この論文はコストについても調査しました。表のようなフォーマットは、プレーンテキストよりも多くの「トークン」(AIがテキストの長さを測るために使う通貨)を消費します。研究者が、消費されたトークンあたりの精度を見てスコアを調整したところ、勝者は再び変わりました。時には、見た目の精度がわずかに低かったフォーマットの方が、読むコストが安いため、実はより優れた選択肢であることもありました。
主な教訓は、「Markdownや表といった『最高のフォーマット』を一つ選んで、それが常に機能すると決めつけてはいけない」ということです。この論文は、スケール(規模)を考慮しなければ、フォーマットは無意味であることを証明しています。もし指示が多すぎる場合(約80個以上)、AIが壁に突き当たるため、フォーマットは重要ではありません。もしコンテキストが巨大すぎる場合(128k語以上)、フォーマットは非常に重要になりますが、「最善のもの」は使用しているAIモデルによって異なります。著者たちは、私たちが警戒すべき失敗モードは、AIが嘘をつくことではなく、タスクが大きくなりすぎたときにAIが諦めて回答を拒否することであると結論付けています。彼らは、誰もが自分自身でこれらの限界をテストできるように、すべてのツールと架空の「ヴェイラの書」を公開しました。なぜなら、ゲームのルールは、出会う新しいロボットごとに変わってしまうようだからです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。