← 最新の論文
🤖 AI

Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?

本論文は、指示の配置においてはシステムプロンプトが概して最も安全なデフォルトであり続ける一方で、スキーマ記述はプロンプトを上書きし得る強力かつモデル依存的な指示チャネルであり、構造化出力のパフォーマンスを最適化するためには統一されたスキーマ設計と実証的な検証が極めて重要であることを示している。

原著者: Sin-Ying Lin

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Sin-Ying Lin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが少し融通の利かないロボットに、バラバラになったおもちゃを仕分ける方法を教えようとしていると想像してください。あなたには、指示を与えるための2つの方法があります。1つは、直接ロボットに話しかける(先生が講義をするような)方法、もう1つは、箱に記入するための特別なフォームを渡し、その箱のすぐ横に指示を書き込んでおく方法です。これは「大規模言語モデル(LLedM)」の世界、つまり現代の多くのAIツールの背後にある脳の仕組みです。通常、人々は「話し言葉(プロンプト)」こそが真のルールが住む場所であり、「フォーム(構造化出力スキーマ)」はロボットが従うべき退屈なテンプレートに過ぎないと考えています。しかし最近、開発者たちは疑問に思い始めています。果たしてロボットは、フォームに書かれたメモを実際に読んでいるのでしょうか?それとも、ただ無視して先生の話だけを聞いているのでしょうか?この問いは重要です。なぜなら、もし最も重要なルールを間違った場所に置いてしまうと、ロボットはおもちゃを完全に間違った方法で仕分けてしまい、私たちが日々頼りにしているアプリやツールを壊してしまう可能性があるからです。

林(Alina)Sin-Yingという研究者は、この論争に決着をつけるために、巧妙な実験を行いました。議論する代わりに、彼女はあるゲームを設定しました。それは、ロボットが短いメッセージを4つの秘密のカテゴリーに分類するというゲームです。ロボットが現実世界の知識に基づいて答えを推測できないよう、「tomil」や「varek」といった架空の名前を使用しました。そして彼女は、指示を「椅子取りゲーム」のように動かしてみました。つまり、先生の講義(システムプロンプト)にある定義を、全く同じ内容でフォームの記述(スキーマの説明)へと移動させたり、時にはユーザーのチャットボックスの中に配置したりしたのです。

彼女が発見したのは、少し驚くべきことでした。ロボットの「耳」の大きさは、すべて同じではないのです。GPT-4.1やGPT-5.4(特別な思考モードなし)のような一部のモデルでは、先生の声が王様でした。定義をフォームに移すと、これらのロボットは混乱し、精度は約11〜13パーセントポイント低下しました。彼らは「フォームはただ記入するためのものであり、真のルールは話し言葉の中にあるのだ!」と考えているようでした。しかし、Claude Haiku 4.5のような他のモデルでは、フォームこそがボスでした。フォーム内の指示を誤ったものに変更すると、このロボットのパフォーマンスは52.5%の精度から、悲惨な7%へと急落しました。一部のロボットにとっては、フォームの上のメモがあまりに騒々しいため、先生の正しい指示をかき消してしまうことが判明したのです。

また、この論文は、フォームを無視するロボットを直すための「魔法のトリック」も発見しました。ロボットが最終的な答えを選ぶ前に、自分の「推論」を一つの箱に書き込むという強制的なステップを加えることで、パフォーマンスは15〜24パーセントポイント跳ね上がりました。まるで、ロボットに「計算過程を見せる(思考プロセスを示す)」ことを強制することで、フォームに書かれたルールに注意を払わせることができたかのようでした。

したがって、大きな教訓は、どちらか一方が常に優れているということではありません。むしろ、この論文は、すべてのロボットモデルには独自の個性があり、異なるチャンネルに対して異なる音量で耳を傾けていることを示唆しています。現時点での最も安全な策は、最も重要なルールをシステムプロンプト(先生の声)に置いておくことですが、フォームに矛盾するルールを書かないよう注意しなければなりません。さもなければ、一部のロボットは間違ったルールに従ってしまうからです。本当の教訓は、単に推測するのではなく、どの場所で最もよく耳を傾けるかを各ロボットごとにテストしなければならないということであり、時には、指示を書き直すことよりも、フォームの形を「思考ステップ」を含む形に変更することの方が、より強力な解決策になることもあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →