← 最新の論文
💬 NLP

SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding

本論文は、ベースモデルのチューニングを必要とせずに、候補の再ランキングを行うためのトークンレベルの遵守スコアを生成するようにクロスアテンション報酬ヘッドを学習させることで、システムプロンプトに対する大規模言語モデルの遵守性を向上させるデコーディング時のフレームワークであるSyRuPを導入する。

原著者: Seoyeon Kim, Minjae Kang, Jaehyung Kim

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Seoyeon Kim, Minjae Kang, Jaehyung Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢く、あらゆる本を読み尽くした、図書館にあるほぼすべての本を読んだことのある、非常にスマートなロボット(大規模言語モデル:LLM)に話しかけていると想像してください。通常、あなたが質問をすると、そのロボットは学習内容に基づいて回答します。しかし、時には会話を始める前に、特定のルールを提示したいことがあります。例えば、「不機嫌な海賊のように振る舞って」とか、「韻を踏んで答えて」とか、「暴力的な表現は一切しないで」といった具合です。これらのルールは「システムプロンプト」と呼ばれます。これらは、ロボットに与える職務記述書や、特定の会話のために着せる衣装のようなものです。

問題は、これらのロボットは、会話の「中」に現れる指示に従うことには慣れていますが、チャットの前に固定されたルールに従うことには慣れていないという点です。ルールが複雑になると(例:「海賊になりつつ、19世紀の文法を使い、文字『e』を避け、かつ面白くすること」)、ロボットは途中でルールを忘れてしまうことがよくあります。海賊のように話し始めていたのに、突然現代のティーンエイジャーに切り替わったり、「e」を避けるというルールを忘れてしまったりするのです。科学者たちは、ロボットを再学習させることで解決しようとしましたが、それはコストがかかり時間がかかります。あるいは、回答がすでに書かれた後に最適な答えを推測しようとしましたが、これはこれは小説の著者が書き終えた後に編集を行うようなものです。大きな疑問は、「AIの脳を作り変えたり、書き終わるまで待ったりすることなく、ロボлоットが書いている最中に、これらの複雑なルールに従うよう導くことはできるのか?」ということです。

ここで、SYRUPと呼ばれる新しい手法が登場します。ロボットの脳を、私たちは並べ替えることが許されていない、巨大で凍結された図書館だと考えてください。SYRUPは、ロボットが書いている間、すぐ隣に立っている超スマートで小さな司書のようなものです。ロボットが次に言う言葉を一つ選ぶたびに、この司書は2つのことをチェックします。「この言葉は物語に合っているか?」そして「この言葉は海賊の衣装に合っているか?」です。

これが実際にどのように機能するかを見てみましょう。ロボットには、次に言うべきお気に入りの言葉のトップ10リストがあります。通常、ロボットは単に1番目の最もお気に入りの言葉を選びます。しかし、SYRUPが介入します。それは、「システムプロンプト(海賊の衣装)」を、独立した特別なメモリーカードとして扱います。そして、**クロスアテンション・リワードヘッド(cross-attention reward head)**という特殊なツールを使用して、ロボットの現在の思考に対して、「ねえ、もしこの言葉を言ったら、海賊の雰囲気と一致するか?」と問いかけます。すると、司書はトップ10の言葉それぞれにスコアを付けます。もしロボットが「Hello」と言おうとしている一方で、海賊の衣装が「Ahoy」を求めている場合、司書は「Ahoy」のスコアを上げ、「Hello」のスコアを下げます。そして、ロボットは最も高い合計スコアを持つ言葉を選びます。

論文は、このアプローチが従来の方法よりもはるかに優れていることを示唆しています。研究者たちは3つの異なるロボットの脳でSYRUPをテストし、SYRUPが、より優れたプロンプトを与えたり、回答が書かれた後に再ランク付けを行ったりする方法よりも、一貫して複雑なルールに従うのを助けることを発見しました。実際、あるテストでは、SYRUPは次点の優れた手法と比較して、ロボットのパフォーマンスを約5.6%向上させました。これは小さく聞こえるかもしれませんが、AIの世界では、これは巨大な飛躍です。

また、論文は他のいくつかのアイデアについても否定しています。ルールをメインの会話テキストの中に混ぜる(例えば、ユーザーの質問の中に海賊の指示を隠すようなこと)だけでは不十分であることを示しています。ロボットがルールを本当に守るためには、ルールを別個の明確なメモリとして扱う必要があります。また、ゼロからロボットを再学習させることでルール遵守を向上させることは可能ですが、それには膨大な時間と費用がかかることも分かりました。SYRUPは「デコーディング・タイム(生成時)」の手法であり、つまり、元の脳を凍結したまま、軽量なアドオンのみを訓練しながら、ロボットが考えている最中に機能します。

興味深いことに、研究者たちは、SY-RUPがまだ見たことのないルールに対しても機能することを発見しました。彼らは一つの複雑な指示セットでトレーニングを行い、その後、全く異なるルール(厳格なフォーマット指定や単語数制限など)でテストしましたが、それでも良好なパフォーマンスを示しました。これは、この手法が単に特定の答えを暗記させるのではなく、「上司の言うことを聞く」という一般的なスキルをロボットに教えていることを示唆しています。

しかし、論文はこれがすべてを解決する魔法の杖ではないことにも注意を払っています。この手法は、司書が言葉をチェックする必要があるため、ロボットの思考プロセスにわずかな追加時間を要します。しかし、著者らは、同じことをしようとする他の複雑な手法と比較すれば、このコストは非常に小さいと述べています。また、「ルール遵守」を強く押し込みすぎると、ロボットが奇妙だったり不自然になったりする可能性があるため、バランスが必要であるとも警告しています。

要約すると、SYRUPは、ロボットの脳全体を再学習させることなく複雑なルールに従わせたい場合、単にロボットがそれを覚えていることを期待するのではなく、代わりに、リアルタイムで動作する専用のガイドを与えるべきであることを示唆しています。そのガイドは、言葉の一つひとつをルールと照らし合わせてチェックし、最終的な物語が、最初から着ていた衣装に忠実であることを保証するのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →