Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers
本論文は、EvoPromptのような既存のオプティマイザの性能を、プロンプト設計戦略を効果的に選択・適用するための明示的なバンディットベースのメカニズム(具体的にはトンプソン抽出)を実装することによって向上させるプロンプト最適化フレームワークであるOPTSを紹介するものであり、それによって暗黙的な戦略選択に依存する手法を凌駕するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いが時々頑固なロボット(大規模言語モデル)に、難しいパズルを解く方法を教えようとしていると想像してください。あなたはロボットに「プロンプト」と呼ばれる指示を与えます。指示が曖昧だと、ロボットは混乱してしまいます。もし指示が完璧であれば、ロボットは即座にパズルを解きます。
長い間、人間はこれらの完璧な指示を手作業で書こうとしたり、あるいは、指示がよりうまく機能するようにコンピュータプログラムを使って自動的に調整したりしてきました。これは**プロンプト最適化(Prompt Optimization)**と呼ばれます。
しかし、問題があります。これらの自動プログラムは、機能的な指示を作成することはできても、人間の専門家が使うような「秘伝の隠し味」を欠いていることが多いのです。彼らは、「ステップバイステップで考える」や「専門家として振る舞う」といった、実証済みのテクニックを見落としてしまいます。
問題点:ロボットの下手な推測ゲーム
最近、APETというツールがこれを解決しようと試みました。このツールは、ロボットに「設計戦略」のメニュー(料理の技法メニューのようなもの:塩を加える、細かく刻む、弱火で煮込むなど)を与えました。ロボットはそのメニューを見て、特定のパズルに対してどのテクニックを使うべきかを判断することになっていました。
しかし、この論文では、ロボットにこの選択をさせることは、疲れ切ったシェフに「どのスパイスが焦げたスープを救うか」を推測させるようなものだと主張しています。ロボットはしばしば推測を誤り、指示を実際には悪化させてしまう戦略を選んでしまいます。これは**暗黙的(implicit)**な選択(ロボットがなんとなく「このテクニックを使うべきだ」と感じるもの)であり、あまり上手くいきません。
解決策:OPTS(スマートなソムリエ)
著者らは、新しい手法であるOPTS(Optimizing Prompts with sTrategy Selection)を紹介しています。
ロボットに推測させる代わりに、OPTSはスマートなソムリエ(ワインの専門家)や、運試しを行うカジノのマネージャーのように振る舞います。その仕組みを、簡単な比喩を使って説明します。
想像してみてください。あなたの前には一列のスロットマシン(研究者はこれを「アーム」と呼んでいます)があります。
- マシン1: 指示に「ステップバイステップで考える」を加える。
- マシン2: ロボットに「問題をもう一度読み直す」よう伝える。
- マシン3: ロボットに「数学の専門家として振る舞う」よう伝える。
- マシンK+1: 何もしない(指示をそのままの状態に保つ)。
古い手法(APET)では、ロボットは単にランダムに、あるいは直感に基づいてレバーを引いていました。
新しいOPTS手法では、システムは**トンプソン・サンプリング(Thompson Sampling)**と呼ばれる数学的な戦略を使用します。これは、スコアカードを付けている「賢いギャンブラー」のようなものです。
- システムはマシン(戦略)を試します。
- もしロボットがパズルをより良く解いたなら、システムはそのマシンに「親指を立てる(合格)」を与え、次回選ばれる可能性を高めます。
- もし失敗したなら、システムはそのマシンに「親指を下に向ける(不合格)」を与え、それを選ばないようにします。
- 決定的なのは、「何もしない」マシンも保持していることです。もし全てのテクニックが状況を悪化させているなら、システムは指示をそのままにしておくことを学習します。
彼らが発見したこと
研究者たちは、2つの異なるロボット(LLM)を用いて、非常に難しい論理および推論パズル(BIG-Bench Hardと呼ばれます)のセットでテストを行いました。
- 結果: この「賢いギャンブラー」のアプローチを用いて正しい戦略を選択することで、システムはロボット自身ができるよりもはるかに優れた指示を作成しました。
- チャンピオン: トンプソン・サンプリング(賢いギャンブラー)の手法が明確な勝者でした。これは、プロンプト最適化のパフォーマンスを、タスクによっては最大**50%**向上させました。
- 比較: ロボットがどのテクニックを使うべきか推測する古い手法(APET)は、実は戦略をランダムに選ぶよりも成績が悪かったのです。これは、ロボットはどのテクニックを使うべきか「推測」するのは苦手ですが、私たちがどのテクニックを使うべきかを「指示」すれば、それに従うことは非常に得意であることを証明しています。
まとめ
この論文は、すべてのAIの問題を解決したとか、医療診断にすぐに使えるレベルに達したと主張しているわけではありません。単に、AIに話し方を教える際、どの教え方を使うべきかをAI自身に推測させるのではなく、トンプソン・サンプリングのようなデータ駆動型のスマートなシステムを使用して、最適な教え方のテクニックを明示的に選択すべきであることを示しています。これは、特定の試合状況に合わせて適切なプレーを選ぶコーチのようなものです。
この「スマートなコーチ」のコードは、他の人々が利用できるように公開されています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。