CAPO: Constraint-Aware Prompt Optimization for LLM Agents
本論文は、安全性やフォーマットといった運用上の制約を遵守しながら、LLMエージェントシステムのタスク性能を効果的に最適化するために、適応的な制約重み付けを用いた主双対アプローチを用いる制約認識型プロンプト最適化手法であるCAPOと、基礎となるタスクエージェントを変更することなく、多様なドメインにわたって実行可能かつ高性能なプロンプトを実現するために特化したリライターを学習させる動的バリアント(DCAPO)を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、単にチャットをするためだけでなく、行動するために展開されることが増えています。これらのデジタルエージェントには、ツールの使用方法、問題の解決方法、ユーザーとの対話方法を指示する「システムプロンプト」と呼ばれる一連の指示が与えられます。航空券の予約、保険の確認、予約のキャンセルができる旅行代理店を想像してみてください。ただし、彼らは厳格な会社のルールに従わなければなりません。開発者にとっての課題は、モデルがタスクを解くことには非常に長けていても、現実世界の仕事における特定の運用要件を満たすことができない場合があることです。ツールを使いすぎたり、本来すべきでない場面で人間に助けを求めたり、レスポンスが長すぎたり、あるいは誤って安全ポリシーに違反したりすることがあります。企業がこのようなエージェントを導入する場合、単に「だいたい」上手いモデルを受け入れるだけでは不十分であり、エージェントが仕事を遂行しながらも、あらゆる要件に対して厳格な境界線内に留まっていることを保証しなければなりません。
核心的な困難は、これらの要件がしばしば相反する方向に作用することにあります。エージェントを非常に正確にするプロンプトは、冗長になったり、ツールを使いすぎたりする傾向があります。従来、開発者は各ルールの重要性を手動で調整することでこれを解決しようとしてきましたが、本質的にはどの制約が最も重要かを推測しているに過ぎません。しかし、このアプローチは脆弱です。あるタスクや特定のモデルに適した設定であっても、状況が変わると機能しなくなることがよくあります。もしルールが事前に固定されていると、システムはある要件を満たすために別の要件を破ってしまうことがあり、その結果、エージェントは実用不可能なものになってしまいます。研究者が直面した問いは、何が機能して何が機能しないかを学習しながら、リアルタイムで各ルールの重みを調整し、完璧なバランスを自動的に見つけ出すシステムを構築できるか、という点でした。
研究チームは、この問題に対処するために、CAPO(Constraint-Aware Prompt Optimization:制約を考慮したプロンプト最適化)と呼ばれる新しい手法を導入しました。ルール間の正しいバランスを推測する代わりに、CAPOは最適化プロセスを、ルール自体が声を上げる「交渉」のように扱います。システムは一連の候補プロンプトから開始し、それらを一連のタスクに対してテストします。エージェントを実行する過程で、彼らはタスクをどの程度遂行できたか、そして決定的な点として、ツールの呼び出し回数やレスポンスの長さといった特定の制約をどれだけ違反したかというデータを生成します。もしプロンプトがルールに違反した場合、システムは次のテストラウンドにおいて、その特定のルールに対する「ペナルティ」を自動的に増加させます。逆に、プロンプトがルールの範囲内に余裕を持っている場合は、そのルールのペナルティを減少させます。この動的な調整により、システムはすべてのルールを最初から等しく扱うのではなく、現在エージェントのデプロイを妨げている具体的な問題に焦点を絞って探索を行うことができます。
研究者たちは、航空会社のカスタマーサービス、小売サポート、通信などの異なる複数のドメインにわたって、このアプローチをテストしました。これらのテストにおいて、エージェントは人間のオペレーターを呼び出す回数、使用できるツールの数、およびシステム指示の長さに対する厳格な制限を守りながら、タスクを完了させる必要がありました。結果は明白でした。CAPOは、高いタスク性能を維持しながら、すべての制約を満たすプロンプトを一貫して見つけ出したのです。対照的に、固定された重みや静的なルールを使用する方法は、すべての要件を同時に満たす解決策を見つけることができませんでした。例えば、航空ドメインにおいて、他の手法は6つの異なるテストシナリオのうち1つでしかルールを満たせなかったのに対し、CAPOはすべてのシナリオで実行可能な解決策を見つけ出しました。この手法は、異なるサイズの言語モデルでも動作するほど堅牢であり、ツールを使用するエージェントの枠を超えて、チャットボットのシナリオにおける安全性やフォーマットの制約にも対応できることが証明されました。
プロセスをさらに効率化するために、研究者たちはDCAPOと呼ばれる第2のバージョンを開発しました。最初のバージョンは、プロンプトを書き換えるために分離された凍結された言語モデルを使用しますが、DCAPOはプロセス自体から学習する特化したリライター(書き換え器)を訓練します。このリライターは、エージェントの挙動と制約からのフィードバックを観察し、基礎となるタスクエージェントを変更することなく、より良いプロンプトを生成することを学習します。実験において、この学習されたリライターは、テストされたすべてのドメインで実行可能なプロンプトを生成することができ、最高のベースライン手法と同等またはそれを上回る精度を実現しました。また、研究には数学的な分析も含まれており、限られた数の例と離散的なテキストの変化を扱っている状況において、システムがどのように機能するかを示し、これらの制限によって導入されるエラーがシステムの良好な解への収束を妨げないことを確認しました。
この研究の意義は、デプロイメント要件を探索プロセスを導く力に変えられる点にあります。ルールの違反度合いに基づいて、どの失敗に注意を向けるべきかを決定させることで、一つの問題を解決しようとして別の問題を生み出すという罠を回避できます。研究者たちは、この適応的なアプローチが不可欠であることを発見しました。なぜなら、最も重要な制約は、特定のタスクや使用されるモデルによって変化するからです。航空業界のシナリオで最も重要なことは、小売のシナリオでは無関係かもしれませんし、問題を解決する能力が十分にあるモデルであっても、予算内に収めるためには異なるガイダンスが必要になることもあります。この研究は、リアルタイムのフィードバックに基づいて最適化の焦点を継続的に調整することで、効果的かつコンプライアンスを遵守した動作ポイントを見つけることが可能であることを示しています。これは、プロンプトエンジニアリングの考え方の転換を示唆しています。つまり、プロンプトエンジニアリングとは静的なセットアップではなく、要件そのものがシステムを現実世界に即した解決策へと導く、動的なプロセスになり得るのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。