SePO: Self-Evolving Prompt Agent for System Prompt Optimization
本論文は、2段階の進化型探索を通じてタスクエージェントとプロンプトエージェント自身のシステムプロンプトの両方を最適化する自己参照的フレームワークであるSePOを提案しており、既存の手法と比較して、多様なベンチマークにおいて優れた汎用性と性能を実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、難しいパズルを解いたり、コードを書いたり、数学の問題に取り組んだりする必要がある、天才的だが頑固なロボット助手(タスク・エージェント)を所有しています。このロボットをより良く機能させるために、あなたは「システム・プロンプト」と呼ばれる一連の指示を与えます。
長い間、これらの指示を書いてきたのは人間でした。もしロボットが失敗すれば、人間が指示を書き直し、再度試行し、成功を祈るのです。新しい手法の中には、ロボットのためにこれらの指示を自動的に書き換える「コーチ」(プロンプト・エージェント)を用いるものもあります。しかし、ここに落とし穴があります。コーチ自身の指示は依然として人間によって書かれたものであり、決して変化しませんでした。 コーチがどれほどロボットを助けようとも、コーチは固定された、手書きのマニュアルに縛られていたのです。
SePO (Self-Evolving Prompt Optimization) は、このゲームのルールを変えます。SePOは、コーチに「コーチ自身をコーチング」させるのです。
基本的なアイデア:コーチがコーチをコーチングする
SePOを、AIの指示書のための「ジム」と考えてください。
- 従来の方法: あなたはクライアント(ロボット)のフィットネスを助けるために、パーソナルトレーナー(コーチ)を雇います。しかし、トレーナー自身のトレーニング計画は人間によって書かれたものであり、更新されることはありません。トレーナーはクライアントを助ける技術は向上しますが、トレーナー自身がより逞しくなることはありません。
- SePOの方法: トレーナー自身もまた、一人のクライアントです。トレーナーはクライアントが健康になるのを助けますが、同時に、自分自身のトレーニング計画を改善するためにも同じトレーニング方法を使用します。トレーナーは、クライアントだけでなく、自身も時間をかけてより賢く、より強く進化していくのです。
仕組み:2段階のトレーニング
この論文では、人間のスキル習得プロセスに似た、2段階のプロセスについて説明しています。
ステージ1:「ブートキャンプ」(事前学習)
コーチが特定のロボットを助ける前に、コーチは多種多様な挑戦(数学、論理パズル、コーディング、科学)が待ち受ける「ブートキャンプ」に参加します。
- このステージで、コーチはこれらの問題を解こうと試みます。
- 失敗したとき、コーチは自身の指示を批判的に検討し、書き換え、再度試行します。
- コーチは、自身の最高の指示を記録した「スクラップブック(アーカイブ)」を保持します。もし新しい指示が古い指示よりも優れた結果を出した場合は、その新しい指示を保持します。
- 結果: コーチは、単に一つの特定のテクニックを暗記するのではなく、指示を修正するための一般的な「スキル」を備えた、熟練のインストラクターへと進化します。
ステージ2:「専門職」(ファインチューニング)
ここで、コーチは特定の仕事(例:数独を解くこと)を持つ特定のロボットを助けるために雇われます。
- コーチは、進化させた超スマートな指示を使用して、ロボットを助けます。
- コーチは、特定のパズルに合わせてロボットの指示を微調整します。
- コーチはステージ1において「学び方」を学んでいるため、自身のマニュアルを人間が書き直すのを待つことなく、新しい仕事に素早く適応することができます。
なぜこれが重要なのか(結果)
研究者たちは、これらを5つの非常に異なる種類の課題でテストしました:
- 数学(難関の競技問題)
- 抽象的推論(視覚的なパターンパズル)
- 科学(大学院レベルの質問)
- コーディング(Pythonプログラムの記述)
- 論理(数独パズル)
彼らはSePOを以下の手法と比較しました:
- Manual-CoT: 人間が指示を書く手法。
- TextGrad: 指示を微調整するが、固定された人間による「批評家」を使用する手法。
- MetaSPO: グローバルなルールを学習するが、依然として固定された人間による最適化器に依存している手法。
結果:
SePOはすべてのタスクにおいて勝利しました。平均して、人間が書いたベースラインと比較して4.49ポイント精度を向上させました。
- それは単に答えを暗記したのではなく、より良い指示を書くための一般的な「スキル」を学習しました。
- ブートキャンプ中に一度も見ることのなかったパズル(数独)でテストされた場合でも、SePOは他の手法よりも優れたパフォーマンスを発揮しました。これは、それが特定のテクニックではなく、転移可能なスキルを学んだことを証明しています。
「進化する庭」という比喩
指示を庭の植物だと想像してください。
- 従来の方法: あなたは種(指示)を植えて、水をやります。もし植物が枯れたら、新しい種を袋から取り出して、再び試します。庭師(コーチ)は変わりません。
- SePO: 庭師自身もまた、一つの植物です。庭師は、他の植物の手入れをしながら、自らも成長し、進化し、より優れた庭師へと成長していきます。庭は最高の植物の記録(アーカイブ)を保持し、それらをステップとして、さらに優れた植物を育てるために使用します。最終的に、その庭は、見たこともない植物であっても育てることができるほど熟練した庭師を生み出すのです。
まとめ
SePOはループを閉じます。AIコーチのための固定されたマニュアルを人間が書く代わりに、SePOはAIコーチ自身に、自身のマニュアルを書き、改善させるのです。これにより、コーチは静的なツールから、経験とともに賢くなっていく学習パートナーへと変貌を遂げ、数学、科学、コーディング、論理パズルの全領域において優れたパフォーマンスを実現します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。