非常に賢いものの、ときどき不器用なロボットアシスタントがいると想像してください。あなたは、インターネット上の特定の事実を見つけることや、コードの作成など、複雑なパズルを解くようそのロボットに依頼します。ロボットは最善を尽くしますが、同じ過ちを繰り返し犯します:过早に諦めたり、誤ったものを検索したり、似たような名前に混乱したりするのです。
通常、この問題を修正しようとするとき、私たちは単に「作業を確認することを忘れないでください!」や「推測しないでください!」といった、マニュアルのような書かれた指示リストをロボットに与えます。しかし、ロボットはこれらを受動的なテキストとして扱うため、しばしば無視してしまいます。いつ止まって耳を傾けるべきか、またどのように行動を変えればよいかを、ロボットは正確には理解していないのです。
HASP(Skill Programs を用いた LLM エージェントの活用)は、ゲームを変える新しいフレームワークです。受動的なマニュアルを与える代わりに、研究者たちはロボットに実行可能な**「スキルプログラム(PFs)」のセットを提供します。これらを単なる本ではなく、ロボットの脳のすぐ横に座るスマートな安全ハーネスやコパイロット**として考えてください。
以下に、簡単な比喩を用いてその仕組みを説明します。
1. 「受動的な助言」から「能動的なガードレール」へ
- 従来の方法(テキストベースのスキル): 助手席の後ろに座った運転教官が、「スピードを落とすべきだ!」と叫んでいる状況を想像してください。ドライバーはそれを聞くかもしれませんが、無視するかもしれませんし、いつブレーキを踏むべきかを正確に理解しないかもしれません。これは単なる助言に過ぎません。
- HASP の方法(プログラム関数): ここで、車にスマートな安全ハーネスが備わっていると想像してください。車が崖(「失敗しやすい状態」)に向かって流され始めた場合、このハーネスは単に助言を叫ぶだけではありません。物理的に介入します。ハンドルを中央に戻すように優しく操舵したり、ドライバーの視界に警告信号を直接注入したりするのです。
- 論文における実装: これらの「スキルプログラム」は、ロボットのあらゆる動きを見守る小さなコードの断片です。ロボットが過ちを犯そうとした場合(例えば、証拠を確認せずに回答を確定するなど)、スキルプログラムが介入します。それはロボットの行動を書き換える(悪い検索クエリを良いものに変えるなど)か、ヒントを注入する(「待て、まだドキュメントを読んでいないぞ!」とロボットに伝えるなど)ことができます。
2. ハーネスを使う 3 つの方法
この論文は、この「ハーネス」を学生を訓練するように、3 つの異なる方法で使用できることを示しています。
モード A:即時修正(推論時の介入)
- 比喩: ロボットが作業している最中に、そのロボットにハーネスを装着します。ハーネスはリアルタイムで過ちを捕捉し、即座に修正します。ロボットは何も新たに学習する必要はありません。ハーネスが重労働を担うだけです。
- 結果: ロボットは追加の学習なしに、すぐに問題をより良く解決できるようになります。
モード B:学習ガイド(事後学習)
- 比喩: ハーネスがロボットの過ちを修正した後、研究者たちは「修正された」経路の動画を撮影し、それをロボットに教訓として示します。ロボットはこれらの例を学び、次回からは自ら正しい選択をするようになります。
- 結果: ロボットはスキルを内面化します。やがてハーネスが自分の脳の一部であるかのように振る舞い、時間とともに助けを必要としなくなります。
モード C:自己改善ライブラリ(進化)
- 比喩: ロボットがハーネスがまだ見たことのない新しい種類の過ちに遭遇した場合、システムは一時停止します。そして、「教師」(非常に賢い AI)に、その過ちのために新しいスキルプログラムを作成するよう依頼します。この新しいスキルを道具箱に追加する前に、教師がそれが安全で有用であることを確認します。
- 結果: ロボットのスキル道具箱は、人間がすべてのルールを書く必要なく、自らの失敗から学ぶことで、時間とともに賢くなっていきます。
3. なぜこれほど効果的なのか
この論文は、この手法を 3 つの困難なタスクでテストしました。
- Web 検索: 複数の情報をつなぎ合わせて答えを見つけること(探偵が謎を解くようなもの)。
- 数学: 複雑な方程式を解くこと。
- コーディング: コンピュータプログラムを書くこと。
結果:
- 「ハーネス」アプローチは、研究者が比較したほぼすべての他の手法を上回りました。
- Web 検索においては、ロボットを学習させることなくハーネスを使用するだけで、標準的な手法と比較して**25%**のパフォーマンス向上が見られました。
- ロボットにハーネスから学習させる(事後学習)と、さらに性能が向上しました。
- 決定的な点は、このシステムがモジュール式であることです。それはスイスアーミーナイフのようです。ツールそのものを使うことも、ツールを使ってロボットに教えることも、ロボットに新しいツールを作らせることもできます。
結論
HASP は、「再利用可能な経験」という漠然としたアイデアを、具体的で実行可能なツールへと変えます。ロボットがルールを覚えることを期待するのではなく、HASP はロボットに自動的な安全チェックのセットを与えます。これにより、エラーが発生した瞬間にそれを捕捉し、修正し、ロボットが将来それらを回避して学習するのを助けます。これは、学生に教科書を与えることと、作業中に隣に座って修正してくれるチューターを与えることの違いに他なりません。
技術概要:スキルプログラムを用いた LLM エージェントの活用(HASP)
1. 問題定義
大規模言語モデル(LLM)エージェントは、計画立案や環境との対話において能力を向上させているが、検証前に終了してしまう、壊れやすい中間結論に固執する、あるいは非生産的な行動を繰り返すなど、反復的な失敗パターンを示すことが頻繁にある。これらの失敗を軽減するための既存のアプローチは、過去の経験から導き出されたテキストベースのスキルに依存することが多い。これらのスキルは通常、プロンプトに注入するか、助言的なガイダンスとして使用される。しかし、本論文は、テキストベースのスキルには以下の 3 つの核心的な限界があると主張している:
- 助言的性質:これらは原則的にエージェントが「何を」すべきかを表現するが、ポリシーループ内で「いつ」活性化し、「どのように」介入するかを決定する明示的なメカニズムを欠いている。
- 制御の弱さ:実際にはモデルによって無視されることが多く、エージェントの行動を確実に変更できない。
- 実行可能性の欠如:言語で表現された再利用可能な経験と、エージェントの行動を明示的に制御できる再利用可能な経験との間にギャップが存在する。
中心的な課題は、このギャップを埋め、受動的なテキストの教訓を、エージェントの意思決定プロセスに直接介入できる能動的かつ実行可能なメカニズムへと変換することである。
2. 手法:HASP フレームワーク
著者は、スキルを受動的なテキストから**プログラム関数(PF)**へと昇華させるフレームワーク、**HASP(Harnessing LLM Agents with Skill Programs)**を導入する。PF は、再利用可能で実行可能な状態 - 行動介入関数として定義される。
コアコンポーネント
- プログラム関数(PF):自然言語のリマインダーとは異なり、PF は 2 つの明確なインターフェースを持つ実行可能な Python モジュールである:
should_activate(state, action):現在の状態と提案された行動に対してスキルが関連するかどうかを決定する決定論的な述語。
intervene(state, action, teacher):構造化された介入を返す。これには以下が含まれる:
- Modify_Action:次の行動を書き換えるまたは洗練する(例:過度に制約された検索クエリの短縮)。
- Inject_Context:エージェントの観測に修正テキストを追加する(例:エンティティの混同に関する警告)。
- NOOP:変更を控える一方で監査記録をログに記録する。
- スキルライブラリ:検証済みの PF のコレクション。新しい候補は失敗事例から生成され、構文とインターフェースの検証を受け、承認前にティーチャーモデルによってレビューされる。
- ハーネス:ベースエージェントの方策(πθ)をラップする外部制御層。各ステップにおいて、ハーネスは関連する PF を取得し、その活性化述語を評価し、有効な介入を実行し、修正された行動または注入されたコンテキストをループにフィードバックする。
3 つの運用モード
HASP は非常にモジュール性が高く、3 つの異なるパラダイムをサポートするように設計されている:
- 推論時の介入:PF は実行時に実行可能なガードレールとして機能する。モデルの重みを更新することなく、エージェントの状態に基づいて自律的にトリガーされ、行動を変更するかコンテキストを注入する。複数の候補が存在する場合、適切な PF を選択するのを補助するオプションの補助ティーチャーを使用できる。
- 事後学習(内部化):PF の実行は、元の行動、PF による修正、および結果を含む構造化されたレコードを生成する。これらのレコードは、タイミング(いつ)、モード(どのように)、正しさ(品質)、結果(有効性)という 4 つのシグナルを用いてスコアリングされる。これらのスコアは、以下の方法で事後学習を導く:
- 教師あり微調整(SFT):修正された行動に基づいて学習する。
- 拒否サンプリング(RS):PF による修正に一致し、タスクの成功を達成する軌道を選択する。
- オンポリシー蒸留(OPD):PF が介入した自身の状態に基づいて学生モデルを学習させる。
- 自己改善進化:システムは現在のチェックポイント下での残存失敗を再検討し、反復的な失敗 - 修正パターンを候補 PF として要約し、厳密な実行可能検証とティーチャーレビューを経て外部スキルライブラリを更新する。これにより、実行、学習、ライブラリの成長の間のループが閉じられる。
3. 主要な貢献
本論文は、以下の 3 つの主要な貢献を概説している:
- 実行可能な状態 - 行動関数としてのスキル:再利用可能なエージェントの経験を、オンデマンドでトリガーされ明示的に介入する実行可能なプログラム関数へと変換し、受動的なテキストベースのスキルを超えていくこと。
- モジュール型エージェントハーネスフレームワーク:推論のみの、事後学習の、および自己改善のパラダイム全体にわたって制御可能な PF のトリガーと介入をサポートする HASP の提案。
- 強力な実証的パフォーマンス:Web 検索推論、数学的推論、コーディングタスクにおいて、競争力のあるベースラインを大幅に上回る成果を実証すること。
4. 実験結果
著者は、HASP をHotpotQA、2Wiki、MuSiQue(Web 検索)、AIME24、AMC23、GameOf24(数学)、HumanEval、MBPP、BigCodeBench(コーディング)で評価した。ベースモデルはQwen2.5-7B-Instructであった。
主要な知見
- 推論時の改善:モデルの更新なしでも、PF 単独の介入はベースラインを大幅に上回った。
- Web 検索推論において、PF 単独の介入は平均精度を**51.0%**まで向上させた(プロンプトのみのスキルは 20.5%、マルチループ ReAct ベースラインは 31.2%)。
- PF 選択のための補助ティーチャーを追加すると、Web 検索の精度はさらに**56.2%**まで向上した。
- コーディングにおいて、PF 単独は**63.4%の pass@1 を達成し、ティーチャー選択により68.7%**まで上昇した。
- 事後学習による内部化:PF 由来の教師信号により、モデルは完全な強化学習なしに行動を内部化できた。
- Web 検索において、**オンポリシー蒸留(OPD)は62.5%**を達成し、**拒否サンプリング(RS)は固定ライブラリ下で59.3%**に達した。
- これらの結果は、標準的な SFT やスキルベースの学習スキームと同等かそれ以上であった。
- クローズドループ進化:スキルライブラリの制御された進化がパフォーマンスをさらに向上させた。
- HASP-Evolve + RSは、Web 検索で60.3%、数学的推論で**45.4%**を達成した。
- コーディングでは**69.9%**の pass@1 に達し、バニラ SFT より 12.4% 上回り、GRPO ベースの手法と競合する性能を示した。
- メカニズム分析:
- 介入タイプ:介入の 65.1% が行動レベルの修正(例:クエリの書き換え)であり、34.9% がコンテキスト注入であった。
- シグナルの重要性:アブレーション研究により、4 つの教師信号(タイミング、モード、正しさ、結果)のすべてが必要であることが示された。「モード」を除去すると最大の低下(-15.5%)が生じ、介入が「いつ」適用されるかと同じくらい「どのように」適用されるかが重要であることを示している。
- フィルタリングの必要性:厳格なフィルタリング(実行可能検証+ティーチャーレビュー)が不可欠であった。フィルタリングなしの進化は性能の急激な低下(-24.0%)を引き起こし、ライブラリの汚染がエージェントのパフォーマンスを劣化させることを確認した。
5. 意義と主張
本論文は、HASP を LLM エージェントを改善するための補完的な道として位置づけている。著者は以下を主張している:
- 発見よりも安定化:PF は、モデルがしばしば実行可能であるが確実に適用しない有用な戦略を表面化し、安定化させる。これは、根本的に新しい戦略の発見に適している RL 型の探索とは対照的である。
- 明示的な制御:スキルを実行可能なコードに変換することで、HASP はエージェントの行動に対する明示的で監査可能な制御を提供し、プロンプトベースのスキルが持つ「助言的」な弱点に対処する。
- モジュール性:このフレームワークは、スキル定義を学習目的から分離し、同じ PF を実行時の介入、教師あり学習、または自己改善に使用できるようにする。
著者は限界について謙虚であり、PF は主に新しい戦略を発見するのではなく、既存の戦略を吸収するのに役立つこと、フレームワークが明確な検証シグナルに依存していること(開放的なタスクへの適用性を制限する)、そして自己改善にはライブラリの劣化を防ぐための厳格なフィルタリングが必要であることを指摘している。彼らは結論として、新しい戦略の発見にはより広範な RL 型の探索が必要かもしれないが、PF は複雑で長期的なタスクにおけるエージェントの行動を洗練し、安定化させるための堅牢なメカニズムを提供すると述べている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録