Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
Evo-Harnessは、コンテキストからハーネスへのスキル・コンピレーション(文脈からハーネスへのスキル集約)を用いることで、経験を再利用可能な構造化されたスキル・ハーネスへと蒸留し、継続的なクロスドメインの改善を実現することにより、未知の実世界タスクにおけるノイズの多いワンショットの相互作用からの学習という課題に対処する、自己進化型エージェント・フレームワークを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能が急速に進化する世界において、大規模言語モデルエージェントとして知られる特定の種類のソフトウェアが、複雑な問題を解決するための強力なツールとして登場しました。これらのエージェントは、人間と同じように、指示を読み、ステップを計画し、デジタルツールを使用し、ウェブサイトやコンピュータシステムと対話することができます。しかし、ある持続的な課題が彼らの可能性を制限してきました。それは、エージェントがタスクに失敗した際、その失敗を行き止まりとして扱ってしまうことです。彼らは、後で同じ間違いを繰り返さないように、そのミスから自然に学ぶことができません。これらのシステムを教えるための伝統的な手法は、通常、過去の数千回に及ぶ試行を収集し、それらをオフラインで分析してパターンを見つけ出すというものでしたが、このプロセスは時間がかかり、リアルタイムの業務の流れから切り離されていることが多いのです。多くの実用的な場面において、エージェントは新しい困難なタスクに一度だけ遭遇し、成功か失敗かのチャンスが一度しかないため、伝統的な学習が要求するような、データの緩やかな蓄積を行う余地はほとんどありません。
研究者たちは現在、これらのデジタルワーカーが即座に(オンザフライで)向上するための新しい方法、彼らが「オンライン・ハーネス学習(online harness learning)」と呼ぶ手法を提案しています。エージェントの核となる「脳」を再学習させようとするのではなく(それは多くの場合、固定されており変更不可能なものです)、経験とともに進化する外部の「ガイドブック」を付加するという方法です。このガイドブック、すなわち「ハーネス(装着具)」は、過去の試行から学んだ教訓の構造化されたコレクションとして機能します。エージェントが失敗したとき、システムは単にエラーを保存するだけでなく、その失敗の乱雑な詳細を、明確で再利用可能な「ルール」へと積極的に編纂します。このルールはガイドブックに追加され、将来同様の課題に直面した際にエージェントを導く準備が整います。目標は、ノイズの多い一度限りのミスを、異なる種類のタスクにも適用できる、クリーンで実行可能な知恵へと変えることです。
このアイデアをテストするために、研究者たちは「Evo-Harness」と名付けられたシステムを構築し、5つの明確かつ困難なベンチマークを用いてその性能を検証しました。これらのテストは、複雑なウェブサイトのナビゲーションから、ソフトウェアのコードリポジトリの管理、精密なコマンドライン命令の実行、そして様々なデジタルツールの使用まで多岐にわたります。あらゆるシナリオにおいて、エージェントには一連のタスクが次々と与えられ、モデルを再学習させるために一時停止する機会は与えられませんでした。システムは、各試行の生のコンテキスト(与えられた指示、取られた行動、結果、および受け取ったフィードバック)を取り込み、それを構造化されたレッスンへと蒸留するように設計されました。もしエージェントが失敗した場合、特化したプロセスが何が間違っていたのかを振り返り、新しいルールを提案するか、既存のルールを修正します。その後、別のプロセスが、その新しいルールを新たに追加すべきか、既存の知識と統合すべきか、あるいはその失敗がその一度きりの試行に特化しすぎていた場合に破棄すべきかを判断します。
この実験の結果は驚くべきものでした。ガイドブックを使用するエージェントは、使用しないエージェントよりも一貫して優れた性能を示し、過去の例を単に検索したり、非構造化されたメモリを保存したりする方法よりも優れた結果を出しました。コマンドラインのタスクに焦点を当てたベンチマークでは、成功率が約63パーセントから73パーセント以上に跳ね上がるなど、改善は特に劇的でした。このことは、ノイズの多い一度限りの経験を構造化されたガイダンスへと編纂する能力が、ファイルの検査やエラーからの復旧といった、一連の精密な操作を必要とするタスクにおいて特に価値があることを示唆しています。また、本研究では、システムが生成するガイダンスの種類がタスクによって異なることも判明しました。ウェブナビゲーションについてはガイドブックはワークフローの手順で満たされ、ソフトウェアエンジニアリングについては検証とリカバリのステップに焦点を当て、推論タスクについてはドメイン固有のロジックを捉えていました。この適応性は、システムが単に答えを暗記しているのではなく、問題解決の方法の根底にある構造を学習していることを示しています。
この研究における重要な洞察は、すべてのフィードバックが等価ではないということです。システムは、自身の成功を判断するように求められるよりも、環境からの明確で根拠のあるフィードバック(特定のエラーメッセージやテスト結果など)を受け取ったときに最も高い性能を発揮しました。エージェントが外部の証拠なしに自らフィードバックを生成しようとすると、パフォーマンスはベースラインを下回りました。これは、自己判断が混乱を招く可能性があることを示唆しています。さらに、研究ではエージェントの「脳」のサイズと能力も重要であることが明らかになりました。より強力なモデルは、進化したガイダンスを解釈し従うことに長けており、弱いモデルよりもシステムからより大きな恩恵を受けていました。興味深いことに、小規模なモデルが、より大規模で有能なモデルを助けるためのガイドブックを書くことはできる場合もありましたが、その逆は必ずしも真ではありませんでした。もしタスクを解決するエージェントに、そのガイダンスを理解するための十分な高度さが備わっていなければ、追加の情報は役に立たないばかりか、むしろパフォーマンスを阻害することさえありました。
研究者たちは、これらの学習されたスキルをどのように転送できるかについても調査しました。彼らは、あるモデルによって作成されたガイドブックが別のモデルにとって有用であり得ること、そして一連のトレーニングタスクで学習されたスキルが、未知のテストタスクにおけるパフォーマンスを向上させ得ることを発見しました。しかし、最も効果的なアプローチは、エージェントがタスクを進める中で、ガイドブックを継続的に更新することでした。このリアルタイムの適応により、システムは現在の環境における特定の癖や失敗モードに適応することができ、最高級の事前学習済みガイドブックをも凌駕しました。本研究は、自己改善するエージェントの鍵は、その中核となるモデルを絶えず再学習させることではなく、現実世界の失敗という混沌を、明確で整理された一連の指示へと変えることができる、堅牢で外部のシステムを構築することにあると結論付けています。ガイドブックを、あらゆる相互作用とともに成長し洗練されていく「生きた文書」として扱うことで、これらのデジタルエージェントは、複雑で予測不可能な現実世界の業務を扱う術を学ぶことができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。