StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
StarHarnessは、モデルの重みを固定したまま、層化探索を通じて環境固有のハーネスを進化させることで、エンタープライズ環境におけるエージェントの性能を大幅に向上させるフレームワークであり、ベンチマークスコアの大幅な向上と異なるモデルファミリー間での汎用性を実現しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代のコンピューティングの世界において、エージェントとして知られる知的なプログラムの新しいクラスが登場しています。これらは単一のコマンドに従うだけの単純なツールではありません。人間が従業員として行うように、推論し、情報を検討し、複雑な問題を解決するために行動するように設計されたシステムです。機能するために、これらのエージェントは2つの異なる部分に依存しています。1つ目は「脳」であり、推論と知識を提供する大規模言語モデルです。2つ目は「ハーネス(装着具)」であり、これはエージェントの「手、目、耳」として機能します。ハーネスは、エージェントがどのように世界を認識するか、どのツールを使用することを許可されるか、そしてどのように自身の作業を検証するかを定義します。長年、科学者たちはほとんどすべてを「脳」をより大きく、より賢くすることに注力してきました。しかし、ビジネス環境という、ルールに縛られた複雑な現実の中では、たとえ優れた脳を持っていても、その「手」が不器用であったり、あるいはそのエージェントが働いているオフィスの特定のルールを理解していなかったりすると、失敗してしまうことがあります。ここで実用的な問いが生じます。もし私たちが「脳」を変えることができないのであれば、エージェントをより良く機能させるために、「手」や「ルール」を改善することはできるのでしょうか?
ServiceNowの研究チームは、共同研究者である学術機関と共に、「StarHarness」と呼ばれる新しいフレームワークを用いて、この問いに答えるべく取り組みました。彼らは、ITシステム、財務ワークフロー、カスタマーサービス記録などの管理をソフトウェアが行わなければならない、エンタープライズ設定に見られる特定の課題に焦点を当てました。これらの環境では、ソフトウェアは厳格で、しばしば隠れたルールを持つデータベースやツールと対話する必要があります。研究者たちは、基礎となる「脳」に一切触れることなく、エージェントのハーネスを自動的に改善できるかどうかを検証したいと考えました。彼らは、ハーネスを、試行錯誤を通じて進化させ、あるいは改善できる「コードの一片」として扱いました。目標は、モデルの内部重みを完全に固定したまま、エージェントがタスクをどのように構成し、ツールを使い、結果を検証するかについて、より優れた方法を見つけることでした。
このアイデアをテストするために、研究者たちは制御された方法で改善を探索できるシステムを作成しました。まず、エージェントを大規模なタスクセット上で実行し、典型的な失敗箇所を特定することから始めました。次に、これらのタスクを3つのグループに分けました。1つのグループは変更の提案に使用され、別のグループは変更が実際に機能するかをテストするために隠しておかれ、3つ目のグループは最終的なバイアスのないチェックのために保存されました。システムは、ツールの呼び出し方を修正したり、一般的なミスを防ぐためのルールを追加したりするなど、ハーネスへの小さな変更を提案します。その後、その変更を隠されたグループでテストします。もしその変更によってエージェントのパフォーマンスが向上すれば、システムはその変更を採用し、そうでなければ破棄します。このプロセスを繰り返すことで、ハーネスはより有能なバージョンへと徐々に進化していきました。研究者たちは、コンピュータネットワークの障害分析、ITサービスリクエストの管理、および財務ワークフローという、3つの異なる種類のビジネス課題に対してこの手法を用いました。
結果は驚くべきものでした。システムがわずか数回の受理された変更(通常、1つの環境につき4回から12回の調整)を行った後、エージェントのパフォーマンスは大幅に跳ね上がりました。ベンチマーク全体において、フルベンチマークのパフォーマンスはデフォルトのハーネスと比較して20〜35パーセントポイント向上しました。具体的には、成功率はネットワーク分析タスクで35パーセントポイント向上し、ITサービス管理テストで20パーセントポイント上昇し、財務ワークフローでは26パーセントポイント上昇しました。決定的なのは、これらの改善が、システムが学習中に見てきた特定の問題を単に暗記した結果ではないということです。研究者が進化したハーネスを新しい未知のタスクに対してテストした際も、エージェントは以前よりもはるかに高いパフォーマンスを示しました。さらに驚くべきことに、これらの改善は異なる種類のAIモデルにも転移しました。ある特定のモデルファミリーを使用して進化したハーネスは、追加のトレーニングや調整を必要とすることなく、全く異なるモデルファミリーに与えられた場合でも同様にうまく機能しました。
研究者たちは、システムが実際に何を学んだのかを理解するために、変更内容を分析しました。彼らは、改善が3つの明確なカテゴリーに分類されることを見出しました。第一に、システムはエージェントとツールの間のインターフェースを修復し、エージェントがツールを誤って呼び出す原因となるエラーを修正しました。第二に、特定のステップを踏むべき順序や、日付や優先度の適切な扱い方など、環境の「隠れた慣習」を学習しました。第三に、運用知識を追加することで探索プロセスを圧縮し、エージェントが不要なステップをスキップして、問題の最も可能性の高い原因に集中できるようにしました。例えば、財務タスクにおいて、進化したハーネスは変更を行う前に安全性の違反をチェックすることを学習し、これによりエラーの数が劇的に減少しました。ネットワーク分析タスクにおいては、エージェントは不要な証拠を求めて時間を浪費するのではなく、有力な原因を見つけた時点で探索を停止することを学習しました。
これらの知見は、多くの実世界のビジネスアプリケーションにおいて、最大の障壁はモデルの知能ではなく、それを導くシステムの設計にあることを示唆しています。ハーネスを進化させることで、研究者たちは誤診の数を減らし、タスク完了時間を短縮し、エージェントの実行コストを下げることができました。この研究は、固定された変化しない「脳」であっても、それが動作する特定の環境に合わせて周囲のツールやルールを注意深く調整することで、驚くほど効果的になり得ることを証明しています。これは、次世代のより大規模なモデルの開発を待つことなく、今日の信頼できるAIエージェントを必要としている組織にとって、実用的な道筋を提示しています。この研究は、時には、最も強力なアップグレードは新しい「心」ではなく、より優れた「働き方」であるということを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。