← 最新の論文
💻 computer science

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

本論文は、過去の診断から運用上の専門知識を蓄積・検証する適応的な外部ハーネスを活用することで、汎用LLMエージェントの根本原因分析能力を大幅に向上させる自己進化型フレームワークであるOpsHarnessを提案しており、これは素の汎用エージェントおよび特化型のRCAエージェントの両方を凌駕するものである。

原著者: Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑なコンピュータシステムが故障し始めるとき、問題が始まった場所に留まることは滅多にありません。現代のデジタル世界では、ソフトウェアは何千もの小さく相互に関連した断片から構築されています。もし一つの断片がつまずけば、そのエラーは外側へと波及し、ユーザーのアプリに遅延を引き起こしたり、全く別の問題のように見える突然のエラーメッセージの急増を招いたりすることがあります。問題が実際にどこから始まったのかを突き止める作業は、「根本原因分析(ルート・コーズ・アナリシス)」と呼ばれます。何十年もの間、エンジニアはこれらの断片がどのように接続されているかのマップや、統計的なパターンに頼って犯人を捜してきました。今日、彼らは人工知能、特に大規模言語モデル(LLM)を利用して、デジタル探偵としての役割を果たすようになっています。これらのモデルは、ログを読み、コードを理解し、複雑なシナリオを推論することに非常に長けており、まるで図書館にあるすべてのマニュアルを読み込んだ優秀なエンジニアのようです。しかし、一つ注意点があります。これらのモデルは賢いものの、自身が修正しようとしているシステム特有の「癖」については知りません。彼らには、同じシステムが失敗し、回復する様子を何度も観察することで得られる、人間としての専門家が持つ深い蓄積された経験が欠けているのです。

香港中文大学とByteDanceの研究者たちは、このギャップを埋めるための新しい方法を開発しました。あらゆるシステムに対してゼロから新しい特化型AIを構築する代わりに、強力で汎用的なAIを包み込む、柔軟な外層を作成したのです。彼らはこの層を「ハーネス(harness)」と呼んでいます。このハーネスを、新しいチームに加わる際に一般的なエンジニアが受け取る、専門的なツールキットやフィールドノートと考えてください。汎用AIは推論能力を提供しますが、ハーネスは具体的なコンテキスト(文脈)、使用すべき適切なツール、そして過去の失敗から学んだ教訓を提供します。彼らの研究における最も重要な革新である「OpsHnerss」と呼ばれるこの層は、自己進化型です。それはただそこに存在するのではなく、自身が支援したすべての診断プロセスを見守り、成功と失敗の両方から学び、時間をかけて自身の指示を更新して改善していきます。

チームはまず、トラブルシューティング専用のカスタムAIエージェントを構築することが最善のアプローチであるという、一般的な仮説の検証から始めました。彼らは、これらのカスタム構築されたエージェントを、単に問題の診断というタスクを与えられた標準的な汎用AIモデルと比較しました。結果は驚くべきものでした。トラブルシューティング用に特別に訓練されていない汎用モデルの方が、カスタムエージェントよりも高いパフォーマンスを示すことが多かったのです。これは、カスタムエージェントが、汎用モデルがすでに習得している洗練された推論能力や計画能力を欠いていることが原因でした。しかし、最高の汎用モデルであっても完璧ではありませんでした。それらはしばしば正しい症状を特定しながらも、特定のシステムがストレス下でどのように振る舞うかという知識が欠けているために、誤った原因を指し示すことがありました。例えば、あるモデルはデータベースへの接続が急減しているのを見てデータベースの故障だと仮定するかもしれませんが、実際には、その減少はサーバーの処理能力不足といった別のコンポーネントによる副作用に過ぎない場合があるのです。

これを解決するために、研究者たちはOpsHarnessを、モデルの汎用的な知性とシステムの具体的な現実との間の架け橋として機能するように設計しました。システムは主に2つの部分で構成されています。第一の部分は、情報を階層的に保存するナレッジベースです。これは、問題を調査するための一般的なルールから始まり、監視されている特定のシステムのプロファイルを追加し、最終的には、実証された特定のワークフローやルールのネットワークを蓄積していきます。第二の部分は、「アイデアカード」のライブラリです。システムの変化によって壊れる可能性のあるスクリプトをハードコーディングする代わりに、ハーネスはAIにツールの説明や手法を与え、AIはその場でそれを使用するためのコードを記述します。これにより、システムは再プログラミングを必要とせずに、異なるデータレイアウトに適応することができます。

OpsHarnessの真の力は、経験から学ぶ能力にあります。システムは問題の診断を支援した後、プロセス全体をレビューします。もし診断が正しかった場合、システムは成功したステップを抽出し、再利用可能なワークフローやルールへと変換します。もし診断が間違っていた場合、推論がどこで脱線したのかを正確に特定し、将来的にその特定のミスを防ぐためのルールを作成します。このプロセスは、無謀な形で自動的に行われるわけではありません。システムには厳格な安全チェックがあります。新しいルールがメモリに追加される前に、それが他の部分を壊すことなく診断を改善できるかどうかを、安全で隔離された環境でテストされます。この二重チェックのプロセスにより、システムが悪習を学んだり、単一の奇妙なイベントに過学習(オーバーフィッティング)したりすることを防ぎます。

研究者たちは、数百の現実世界の失敗事例を含む2つの公開ベンチマークを用いてこのアプローチをテストし、さらに大規模な商用クラウド環境にも展開しました。結果は劇的な改善を示しました。汎用AIモデルのみを使用した場合、システムは約36パーセントの割合で根本原因を正しく特定できました。同じモデルにOpsHarnessを装備させると、その精度は59パーセント近くまで跳ね上がりました。この向上は、異なる種類のAIモデルや異なる種類のシステムにおいても一貫していました。また、研究では、システムは使用すればするほど賢くなることが分かりました。システムが時間の経過とともに一連のインシデントを診断していく継続的なテストにおいて、その精度は経験を蓄積するにつれて着実に上昇しました。対照的に、進化しないシステムは停滞し、安全チェックなしで進化するシステムは、ノイズから学習してしまうことで状況を悪化させることがよくありました。

研究者たちはまた、このシステムを運用するコストも測定しました。ハーネスはプロセスにオーバーヘッドを加えますが、汎用AIモデルのみを使用する場合と比較して、計算能力や時間を大幅に必要とするものではありません。実際、AIを正しい経路へと導くことで、問題を解決するためにAIが踏むべきステップの数を減らすことが多いのです。学習されたすべてのルールやツールを含むシステム全体は、非常に少ないストレージ容量しか占有せず、実用的な使用に適しています。

この研究は、複雑なタスクのために知的なシステムを構築する方法におけるパラダイムシフトを示唆しています。特定の仕事のためにゼロから新しいAIを訓練するのではなく、強力で汎用的なAIを取り上げ、それを環境の詳細を教え込むスマートで進化する層で包み込むことが、最も効果的な道である可能性があります。この外部レイヤーに焦点を当てることで、研究者たちは、汎用モデルの生の知性を、自らの履歴から学び、解決を支援するたびに改善していく専門家へと変えることができるシステムを作り上げました。この知見は、自動トラブルシューティングの未来は、より賢いモデルにあるのではなく、それらのモデルにどのように働かせるかを教える、より賢い方法にあることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →