← 最新の論文
💬 NLP

ORCA-bench: How Ready Are Language Model Agents for Oncall?

本論文は、オンコールにおける根本原因分析タスクにおける言語モデルエージェントを評価するための、プロダクション品質のベンチマークであるORCA-benchを導入しており、最も高度な最先端モデルでさえ現在、中程度の難易度において低い精度(25.3%)しか達成できておらず、ハルシネーションに苦しんでいることを明らかにしており、これらは、それらが現実世界のプロダクションの信頼性を安全に任せられるようになるまで、大きな隔たりがあることを示している。

原著者: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、銀河を航行する巨大でハイテクな宇宙船の船長であると想像してください。突然、船のコンピュータの様子がおかしくなりました。ライトが点滅し、重力が不安定になり、コーヒーメーカーからは火花が飛び散っています。何が起きているのか正確には分かりませんが、船が危機に瀕していることは分かっています。現実の世界では、これらの宇宙船は私たちが毎日使っているウェブサイトやアプリであり、「船長」はサイトリライアビリティエンジニア(SRE)と呼ばれる特別なエンジニアです。彼らの仕事は、なぜ壊れたのかを突き止めることであり、多くの場合、「チェックアウトボタンが機能しない」や「サイトの動作が遅い」といった漠然とした苦情から始まります。彼らは、システム全体が崩壊する前に、たった一つの故障箇所を見つけ出すために、トラフィックログ、エラーメッセージ、コードといった膨大なデジタルの手がかりを掘り下げなければなりません。

長い間、人々は人工知能(AI)、特に大規模言語モデル(LLM)を使って、コンピュータにこの探偵のような仕事を教えようとしてきました。これらは、物語を書いたり、質問に答えたり、さらにはコードの作成を支援したりできる、あの賢いコンピュータのことです。大きな疑問は、「これらのAI探偵は、物事がうまくいかなくなった時に、私たちの現実世界のシステムを制御し、修理する準備ができているのだろうか?」という点です。これは非常にリスクの高いゲームです。なぜなら、もしAIが誤った推測をすれば、小さな不具合が巨大な災厄へと発展してしまう可能性があるからです。

ORCA-BENCHと題されたこの論文は、まさにそのことをテストするための、巨大で現実的な訓練場を設けています。研究者たちは、非常に詳細な架空のオンラインショップ(「アストロノミー・ショップ」と呼ばれます)を構築しました。これは6日間にわたって稼働し、実際の忙しいウェブサイトのように膨大な量のデジタルノイズを生成します。そして、彼らはシステム内で密かに不具合を引き起こした1,079通りの異なる「ミステリー・インシデント」を作成し、現存する最もスマートな5つのAIエージェントにその事件を解決するよう依頼しました。彼らは、人間のエンジニアが使うものと同じツール、つまりライブデータストリーム、ソースコード、そして漠然としたユーザーからの苦情へのアクセス権をAIに与えました。

結果はどうだったでしょうか? AI探偵たちは、まだ修行中の段階にあります。最も優れたAIモデルでさえ、「中程度の難易度」のケースを正しく解決できたのはわずか**25%であり、最も難しいケースではわずか10%**に過ぎませんでした。これを比較すると、もし人間のエンジニアがテストで10%のスコアしか取れなかったら、彼らは解雇されるでしょう。しかし、これらのAIにとっては、それが現在の最先端の性能なのです。論文によると、AIがソースコードを見ることができない場合、そのパフォーマンスはさらに悪化することが分かりました。最も懸念すべき点は、AIがしばしば「ハルシネーション(幻覚)」を起こすこと、つまり、存在しない問題に対して自信満々に偽の理由を捏造してしまうことです。あるケースでは、ユーザーのショッピングカートが失敗した原因について、AIはテストツール内のブラウザクラッシュのせいだと決めつけ、真の犯人を完全に見逃していました。

著者らは、これらのAIエージェントはコードを書くことには優れているものの、現実のライブシステムの安全性を任せる準備はまだできていないと結論付けています。AIができることと、インターネットを安全に稼働させ続けるために必要なこととの間には、依然として巨大な隔たりがあります。論文は、AIに「オンコール(待機)」のシフトを任せる前に、彼らを信頼できるものにするためのさらなるエンジニアリング作業が必要であると示唆しています。なぜなら、現時点では、彼らは謎を解くよりも、間違った推測をする可能性の方が高いからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →