Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps
本論文は、認知トラップを備えた SME 作成のプロンプトを用いて専門コンサルティングタスクにおける深層研究エージェントを評価するための厳密なベンチマークを導入し、ハルシネーション、算術誤り、一貫性のない推論といった固有の失敗モードにより、現在の最先端モデル(Claude、o3、Gemini)が均一に低い受入率を達成していることを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超賢い研究アシスタントのチームを雇って、複雑な仕事を任せる状況を想像してください。彼らは散らかった書類の山を読み、特定の数値を見つけ、計算を行い、CEO 向けの専門的なレポートを作成する必要があります。もし彼らがたった一つの数値を間違えれば、CEO は数十億ドル規模の過ちを犯す可能性があります。
この論文は、現在利用可能な最も高度な AI 研究アシスタント 3 種(Claude、o3、Gemini)に対する「厳格な採用面接」のようなものです。Deccan AI Research の著者らは、これらの AI が人間の管理コンサルタントが行うような詳細でリスクの高い仕事を本当に遂行できるのか、それとも単に簡単な雑学問題に答えるのが得意なだけなのかを確認したいと考えていました。
以下に、彼らの実験を簡単な比喩を用いて解説します。
1. テスト内容:「罠だらけ」の障害物競走
AI に対するこれまでのほとんどのテストは、「フランスの首都はどこか?」(事実の想起)と問うようなものでした。しかし、このテストは異なります。著者らは、実際のコンサルティング業務に基づいた「42 の複雑なシナリオ」を作成しました。
これらのシナリオは、AI を欺くように設計された「サバイバル・コース」と考えてください。AI に提示された書類には、「認知の罠」が含まれていました。
- 「赤いニシン(誤魔化し)」の罠: 100 ページのテキストで満たされたファイルですが、答えは 98 ページの小さな脚注に隠されています。
- 「矛盾」の罠: ある書類では価格が 50 ドルと記載されていますが、脚注には「ただし火曜日の場合は 60 ドル」とあります。
- 「数学の罠」: 平均値を求められますが、正しい方法は加重平均(各テストの重み付けに基づいて成績を計算するような)を必要とします。
AI が表面的に読み飛ばしたり、推測したりしただけでは、不合格となります。
2. 審査員:二段階の採点システム
この論文では、AI が AI を採点するだけではありませんでした。彼らは「二段階の採点システム」を採用しました。
- 第一段階:ロボットによるチェック(検証者)
これらは厳格な自動チェックです。AI はファイルを生成しましたか?正しい数値を使用しましたか?正しい出典を引用しましたか?AI が計算のステップを一つでも間違えれば、この層はそれを不合格と判定します。 - 第二段階:人間の専門家(SME)
15 年以上の経験を持つ実際の人間のコンサルタントが、AI のレポートを読み、以下の 5 つの項目で採点しました。- データの完全性: 事実を捏造しましたか?
- 分析の厳密性: 論理は妥当ですか?
- 関連性: 質問に答えましたか、それともただ漫然と書き連ねましたか?
- 実行: 計算は正しかったですか?
- 形式: レポートは専門的で実用的ですか?
最終スコアは、これら二つの層を組み合わせました。テストに「合格」するには、AI はロボットによるチェックをクリアし、かつ人間の専門家を感銘させる必要がありました。
3. 結果:「合格率」は驚くほど低かった
合計 126 回の試行(42 タスク × 3 種類の AI)のうち、ほとんど誰も合格しませんでした。
- Gemini は約 21% の確率で合格しました。
- Claude と o3 はわずか 9.5% の確率で合格しました。
つまり、これらの AI のいずれかを百万ドル規模のコンサルティングプロジェクトに雇った場合、79% から 90% の確率で、使用可能かつ正確なレポートを提供できないことになります。
4. 各 AI の失敗の仕方(失敗の「個性」)
この論文は、各 AI がそれぞれ独自の失敗の仕方をしていることを発見しました。まるで 3 人の異なる学生が難しい試験を受けたようなものです。
Claude(自信に満ちた捏造者)
- 強み: 最終ファイル(Word ドキュメントや Excel シートなど)を実際に作成する能力が最も高かったです。提出を忘れることはほとんどありませんでした。
- 弱み: 嘘をつく可能性が最も高かったです。書類から答えを見つけられなかった場合、隙間を埋めるために自信を持って数値や出典を捏造しました。まるで、美しいエッセイを書いたが、すべての事実を捏造した学生のようです。
o3(慎重だが不器用な数学者)
- 強み: 推論を行った場合、その論理は最もクリーンであることが多かったです。
- 弱み: 頻繁にレポートの必須セクションを省略したり、連鎖的な計算ミスを犯したりしました。最初のステップで間違えると、その後の計算全体が誤ったものになります。また、ファイル作成の指示を無視して、単にテキストで回答するケースもありました。
Gemini(ジェットコースター)
- 強み: 機能した場合は、しばしば最も優秀でした。「完璧」なスコアを最も多く獲得しました。
- 弱み: 不安定でした。「ゼロ」スコアの数が最も多かったです。時にはクラッシュしたり、回答を拒否したり、壊れたコードを含むファイルを生成したりしました。まるで、試験で満点を取るか、あまりにもひどく失敗して出席さえしない学生のようです。
5. 大きな教訓
この論文は、これらの AI エージェントは印象的ではあるものの、まだ高リスクで意思決定に直結する業務には適していないと結論付けています。
人間のコンサルタントがミスをする場合、それは通常、些細な過ちです。しかし、これらの AI がミスをする場合、それはしばしば壊滅的な失敗となります。彼らは偽りの出典を捏造したり、ソフトウェアをクラッシュさせたり、ビジネス判断全体を変える重要な脚注を見落としたりする可能性があります。
著者らは現在、このテストのより大規模な第二版を準備していますが、現時点でのメッセージは明確です。**まだ、これらの AI に自社の数十億ドル規模の意思決定を任せてはいけません。**彼らはまだ、信頼できる研究者になる方法を学んでいる段階です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。