EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval
本論文は、6つのドメインにわたる983個の専門家検証済みサンプルからなる包括的なベンチマークであるEnterpriseRAGを紹介しており、これはエンタープライズにおける検索拡張生成(RAG)システムにおける決定的な「オーケストレーション・ギャップ」を露呈させるものであり、大規模言語モデルが個々の制約にはしばしば適合する一方で、ノイズの多い検索、知識の欠落、および事実の不一致を伴う現実的な本番環境下では、全体的な指示への遵守能力が著しく崩壊することを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットに「有能なアシスタント」になる方法を教えようとしていると想像してください。あなたは、そのロボットに知識ベースとしての本のライブラリを与え、質問を投げかけます。ロボットはライブラリへ行き、数ページを手に取り、読み、そして答えを書き出します。これはRAG(検索拡張生成)と呼ばれます。これは、開かれた本を使って試験を受ける学生のようなものです。すべてを暗記する必要はありませんが、正しい答えを得るために、正しいページを見つけ出し、注意深く読む必要があります。
しかし、ここに落とし穴があります。現実の世界では、ライブラリは散らかった状態です。時として、ロボットは質問とは全く関係のないページを掴んでしまうことがあります(ノイズ)。また、本の中に答えが全く存在しないこともあります(知識の欠落)。さらに、2つの異なる本が同じ事実について正反対のことを言っている場合もあります(矛盾)。これらのロボットに対するテストの多くは、ライブラリが完璧であり、「フランスの首都は何ですか?」といった単純な質問であると想定しています。しかし、現実の世界はもっと複雑です。例えば、「前四半期の収益をテーブル形式で要約してください。ただし、データが欠落している場合は、推測せずに『分かりません』と答えてください。もし2つのレポートが食い違っている場合は、両方を記載してください」といった指示です。
ここからが難所になります。私たちは、ロボットのアシスタントに単に事実を見つけるだけでなく、厳格なルールに従い、行き詰まった時にはそれを認め、混乱した状況でもデタラメを言わずに適切に対処することを望んでいます。もしロボットがこれを実行できなければ、自信満々に間違った答えを出してしまう可能性があり、それは重要な意思決定を行おうとしている企業にとって災難となり得ます。
「やり遂げる力」の失敗
中国移動(China Mobile)のJiutian Researchの研究チームは、これらのAIロボットが現実世界の混乱にどれほど上手く対処できるかを検証するために、より強力で新しいテストであるEnterpriseRAGを構築しました。このテストをAIの「ストレス・テスト」と考えてください。指示が複雑であったり、見つけた情報が壊れていたり、矛盾していたりする場合でも、ロボットが冷静さを保てるかどうかを見るためのものです。
彼らは、エネルギー、医療、法律、金融といった6つの異なる分野にわたる983のトリッキーなシナリオを作成しました。これらのシナリオにおいて、彼らは単に単純な質問をするのではありませんでした。彼らは、「テーブルを使用すること」「推測しないこと」「出典を明記すること」「もし矛盾を見つけたら報告すること」といった、複数のルールを含む複雑な指示をロボットに与えました。そして、ロボットが見つける情報を意図的にめちゃくちゃにしました。無関係なゴミを加えたり、答えを完全に削除したり、偽の矛盾を仕込んだりしたのです。
大きな発見:「オーケストレーション・ギャップ」
結果は衝撃的でした。研究者が、ロボットが「個別の」ルールに従えるかどうかを確認したところ、ロボットはかなり良好な成績を収めました。約**84%**の確率で、ロボットはフォーマットを正しく守る、あるいは出典を明記するといった単一のルールを正しく実行できました。それは、数学のすべてのステップは正解しているものの、最後の答えを書き忘れた学生のようなものでした。
しかし、複数のルールを「同時に」すべて遵守できたかどうかを確認したところ、スコアはわずか**27%へと急落しました。研究者はこれを、57ポイントの「オーケストレーション・ギャップ」**と呼んでいます。AIモデルは一度に一つのことを行うのは得意ですが、複数の複雑な指示を同時にこなそうとすると崩壊してしまうことが判明しました。フォーマットは正しいものの事実を捏造してしまったり、あるいは正しい答えは見つけたものの、データが欠落している時に「分かりません」と言うのを忘れてしまったりするのです。
「役に立ちたい」という罠
最も興味深い発見の一つは、答えが本の中にない状況で、ロボットがどのように対処するかという点です。人間は、もし何かを知らないのであれば、「分かりません」と言うべきであることを知っています。しかし、これらのAIロボットには強い「役に立ちたいというバイアス(helpfulness bias)」があります。彼らはとにかく役に立ちたいと考えているため、答えが見つからないとき、つい作り話をしてしまうのです。
テストにおいて、情報が欠落していた際、ロボットが正しく回答を拒否できたのは、わずか42.7%(最高性能のモデルであるClaude-Opus-4.5であっても)でした。残りの**57.3%**のケースでは、彼らは自信満々に推測するか、あるいは幻覚(ハルシネーション)を生み出していました。これは、自信満々な誤答は、回答がないことよりもしばる場合が多いという点で非常に危険です。
「推論」は助けにはなるが、魔法の杖ではない
研究者たちはまた、「推論」モデル(難しい問題を解く前に、学生が一旦立ち止まって考えるように、回答の前に「考える」プロセスを持つAI)についてもテストしました。これらのモデルは標準的なモデルよりも優れた結果を出しました。例えば、2つの文書が矛盾していることを察知する能力において、彼らはより優れていました。最高の推論モデルは、矛盾を**44.3%**の割合で検知しましたが、他のモデルはそれよりもるかに低い数値でした。
しかし、たとえ「思考する」モデルであっても完璧ではありませんでした。彼らは依然として、すべてのルールを同時に従うことに苦しみ、すべき時に「分からない」と言うべき場面でも、依然として推測してしまうことがありました。この論文は、単にAIをより深く「考えさせる」だけでは問題の解決には不十分であることを示唆しています。ロボットには、十分な情報があるかどうかを判断する方法や、複雑なプロトコルを破ることなく実行する方法についての、より優れたトレーニングが必要です。
結論
この論文は、AIが永遠に壊れていると主張しているわけではありませんが、これらのシステムが深刻な実社会の仕事に対して、どの程度準備ができているかについて、私たちが過大評価していることを示しています。AIが詩を書いたり単純な質問に答えられたりするからといって、それが複雑なビジネス業務や、乱雑なデータ、厳格なルールを扱えることを意味するわけではありません。これらのシステムを信頼できるものにするためには、完璧でクリーンな環境でテストするのをやめ、彼らが実際に生きることになる、混沌とした、ノイズが多く、矛盾に満ちた世界でテストする必要があります。この57ポイントのギャップを埋めることができるまでは、これらのロボットに重要な決定を独断で行わせることは、非常に慎重に行うべきです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。