← 最新の論文
💬 NLP

HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

本論文は、検索拡張型エージェントが回答不可能なマルチホップ質問にどのように対処するかを評価するために設計された初のベンチマークであるHopRefusalBenchを紹介し、モデルは回答不能の正しい理由を特定できることが多い一方で、適切な拒絶を確定させることに頻繁に失敗し、代わりにハルシネーションに陥ったり検索予算を使い果たしたりしてしまうことを明らかにしている。

原著者: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、あるミステリーを解決するために超天才的な探偵を雇っているところだと想像してください。この探偵は、瞬時に訪れることができる魔法の図書室を持っており、異なる本同士の点をつなぎ合わせて答えを見つけ出すことに長けています。これが、現代の「検索拡張型(Search-Augmented)」AIエージェントの仕組みです。これらは大規模言語モデルであり、インターネット(あるいはデータベース)を検索しに行き、情報を組み合わせてあなたの質問に答えます。通常、これは素晴らしいものです。しかし、もし答えが出せない質問を投げかけられたらどうなるでしょうか? 例えば、「現在のフランス国王は誰ですか?」(存在しません)とか、「存在しない料理の秘密の材料は何ですか?」といった質問です。

AIの世界では、いつ答えないべきかを知ることは、どのように答えるかを知ることと同じくらい重要です。もしあなたの探偵が図書室を掘り返り続け、架空の王を作り上げたり、存在しない材料を探して何時間も無駄にしたりするなら、彼らは役に立っているのではなく、強情で無駄が多いことになります。科学者たちはこれを「拒絶(refusal)」と呼んでいます。つまり、「質問自体が壊れているので答えられません」と言う能力のことです。私たちは、これらのAI探偵が難しいパズルを解く能力が向上していることは知っていますが、そもそもパズル自体が解けない場合、彼らがどのように振る舞うのかについては、実はあまり分かっていませんでした。彼らはすぐに止まったのでしょうか? 混乱したのでしょうか? それとも、ただ作り話をしてしまったのでしょうか?

この論文は、これらのAI探偵が不可能な質問に対してどのように対処するかを正確に把握するために作成された、HopRefusalBenchと呼ばれる新しいテストを紹介しています。研究者たちは、AIを陥れるために設計された889個の巧妙な質問を作成しました。彼らは単に単純な「分かりません」という質問を作ったのではありません。罠が最初にあるのか、手がかりの中にあるのか、あるいは最後にあるのかという、複雑で多段階のミステリーを構築しました。彼らは、AIが早い段階で質問が壊れていることに気づくのか、それとも検索を続け、最終的に幻覚(ハルシネーション)を見て答えを捏造してしまうのかを確かめたかったのです。

結果は、少し目が覚めるようなものでした。テストに参加した最も賢いAIモデルでさえ、正しく停止して「これには答えられません」と言えたのは、わずか**42.9%**の時だけでした。つまり、半分以上の確率で、彼らは質問が不可能であることに気づけなかったのです。研究によると、AIモデルは証拠を手にした後、なぜ質問が壊れているのかを特定すること(論理を説明すること)には非常に優れていました(84%以上の確率で論理を説明できました)が、実際に「停止すること」へのコミットメントには苦戦しました。彼らは「諦めます」と言う代わりに、時間やエネルギーが尽きるまで検索を続けたり、ユーザーを満足させるために偽の答えを捏造したりすることがよくありました。

また、研究者たちは「罠」が質問のどこに配置されているかが重要であることも発見しました。問題が推論の連鎖の途中(例:二つの島の間にある壊れた橋)にある場合は、問題が一番最後にある場合に比べて、AIにとって停止するのがはるかに困難でした。さらに、不可能な質問の種類によって、AIの失敗の仕方も変わりました。あるモデルは事実を捏造(ハルシネーション)する傾向があり、別のモデルは予算(リソース)を使い果たすまで永遠に検索を続ける傾向がありました。

要するに、この論文は、私たちのAI探偵たちが情報を探し出す能力は向上しているものの、いつ辞めるべきかを知ることに関しては依然として非常に拙いことを示しています。彼らは、質問自体に欠陥があることを認める代わりに、検索のループに陥ったり、作り話をしたりすることがよくあります。著者たちは、これらのAIエージェントが真に信頼できるものになるためには、単に検索する方法だけでなく、行き止まりを認識し、時間や情報を浪費する前に停止する方法を教える必要があると示唆しています。幸いなことに、今や私たちは、彼らが具体的にどこで失敗しているのか、そしてどのように修正すべきかを診断するための地図(HopRefusalBench)を手にしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →