Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents
本論文は、リンクの有効性、関連性、事実の正確性という観点から大規模言語モデルが生成した研究報告書を評価するために抽象構文木パーサーを用いた新たな評価フレームワークを導入し、最先端モデルであっても引用のアクセス可能性と関連性は高い一方で事実の一貫性に課題を抱えており、この問題は検索の深さが深まるにつれて悪化するという重大な乖離を明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超賢い研究アシスタント(AI モデル)のチームを雇って、複雑なトピックに関するレポートを作成させると想像してください。「インターネットで真実を見つけ、レポートを作成し、すべての事実の正確な出典をリストアップするように」と指示します。
共有された論文は、これらの AI アシスタントが提出した宿題をチェックする品質管理検査員のようなものです。検査員は単にレポートを読んでうなずくだけでなく、AI が記述したすべての脚注をチェックするための特殊なロボットを構築しました。
彼らが発見したことを簡単に説明します。
3 段階の検査
研究者たちは、AI の引用を 3 つの特定の方法でチェックするシステムを構築しました。これは 3 段階のセキュリティチェックのようです。
- 「ドアは開いているか?」チェック(リンクが機能するか): リンクは実際に機能しますか?クリックするとウェブページに移動しますか、それとも壊れた 404 エラーになりますか?
- 「これは同じ話題についてか?」チェック(関連コンテンツ): リンクが機能する場合、そのウェブページは AI が主張したトピックについて実際に語っていますか?(例:AI は「このリンクは猫が犬であることを証明する」と言いますが、リンクは実際にはラザニアのレシピです)
- 「それは真実か?」チェック(事実確認): これが最も難しい部分です。ウェブページは、AI が主張した通りの具体的な事実、数値、または日付を本当に含んでいますか?
大きな驚き:「光沢のある包装」の問題
最も衝撃的な発見は、AI アシスタントは最初の 2 つのチェックでは優れているが、3 つ目のチェックではひどいという点です。
- 比喩: 学生が論文を書き、参考文献リストを含めたと想像してください。
- 94% の場合、参考文献リストにある本は実際に図書館の棚に存在します(リンクが機能する)。
- 80% の場合、それらの本は実際に学生が書いている主題についています(関連コンテンツ)。
- しかし、実際に本を開いて学生が引用した特定のページを読むと、約 40% から 77% の場合のみ、本は学生が主張した通りのことを実際に述べています。
結論: AI は関連するウェブサイトへの機能するリンクを見つけるのが非常に得意ですが、そのウェブサイトが何を述べているかについてはしばしば嘘をついています。これは、常に正しい美術館へ案内してくれるが、展示物についての話を間違って語るガイドのようなものです。
「多ければ少ない」という逆説
研究者たちは、AI に「より深く」検索させ、より多くのウェブサイトを見るように指示した場合に何が起こるかもテストしました。「AI に 2 つではなく 150 のウェブサイトを読ませれば、より正確になるだろう」と思うかもしれません。
間違いです。
- 比喩: パズルを解こうと想像してください。パズルのピースが 2 つしかない場合、絵は簡単にわかります。しかし、誰かが 150 のピースを前に投げ出せば、圧倒されてしまいます。絵を完成させるために、合わないピースを無理やり組み合わせ始めるかもしれません。
- 結果: AI が 2 から 150 へと、より多くのソースを見るように強制されるにつれ、真実を語る能力は実際には約 42% 低下しました。リンクは機能し続け、トピックも依然として関連していましたが、具体的な事実が混乱しました。AI は「情報過多」に陥り、詳細を幻覚として作り出し始めました。
誰がうまくいったか?誰が不振だったか?
- 「フロンティア」モデル(大手テック企業の AI): これらのモデル(OpenAI、Anthropic、Google のものなど)は、完璧に見えるレポートを生成するのが非常に得意でした。機能するリンクと関連トピックをほぼ常に発見しました。しかし、最も賢いモデルでさえ、事実を正しく把握できたのは 39% から 77% の場合のみでした。
- オープンソースモデル: これらのモデルはさらに苦労しました。その多くは、引用付きのレポートを作成するというタスクさえ完了できませんでした。試みた場合でも、機能するリンクを見つけたり、事実を正しく把握したりする能力ははるかに劣っていました。
結論
この論文は、AI 研究が単に下部にリンクのリストを持っているからといって信頼できるわけではないと結論付けています。長い機能するリンクのリストは「誤った安心感」を生み出します。ドアが開いていて、部屋が正しい部屋だとしても、AI がその部屋の中身について語る話が真実であるとは限りません。
研究者たちは、この「検査ロボット」を構築することで、見た目によい引用と実際に真実である引用の間のギャップを私たちに明らかにしました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。