← 最新の論文
🤖 AI

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe v3 は、視覚的に豊かなドキュメントに対する複雑なマルチモーダル検索拡張生成(RAG)タスクを評価するために、10 の分野にまたがる 26,000 ページのドキュメントと 3,099 の多言語クエリからなる大規模なベンチマークを提案し、既存のモデルが視覚要素や開かれたクエリ、微細な視覚的グラウンディングにおいて依然として課題を抱えていることを明らかにしています。

原著者: António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

公開日 2026-04-22
📖 1 分で読めます☕ さくっと読める

原著者: António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文「ViDoRe V3」は、**「AI による『賢い検索と回答』システムの、本当の実力を測るための、世界最高峰のテスト問題集」**を作ったというお話しです。

これまでの AI 研究は、少し子供っぽかったり、現実離れしていたりすることがありました。この論文は、「いやいや、実際のビジネスや専門家の現場では、もっと複雑で難しいことを求められているよ!」と指摘し、その難しさを正しく評価できる新しい基準を提案しています。

わかりやすく、いくつかのメタファーを使って説明しましょう。

1. 従来のテストは「お絵かきドリル」だった

これまでの AI のテスト(ベンチマーク)は、**「教科書の 1 ページだけを見て、その中の文章から答えを探す」**ような、とても単純なものでした。

  • 例: 「青い空について書かれている段落を探して」と言われ、文章だけを読んで「ここだ!」と指を差す。

しかし、現実の世界(特に企業や研究現場)では、そんな単純なことは起きません。

  • 現実: 「この会社の 2024 年の報告書(1000 ページある)を見て、グラフから売上高の傾向を読み取り、の数字と照らし合わせ、さらに写真の設備状況も考慮して、なぜ利益が減ったのかを説明して」と言われます。
  • 問題点: 従来のテストでは、グラフや写真、複数のページをまたぐ複雑な思考は評価されていませんでした。

2. ViDoRe V3:「現実世界の探偵ゲーム」

この論文が作ったViDoRe V3は、まるで**「現実世界の探偵ゲーム」**のようなテストです。

  • 広大な図書館(データ): 10 種類の異なる分野(金融、医療、工学など)から、26,000 ページもの「本」を集めました。これには文章だけでなく、表、グラフ、図解、写真がぎっしり詰まっています。
  • 複雑な依頼(クエリ): 人間が実際に使いそうな、難しい質問を 3,099 個作りました。
    • 「S-3 航空機の給油口はどこにある?」(図解を見て場所を特定)
    • 「2018 年から 2023 年の雇用安定性の差を、複数の国のデータ表から比較して」といった、**「表とグラフと文章を全部混ぜて考えないと答えられない」**ような質問です。
  • 6 言語対応: 英語やフランス語の資料を、スペイン語やドイツ語などで質問することもできます。まるで**「翻訳しながら探偵をする」**ような難易度です。

3. 人間が「正解」を徹底的にチェックした

AI に「正解」を教えるために、12,000 時間もの時間をかけて、専門家が手作業でチェックしました。

  • 正解の答え: 単に「ここ」と言うだけでなく、「このグラフのこの部分」と「この表のこの行」が根拠だと、**「どの範囲(枠)」**を指せばいいかを、人間が一つ一つ丁寧に囲んで(バウンディングボックス)記録しました。
  • これにより、「AI が正解を言ったとしても、その根拠が正しい場所を指しているか」まで厳しく評価できます。

4. 実験結果:AI の「得意」と「苦手」

このテストで最新の AI を試したところ、面白い結果が出ました。

  • 得意なこと:

    • 画像を見るのが得意: 文章だけを読む AI よりも、「画像そのもの」を見て検索する AIの方が、表やグラフを含む資料の検索では圧倒的に強かったです。
    • リランキング(再順位付け): 一度検索した結果を、もう一度「もっと良い答えはないか?」と人間のように考え直す(リランキング)と、精度が劇的に上がりました。
  • 苦手なこと(まだ課題):

    • 複雑な推理: 「A と B を比較して、C の原因を推測する」といった、**「頭をフル回転させるような質問」**にはまだ弱いです。
    • 根拠の特定: 答えは合っても、「どのページの、どの部分」が根拠かを正確に指し示す(視覚的な位置特定)のが、人間に比べると非常に苦手です。まるで「答えは知っているけど、教科書のどこに書いてあったか忘れた」状態です。

5. この研究の意義:「AI の成長を促すための鏡」

この論文の最大の貢献は、「AI がどこまで成長できているか、そしてどこがまだ未熟か」を、現実の複雑な状況に合わせて正確に映し出す鏡を作ったことです。

  • オープンな挑戦: このテスト問題は、誰でも自由に使えるように公開されています。
  • 未来への道標: 「今の AI は、表やグラフを読み解くのが苦手だ」という弱点が明確になったことで、研究者たちは「次はここを強化しよう!」と具体的な目標を持って開発を進められます。

まとめ

ViDoRe V3 は、「AI に『教科書の 1 ページ』だけでなく、『現実世界の膨大な資料』から、表や図を駆使して答えを導き出す力があるか」を試す、究極のテスト問題集です。

これにより、AI は単なる「文章検索機」から、**「表やグラフも読み解き、複雑な問題を解決できる『真の知的アシスタント』」**へと進化するための道筋が見えてきました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →