← 最新の論文
💬 NLP

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

本論文は、座標ベースのバウンディングボックス出力をテキストベースの「引用および検索(quote-and-retrieve)」インターフェースに置き換えることで、視覚的文書理解における根拠のハルシネーションを大幅に減少させ、エビデンスの想起を向上させると同時に、コストのかかる領域レベルのラベルなしでの効果的な学習を可能にすることを実証している。

原著者: Zhuchenyang Liu, Yao Zhang, Yu Xiao

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Zhuchenyang Liu, Yao Zhang, Yu Xiao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、あるミステリーを解決しようとしている探偵だと想像してください。ただし、現場は犯罪現場ではなく、領収書、チャート、手書きのメモが積み重なった巨大で乱雑な書類の山です。人工知能の世界では、これらは「視覚的文書(visual documents)」と呼ばれます。コンピュータが優れた探偵になるためには、単に答えを推測するだけでなく、どこに手がかりを見つけたのかを正確に指し示さなければなりません。これを「アトリビューション(根拠付け)」と呼びます。

長い間、コンピュータに手がかりを指し示させる標準的な方法は、テキストの周りにボックスを描き、そのボックスのGPS座標(例:「x=50, y=100」)を出力させることでした。これは、子供にページ上の特定の単語を指させる際に、数字を叫ばせるようなものです。それは非常に不器用な「アイ・スパイ(隠れたもの探し)」の遊び方です。これからあなたが読む論文は、なぜこの「座標ゲーム」がこれほどまでに失敗しているのかを調査しています。研究者たちは、問題はコンピュータが手がかりを見つけるのが下手なことではなく、ゲームのルール(座標)が混乱を招きすぎていることにあると示唆しています。彼らは新しいルールを提案しています。数字を叫ぶ代わりに、コンピュータは手がかりを言葉通りに、一言一句正確に「音読」すべきであるというルールです。そして、賢い助手(検索システム)が、それらの言葉がページのどの位置にあるかを自動的に見つけ出します。

「指し示し」の重大な不具合

研究者たちは、あるフラストレーションの溜まる観察から調査を開始しました。強力なAIモデルに対し、長い文書に関する質問に答えさせ、その根拠を証明させたところ、モデルは答え自体は完璧に導き出すものの、どこで見つけたかを示すことには極めて劣悪であるという事実です。たとえ答えが完璧であっても、AIはしばしば間違った段落を指したり、空白のページの真ん中にボックスを描いたりしてしまうのです。論文ではこれを「アトリビューション・ハルシネーション(根拠付けの幻覚)」と呼んでいます。これは、数学の問題は正解したものの、解答をノートではなく先生の机の裏に書いてしまう生徒のようなものです。

大きな疑問はこうでした。AIは実際に場所を見つけるのが下手なのか、それとも単に「座標」という言語を話すのが下手なだけなのか?

「音読」実験

これをテストするために、チームは6つの異なるAIモデルを用いて大規模な実験を行いました。文書、質問、モデルはすべて同じ条件に保ちましたが、ゲームのルールだけを変更しました。

ゲームA(従来の方法): AIは、証拠の周りにボックスを描くための一連の数字(座標)を出力しなければならない。
ゲームB(新しい方法): AIは、文書内の正確なテキストを引用することで、単に「証拠を音読する」よう指示される。別のコンピュータプログラムが、その引用文を受け取り、文書内の該当箇所を自動的に見つけ出す。

結果はまるで手品のようなものでした。AIが数字を叫ぶ代わりに「音読」することを許されると、正しい場所を見つける能力が急上昇したのです。

  • 従来の方法: AIが正しい証拠を見つけられた割合は8%未満であった。
  • 新しい方法: AIが正しい証拠を見つけられた割合は**26%から47%**の間であった。

これは驚異的な跳躍です!「ハルシネーション(間違った場所を指すこと)」の発生率は約半分に減少しました。最も驚くべき点は、実際の回答の質にはほとんど変化がなかったことです。モデルは以前と同じくらい賢かったのです。ただ、座標を使って苦労する必要がなくなったことで、自分の仕事(根拠の提示)をより上手く示せるようになっただけでした。

なぜ座標が問題なのか

論文は、この失敗の原因は知能の欠如ではないと主張しています。それは「インターフェースのアーティファクト(生成物による不具合)」です。料理人にレシピを説明させる場面を想像してみてください。もし、秘密の数字コードを使って食材を説明するように強制したら、料理自体は正しく作れても、食材のリストを正確に記述することはできないかもしれません。しかし、「小麦粉を2カップ」と普通に言わせれば、リストは正確になります。

研究者たちは、AIモデルは実際に情報の場所を「知っている」ことを発見しました。ただ、座標を使用しなければならないとき、彼らは(言葉による)表現(例:「2ページ目の、テーブルの下にある」など)を用いて説明していたのです。引用方式に切り替えることで、AIが本来の強みである「言語」を使えるようにしたのです。

AIに優れた探偵になってもらう方法

研究者たちは単にルールを変えただけではありません。人間がすべてのボックスにラベルを貼って採点する必要なく、AIがこの新しいゲームでさらに上手くなる方法を教えたいと考えました。そこで、彼らはGRPO(Group Relative Policy Optimization)と呼ばれる特別な学習法を作成しました。

AIが質問に答え、別のAIである「判定役(Judge)」がその回答と証拠を確認するというゲームを想像してください。判定役は、人間がどこに証拠があるかを教える必要はありません。代わりに、判定役は単にチェックします。「答えは正しいか? 引用された言葉は実際にその答えを裏付けているか?」もしAIが正しい言葉を引用していれば、報酬が与えられます。もしデタラメを言えば、報酬はゼロになります。

この手法を用いて、彼らは小型のAIモデル(80億パラメータのバックボーン)を訓練し、証拠を見つける能力を大幅に向上させました。

  • 訓練前: モデルの「厳密なアトリビューション精度(Strict Attribution Accuracy)」は**22.4%**でした。
  • 訓練後: それは**33.8%**へと跳ね上がりました。

これは大きな意味を持ちます。なぜなら、何千枚ものページにボックスを描くための高価な人間によるラベル付けを必要とせずに、AIをより信頼でき、検証可能なものへと訓練できることを意味するからです。

まとめ

この論文は、AIをより信頼性の高いものにするための実用的な道筋を示しています。それは、「座標インターフェース(数字によるボックスの描画)」がAIのハルシネーションを引き起こす弱点であるということを示しています。引用(テキストの書き出し)を行い、システムに場所を特定させる「言語インターフェース」へと切り替えることで、AIが証拠を指し示す能力を劇的に向上させることができます。

これらの知見は、AIが文書を「見る」ことができないのではなく、指し示し方を求める「方法」が壊れていることを示唆しています。AIに引用による発話をさせ、スマートなシステムに指し示しを任せることで、私たちはより信頼できる探偵を手に入れることができます。論文は、これが、根拠を示すことが回答を得ることと同じくらい重要な法律、医学、金融などの分野において、より優れたAIを構築するための、実現可能でコスト効率の高い方法であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →