BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
本論文は、マルチモーダル大規模言語モデルの複雑な推論能力とハルシネーション検出の信頼性を評価するために、テキスト情報の豊富な企業および学術文書に基づいた1,000個の人間によるアノテーション済み質問からなる二言語(英語・ロシア語)ベンチマークであるBEAR-Benchを紹介し、最先端のシステム間においてさえも顕著な性能差があることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の世界において、コンピュータは画像を見て、その中にある言葉を読み取ることに驚くほど長けてきました。街路標識の写真を見せれば、機械はその標識に何と書いてあるかを判別できます。ニュースレポートのグラフを見せれば、線の描く傾向を説明できることも少なくありません。マルチモーダル理解として知られるこの能力は、視覚と言語を一つのスキルへと統合したものです。長い間、課題は単に機械にテキストを明瞭に読ませることにありました。しかし、その次にある、より困難なステップは「推論」です。これは、複雑な文書を見て、ページ内に散らばった複数の異なる情報を探し出し、どこにも書かれていない答えを導き出すためにそれらを結びつける能力のことです。表、チャート、そして文章の段落が詰まった財務報告書を想像してみてください。人間の専門家は、表の中の数字を見つけ、チャートの傾向と比較し、さらにテキストの一文を読むことで、なぜその数字が変化したのかを理解することができます。このような種類の思考をコンピュータに教え込むことは、特に文書の情報が密集しており、英語以外の言語で書かれている場合、依然として困難な未開の領域であり続けています。
YandexとApplied AI Instituteの研究チームは、この種の問題を解決するための新しいテストを作成することで、この問題の解決に向けて大きな一歩を踏み出しました。彼らは自らの創造物をBEAR-Benchと呼んでいます。単純な読解に焦点を当てたり、コンピュータが外部の事実を知っていることを前提としたりする従来のテストとは異なり、この新しいベンチマークは、単一の文書ページ内に存在する情報のみを使用して問題を解くよう機械に求めます。このテストは英語とロシア語の両方に対応したバイリンガル仕様であり、その選択は、機械が英語や中国語以外の言語で苦戦することが多いという、現在のテクノロジーにおけるギャップを浮き彫りにしています。研究者たちは、企業の財務報告書、投資家向けプレゼンテーション、学術的な科学論文など、実世界の文書1,000枚を集めました。これらのページは単純なものではありません。テキスト、表、チャート、図、そして数式がぎっしりと詰め込まれています。
このテストを構築するために、研究者たちは単にコンピュータに質問を生成させたのではありません。技術分野の学位を持つ13人の人間による専門家を雇い、質問と回答を手書きで作成させました。すべてのページ画像に対して、専門家は複数のステップを踏まなければ解けない質問を作成しなければなりませんでした。例えば、ある質問は、コンピュータに表の中の特定の数値を見つけさせ、関連するチャートを見てその数値が時間の経過とともにどのように変化したかを確認し、最後にテキストの一文を読んでその変化の理由を説明させる、といった内容になります。コンピュータは外部知識を使用することを禁じられており、提供された画像内にある情報のみから答えを見つけ出さなければなりません。これにより、テストがインターネットからの事実を暗記する能力ではなく、目の前にある文書を用いて推論する能力を測定していることが保証されました。また、研究者たちは、図解や方程式などの視覚的な複雑さが十分にあり、タスクが挑戦的なものになるよう、文書を慎重にフィルタリングしました。
研究者が16種類の人工知能モデルをこのテストに通したところ、その結果は現在のテクノロジーの立ち位置を明確に示しました。現在利用可能な最も高度なシステムである最良のパフォーマンスを示すモデルは、約75パーセントの質問に正解しました。これは印象的に聞こえるかもしれませんが、これは最も賢い機械であっても、およそ4問に1問の割合で間違いを犯していることを意味します。研究では、これらのモデルは英語と比較してロシア語の文書において著しく性能が低下することが判明しており、言語が依然として大きな障壁であることを裏付けました。さらに、文書の種類も重要でした。モデルは科学論文よりもビジネスレポートにおいて苦戦する傾向があり、特に項目のカウントや、ページの異なる部分からの情報の組み合わせを要求される質問において困難を感じました。
研究者たちは、なぜ機械が失敗したのかについても詳しく調査しました。彼らは、最も一般的なエラーは論理の欠如によるものではなく、むしろ単純な知覚の問題によるものであることを見出しました。コンピュータは、表の中の数字を読み間違えたり、チャート上の特定のラベルを見落としたり、図の中の矢印がどこを指しているのかについて混乱したりすることがよくありました。機械がたった一つの視覚的な詳細を読み間違えると、その後の推論はすべて崩れてしまいます。このことは、これらのシステムが文書を分析する真の専門家になる前に、細部を明確に捉える能力を大幅に向上させる必要があることを示唆しています。
研究者たちは単にモデルをテストするだけでなく、その結果を用いて、機械が間違いを犯しているかどうかを判断する方法があるかどうかも調べました。現実世界の多くの状況においては、コンピュータが間違える可能性があると知るだけでは不十分であり、被害が出る前にそのエラーを検知する方法が必要です。チームは、これらの間違いを特定するためのいくつかの異なる手法をテストしました。その結果、内部構造が見えないクローズドなプロプライエタリ・システムにおいては、別の強力なAIモデルを「審判」として使い、回答をチェックする方法が最善であることがわかりました。内部コードを確認できるオープンなシステムにおいては、コンピュータ自身の内部の信頼度信号をチェックすることが短い回答には有効でしたが、コンピュータが非常に長く詳細な説明を生成する場合には苦戦することがわかりました。研究は、進歩はしているものの、あらゆるエラーを完璧に捉える方法はまだ存在せず、最高のシステムであっても改善の余地が多分に残されていると結論付けています。
この研究が重要なのは、議論を単純な読解の先へと進めるからです。それは、機械がテキストを読むことはできても、それを使って「考える」方法についてはまだ学習過程にあることを示しています。困難で、バイリンガルで、実世界の文書に焦点を当てたテストを作成することで、研究者たちはテクノロジーの強みと弱みの明確な地図を提供しました。彼らは、前進への道筋には、単にモデルを大きくすることではなく、複数の言語における専門的な文書の、乱雑で詳細な現実を扱うためのより優れた方法が必要であることを示しました。機械がチャートを確実に読み取り、それを表と照らし合わせ、細部に迷うことなくその関連性を説明できるようになるまで、金融や科学のような極めて重要な分野での機械の活用には、慎重な人間の監視が必要とされるでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。