Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities
本論文は、テキストからコードへの生成とテキストから画像への生成のパラダイムを統合することで、テキストによるプロンプトから数学的に正確な図表を生成する大規模言語モデルの能力を評価するために設計された初の包括的なベンチマークである「Math-Vision Diagrams」を紹介し、この重要なスキルにおける現在の著しい限界を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに完璧な家の設計図を描く方法を教えようとしている場面を想像してみてください。ただ「家を描いて」と言うだけでは、壁が真っ直ぐであったり、ドアが正しい位置にあったりすることを期待することはできません。角がどこにあるのか、梁の長さはどのくらいか、屋根は特定の角度でなければならないといったことを、正確に説明する必要があります。これが**数学的図表生成(mathematical diagram generation)**の世界です。これは、二つの強力な能力の交差点に位置しています。一つは、三角形の内角の和は180度であるという論理を知っている「数学的推論(数学的な脳)」であり、もう一つは、実際に絵を描く「視覚的創造力(芸術的な能力)」です。長い間、コンピュータは画像を見て質問に答えたり、単純なチャートを作成するためのコードを書いたりすることには非常に長けてきました。しかし、コンピュータに対して、文章題を見て、そこから数学的に正確な図表をゼロから描き出すよう求めることはどうでしょうか?それは、シェフにレシピを読み取らせた直後に、アイシングが完璧に絞られ、層が均一に重なった、写真と全く同じ見た目のケーキを焼くよう頼むようなものです。これは非常に大きな挑戦です。なぜなら、数学には「だいたい合っていればいい」という概念がないからです。もし線が1ミリでもずれていたり、ラベルの位置が間違っていたりすれば、その図表は役に立たないものになります。まるで、崖へと続く間違った地図のようなものです。
これこそが、Pandita AI Inc.の研究チームが取り組むことにした課題です。彼らは、ロボットが図を使って数学の問題を「解く」ためのテストはたくさんある一方で、ロボットがそれらの図をそもそも「作成」できるかどうかをテストする公平な方法がないことに気づきました。そこで、彼らは新しい遊び場であるMath-Vision Diagramsを作り上げました。これは、AIにとっての巨大で厳格な美術の授業だと考えてください。そこでは、先生(ベンチマーク)が学生(AI)にテキストによる説明を与え、単に見た目が美しいだけでなく、数学的に完璧な図を描くよう要求します。
研究者たちはまず、幾何学から統計学まで、あらゆる分野を網羅する実際のコンテストから集めた3,040個の難解な数学問題を集めました。そこから、視覚的な図表に大きく依存している2,920個の問題へと絞り込みました。そして、他のAIモデルと人間の数学の専門家を巧みに組み合わせることで、元の、時には曖昧な問題文を、極めて明確な指示へと変換しました。例えば、単に「円を描け」と言うのではなく、新しいプロンプトでは「中心で水平および垂直の直径が交差する、'O'とラベル付けされた円を描け」と言うようになります。彼らはさらに、これらの指示が人間にとって完璧に図を描けるほど明確であるかどうかを、人間の専門家に1から5のスケールで採点させ、ダブルチェックを行いました。
「試験問題」の準備ができたら、彼らは11種類のAIモデルをテストにかけました。これらのモデルの中には、詳細な設計図(コード)を書き、それをコンピュータが画像として構築する「建築家」のようなモデル(text-to-code)もあれば、コードを一切書かずに、説明から直接絵を描こうとする「デジタル画家」のようなモデル(text-to-image)もあります。研究者たちは、いくつかのツールを用いて、図が元の数学問題とどれほど一致しているかを測定しました。具体的には、線やエッジが完璧に一致しているか、全体的な見た目がターゲットにどれほど似ているか、そしてコードがエラーを出さずに動作するかどうかを確認しました。
結果は、目覚ましい進歩と、謙虚にならざるを得ない現実の突きつけが混ざり合ったものでした。研究によると、単一のAIモデルがすべてにおいて達人であるということはありませんでした。「建築家」モデル(コード生成器)は、数学的な構造を正しく捉えること(例えば、正方形が実際に4つの等しい辺を持つようにすることなど)には概して優れていましたが、コードがコンパイルできずに失敗し、10%から30%の割合でクラッシュするという問題を抱えていました。一方、「画家」モデル(直接的な画像生成器)は、ほぼ常に画像を生成できるため非常に信頼性は高いのですが、その図画は数学的な構造に欠けることが多く、線がわずかに歪んでいたり、ラベルの位置が間違っていたりしました。
最も興味深い発見の一つは、最も高度なモデルであっても、有名な大手AIを含む多くのモデルが著しく苦戦したことです。最も優れたパフォーマンスを示したモデルであるClaude Opus 4.6は、視覚的な見た目と数学的構造をかなり正確に捉えましたが、それでも間違いを犯しました。一方で、GPT-5.4というモデルは驚くほど低い性能を示し、しばしば過度に複雑な図を作成して数学的に誤ったものを作ってしまいました。これは、時に「考えすぎる」ことが、描画プロセスを混乱させてしまうことを示唆しています。また、研究者たちは、単純な幾何学についてはAIにとって扱いやすくなりつつある一方で、統計的なチャートや抽象的な位相幾何学的形状のような、より複雑なトピックは依然として大きな障壁であることを指摘しました。
結局のところ、この論文は、私たちはまだこの技術の初期段階にいることを示唆しています。AIは現在、まともに見える図を生成することはできますが、数学や科学に求められる「完璧な精度」をマスターするには至っていません。チームは、すべてのデータ、コード、およびテストツールを誰でも利用できるように公開しました。これにより、モデルがどこで失敗するのかを明らかにすることで、次世代のAIが、毎回必ず完璧な円を描けるようになることを願っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。