← 最新の論文
💻 computer science

MathAtlas: A Benchmark for Autoformalization in the Wild

本論文は、103 冊の教科書から約 52,000 件の大学院レベルの数学的概念を網羅する初の大規模自動形式化ベンチマークである MathAtlas を紹介するものであり、これにより複雑で依存関係に富んだ研究数学を現在のモデルが処理することの極端な困難さが明らかになった。

原著者: Nilay Patel, Noah Arias, Davit Babayan, Victoria Cochran, Timothy Libman, Hafsah Mahmood, Liam McCarty, Soli Munoz, Laurel Willey, Jeffrey Flanigan

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Nilay Patel, Noah Arias, Davit Babayan, Victoria Cochran, Timothy Libman, Hafsah Mahmood, Liam McCarty, Soli Munoz, Laurel Willey, Jeffrey Flanigan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。人間の物語を「Lean」という厳密でコンピュータが読み取れる言語に変換する、卓越した翻訳者がいると。長らく、この翻訳者は高校の数学の問題や基本的なパズルといった単純な物語でのみテストされてきました。コンピュータはこれらの変換を容易に行うことができました。なぜなら、規則は単純で、コンピュータは以前に同様の規則をすでに目にしてきたからです。

しかし、この翻訳者に大学院レベルの複雑な研究論文の変換を頼んだらどうなるでしょうか。それがMathAtlasが取り組む問題です。

以下に、日常の比喩を用いて、この論文が何を行うかを簡単に解説します。

1. 問題:「図書館」が大きすぎる

数学の教科書(設計図)に基づいて家を(形式的な証明を)建てようとしていると想像してください。

  • 従来のベンチマーク: 以前のテストでは、翻訳者に小さな物置を建てることしか求められていませんでした。材料はすべて工具箱の中にあり、指示も短かったのです。
  • 現実世界: 大学院の数学は、摩天楼を建てるようなものです。最上階を建てるには50階が必要で、50階を建てるには49階が必要であり、そのようにして基礎までさかのぼります。
  • 課題: 高度な数学では、「基礎」(定義や理論)がまだコンピュータの言語で構築されていないことがよくあります。翻訳者が「リー環」(複雑な概念)の定義を知らなければ、それを用いる定理を変換することはできません。

2. 解決策:MathAtlas(「野生」の地図)

著者たちは、MathAtlasという大規模な新しいテストセットを作成しました。

  • 規模: 彼らは103冊の大学院レベルの数学教科書を収集しました。これは、5万2000ページに及ぶ高度な数学の図書館をデジタル地図に変えるようなものです。
  • 「依存関係グラフ」: これが論文の超能力です。各ページに、まず読む必要がある他のページへ向かう矢印が描かれている「自分だけの冒険」の本を想像してください。MathAtlasはこの矢印を描きます。それは、命題15を理解するためにはまずデデキント環を理解する必要があり、それはさらに素イデアルを必要とすることを示します。
  • 重要性: これにより、AIは単に一文を変換するだけでなく、「このものを建てるための道具を持っているか?持っていなければ、まず道具を見つけたり作ったりできるか?」を判断することを強いられます。

3. 結果:AIは泥沼に立ち往生している

著者たちは、利用可能な最も賢いAIモデルをMathAtlasでテストし、結果は謙虚さを促すものでした。

  • スコア: 最高のAIでさえ、定理の記述の10%未満を正しく変換しました。定義については、約**16%**でした。
  • 「深さ」の罠: 「依存関係ツリー」(定義を見つけるためにさかのぼる必要があるステップ数)が深くなるほど、AIのパフォーマンスは低下しました。
    • 比喩: AIが一文を変換するために10個の以前の概念を調べる必要がある場合、混乱して諦めてしまいます。最も難しい問題(依存関係ツリーが最も深い場合)では、AIの正解率はわずか**2.6%**でした。
  • 「Mathlib」効果: AIが変換する必要のある概念が、すでに「Mathlib」という有名なライブラリ(AIがすでに研究した可能性のある既製の工具箱のようなもの)に含まれている場合、AIはわずかに良い結果を示しました。概念が新しく、そのライブラリに含まれていない場合、AIははるかに苦労しました。

4. 「信頼性」テスト(MA-Align)

この論文では、MA-Alignと呼ばれる新しいテストも作成されました。

  • 問題: 時々、AIは原文を、完璧に見えエラーなく実行されるコードに変換しますが、実際には元の数学とは全く異なる意味を表していることがあります。「猫がマットに座った」を「犬がピザを食べた」と言うコンピュータプログラムに変換するようなものです。プログラムは動作しますが、それは間違いです。
  • テスト: 彼らはAIの判定者に、変換が「忠実」(意味に忠実)かどうかをチェックするよう求めました。その結果、最も優れたAIの判定者でさえ、特に複雑な大学院レベルの定義については、しばしば欺かれていたことがわかりました。

結論

この論文は、AIが単純な数学では上手くなっているものの、現在、複雑で現実的な大学院レベルの数学を変換する能力は極めて劣っていると結論付けています。主なボトルネックは単語の変換だけではありません。アイデア間の膨大なつながりの網を理解し、家を(定理を)建てる前に必要な「道具」(定義)をどのように構築するかを知ることです。

MathAtlasは、AIがこれらの深遠で複雑な依存関係に対処する方法を学ぶための挑戦コースとして、誰でも利用できるように公開されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →