← 最新の論文
💻 computer science

ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers

本論文は、4つの主要な対話型定理証明器にわたる自動形式証明翻訳を評価するための初のベンチマークおよび統一されたインフラストラクチャであるITPEvalを紹介し、現在の大規模言語モデルがライブラリの不一致により証明の翻訳において著しく苦戦していること、およびネイティブの型チェックのみでは意味的な忠実度を過大評価してしまうことが多いことを明らかにしている。

原著者: Jiayi Wu, Robert Joseph George, Anima Anandkumar

公開日 2026-07-23
📖 1 分で読めます☕ さくっと読める

原著者: Jiayi Wu, Robert Joseph George, Anima Anandkumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

数学者が4つの異なる言語を話しているものの、全員が全く同じパズルを解こうとしている世界を想像してみてください。「形式的定理証明(formal theorem proving)」という高リスクの舞台では、コンピュータが究極の審判として機能し、数学的証明のあらゆるステップをチェックして、それが100%正しいことを保証します。しかし、フランス語、日本語、スワヒリ語、アラビア語を話す人間と同じように、これらのコンピュータシステム(対話型定理証明器、またはITPと呼ばれる)もまた、独自の文法、語彙、そして事前に承認された事実のライブラリを持っています。あるシステムで完璧に書かれた証明は、他のシステムにとってはしばしば意味不明なものとなります。これは孤独な問題を生み出します。もし素晴らしい証明がある一つの言語で書かれていたとしても、それを他のシステムで簡単に利用したり検証したりすることができないからです。科学者たちは、この溝を埋めるための「万能翻訳機」を構築しようと試みてきました。人工知能(AI)がこれらの数学的証明を自動的に翻訳できるようになり、コミュニティ全体が成果を共有できるようにすることを期待してのことです。

ここで、大規模で厳格な言語試験として機能する新しい研究、ITPEVALが登場します。研究者たちは、今日の最もスマートなAIモデルが、4つの主要なシステム(Lean 4、Rocole、Isabelle、HOL Light)の間で、実際に形式的な数学的証明を翻訳できるかどうかを確かめたいと考えました。彼らは単にAIに推測させたのではありません。彼らは、1,500以上のソースファイルと7,000近い定理を備えた、特化したテスト環境を構築しました。テストは2つのレベルに分けられました。一つは、単純で自己完結的な数学の問題を用いた「制御(Controlled)」レベル(外部の参照がない語彙クイズのようなもの)、もう一つは、複雑でシステム固有のルールに依存する、実際の複雑なライブラリコードを用いた「エコシステム(Ecosystem)」レベル(スラングや文化的背景を含むフルバージョンの会話のようなもの)です。

結果は、「悪くはないが、依然として非常に困難である」という混合したものでした。AIが定理の「命題(what)」のみを翻訳しようとした場合、最高のモデルの正解率は約**29.1%でした。しかし、実際の「証明(how)」を翻訳するよう求められると、成功率はわずか10.5%**へと急落しました。研究によって明らかになった最大の障害は、数学そのものや論理的基盤の違いではなく、「エコシステム」でした。AIは、ターゲットとなるシステムの特定のライブラリ、命名規則、および自動化スタイルをナビゲートしなければならない時に、最も苦戦しました。それは、AIが「猫がマットの上に座った」という文章は理解できても、特定のブランドのマットと特定の種類の猫を使用しなければならない特定のダイアレクト(方言)への翻訳を求められると失敗するようなものです。

さらに、研究者たちは、コンピュータに単に「これは正しく見える」と言わせる(型チェック)だけでは不十分であることを発見しました。彼らがより深い「意味チェック」を行ったところ、AIの翻訳がコンピュータの基本的なテストを通過したとしても、その**46%**のケースにおいて、元の証明よりも数学的に弱かったり、あるいはわずかに異なっていたりすることが分かりました。この研究は、AIが基礎については習熟しつつあるものの、真の万能翻訳機になれる前に、各数学システムの独特な「文化」に適応する方法を学ぶ必要があることを示唆しています。著者らはまた、数学を自然言語に翻訳し、再び戻すという「ラウンドトリップ」テストについても調査し、その結果は使用されるシステムによって大きく異なることを発見しました。これは、複数のシステムを併用することが助けになる可能性を示唆していますが、まだ魔法の解決策にはなっていません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →