← 最新の論文
🤖 AI

Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics

本論文は、自然言語に近いインターフェースとルール駆動型の自動化を用いて、LLMが生成した数学的記述を検証済みのLeanファイルへと変換することで、LLM生成の数学と形式検証の架け橋となる依存型ベースの証明器であるVisoredを紹介し、特化した学習を行うことなくminiF2Fベンチマークにおいて効果的な性能を実証する。

原著者: Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

公開日 2026-06-17
📖 1 分で読めます☕ さくっと読める

原著者: Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、天才的ながらも少し「幻覚(ハルシネーション)」を起こしやすい学生(AI)に、数学の証明の書き方を教えていると想像してください。その学生は、自然言語による証明の「ストーリー」を書くことは得意なのですが、厳格な数学の教師が真実だと信じるために必要となる、細かな、退屈なディテールを飛ばしてしまうことがよくあります。

現在、この学生に厳格なコンピュータ可読言語(Leanなど)で証明を書かせようとすると、彼らは行き詰まってしまいます。どの特定の「ライブラリのルール」を選べばよいのか分からなかったり、「ゼロで割ってはいけない」といった極めて細かい詳細を見落としたりするのです。

Visoredは、この問題を解決するために設計された新しいツールです。これは、学生の自然言語と厳格なコンピュータ言語の間に位置する、翻訳者でありセーフティネットとして機能します。

その仕組みを、いくつかの比喩を用いて説明します。

1. 「制御された自然言語」(スクリプト)

Visoredは、AIにいきなりLeanのような硬直したコードのような言語を書かせるのではなく、制御されたバージョンの英語で書かせます。

  • 比喩: これは「マッドリブス(穴埋め問題)」形式のスクリプトのようなものです。AIは何でも自由に書けるわけではありません。「Let x be...(xを...とする)」「Assume...(...と仮定する)」「Then...(そのとき...)」といった特定の文章テンプレートを使用しなければなりません。
  • なぜ役立つのか: これにより、AIは自分の得意領域(英語を書くこと)に留まりつつ、コンピュータが理解できるほどに構造を厳格に保つことができます。白紙のページを与える代わりに、空欄を埋める形式のワークシートを与えるようなものです。

2. 「中間役」(IR)

Visoredは、AIが何を意図したかを単に推測するだけではありません。その英語のスクリプトを、**中間表現(IRと呼ばれるもの)**へと変換します。

  • 比喩: AIが下書きを書くと想像してください。Visoredはその下書きを受け取り、AIが飛ばしてしまった目に見えない「脚注」をすべて補完します。AIが「xは正である」と仮定しましたか?Visoredはそれを書き留めます。AIが変数で割り算をしましたか?Visoredはその変数がゼロではないことを確認します。
  • 魔法の仕組み: もしAIが間違いを犯した場合、Visoredは単に「間違い」と言うのではありません。論理が崩れた正確な箇所を指し示します。まるで、教師が赤ペンで特定のエラーを丸で囲むようにです。これにより、AIは次の試行をどのように修正すべきかという明確な信号を得ることができます。

3. 「ルール駆動型ソルバー」(自動採点機)

中間の形式で証明が整ったら、Visoredはルールベースのエンジンを使用して、「退屈な」ステップをチェックします。

  • 比喩: 数学の教科書を想像してください。教科書で「したがって...となる」と書かれているとき、人間にとっては明白であるため、しばしば代数の計算が省略されています。Visoredのソルバーは、それらの飛ばされたステップを埋めるための、疲れを知らないロボットのようなものです。計算、代数、そして小さなステップの論理を自動的にチェックします。
  • 結果: AIが主要なアイデアを提供すれば、Visoredが面倒な「重労働」の部分を処理します。

4. 「逆翻訳」(Lean出力)

Visoredがその証明に納得すれば、最終的な検証のために、それをLeanコード(厳格な言語)へと翻訳することができます。

  • 注意点: この論文では、現在の翻訳は非常に「冗長」であると認めています。それは、1ページの要約を、すべての言葉が法的に正確であることを保証するために、200ページの法的契約書へと拡張していくようなものです。機能はしますが、膨大な量になります。

彼らは実際に何を達成したのか?

研究者たちは、この手法を244の問題(主に中学校レベルの競技数学)でテストしました。

  • 結果: Visoredを使用したAIエージェントは、これらの問題の**91%**を成功裏に解きました。
  • 注意点: AIはこれらを「単独で」解いたわけではありません。ループの中で機能しました。AIがドラフトを書き、Visoredがそれをチェックして「ここにエラーがあります」と伝え、AIがそれを修正し、そして再び試行するというプロセスです。
  • 限界: 最も難しい問題(国際数学オリンピックの問題など)には苦戦しました。これは、Visoredの「ルールブック」に、それらに必要な高度な数学的テクニックがまだ備わっていないためです。

結論

Visoredは、難しい数学の問題を即座に解決する魔法の杖ではありません。むしろ、それは協調的なワークスペースです。AIが理解できる言語(英語)で証明を書くことを可能にし、コンピュータシステムが厳格な論理とエラーチェックを担当します。

この論文は、この「中間役」のアプローチを用いることで、AIに困難で硬直したプログラミング言語をゼロから学習させることなく、実際に信頼できる数学の証明を作成させることができると主張しています。それは、AIの「幻覚」を、構造化された、検証可能なプロセスへと変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →