Self-Supervised Theorem Discovery in a Formal Axiomatic System
本論文は、公理と推論規則のみから出発して、数万もの意味のある定理を自律的に発見し、ヒューマン・ベンチマーク問題(human benchmark problems)を解決する自己教師ありエージェントを提示しており、有用な数学的知識が人間の事前知識なしに創発可能であること、そしてLLMの推論能力を効果的に向上させ得ることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはロボットに数学を教えようとしています。ただし、非常に厳格なルールがあります。ロボットに教科書を与えてはいけませんし、解かれた問題の例や、既知の事実が書かれた「カンニングペーパー」も与えてはいけません。 あなたに許されているのは、ごく最小限の要素だけです。いくつかの基本的な論理規則(例えば「Aが真であり、かつAがBを意味するならば、Bは真である」など)と、白紙の状態だけを与えてください。
この論文が問いかけているのは、このロボットは、それらの基本的な規則を使って遊ぶだけで、新しい有用な数学的事実を発見し、自習することができるのか? ということです。
研究者たちがどのようにこのロボットを構築し、何を達成したのかを、簡単な比喩を用いて説明します。
1. ゲーム:積み木
研究者たちは、「ヒルベルト論理」と呼ばれるシステムを用いて、ロボットのためにゲームを用意しました。このシステムは、**積み木のスタック(積み重ね)**を扱うゲームだと考えてください。
- ルール: ロボットは、スタックの上に置いて使える3種類の特別なブロック(公理)を持っています。また、ブロックを組み合わせるためのルールが1つあります。「もしX、ならばY」と書かれたブロックが、「X」と書かれたブロックの上に置かれている場合、それらを「Y」と書かれたブロックに置き換えることができます。
- ゴール: ロボットは、ターゲットとなるブロック(定理)を与えられ、その特定のブロックをスタックの上に作り上げるための正確な手順を見つけ出さなければなりません。
2. 戦略:「それは後でやっておこう」
ロボットは最初はランダムな動きを推測することから始めます。ほとんどの場合、与えられた特定のターゲットに到達することには失敗します。しかし、研究者たちはロボットに「自己教師あり学習」という賢いトリックを教えました。
想像してみてください。ロボットは赤い旗(ターゲット)に到達するために塔を建てようとしています。旗には届きませんでしたが、その過程で、途中に非常に頑丈な青いプラットフォームを偶然作り上げてしまいました。
- トリック: その青いプラットフォームを捨ててしまう代わりに、ロボットはこう言います。「おや、青いプラットフォームを作ったぞ!これを次のための新しいゴールにしよう」
- ループ: ロボットはこの青いプラットフォームを「ゴール」として保存します。その後、ロボットはその青いプラットフォームを再び作ることを試みます。成功するたびに、ロボットはその方法を正確に学習していきます。時間をかけて、ロボットは自ら発見したこれらの「プラットフォーム」(定理)の膨大なライブラリを築き上げていきます。
3. 最良の道具を選ぶ
ロボットは何千ものこれらのプラットフォームを発見します。しかし、そのすべてが有用なわけではありません。あまりに特殊すぎるもの(例えば、たった一つの小さなレンガにしか適合しないプラットフォームなど)もありますし、すでに知っていることの単なる繰り返しもあります。
ロボットは、これらの中から「黄金の道具」を選ぶために、2つのフィルターを使用します。
- 汎用性(Generality): ロボットは、多用途に使えるもの(例えば平らなテーブルのようなもの)を残し、あまりに奇妙だったり特殊すぎたりするものは捨てます。
- 難易度(Difficulty): 基本的な規則から特定のプラットフォームを作り上げるのが難しいかどうかを見極めます。もしロボットが特定のプラットフォームを作るのに苦労する場合、そのプラットフォームは「難しい問題」です。ロボットは、この難しい問題を、あらかじめ用意された道具(補題)として自分のツールボックスに加えることにします。
4. 成長するライブラリ
数世代(学習のラウンド)にわたってこのプロセスを実行した後、ロボットは数万個の自己発見された数学的事実のライブラリを手にします。
研究者たちは、この結果を2つの方法でテストしました。
- ロボットは人間の問題を解けるか? 研究者たちは、人間が書いた30個の古典的な論理パズル(教科書から引用)をロボットに与えました。自作のライブラリを用いたロボットは、そのうちの**30%**を解くことに成功しました。これは、ロボットがこれらのパズルを一度も見たことがなく、人間の助けも受けていないことを考えると、非常に印象的な結果です。
- 他のロボットの助けになれるか? 研究者たちは、ロボットが発見した「黄金の道具」を取り出し、別の非常に賢いAI(GPTのような大規模言語モデル)に対して「ヒント」として与えました。この他のAIが、これらの自己発見された道具を使えるようにしたところ、論理パズルを解く能力が大幅に向上しました。
大きな展望
この論文は、AIに数学の事実のライブラリを手渡しする必要はないということを証明しています。AIにゲームの基本的なルールさえ与えれば、AIはゲームをプレイし、自分自身の近道を発見し、有用な知識のライブラリを自ら構築できるのです。
それは、子供がレゴで遊んで学ぶ過程に似ています。もし、いくつかの基本的なブロックと「これらを組み立てなさい」という指示だけを与えられたとしても、彼らは最終的に複雑な城を建てる方法を自力で見つけ出し、「あ、この特定のアーチの形はドアを作るのにとても便利だ」と気づき、将来のすべての城作りにそのアーチの形を標準的なパーツとして使い始めるかもしれません。
この論文が主張していないこと:
- ロボットがまだ高度な微積分や物理学ができるようになったとは主張していません。
- これがすぐにすべての種類の数学に適用できるとは主張していません(彼らは命題論理のみをテストしました)。
- これが人間の数学者に取って代わるものではなく、AIが独自の形式的な知識を進化させるための道筋を示していることを示しています。
要約すると、AIはゼロから数学を自習し、有用な事実の辞書を自ら作り上げ、それらの事実が実際に問題を解決するのに役立つことを証明したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。