OEIS Open: How many conjectures can language models turn into theorems?
本論文は、OEIS Open、すなわちOEIS(オンライン整数列カタログ)由来の形式化された492の数学的予想からなる安全なベンチマークを紹介するものであり、最小限のツールを備えた言語モデルが、膨大な文献へのアクセスや高度なエージェントループが性能を大幅に向上させることはなかったものの、控えめなコストでこれら未解決問題の約30%から44%を自律的に解決できることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
数(1, 2, 4, 8...のような単純なものから、奇妙で不可解なものまで)の膨大なデジタル図書館であるOEIS(オンライン整数列カタログ)を想像してみてください。それは、数学者たちが発見した数のパターンをリストアップしている巨大なカタログのようなものです。多くの場合、そのパターンの記述に続いて、それが永遠にどのように機能するかについての「推測」が書き込まれます。これらの推測は「予想(コンジェクチャー)」と呼ばれます。長い間、これらの予想を証明することは、チョークボードと果てしない忍耐力を持つ人間の天才だけの仕事でした。しかし最近、コンピュータもこれらのパけーズルを解こうとし始めています。大きな疑問は、人工知能(AI)は自力で真実を見つけ出すことができるのか、それとも単に人間に手助けを必要とするだけなのか、ということです。この論文は、AIエージェントが許可されていない手法や人間による誘導なしに、これらの数の予想を証明または反証するという厳格なテストを設定することで、この問いに切り込んでいます。
Epoch AIというグループの研究者たちは、OEIS OPENと呼ばれる新しい挑戦を作り出しました。これは、巨大な数学の障害物コースのようなものです。彼らは、OEHSにある492個の未解決の数学的予想を取り上げ、Leanと呼ばれる厳格なコンピュータ言語に翻訳しました。Leanは、非常に厳格な審判として機能します。このゲームでは、AIエージェントはテキストエディタ、コマンドライン(コンピュータの端末のようなもの)、そして計算機といういくつかの基本的なツールを備えたデジタルルームに投入されます。AIの唯一の目標は、コンピュータの審判が受理する証明を書くことです。もしAIがその予想が正しいことを証明できなければ、それが間違っていることを証明しなければなりません。ただし、AIには1つの予想につき50ドルという厳格な予算が与えられます。もし解決する前に予算を使い果たしてしまったら、そのAIは敗北となります。
結果は驚くほど有望でした。最も優れたAIモデルは、492個の予想のうち147個を解き、約**30%**のスコアを記録しました。つまり、彼らはこれら未解決の謎のほぼ3分の1を、自分たちの力だけで確定した定理(または反証)に変えたのです。最も成功したモデルであるClaude Opus 4.8は30%を解き、GPT-5.5やGemini 3.5 Flashといった他のモデルも、それぞれ26%と22%を解くなど好成績を収めました。これは大きな成果です。なぜなら、研究者たちは非常にシンプルなAI構成、つまり「試行、確認、再試行」を繰り返すだけの基本的なループを使用したからです。それは、大規模な人間のヘルパーチームを抱えた、派手で超複雑なロボットではありませんでした。実際、このシンプルなアプローチは、同じ問題のわずか9%しか解けなかったAlphaProof Nexusという、より複雑なシステムよりも優れた結果を出しました。
研究者たちは、AIをより賢くするための「パワーアップ」が役立つかどうかを検証するため、いくつかのテストを行いました。彼らは、AIが過去の人間の研究から学べることを期待して、インターネット上の47万6,000件もの膨大な数学論文(arXiv)へのアクセス権を与えました。また、タスクをサブエージェントに委譲したり、長い時間をかけて記憶したりできる、より複雑な「脳」を与えることも試みました。驚いたことに、これらのアップグレードはいずれも効果がありませんでした。AIは論文ライブラリを利用しても解ける数は増えず、複雑な脳を与えても速度や正確性は向上しませんでした。この特定の種類の数学問題においては、膨大なライブラリや複雑な性格を持つことよりも、シンプルで集中したツールセットと適切な予算を持つことの方が重要であるようです。
興味深い発見の一つは、研究者が1つの予想に対してより多くの予算を投じるほど、AIがそれを解く可能性が高くなるということでした。成功率は、一定かつ予測可能な形で上昇しました。予算を10回増やすごとに、成功率は約10パーセントポイント上昇しました。これは、もしAIにより大きな予算を与えていれば、さらに多くの問題を解けていた可能性があることを示唆しています。しかし、論文では、これらの予想は数学的に妥当ではあるものの、主に数学の世界における「未知のもの」であることに注意を促しています。これらはリーマン予想のような、世界を変えるような有名な難問ではなく、人間の数学者からあまり注目されてこなかった、小さく、目立たないパズルのようです。
では、これらは何を意味するのでしょうか? この論文は、AIが控えめなコストで、実際の未解決の数学的研究問題を自律的に解く能力を持っていることを示しています。AIはもはや既知の答えがあるパズルを解いているだけではありません。それは、私たちが知っていることの境界線を押し広げているのです。しかし、同時に限界も示しています。AIはより多くの本を読むことで賢くなったわけではなく、最も困難で、最も不可解な問題には依然として苦戦しています。研究者たちは、AIが突如として天才数学家になるような「質的な飛躍」は見られないものの、一つの数式、一つの数列ずつ、未知の領域を削り取っていくための、着実で強力なツールになりつつあると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。