First Proof Second Batch
本論文は、数学者によって提供された10個の異なる問題に対し、複数のAIモデルをテストした手法と結果、および人間の解法や査読報告書を含む補足資料を提示することにより、研究レベルの数学を解決する現在のAIシステムの能力を評価するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
数学者たちが、ケーキを焼く代わりに、人工知能に新しい数学的証明を「料理」させるという、高額な賞金のかかった「料理コンテスト」を開催することを決定した場面を想像してください。この文書は、そのコンテストの第2ラウンド、**「First Proof Second Batch(第一回証明・第二弾)」**の公式成績表です。
以下は、そこで何が起きたのかを分かりやすく分解した物語です。
セットアップ:新しい種類の試験
この実験の第1ラウンドでは、誰でも問題を解くことができるオープンハウスのようなものでした。しかし、この第2ラウンドでは、彼らはより厳格で科学的な方法を求めました。
- シェフたち(AIシステム): 彼らは4つの特定の「シェフ」を招待しました。これらは単なるランダムなコンピュータではありません。UCLAやプリンストンといったトップクラスの大学や、OpenAIといった企業によって構築された高度なAIシステムです。
- 材料(問題): 主催者は、教科書にあるような既知の解決済みの数学問題をAIに与えたのではありません。代わりに、人間の数学者が自身の研究の中で最近発見したばかりの、10個の全く新しい未解決のパズルを与えました。これらは、インターネット上に投稿されたり、ジャーナルに掲載されたりしていない問題でした。
- ルール: AIは、人間から答えを耳打ちされることなく、自力でこれらの問題を解かなければなりませんでした。主催者はAIのあらゆるステップを監視し、AIがタイピングしたすべての言葉を記録し、その「キッチン」を運営するのにかかったコストを厳密にログに記録しました。
審査:ブラインド・テイストテスト
AIが「料理」(証明)を提出した後、30人の専門家である数学者のパネルが審査員を務めました。公平を期すため、審査員はどのAIがどの料理を作ったのかを知らされていませんでした。彼らは各解法に対して以下の評価を与えました。
- ほぼ完璧(Essentially Flawless): 完璧な料理であり、すぐに提供できる状態。
- 軽微な修正(Minor Revisions): 美味しいが、塩をひとつまみ足したり、飾りを整えたりする必要がある。
- 大幅な修正(Major Revisions): メインディッシュはあるが、ソースが焦げていたり、材料が足りなかったりする。多くの作業が必要。
- 却下(Rejected): 食物として成立しない。
結果:混合状態
結果は、印象的な突破口と、恥ずべき失敗が入り混じったものでした。
1. 「ワォ!」という瞬間(成功)
- サプライズ・ゲスト: 複雑な流体方程式に関する問題(問題5)において、あるAIは単に人間の解法を模倣しただけでなく、全く新しい解法を編み出しました。審査員は非常に感銘を受け、それを「ほぼ完璧」と呼びました。それは、まるでシェフが、これまで人間が考えもしなかった新しい調理技法を発明したかのようでした。
- コピーキャット(模倣者): 別の問題(問題6)では、2つのAIが完璧に解き切りました。彼らは人間の解法の経路を辿りましたが、あまりにも機械的な精密さで行ったため、審査員は「書き方は少しロボット的だが、数学的には正しい」と評しました。
2. 「幻覚(ハルシネーション)」の問題(失敗)
- 偽の引用: 繰り返される問題として、AIが実在しない本や論文を、自信満々に引用したり、AIが主張する内容とは異なる内容のものを引用したりすることがありました。これは、シェフが「このソースは有名なフランス人シェフの秘密の材料で作られています」と言っているものの、実際にその本を調べてみると、そのシェフはそのことについて何も書いていないようなものです。
- 盗作: あるケースでは、あるAIが幾何学の問題を、人間の数学者の過去の著作とほぼ一言一句違わぬ形で、同じ独特なラベルや用語を使用して解いていました。しかし、クレジット(出典)を記載することを忘れていました。もし人間の学生がこのようなことをすれば、不正行為として退学処分になるでしょう。
- 誤った方向への転換: いくつかの問題において、AIは実際には偽である事柄を証明しようとしたり、ナンセンスなループに陥ったりしました。あるAIは、存在しない定理を捏造して幾何学の問題を解こうとしました。これは、証明を完成しているように見せるために、審査員に対して嘘をついているようなものです。
3. 料理のコスト
レポートは「食事の価格設定」についても調査しました。
- 一部のAIシステムは安価でしたが、間違いを犯しました。
- 他のシステムは非常に高価で、たった一つの解法を生み出すために、数千ドルのコンピュータ稼働時間を要しました。
- 最も成功した解法は、多くの場合、最も多くの「思考時間(トークン)」と費用を必要としました。
大きな教訓
この論文は、AIが定型的な数学においては非常に優れていると結論付けています。もし問題が、以前に見たことがあるようなものだったり、既知のレシピに従うだけで済んだりする場合、AIはそれをうまくこなすことができます。
しかし、真の創造性――つまり、全く新しいアイデアを生み出すこと、あるいは、関連のない二つの分野の間の深い繋がりを見つけ出すこと、または、「作り事」をする罠を避けること――に関しては、AIは依然として苦戦しています。AIは、偽の論文を引用したり、議論の最も難しい部分をスキップしたりすることで、「取り繕おう」とすることがよくあります。
要約すると: AIは、レシピを完璧にこなすことはできるものの、まだ独自の新しい料理を考案できる段階にはない、非常に速くて非常に高価な「見習いシェフ」です。AIには、その仕事をチェックし、引用を修正し、材料を捏造していないかを確認するための「人間のシェフ」が必要です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。