Assessing LLMs' mathematical abilities requires understanding the various mechanisms of mathematical creativity
本論文は、LLMの数学的能力を評価するには、集約的なベンチマークを超えて、明確かつ代替不可能な個別の創造的メカニズムの微細な分類へと移行する必要があると論じており、現在のモデルは既存の知識を再結合することには長けているものの、自動証明生成の向上に伴い価値が高まりつつある他の形態の数学的発明の能力を根本的に欠いている可能性があることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
数学は長い間、人間の論理の究極のテスト、すなわち答えが正しいか間違っているかのどちらかであり、真理への道が厳格な証明によって築かれる領域であると見なされてきました。何世紀もの間、この分野は単純な経済学に依存してきました。すなわち、人間の直感がパターンや可能性を見つけ出し、その後に検証という重労働が行われて、それを確認するという仕組みです。今日、人工知能はこの方程式の後半の部分を習得し始めています。現代のコンピュータシステムは、人間をはるかに凌駕するスピードと規模で数学的証明を生成し、検証することができます。かつては希少な資源であった「検証」を、圧倒的な過剰状態へと変えてしまったのです。この変化は、より困難で新しい問いを突きつけています。もし機械がこれほど容易に物事を証明できるのであれば、数学の真の価値はどこにあるのか、という問いです。その答えは、証明そのものではなく、プロセス全体を開始させる「火花」――数学者が新しいアイデア、新しい概念、あるいは世界を見るための新しい方法を編み出す瞬間――の中にあります。
シルヴェール・ガングロフによる最近の論文は、まさにこの火花について調査し、人工知能が本当に数学的なアイデアを発明できるのか、それとも単に古いものを並べ替えているだけなのかを問い直しています。著者は、私たちが間違った問いを投げかけていると主張します。「数学的創造性」を、コンピュータが持っているか持っていないかという単一のスキルとして扱うのではなく、それは実際には、互いに関連のない明確に異なるメカニズムの集合体であると論文は示唆しています。これらのメカニズムの中には、数学者がどのように働くかを観察し、その習慣を形式的なルールへと変えるものがあります。また、熱の流れのような物理世界で発見された構造を取り上げ、それを抽象的なパズルを解くために再利用するものもあります。さらに、特定の困難な問題を解決するために、それを打破するための新しい道具自体を発明するという作業や、これまで一度も対話したことのない二つの数学分野を結びつけるという、稀で高次元な行為もあります。論文は、これらは単に同じものの異なるバリエーションではなく、異なる種類の機械を必要とする、根本的に異なるタイプの思考であると提案しています。
この研究の中心的な発見は、現在の人工知能システムはこれらのモードのいくつものうちは非常に優れているが、どれほど強力になっても、他のモードについては不可能である可能性が高いということです。現在私たちが手にしているシステムは、既存の断片を再結合することによって機能しています。それらは、かつて読んだあらゆる事実を即座に見つけ出し、縫い合わせることができる熟練の司書のようなものです。このため、既知のタイプの問題に対して特定の解を見つけたり、証明がルールに従っているかを確認したりすることには非常に長けています。しかし、論文は、全く新しいタイプの対象や、学習データに前例のない新しい考え方を発明することを求められたとき、それらが「壁」に突き当たることを示唆しています。例えば、コンピュータは既存の何百万もの数学的構造の中から、制約に適合するものを見つけ出すことはできますが、人間の計算の実践を見て、その実践自体が研究すべき新しい数学的対象になるべきだと自律的に判断することはできません。これは速度の問題ではなく、性質の違いです。機械は新しいプリミティブ(基本要素)の発明において単に遅いのではなく、そもそも何を発明する価値があるのかを選択するメカニチズムを欠いているため、構造的にそれが不可能なのです。
著者は、数学が実際にどのように進歩してきたかを見ることで、この見解を支持しています。ある有名なケースでは、数学者のアラン・チューリングは単に問題を解いたのではなく、人間がルールブックに従うという「行為」に注目し、その行為自体を新しい理論の主題にすることに決めました。また別の例では、物理学者のコルモゴロフが、熱やエネルギーを扱う熱力学の概念を、抽象的な図形に関する問題を解くために純粋数学に応用しました。これらは、既知のパズルの欠けているピースを探す作業ではありませんでした。それらは、パズルそのものを作り出す行為だったのです。論文は、既知の動きの固定されたライブラリを検索することに依存している現在の人工知能は、これを再現できないと論じています。AIは、ピースの形がすでに定義されていれば、その欠けているピースを見つけることはできますが、存在したことのない新しい形を想像することはできないのです。
この区別は、科学における人工知能の未来をどのように判断すべきかについて、深い示唆を与えます。もし私たちが、AIの成功を、生成できる証明の数や標準的なテスト問題をどれだけうまく解けるかによって測定し続けるならば、私たちは間違ったものを測っていることになります。私たちは、機械が得意としている仕事に対して報酬を与えている一方で、人類の進歩を実際に駆動している仕事を無視しているのです。論文は、証明の生成が安価で自動的になるにつれ、数学の真の価値は、これらより困難な発明のモード――すなわち、新しい実践を形式化する反省的な行為、他の分野からアイデアを輸入する類推的な飛躍、そして全く新しい概念の深い目的指向的な創造――へと移行していくと警告しています。もし私たちがこれらのシステムを評価する方法を変えなければ、正解ではあるが興味のない結果の洪水を生み出すリスクがあり、その間に、真に革新的な理解への飛躍は手の届かないままになってしまうでしょう。
この研究は、人工知能がこれらの創造的な行為を行うことが決してできないと主張しているわけではありません。それらが実現するためには、単に次の言葉を予測するのではなく、世界と相互作用して接地された理解を形成できるような、基礎となるテクノロジーが変わる必要があると示唆しています。それまでは、古いアイデアを再結合する能力と、新しいものを創造する能力を混同しないよう注意しなければならない、と論文は結論づけています。数学的発見の未来は、コンピュータがいかに速く計算できるかではなく、機械が「何を発明する価値があるのか」を知ることができるかどうかにかかっているのかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。