← 最新の論文
🤖 AI

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

本論文は、ランダムに生成された等式法則に対して、独創的かつ検証可能な数学的証明または構成を生成させることで、大規模言語モデルにおける妥当な創造性を厳密に測定する新しいベンチマークであるALPSを紹介しており、現在のモデルが構成の側面において著しく苦戦していること、およびほとんどの事例が高度な自動証明器によってさえ未解決のままであることを明らかにしている。

原著者: Eric Xie, Wenqian Ye, Aidong Zhang

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Eric Xie, Wenqian Ye, Aidong Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の科学的展望において、人工知能は単なるデータ処理の役割から、発見者としての役割へと踏み出し始めています。私たちは、新しい化学物質を提案し、斬新な材料を提言し、さらには人間がまだ考慮していない数学的予想さえも定式化できる機械を目にしています。この変化は、深遠な問いを投げかけます。もし機械が画期的な成果のように見える答えを生み出したとき、それが単に学習中に記憶したものを巧みに繰り返しているだけではなく、真に創造的であると、どのようにして判断すればよいのでしょうか。科学における真の創造性には、二つのことが必要です。すなわち、解決策が独創的であること(つまり、以前に見たことがないものであること)、そして効果的であること(つまり、実際に機能し、目の前の問題を解決すること)です。困難は、これらの性質を検証することにあります。多くの分野では、新しいアイデアが妥当かどうかを判断するために、人間の専門家がその結果を見て判断する必要がありますが、これは遅く、主観的なプロセスです。答えを絶対的な確実性をもってチェックできる数学においては、課題は異なります。問題があまりにも複雑であるため、コンピュータはすべての可能性を単純に探索して答えを見つけることができず、また、問題自体が機械がすでに学習済みである可能性のある固定された集合であることも多いのです。

このジレンマを解決するために、バージニア大学の研究者たちは、人工知能をテストするための新しい方法、彼らがALPSと呼ぶベンチマークを開発しました。このシステムは、記憶や標準的なルーチンに従うことでは解決できない特定の種類の数学パズルを提示することで、「妥当な創造性」を測定するように設計されています。パズルは、一連のアイテムをどのように組み合わせることができるかというルールに基づいています。オブジェクトのコレクションと、それらのうち任意の二つを混ぜ合わせるためのルールを想像してください。研究者たちは、これらのオブジェクトがどのように振る舞わなければならないかを記述する、特定のルール、あるいは「法則」を生成します。機械の任務は、次の二つのうちいずれかを決定することです。そのルールが非常に制限的であり、すべてのオブジェクトを同一のものにするのか、あるいは、そのルールが条件を満たす複雑で無限の構造を持つオブジェクトを許容するのか、という点です。もし機械がその構造が存在すると主張する場合、その記述を構築しなければなりません。もしオブジェクトが同一でなければならないと主張する場合、他に可能性が存在しないことを証明しなければなりません。このセットアップの素晴らしさは、人間が結果を見る必要なく、コンピュータによって完璧な精度で答えをチェックできる点にあります。さらに、このシステムはこれらの一連のパズルを無限に生成できるため、機械は常に一度も見聞きしたことのない問題に直面することになります。

研究者たちは、論理的な問題を解くために設計された特化したコンピュータプログラムである、さまざまな強力な自動推論ツールを用いてこのシステムをテストしました。彼らは、生成された四千件以上の法則のプールに対してこれらのツールを実行しました。結果は明白でした。計算能力を大幅に増大させたとしても、自動化されたツールはごくわずかな問題しか解決できませんでした。具体的には、最高のプロバー(証明器)を用いた8つの異なる構成のポートフォリオは、わずか約2パーセントの法則しか解決できませんでした。研究者が計算予算を20倍に増やしたところ、追加の解決策はわずか数件しか見つからず、それらは探していた複雑な構造ではなく、オブジェクトが同一であることを示す証明に過ぎませんでした。このことは、これらの問題を解決する上での障壁が、計算能力の不足ではなく、それぞれの固有の法則に合わせた特定の構造を発明する方法の欠如であることを示唆しています。機械は、適切な種類の無限の構造をゼロから構築する方法を知らないのです。

研究者たちは、その後、今日の対話型ツールを動かしているものと同じタイプの人工知能である、大規模言語モデルに目を向けました。彼らは最強の推論モデルに対し、同じパズルと、答えを証明するための同じ機会を与えてテストを行いました。機械がすべてのオブジェクトが同一であることを証明するというタスクの側では、最高のモデルは約14パーセントのケースで成功しましたが、それは単純な問題に限られていました。一方で、機械が新しい無限の構造を構築しなければならない側のタスクでは、結果はさらに明白でした。どのモデルも成功しませんでした。モデルが構造を構築しようと試みた際、それらは一貫して二つの方法のいずれかで失敗しました。あるいは、構造が硬すぎて、すべてのオブジェクトを単一の点へと崩壊させ、複雑な解を示すことに失敗するか、あるいは、構造が緩すぎて、従おうとしている法則のルールを守ることができなかったかのどちらかでした。あらゆる事例において、機械はルールの遵守と、新しい複雑なものを創造することのバランスを取ることができなかったのです。

この研究は、これらの人工知能システムは指示に従ったり、自身の作業をチェックしたりすることは上手くなっているものの、科学的発見の核心である「制約に適合する新しい構造を発明すること」には依然として苦戦していると結論付けています。研究者たちは、パズルを生成するジェネレーターと、答えをチェックする自動判定器を含むシステム全体を公開しました。これにより、他の科学者たちが、新鮮な問題が尽きることを心配することなく、これらのモデルをテストし、改善し続けることができます。今回の知見は、科学におけるAIの進むべき道は、より多くのデータや時間を機械に与えることではなく、創造と検証のループの中で、自らのアイデアを提案し、洗練させる方法を教えることにあるかもしれないと示唆しています。機械がこれらのカスタマイズされた解決策を確実に構築できるようになるまで、科学的発見における彼らの役割は限定的なままであり、情報の処理と、真に妥当で独創的な知識の生成との間の溝を越えることはできないでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →