← 最新の論文
💻 computer science

Distilling Answer Set Programming Theories from Large Language Models

本論文は、1時間の制限時間内で視覚的質問応答タスクのための完全かつ正確な回答集合プログラミング(Answer Set Programming)理論を自律的に蒸留する大規模言語モデルの能力を調査しており、Claude Sonnet 4.6、Claude Opus 4.7、およびDeepSeek V4 Proのような最先端モデルがいくつかのベンチマークにおいてほぼ完璧な精度を達成する一方で、GPT-5は著しい性能の変動性と参照データへの敏感さを示すことを明らかにしている。

原著者: Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが、大きく分けて二つの全く異なることに非常に長けている世界を想像してみてください。一方で、コンピュータは厳格なルールに従って論理パズルを解くことができる超高速の計算機のようですが、混沌として曖昧な現実世界を理解することについては非常に不得手です。他方では、コンピュータはあらゆる文章を読み、詩を書くことができるほど輝かしい創造的なストーリーテラーのようですが、厳格な指示に従うよう求められると、事実を捏造したり迷子になったりすることがよくあります。科学者たちは、これら二つのスキルの結婚を「ニューロシンボリック」コンピューティングと呼んでいます。それは、詩人のような想像力と数学者のような精密さの両方を備えたロボットを作ろうとする試みに似ています。研究者たちが投げかけている大きな問いは、大規模言語モデル(LLM)に、人間が一つ一つのルールを手書きすることなく、自力で厳格な「ルールブック」をゼロから書き上げる方法を教えられるか、ということです。これは、ルールブックを書く作業が遅くて退屈で、かつ正確に行うのが難しいものであるため、もしコンピュータがそれを実行できれば、機械が世界について推論するための新しい方法を切り開くことができるからです。

この論文の中で、ある研究チームは、大規模言語モデルが「視覚的質問応答(VQA)」と呼ばれるビデオゲームのようなパズルのための完全な「ルールブック」を書くことを学ぶ、疲れを知らない徒弟のように振る舞えるかどうかを検証しました。例えば、コンピュータにシーンの画像を見せ、「黄色いフリスビーは人の左側にありますか?」と尋ねるとします。これに答えるためには、コンピュータは画像を理解し、質問を分解し、そして論理的なチェックを実行する必要があります。研究者たちは、コンピュータに空のファイルと、ルールが理にかなっているかをチェックする「ソルバー(厳格な審判)」を含む一連のツールを与えました。コンピュータの仕事は、いくつかの練習例を読み、ルールを書き、審判にチェックを求め、どこで失敗したかを確認し、そしてルールを書き直すことでした。コンピュータには、できる限り上手くなるまでこれを繰り返すための1時間が与えられました。

研究者たちは、これを3つの異なる「パズルレベル」でテストしました(単純なコンピュータ生成の図形であるCLEVR、より多くの物体を含む実世界の写真であるGQA、そして因果関係を伴う短い動画であるCLECLEVRERです)。彼らは、最新かつ最も強力な「最先端(フロンティア)」モデルから、より小さく古いモデルに至るまで、9種類の異なるコンピュータモデルを用いてテストを行いました。結果は、驚異的な成功と意外な失敗が混在していました。4つのトップティアモデルのうち3つが、このゲームの達人となりました。単純なCLEVRパズルにおいて、それらは100%の完璧なスコアに達しました。より難しいGQAパズルでは、92.8%から98.8%のスコアを記録しましたが、これはそのデータセットに対して存在する最高の人間の書いたルールブックをも上回る数値です。ビデオパズル(CLEVRER)では、92.7%から95.3%のスコアを記録しました。

しかし、すべてのモデルが成功したわけではありません。最も有名なモデルの一つであるGPT-5は、単純なパズルでは優れた成績(98.7%)を出しましたが、実世界の写真のパズルでは崩れ落ち、わずか41.8%にまで低下しました。研究者たちは、これがモデルが推論できなかったからではなく、モデルがすべての種類の質問をカバーするのに十分な数のルールを単に書いていなかったためであることを見出しました。研究者たちがモデルに(別のパズルタイプからの参照用ルールブックという)「カンニングペーパー」を与えて助けを与えたところ、トップクラスのモデルはほぼ横ばいでしたが、GPT-5は実際には成績が悪化しました。これは、カンニングペーパーを見ることがモデルを惑わせたり、メモリを消費させたりした可能性を示唆しています。より小さく、能力の低いモデルは、ほとんどの場合、動作するルールを全く書けないまま、行き詰まるか、あるいは審判が理解できないルールを書いていました。

この研究は、適切なセットアップがあれば、コンピュータは確かに自分自身に教え込み、高品質な論理ルールブックをゼロから書き上げることができ、いくつかのベンチマークにおいて人間のパフォーマンスに到達、あるいはそれを超えることができるということを示しています。しかし同時に、この能力は保証されているわけではないことも示唆しています。それは使用される特定のモデルに大きく依存しており、時には、モデルにより多くの情報(参照書など)を与えることが、実際には混乱を招くこともあるのです。研究者たちは、すべてのコードとコンピュータが書き上げたルールブックを公開し、他の人々がこの「ニューロシンボリック」な徒弟制度を改善できるよう、広く呼びかけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →