← 最新の論文
🤖 AI

A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT

本論文は、仮説演繹的推論を人工汎用知能の根本的な基準として提案し、テストを通じて、ChatGPTのような現在のモデルが複雑な文脈におけるこの種の推論に対して限定的な能力しか備えていないことを実証している。

原著者: Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問い:AIは本当に「考えて」いるのか?

図書館にあるすべての本を読み終えた学生がいると想像してみてください。その学生は、事実を暗唱し、数学の問題を解き、驚くほど賢そうなエッセイを書くことができます。しかし、もしあなたが「どうやってそれを導き出したのですか?」とか「なぜそうなるのですか?」と尋せたら、彼らは言葉に詰まるかもしれません。彼らは言葉のパターンを推測することで正しい答えを出しているだけで、答えの背後にある「ルール」を実際に理解しているわけではないからです。

この論文はこう問いかけます。ChatGPTは本当に「考えて」いるのか、それとも単に非常に優れた「推測者」に過ぎないのか?

著者であるルイ・ヴェルヴォールト氏とそのチームは、真の「思考マシン」(人工汎用知能、通称AGI)と見なされるためには、AIは**仮説演繹的推論(Hypothetic-Deductive Reasoning)**と呼ばれる特定のスキルを習得しなければならないと主張しています。

2つの鍵となるスキル

この論文では、「思考」を2つの主要な能力に分解しています。

1. 因果推論(「ドミノ」テスト)

  • 内容: 最初のドミノを押せば、最後のドミノが倒れるということを理解することです。何が何を引き起こすのかを知ることです。
  • 論文のテスト: 研究者たちは「ニューロン図」(複雑なドミノのフローチャートのようなもの)を使用しました。彼らはAIにこう尋ねました。「もしこのレバーを引いたら、他のどのレバーが動き、どのレバーが動かないでしょうか?」
  • 結果: AIは単純な連鎖には対応できましたが、ドミノが絡み合った場合(あるレバーが他のレバーをブロックしているような状況)には混乱しました。AIは根本的な原因を見逃したり、順序を間違えたりすることがよくありました。それは、言葉としての「原因」は知っているものの、散らかった部屋の中で倒れていくドミノの経路を実際に辿ることはできない人のようでした。

2. 仮説演繹的推論(「レシピ」テスト)

  • 内容: これは「科学者」的な思考法です。これには2つのステップが含まれます。
    1. 仮説の設定: 問題に対して正しいルールブック(理論)を選ぶ。
    2. 演繹: そのルールブックに従って、答えを導き出す。
  • 論文のテスト: 研究者たちは、物理学や論理学のパズル(例:「もし氷で作られたキューブがある列を押し、部屋が熱くなったらどうなるか?」)をAIに提示しました。
  • 秘密兵器: 研究者たちは単に答えを求めたのではありません。AIに、その答えを導き出すために使用した**「ルール(仮説)」をリストアップする**よう求めました。
    • 比喩: シェフに「どうやってこのスープを作ったのですか?」と尋ねたとしましょう。もしシェフが「ただ材料を放り込んだだけです」と言ったら、それは運が良かっただけかもしれません。しかし、もしシェフが「塩は熱い水に溶けるというルールと、玉ねぎはニンジンよりも早く火が通るというルールを使いました」と言ったなら、そのシェフは実際に考えていることになります。

ChatGPTをテストした結果はどうだったのか?

研究者たちは、旧バージョンのChatGPT-3.5と、よりスマートになった新しいバージョンであるChatGPT-4の両方をテストしました。

  • 「答えは合っているが、理由が間違っている」問題:
    ChatGPT-4は、パズルの正解を出すことがよくありました。それは非常に印象的でした!しかし、使用したルールをリストアップするよう求めると、AIはしばしば作り話をしました。

    • 例: あるテストでは、AIはバケツの水がこぼれることを正しく予測しました。しかし、「なぜか」と尋ねられると、実際の物理現象とは全く関係のない「絶縁シャツ」に関する架空のルールを捏造しました。
    • 比喩: これは、答えの数字を丸暗記しているために数学の問題を正解できるものの、解き方を見せろと言われると、その場で作り出した公式を書き込む学生のようなものです。
  • 判定:
    この論文は、ChatGPTは人間の会話を模倣することや単純な問題を解決することには長けているものの、現在は真の理解を欠いていると結論付けています。

    • それは、「空は青い」と完璧に言えるけれど、なぜ空が青いのか、あるいは物理学的な意味での「青」とは何なのかを理解していないオウムのようなものです。
    • 問題が少し複雑になったとき(異なるアイデアが組み合わさったとき)、AIは失敗し始めました。AIは、正しいルールを正しい答えに一貫して結びつけることができなかったのです。

「AGI」のハードル

著者たちは、何をもって「人工汎用知能(AGI)」と呼ぶかについて、高い基準を設けています。彼らは、AIが真に「考えている」と言えるのは、以下のことができるようになるまでだと主張しています。

  1. 問題を解決する。
  2. 使用したルールと理論を明示的にリストアップする。
  3. これを(一つの問題だけでなく)多くの異なるタイプの問題に対して正しく実行できる。

結論:
現在のChatGPTは、素晴らしい「即興劇の達人」です。うまく立ち回って、賢そうに見せることができます。しかし、世界の仕組みに関する深い論理的なマップを持っていることは、まだ証明されていません。真の「思考マシン」になるためには、単に次の言葉を予測するだけでなく、その言葉がなぜ正しいのかを、現実のルールを用いてステップ・バイ・ステップで証明する必要があるのです。

AIがこれらの「ルールをリストアップする」テストを一貫してパスできるようになるまで、この論文によれば、それはまだ真のAGIではありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →