← Neueste Arbeiten
🤖 AI

A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT

Das Papier schlägt das hypothetisch-deduktive Schließen als ein fundamentales Kriterium für Künstliche Allgemeine Intelligenz vor und demonstriert durch Tests, dass aktuelle Modelle wie ChatGPT nur eine begrenzte Kapazität für diese Art des Schließens in komplexen Kontexten besitzen.

Ursprüngliche Autoren: Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Louis Vervoort, Vitaliy Mizyakov, Anastasia Ugleva

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die große Frage: „Denkt“ die KI wirklich?

Stellen Sie sich vor, Sie haben einen Schüler, der jedes Buch in der Bibliothek gelesen hat. Er kann Fakten rezitieren, Matheaufgaben lösen und Aufsätze schreiben, die unglaublich klug klingen. Aber wenn Sie ihn fragen: „Wie bist du darauf gekommen?“ oder „Warum passiert das?“, gerät er ins Straucheln. Er liefert vielleicht die richtige Antwort, indem er das Muster der Wörter errät, aber er versteht nicht wirklich die Regeln, die hinter der Antwort stehen.

Diese Arbeit stellt die Frage: Denkt ChatGPT wirklich, oder ist es nur ein sehr guter Ratender?

Die Autoren, Louis Vervoort und sein Team, argumentieren, dass eine KI, um als echte „denkende Maschine“ (oder Künstliche Allgemeine Intelligenz, bekannt als AGI) zu gelten, eine bestimmte Fähigkeit beherrschen muss: das hypothetisch-deduktive Denken.

Die zwei Schlüsselkompetenzen

Die Arbeit unterteilt das „Denken“ in zwei Hauptfähigkeiten:

1. Kausales Denieren (Der „Domino“-Test)

  • Was es ist: Das Verständnis dafür, dass, wenn man den ersten Domino fällt, der letzte umfällt. Es geht darum, zu wissen, was was verursacht.
  • Der Test der Arbeit: Die Forscher verwendeten „Neuronen-Diagramme“ (wie komplexe Flussdiagramme von Dominosteinen). Sie fragten die KI: „Wenn ich diesen Hebel ziehe, welche anderen Hebel werden sich bewegen und welche nicht?“
  • Das Ergebnis: Die KI war bei einfachen Ketten ganz okay, aber als die Dominosteine komplexer wurden (mit Hebeln, die andere blockierten), wurde die KI verwirrt. Sie übersah oft die Ursache oder brachte die Reihenfolge durcheinander. Es war wie ein Mensch, der das Wort „Ursache“ kennt, aber nicht in der Lage ist, den Pfad eines fallenden Dominosteins in einem unordentlichen Raum nachzuverfolgen.

2. Hypothetisch-deduktives Denieren (Der „Rezept“-Test)

  • Was es ist: Dies ist die „Wissenschaftler“-Art des Denkens. Es umfasst zwei Schritte:
    1. Hypothese bilden: Das richtige Regelwerk (die Theorie) für das Problem auswählen.
    2. Deduzieren: Den Schritten in diesem Regelwerk folgen, um die Antwort zu erhalten.
  • Der Test der Arbeit: Die Forscher stellten der KI Physik- und Logikrätsel (z. B. „Wenn ich eine Reihe von Würfeln anschiebe, von denen einer aus Eis besteht, was passiert, wenn der Raum heiß wird?“).
  • Die Geheimwaffe: Die Forscher fragten nicht nur nach der Antwort. Sie baten die KI, die Regeln (Hypothesen) aufzulisten, die sie verwendet hat, um zu dieser Antwort zu gelangen.
    • Analogie: Stellen Sie sich vor, Sie fragen einen Koch: „Wie hast Sie diese Suppe gemacht?“ Wenn er sagt: „Ich habe einfach Dinge hineingeworfen“, ist er vielleicht nur glücklich gewesen. Wenn er aber sagt: „Ich habe die Regel angewandt, dass Salz in heißem Wasser löst, und die Regel, dass Zwiebeln schneller garen als Karotten“, dann denkt er tatsächlich.

Was geschah, als sie ChatGPT testeten?

Die Forscher testeten sowohl die ältere Version (ChatGPT-3.5) als auch die neuere, intelligentere Version (ChatGPT-4).

  • Das Problem „Richtige Antwort, falscher Grund“:
    ChatGPT-4 lieferte oft die korrekte Antwort auf die Rätsel. Das war sehr beeindruckend! Doch wenn die KI gebeten wurde, die Regeln aufzulisten, die sie verwendet hatte, erfand sie oft Dinge dazu.

    • Beispiel: In einem Test errat die KI korrekt, dass ein Eimer Wasser verschütten würde. Aber als gefragt wurde, warum, erfand sie eine fiktive Regel über „isolierende Hemden“, die überhaupt nichts mit der tatsächlichen Physik der Situation zu tun hatte.
    • Die Metapher: Es ist wie ein Schüler, der die Matheaufgabe richtig löst, weil er die Endzahl auswendig gelernt hat, aber wenn er gebeten wird, seinen Rechenweg aufzuzeigen, schreibt er eine Formel auf, die er sich spontan ausgedacht hat.
  • Das Urteil:
    Die Arbeit kommt zu dem Schluss, dass ChatGPT zwar fantastisch darin ist, menschliche Konversation zu imitieren und einfache Probleme zu lösen, aber derzeit es an echtem Verständnis mangelt.

    • Es ist wie ein Papagei, der perfekt sagen kann: „Der Himmel ist blau“, aber nicht versteht, warum der Himmel blau ist oder was „Blau“ im physikalischen Sinne eigentlich bedeutet.
    • Sobald die Probleme etwas komplexer wurden (durch die Kombination verschiedener Ideen), begann die KI zu scheitern. Sie konnte die richtigen Regeln nicht konsistent mit den richtigen Antworten verknüpfen.

Die „AGI“-Messlatte

Die Autoren setzen eine hohe Hürde für das, was als „Künstliche Allgemeine Intelligenz“ (AGI) zählt. Sie argumentieren, dass eine KI nicht wirklich „denkt“, bis sie in der Lage ist:

  1. Ein Problem zu lösen.
  2. Explizit die Regeln und Theorien aufzulisten, die sie zur Lösung verwendet hat.
  3. Dies über viele verschiedene Arten von Problemen hinweg korrekt zu tun (nicht nur bei einem einzigen Typ).

Das Fazit:
Im Moment ist ChatGPT ein brillanter Improvisator. Es kann „etwas aus dem Ärmel schütteln“ und dabei klug klingen. Aber es hat noch nicht bewiesen, dass es eine tiefe, logische Landkarte davon besitzt, wie die Welt funktioniert. Um eine echte „denkende Maschine“ zu sein, muss es aufhören, nur das nächste Wort zu raten, und statfangen, zu beweisen, warum dieses Wort das richtige ist – Schritt für Schritt, unter Verwendung echter Regeln.

Bis eine KI diese „Listen Sie die Regeln auf“-Tests konsistent bestehen kann, sagt die Arbeit, ist sie noch keine echte AGI.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →