← Neueste Arbeiten
🤖 AI

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

Dieser Beitrag stellt „Absurd World" vor, ein Benchmarking-Framework, das reale Szenarien systematisch in logisch kohärente, aber absurde Kontexte überführt, um zu evaluieren, ob große Sprachmodelle über robuste logische Schlussfolgerungsfähigkeiten verfügen, die unabhängig von auswendig gelernten realen Mustern sind.

Ursprüngliche Autoren: Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

Veröffentlicht 2026-05-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen sehr intelligenten Roboter-Assistenten, der fast jedes Buch, jeden Artikel und jede Website im Internet gelesen hat. Sie stellen ihm eine einfache Frage: „Wenn ich 3 Äpfel habe und 1 esse, wie viele habe ich dann noch übrig?" Er antwortet sofort mit „2". Das scheint perfekt.

Aber was, wenn Sie dem Roboter sagen: „In dieser magischen Welt, wenn du einen Apfel isst, gewinnst du tatsächlich einen Apfel"? Ein Mensch würde die neue Regel sofort verstehen und sagen: „Okay, also habe ich 4 Äpfel." Doch dieser Artikel legt nahe, dass viele unserer aktuellen KI-Assistenten verwirrt sein könnten. Sie könnten Ihre neue Regel ignorieren und einfach „2" sagen, weil das das ist, was sie gelernt haben, in der „realen Welt" zu erwarten.

Dieser Artikel führt einen neuen Testbereich namens Absurd World ein, um zu prüfen, ob KI tatsächlich Ihre Regeln befolgen kann oder ob sie nur blind ihrer eigenen Erinnerung daran folgt, wie die Welt normalerweise funktioniert.

Die große Idee: Das „Magische Fußball"-Spiel

Die Forscher entwickelten ein einfaches Spiel, das auf einem Fußball-Elfmeterschießen basiert. In einem normalen Spiel erhalten Sie einen Punkt, wenn Sie den Ball ins Netz schießen. Wenn Sie daneben schießen, erhalten Sie nichts.

In Absurd World nahmen sie dieses vertraute Spiel und verdrehten die Regeln nur ein wenig, wodurch „absurde" Versionen entstanden, die für Menschen immer noch leicht zu verstehen, aber für KI seltsam sind:

  • Die „Fehlschuss"-Regel: In dieser Version gibt es einen Punkt für das Verfehlen des Netzes, und das Treffen des Netzes ergibt null Punkte.
  • Die „Wenigste"-Regel: Das Team mit dem niedrigsten Punktestand gewinnt.
  • Die „Eiscreme"-Regel: Anstelle von Punkten verdienen sich die Teams Eiscreme-Ecken.
  • Die „Wechsel"-Regel: Die Teams schießen das Netz auf den Ball (die Rollen der Objekte werden vertauscht).

Das Ziel war nicht, die Mathematik schwierig zu machen. Die Mathematik bestand immer noch nur aus einfachem Zählen. Das Ziel war zu sehen, ob die KI ihre reale Welt-Training ignorieren und strikt den seltsamen, neuen Anweisungen folgen konnte, die im Prompt gegeben wurden.

Wie sie es testeten

Sie verhielten sich wie verrückte Wissenschaftler, nahmen ein Standard-Fußballspiel und zerlegten es in Bausteine:

  1. Symbole: Die Spieler, der Ball, das Netz.
  2. Aktionen: Treffen oder Verfehlen.
  3. Regeln: Wie Punkte erzielt werden und wer gewinnt.

Dann tauschten sie diese Blöcke aus, um Hunderte dieser „absurden" Szenarien zu erstellen. Sie forderten verschiedene KI-Modelle auf, eine kurze Geschichte über ein Spiel zu lesen und den Gewinner zu verkünden.

Die überraschenden Ergebnisse

Der Artikel fand drei Hauptpunkte, die Sie dazu bringen könnten, darüber nachzudenken, wie „intelligent" diese KIs wirklich sind:

1. Die „teuren" Modelle waren tatsächlich schlechter
Man könnte denken, dass die teuersten, leistungsstärksten KI-Modelle am besten darin sind, neuen Regeln zu folgen. Überraschenderweise schnitten die „günstigen" Modelle oft besser ab als die „teuren" Modelle ohne Schlussfolgerungsfähigkeit. Die teuren Modelle scheinen in ihren eigenen Köpfen stecken zu bleiben und sich zu stark darauf zu verlassen, was sie dachten, was in einem echten Fußballspiel passieren sollte, anstatt darauf, was der Prompt tatsächlich sagte.

2. Die „Schlussfolgerungs"-Modelle waren die Champions
Die Modelle, die speziell dafür entwickelt wurden, zu „denken" (oft als Reasoning-Modelle bezeichnet), waren die einzigen, die eine perfekte Punktzahl erreichten. Sie konnten die absurde Regel („Fehlschuss gibt einen Punkt") betrachten und sagen: „Okay, ich werde mein Weltwissen ignorieren und dieser neuen Regel folgen." Sie ließen sich nicht durch die Magie verwirren.

3. Das Geben von Beispielen ging nach hinten los
Normalerweise, wenn Sie einer KI etwas beibringen wollen, geben Sie ihr zuerst ein paar Beispiele (dies nennt man „Few-Shot-Prompting"). Sie könnten sagen: „Hier ist ein Beispiel, wie man spielt, jetzt versuchen Sie es."

  • Die Wendung: In dieser Studie machte das Geben von Beispielen die KI tatsächlich schlechter. Es schien, dass das Sehen von Beispielen der „alten" Art, Dinge zu tun, die KI verwirrte, als sie versuchte, zu den „absurden" Regeln zu wechseln. Es war, als würde man jemandem ein Bild von einer Katze zeigen, bevor man ihn auffordert, einen Hund zu zeichnen; sie zeichneten weiterhin Katzenmerkmale.

Das Fazit

Der Artikel argumentiert, dass wir aufhören müssen, KI nur an schwierigen, komplexen Rätseln zu testen. Stattdessen müssen wir sie an einfachen Aufgaben mit seltsamen Regeln testen.

Wenn eine KI nicht einer einfachen Regel folgen kann, die besagt: „Verfehle das Tor, um zu gewinnen", dann ist es vielleicht nicht sicher, ihr komplexere Aufgaben anzuvertrauen, bei denen die Regeln sich von denen unterscheiden, die sie in ihren Trainingsdaten gelernt hat. Absurd World ist ein Werkzeug, um zu prüfen, ob eine KI Ihnen wirklich zuhört oder ob sie nur rezitiert, was sie denkt, dass Sie hören sollten.

Kurz gesagt: Nur weil eine KI alles über die reale Welt weiß, bedeutet das nicht, dass sie nach Ihren Regeln in einer magischen Welt spielen kann. Dieser Artikel baute einen Spielplatz, um herauszufinden, welche KIs tatsächlich den Gang wechseln können und welche im Leerlauf stecken bleiben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →