← Neueste Arbeiten
💻 computer science

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

Dieser Beitrag stellt SciCrafter vor, einen auf Minecraft basierenden Benchmark, der KI-Agenten im Kreislauf von Entdeckung bis Anwendung durch Redstone-Schaltungsaufgaben bewertet und zeigt, dass zwar aktuelle Spitzemodelle aufgrund von Einschränkungen bei der Wissensanwendung bei einer Erfolgsrate von 26 % stagnieren, sich der entstehende Engpass für fortschrittliche Systeme jedoch zunehmend auf die Fähigkeit verlagert, Wissenslücken zu identifizieren und die richtigen Probleme zu formulieren.

Ursprüngliche Autoren: Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

Veröffentlicht 2026-04-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem brillanten, aber unerfahrenen Lehrling beizubringen, eine komplexe Maschine zu bauen, wie etwa einen Uhrwerk-Roboter. Sie geben ihm eine Kiste mit Teilen und ein Ziel: „Bauen Sie den Roboter so, dass er läuft."

Der Lehrling muss nicht nur wissen, wie man die Zahnräder zusammenfügt (Anwendung); er muss zunächst herausfinden, welche Zahnräder funktionieren, warum sie sich so drehen, wie sie es tun, und was passiert, wenn man sie auf eine seltsame Weise verbindet (Entdeckung).

Dieser Artikel mit dem Titel „Können aktuelle Agenten die Lücke zwischen Entdeckung und Anwendung schließen? Eine Fallstudie in Minecraft" ist im Wesentlichen ein Zeugnis darüber, wie gut die fortschrittlichsten heutigen KI-„Lehrlinge" diesen gesamten Prozess bewältigen können.

Hier ist die Aufschlüsselung ihrer Erkenntnisse, unter Verwendung einfacher Analogien:

1. Der Test: Ein „Redstone"-Rätsel

Die Forscher testeten die KI nicht in der realen Welt (die zu chaotisch und teuer ist). Stattdessen nutzten sie Minecraft, ein Videospiel, in dem man komplexe Maschinen mit „Redstone" (die Version des Spiels für elektrische Verkabelung) bauen kann.

  • Die Aufgabe: Die KI musste einen Stromkreis bauen, um eine bestimmte Anzahl von Lampen (von 4 bis 64) in einem bestimmten Muster zu beleuchten (alle gleichzeitig oder in einer Sequenz).
  • Der Haken: Die KI konnte nicht einfach raten. Mit zunehmender Anzahl der Lampen änderten sich die Regeln des Spiels. Beispielsweise wird ein Signal in Minecraft schwächer, je weiter es reist. Um 64 Lampen zu beleuchten, musste die KI entdecken, dass sie spezielle „Repeater" (Signalverstärker) benötigte und diese in einer bestimmten „Hub"-Form anordnete. Wenn sie lediglich versuchte, eine Lösung für 4 Lampen zu merken und diese hochzuskalieren, würde sie scheitern.

2. Das Ergebnis: Die KI stieß an eine Wand

Die Forscher testeten die intelligentesten verfügbaren KI-Modelle (wie GPT-5.2, Gemini-3-Pro und Claude-Opus-4.5).

  • Die Punktzahl: Selbst die beste KI hatte nur etwa 26 % Erfolg.
  • Die Analogie: Stellen Sie sich vor, Sie geben einem genialen Schüler einen Mathe-Test. Er kann einfache Additionen perfekt lösen, aber wenn Sie ihn bitten, eine neue Art zu erfinden, Zahlen zu multiplizieren, um ein schwierigeres Problem zu lösen, gerät er ins Stocken. Er ist großartig darin, Anweisungen zu befolgen, aber schrecklich darin, herauszufinden, welche Anweisungen er selbst formulieren muss.

3. Die Diagnose: Wo scheiterten sie?

Die Forscher teilten das Versagen der KI in vier Schritte auf, wie bei einer Staffel. Sie wollten sehen, welcher Läufer das Staffelholz fallen ließ.

  • Schritt 1: Wissen, was man nicht weiß (Identifikation)

    • Das Problem: Die KI wusste nicht, was sie fragen sollte. Sie merkte nicht: „Hey, ich weiß nicht, wie sich Signale über die Distanz abschwächen."
    • Die Lösung: Als die Forscher der KI einen Hinweis gaben wie „Prüfen Sie, wie weit das Signal reicht", verdoppelte sich die Erfolgsrate.
    • Die Erkenntnis: Für die intelligentesten KIs ist das größte Problem nicht das Lösen des Rätsels, sondern herauszufinden, was das Rätsel eigentlich ist. Sie sind schlecht darin, die richtigen Fragen zu stellen.
  • Schritt 2: Experimente durchführen (Entdeckung)

    • Das Problem: Die KI wusste nicht, wie man ihre Ideen systematisch testet.
    • Die Lösung: Die Forscher fügten einen „Wissenschaftler"-Sub-Agenten hinzu. Dies war eine zweite KI, deren einzige Aufgabe darin bestand, kleine Tests durchzuführen (z. B. „Was passiert, wenn ich hier einen Block platziere?") und einen Bericht zu schreiben.
    • Die Erkenntnis: Als die KI einen „Wissenschaftler" hatte, der die Experimente durchführte, wurde sie besser. Dies zeigt, dass KIs zwar das Wissen darüber haben, wie man experimentiert, aber Schwierigkeiten haben, dies ohne einen strukturierten Prozess selbstständig zu tun.
  • Schritt 3: Die Regeln aufschreiben (Konsolidierung)

    • Das Problem: Die KI fand die Antwort, vergaß aber später, wie man sie anwendet, weil sie die Notizen auf eine unordentliche Weise aufschrieb.
    • Die Lösung: Als die Forscher die KI zwangen, ihre Erkenntnisse in einem strengen Format (Behauptung, Beweis, Einschränkungen, Beispiel) aufzuschreiben, schnitt sie deutlich besser ab.
    • Die Erkenntnis: Es reicht nicht aus, etwas zu „wissen"; die KI muss wissen, wie man dieses Wissen speichert und organisiert, um es später zu nutzen.
  • Schritt 4: Die Maschine bauen (Anwendung)

    • Das Problem: Selbst nachdem sie die Regeln herausgefunden und aufgeschrieben hatte, hatte die KI immer noch Schwierigkeiten, die Blöcke im Spiel tatsächlich korrekt zu platzieren.
    • Die Erkenntnis: Dies ist die „restliche" Lücke. Die KI hat immer noch Schwierigkeiten, ihr neues Wissen in eine perfekte physische Konstruktion zu übersetzen. Für die intelligentesten Modelle wird diese Lücke jedoch kleiner, während die Lücke beim „Stellen der richtigen Frage" größer wird.

4. Das große Fazit

Der Artikel kommt zu dem Schluss, dass wir einen Wendepunkt für die KI erreichen.

  • Die Vergangenheit: KI war in allem schlecht: Fragen stellen, experimentieren und bauen.
  • Die Gegenwart: KI wird sehr gut im Bauen (Anwendung), wenn man ihr die Regeln gibt.
  • Die zukünftige Engstelle: Der schwierigste Teil ist nicht mehr das „Lösen des Problems". Der schwierigste Teil ist das „Definieren des Problems".

Die abschließende Metapher:
Stellen Sie sich ein Auto vor, das sich perfekt selbst fährt, sobald man ihm das Ziel und die Route sagt. Das Problem ist, dass das Auto derzeit schrecklich darin ist, aus dem Fenster zu schauen, zu erkennen: „Oh, die Straße ist blockiert", und zu entscheiden, eine neue Route zu finden. Es braucht einen Menschen, der ihm sagt: „Hey, die Straße ist blockiert, fahre drumherum."

Die Forscher sagen: Wir müssen aufhören zu versuchen, das Auto schneller fahren zu lassen, und anfangen, ihm beizubringen, auf die Straße zu schauen und herauszufinden, wohin es gehen soll.

Zusammenfassung der Beiträge

  1. SCICRAFTER: Ein neuer Test (in Minecraft), um zu prüfen, ob KI von der „Entdeckung" zur „Anwendung" gelangen kann.
  2. Die Aufschlüsselung: Sie bewiesen, dass das größte Hindernis für intelligente KIs nun darin besteht, herauszufinden, was sie lernen müssen, und nicht nur darin, das anzuwenden, was sie wissen.
  3. Die Werkzeuge: Sie schufen einen „Wissenschaftler"-Helfer und eine bessere Art, Notizen zu machen, die KI beim Erlernen neuer Dinge erheblich unterstützt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →