← Neueste Arbeiten
🤖 machine learning

Multi-Perspective Transformers in ARC-AGI-2 Challenge

Dieser Artikel stellt einen auf TinyLM basierenden Ansatz vor, der durch Testzeit-Feinabstimmungstechniken wie Test-Time-Training und Products of Experts zur Lösung von ARC-AGI-2-Vision-Rätseln erweitert wurde und auf dem Evaluierungsdatensatz eine Genauigkeit von 21,7 % erreicht.

Ursprüngliche Autoren: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

Veröffentlicht 2026-05-05
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu, Fariha Sheikh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Ihnen wird eine Reihe visueller Rätsel übergeben. Jedes Rätsel zeigt Ihnen einige „Vorher"- und „Nachher"-Bilder von farbenfrohen Gittern, und Ihre Aufgabe besteht darin, die Regel zu erraten, die das „Vorher" in das „Nachher" verwandelt. Anschließend müssen Sie diese Regel auf ein neues, bisher unbekanntes Bild anwenden. Dies ist die ARC-AGI-2-Herausforderung, ein Test, der entwickelt wurde, um zu prüfen, ob ein Computer wie ein Mensch denken kann: indem er aus sehr wenigen Beispielen lernt und sich sofort an neue Situationen anpasst.

Hier ist, wie das Team (Caleb, Seun, Weiwen, Fariha, Vedant und Xinyu) diese Herausforderung angegangen ist, einfach erklärt.

Die Strategie des Teams: Der „Viele-Augen"-Ansatz

Anstatt das Rätsel nur einmal zu betrachten, entwickelte das Team ein System, das das Rätsel aus vielen verschiedenen Winkeln betrachtet. Stellen Sie sich vor, Sie versuchen, ein Rätsel zu lösen, indem Sie fünf verschiedene Personen bitten, denselben Tatort zu beschreiben, wobei jede Person jedoch durch ein anderes Fenster schaut oder einen Spiegel davorhält.

  1. Der Übersetzer (Tokenisierung): Zuerst übersetzt der Computer das farbenfrohe Gitter in einen einfachen Textstring, wie ein Rezept. Er sagt Dinge wie „Start hier, Breite ist 5, Höhe ist 5, Farbe ist rot."
  2. Die Gestaltwandler (Daten-Augmentierung): Das System nimmt dieses Rätsel und erstellt Dutzende „Ansichten" davon. Es dreht das Gitter, kehrt es wie einen Pfannkuchen um, tauscht die Farben aus (wie etwa alle Roten in Blau verwandelnd) und transponiert es. Das Ziel ist es, eine Version des Rätsels zu finden, in der die versteckte Regel für den Computer offensichtlich ist.
  3. Das kleine Gehirn (TinyLM): Sie verwendeten ein sehr kleines, effizientes KI-Modell namens TinyLM. Stellen Sie sich dies als einen klugen, aber kompakten Schüler vor, der nicht jedes mögliche Rätsel der Welt auswendig gelernt hat, aber sehr gut darin ist, Muster schnell zu erkennen.
  4. Das „Produkt der Experten" (PoE): Dies ist ihr Abstimmungssystem. Das Modell betrachtet all diese verschiedenen „Ansichten" des Rätsels. Wenn das Modell bei seiner Antwort über alle verschiedenen Ansichten (gedreht, gespiegelt, farbaustauschend) hinweg zuversichtlich ist, erhält diese Antwort eine hohe Punktzahl. Es ist wie eine Jury, bei der ein Urteil nur akzeptiert wird, wenn jeder einzelne Geschworene zustimmt.
  5. Der Schnellstudent (Testzeit-Training): Bevor es ein spezifisches Rätsel löst, erhält das Modell einen winzigen, schnellen „Intensivkurs" mit den wenigen Beispielen, die in diesem spezifischen Rätsel enthalten sind. Es ist wie ein Koch, der die Sauce kurz vor dem Servieren probiert und eine Prise Salz hinzufügt, um zum spezifischen Gericht zu passen, anstatt sich auf ein generisches Rezept zu verlassen.

Die Ergebnisse: Eine Geschichte von zwei Sätzen

Das Team testete sein System an zwei Gruppen von Rätseln:

  • Der Übungssatz (Training): Dies sind Rätsel, die das Modell während seines „Intensivkurses" gesehen hat.
  • Die Abschlussprüfung (Evaluation): Dies sind brandneue Rätsel, die das Modell noch nie zuvor gesehen hat.

Das Punktesystem:

  • Auf dem Übungssatz: Das Modell war ein Superstar und erreichte 96,1 % Korrektheit. Es beherrschte die Regeln, die ihm gezeigt wurden.
  • Auf der Abschlussprüfung: Die Punktzahl sank auf 21,7 %.

Was lief schief? (Das Problem des „Overfitting")

Die Arbeit erklärt, dass die Methode des „Schnellstudenten" (Testzeit-Training) die Ergebnisse bei der Abschlussprüfung tatsächlich verschlechterte.

Stellen Sie sich vor, Sie lernen für eine Matheprüfung, indem Sie die spezifischen Zahlen in Ihren Hausaufgaben auswendig lernen. Wenn die Prüfung kommt, sind die Zahlen anders, aber die Logik ist dieselbe. Da das Modell so hart an den spezifischen Hausaufgaben-Zahlen gelernt hatte, geriet es in Verwirrung, als sich die Prüfungs-Zahlen änderten. Es „overfittete" – es lernte die Übungsbeispiele zu perfekt auswendig und konnte sich nicht an die neuen anpassen.

Ebenso funktionierte die „Viele-Augen"-Strategie (PoE) nicht so gut wie erhofft, weil das Modell hauptsächlich darauf trainiert war, die Rätsel in einer bestimmten Reihenfolge zu lesen (zeilenweise). Als das System versuchte, die Rätsel aus verschiedenen Winkeln zu betrachten (wie spaltenweise), verstand das Modell die neue Perspektive nicht, wodurch diese zusätzlichen Ansichten nutzlos wurden.

Das Fazit

Das Team baute ein kluges System, das multiple Perspektiven und schnelles Lernen nutzt, um visuelle Rätsel zu lösen. Es bewies, dass es die Regeln der Rätsel, an denen es übte, fast perfekt erlernen konnte. Allerdings hatte es Schwierigkeiten, diese Regeln auf völlig neue, bisher unbekannte Rätsel anzuwenden.

Die Arbeit kommt zu dem Schluss, dass ihre Tricks des „Schnellstudenten" und der „Viele-Augen" zwar interessant sind, das Modell jedoch größer sein muss, auf vielfältigere Beispiele trainiert werden muss und gelehrt werden muss, die Logik der Rätsel zu verstehen, anstatt nur die spezifischen Übungsbeispiele auswendig zu lernen. Sie haben den schwierigsten Teil der Herausforderung noch nicht gelöst, aber sie legten ein solides Fundament, um zu verstehen, wie kleine KI-Modelle versuchen können, zu schlussfolgern.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →