← Neueste Arbeiten
🤖 AI

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

Dieser Artikel stellt TMAS vor, ein Multi-Agenten-Synergie-Framework, das die Skalierung der Rechenleistung zur Laufzeit für große Sprachmodelle verbessert, indem es hierarchische Speicher für strukturierte kollaborative Zusammenarbeit über verschiedene Trajektorien hinweg sowie ein hybrides Belohnungs-Verstärkungslernschema zur effektiven Balance zwischen Exploration und Exploitation bei推理-Aufgaben nutzt.

Ursprüngliche Autoren: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

Veröffentlicht 2026-05-12
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein unglaublich schwieriges Rätsel zu lösen, wie eine komplexe mathematische Aufgabe oder ein kniffliges Logikrätsel. Sie haben einen sehr klugen Assistenten (eine KI), der versuchen kann, es zu lösen.

Der alte Weg: Der einsame Wolf gegen die Masse
Früher, wenn die KI feststeckte, forderten die Forscher sie einfach auf, „intensiver nachzudenken" oder es „noch einmal zu versuchen".

  • Der einsame Wolf: Die KI würde einfach weiter mit sich selbst sprechen und eine lange Gedankenkette schreiben. Manchmal geriet sie in eine Schleife und wiederholte denselben Fehler immer wieder.
  • Die Masse: Andere Methoden ließen die KI viele verschiedene Antworten gleichzeitig generieren, die beliebteste auswählen oder eine Version eine andere überprüfen lassen. Doch diese Versionen arbeiteten oft in Silos. Wenn eine Version einen brillanten Trick fand, wussten die anderen nichts davon. Wenn eine Version in eine Sackgasse geriet, wussten die anderen nicht, diesen Weg zu vermeiden. Sie waren wie eine Gruppe von Menschen in einem Raum, die alle verschiedene Ideen riefen, aber niemand hörte wirklich zu oder führte ein gemeinsames Notizbuch.

Der neue Weg: TMAS (Das Team mit einem gemeinsamen Gehirn)
Die Studie stellt TMAS (Test-time Multi-Agent Synergy) vor. Betrachten Sie dies nicht als eine KI, sondern als ein spezialisiertes Team, das mit einem gemeinsamen Speichersystem zusammenarbeitet.

So funktioniert TMAS, anhand einer einfachen Analogie:

1. Das Team von Spezialisten

Anstatt dass eine KI alles erledigt, teilt TMAS die Arbeit unter fünf spezifischen „Agenten" (Teammitgliedern) auf:

  • Der Löser: Versucht, Antworten zu finden.
  • Der Prüfer: Überprüft die Arbeit des Löser, um Fehler zu finden.
  • Der Zusammenfasser: Nimmt die Notizen des Prüfers und verwandelt sie in eine klare „gelernte Lektion".
  • Der Erfahrungsbewahrer: Dies ist entscheidend. Er betrachtet die Lektionen und schreibt sie in ein „Niedrig-Niveau-Notizbuch". Dieses Notizbuch enthält spezifische, konkrete Fakten wie: „Hey, wir haben versucht, diesen Stein vertikal zu legen, und es ist gescheitert. Mach das nicht noch einmal," oder „Wir haben bewiesen, dass diese spezifische Zahl 3 ist, also können wir diese Tatsache später verwenden."
  • Der Strategie-Guide: Dieser Agent schreibt in eine „Hoch-Niveau-Karte". Diese Karte listet keine spezifischen Fakten auf; sie listet Ansätze auf. Sie sagt: „Wir haben bereits versucht, dies mit Algebra zu lösen. Wir haben auch versucht, Geometrie zu verwenden. Verschwenden Sie keine Zeit damit, diese erneut zu versuchen; versuchen Sie etwas völlig Neues."

2. Der iterative Prozess (Die Schleife)

Das Team arbeitet in Runden:

  1. Erkunden: Der Löser generiert mehrere verschiedene Versuche für das Problem.
  2. Überprüfen: Die Prüfer bewerten sie.
  3. Lernen: Der Erfahrungsbewahrer und der Strategie-Guide aktualisieren ihre Notizbücher und Karten basierend auf dem, was passiert ist.
  4. Verfeinern: Die nächste Runde von Lösern liest die Notizbücher und Karten. Sie nutzen das „Niedrig-Niveau-Notizbuch", um vergangene spezifische Fehler zu vermeiden, und nutzen die „Hoch-Niveau-Karte", um sicherzustellen, dass sie nicht einfach alte Strategien wiederholen.

3. Die „Hybride Belohnung" (Der Anreiz des Trainers)

Um die KI zu lehren, wie sie dieses Team effektiv nutzt, schufen die Forscher ein spezielles Trainingssystem (Bestärkendes Lernen). Stellen Sie sich einen Trainer vor, der dem Team drei Arten von Belohnungen gibt:

  • Belohnung 1 (Es richtig machen): Wenn Sie das Rätsel lösen, erhalten Sie einen Punkt. (Grundlegende Fähigkeit).
  • Belohnung 2 (Das Notizbuch nutzen): Wenn Sie das Rätsel lösen, speziell weil Sie eine Tatsache aus dem „Niedrig-Niveau-Notizbuch" verwendet haben, erhalten Sie einen Bonus. Dies lehrt die KI, das gemeinsame Gedächtnis tatsächlich zu lesen und ihm zu vertrauen, anstatt es einfach zu ignorieren.
  • Belohnung 3 (Kreativ sein): Wenn Sie das Rätsel mit einer neuen Strategie lösen, die nicht auf der „Hoch-Niveau-Karte" steht, erhalten Sie einen Bonus. Dies verhindert, dass das Team faul wird und einfach dieselben alten Tricks wiederholt. Wenn Sie einfach eine alte Strategie kopieren und einfügen, werden Sie bestraft.

Die Ergebnisse

Die Studie testete dies an sehr schwierigen mathematischen Benchmarks (wie der Internationalen Mathematik-Olympiade).

  • Die Erkenntnis: Je mehr Zeit das Team zum Nachdenken hat (mehr „Iterationen"), desto intelligenter wird TMAS kontinuierlich. Andere Methoden neigen dazu, an eine Wand zu stoßen, wo sie aufhören, sich zu verbessern, oder sogar beginnen, mehr Fehler zu machen, weil sie durch ihre eigene Geschichte verwirrt werden.
  • Die Analogie: Es ist wie der Unterschied zwischen einem Schüler, der einfach ein Lehrbuch immer wieder durchliest (und müde und verwirrt wird), und einem Schüler, der einen Tutor, eine Lerngruppe und einen gemeinsamen Satz von Karteikarten hat. Der Schüler mit dem System lernt schneller, vermeidet die Wiederholung von Fehlern und versucht neue Winkel, wenn er feststeckt.

Zusammenfassung:
TMAS verwandelt eine einzelne KI in ein koordiniertes Team mit einem gemeinsamen Gedächtnis. Es zwingt die KI, spezifische Fakten zu merken (Erfahrungsbank) und zu verfolgen, welche großen Ideen bereits gescheitert sind (Leitfadenbank). Indem die KI trainiert wird, die Nutzung dieser Erinnerungen zu schätzen und neue Wege zu versuchen, kann sie viel schwierigere Probleme lösen als zuvor, indem sie ihre „Denkzeit" effektiv hochskaliert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →