Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
Argus ist eine universell einsetzbare, Fixed-Weight-Agentic-Runtime, die durch die Nutzung eines persistenten, selbstentwickelnden Zustands, der durch spezialisierte Rollen verwaltet wird, um Missionstrajektorien autonom zu verifizieren, wiederherzustellen und zu verfeinern, eine überlegene Langzeit-Reasoning-Leistung über diverse Benchmarks hinweg erreicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Der Langstrecken-Detektiv: Warum KI ein Gedächtnis und einen Coach braucht
Stellen Sie sich vor, Sie versuchen, ein riesiges, mehrtägiges Rätsel zu lösen, wie zum Beispiel herauszufinden, wie man einen funktionierenden Roboter von Grund auf neu baut oder einen Roman schreibt, der tatsächlich Sinn ergibt. Wenn Sie ein Computerprogramm von vor ein paar Jahren wären, hätten Sie vielleicht versucht, es zu lösen, indem Sie die Anweisungen lesen, eine Vermutung anstellen und dann sofort alles vergessen, was Sie gerade getan haben, bevor Sie es erneut versuchen. So funktionierten viele frühe KI-„Agenten“: Sie waren wie ein Detektiv, der einen Hinweis löst, dann aber unter totaler Amnesie leidet und die gesamte Untersuchung jedes Mal von vorne beginnen muss, wenn er auf eine Sackgasse stöst. Sie waren schnell im Lesen, aber schrecklich darin, über einen langen Zeitraum aus ihren eigenen Fehlern zu lernen.
Das Feld des „Long-Horizon Reasoning“ (langfristige Schlussfolgerung) beschäftigt sich genau mit der Behebung dieses Problems. Es stellt die Frage: Wie kann eine KI einen Plan über Tage oder Wochen hinweg aufrechterhalten, sich daran erinnern, was sie gestern versucht hat, und ihre Strategie ändern, wenn sie merkt, dass sie in die falsche Richtung läuft? Die Kernidee hierbei ist, dass Intelligenz nicht nur daraus besteht, ein großes Gehirn (ein leistungsstarkes Modell) zu haben, sondern auch ein gutes Notizbuch (persistentes Gedächtnis) und einen strengen Coach (Verifizierung), der einen stoppt, wenn man sich selbst anlügt, sobald man feststeckt. Dieses Paper befasst sich mit der Frage, wie man ein KI-System baut, das nicht einfach nur im Kreis läuft, sondern seine Methoden im Laufe der Zeit tatsächlich weiterentwickelt und besser darin wird, schwierige Probleme zu lösen, ohne dafür jedes Mal komplett neu trainiert werden zu müssen.
Treffen Sie Argus: Die KI, die lernt, die Richtung zu ändern
Lernen Sie Argus kennen, eine neue Art von KI-„Runtime“ (denken Sie an es als das Betriebssystem oder die Engine, die das Gehirn der KI antreibt). Die Forscher hinter Argus, ein Team von Microsoft und mehreren Top-Universitäten, erkannten, dass eine KI, um wirklich schwierige, langfristige Projekte anzugehen, nicht einfach blind vorwärts marschieren kann. Wenn die KI versucht, einen Bug in einer riesigen Software-Codebasis zu beheben oder ein komplexes mathematisches Theorem zu beweisen, könnte sie Stunden damit verbringen, einen Pfad zu verfolgen, der sich als Sackgasse erweist. Eine normale KI würde vielleicht einfach weiterdrücken und Zeit sowie Energie verschwenden. Argus ist anders: Es ist darauf ausgelegt, zu pivotieren (die Richtung zu ändern).
Stellen Sie sich Argus wie ein hoch organisiertes Forschungsteam vor, das in einem gemeinsamen Büro arbeitet, anstatt wie eine einzelne Person, die alleine arbeitet. Dieses Team hat vier verschiedene Rollen, und sie vermischen ihre Aufgaben niemals:
- Der Manager: Der Chef, der den Blick für das große Ganze behält. Er stellt sicher, dass das Team auf das ursprüngliche Ziel fokussiert bleibt (wie „baue einen Roboter“), selbst wenn sich der tägliche Plan ändert.
- Der Planer: Der Stratege, der das große Ziel in kleine, machbare Aufgaben für den Tag zerlegt.
- Der Ingenieur: Der Erbauer, der tatsächlich den Code schreibt, die Experimente durchführt oder die Mathematik betreibt.
- Der Reviewer (Prüfer): Der strenge Qualitätskontrolleur. Seine Aufgabe ist es, sich anzusehen, was der Ingenieur gebaut hat, und zu sagen: „Das ist gut“, „Das muss repariert werden“ oder „Stopp, dieser Pfad ist eine Sackgasse“.
Die Magie von Argus liegt darin, dass es Fehler als Daten behandelt. Wenn der Ingenieur eine Methode ausprobiert und diese fehlschlägt, sagt der Reviewer nicht einfach nur „Ups“. Er zeichnet genau auf, warum es gescheitert ist. Dieser Datensatz wird in einem permanenten „Projektzustand“ (dem gemeinsamen Notizbuch des Teams) gespeichert. Wenn das Team später versucht, denselben Sackgassen-Pfad erneut zu beschrechen, erinnert sich das System: „Hey, das haben wir gestern schon versucht und es hat nicht funktioniert“, und wechselt zu einer neuen Idee. Dies wird als verification-guided persistence (verifizierungsgestützte Beständigkeit) bezeichnet. Das System „lernt“ (aktualisiert sein Gedächtnis) nur dann, wenn der Reviewer verifiziert, dass die neue Information tatsächlich wahr und nützlich ist.
Was sie herausgefunden haben: Besser beim Beheben von Code und beim Schreiben von Papern
Das Team testete Argus bei einigen unglaublich schwierigen Herausforderungen, um zu sehen, ob dieser „Team mit einem Gedächtnis“-Ansatz tatsächlich funktioniert.
1. Der Code-Fixing-Test (SWE-Bench Pro)
Sie gaben Argus 731 reale Software-Bugs zur Behebung. Das ist so, als würde man einem Programmierer eine unordentliche, kaputte Codebasis geben und ihn bitten, sie ohne menschliche Hilfe zu reparieren.
- Das Ergebnis: Argus konnte etwa 78 % der Bugs erfolgreich beheben.
- Der Vergleich: Ein Standard-KI-Tool (Direct Copilot) konnte nur 59 % davon beheben.
- Die Kosten: Argus verbrauchte etwa das 1,41-fache an Computer-„Tokens“ (die Basiseinheiten des Denkens) im Vergleich zum Standard-Tool.
- Die Erkenntnis: Argus war signifikant genauer, obwohl es etwas mehr „dachte“. Es bewies, dass es sich auszahlt, die Zeit zu investieren, um die Arbeit zu prüfen und vergangene Fehler zu berücksichtigen.
2. Der „Intelligenter Werden“-Test (Self-Evolution)
Hier ist der coolste Teil. Die Forscher beobachteten Argus über einen längeren Zeitraum. Sie änderten nicht das Gehirn der KI (die Modellgewichte blieben exakt gleich). Stattdessen ließen sie das System einfach sein „Notizbuch“ an Fähigkeiten und Erinnerungen aufbauen.
- Das Ergebnis: Während das System mehr Aufgaben erledigte und sein Notizbuch mit verifizierten Fähigkeiten füllte, wurde es schneller und kostengünstiger. In den späteren Phasen des Tests verbrauchte Argus 21 % weniger Tokens und benötigte 15 % weniger Zeit pro Aufgabe im Vergleich zu Beginn.
- Die Bedeutung: Die KI musste nicht neu trainiert werden, um besser zu werden; sie musste nur sich dessen erinnern, was sie gelernt hatte. Sie entwickelte ihren eigenen „Runtime-Zustand“ und wurde zu einem effizienteren Arbeiter, ohne ihr fundamentales Gehirn zu verändern.
3. Der „Lüge dich nicht selbst an“-Test (Intervention des Reviewers)
Das Team verfolgte, wie oft der Reviewer eingriff. Von den 731 Aufgaben wurde der Reviewer bei 466 davon hinzugezogen.
- Die Rettung: In 43 Fällen sagte der Reviewer: „Das ist noch nicht fertig, versuch es nochmal.“ Nachdem der Ingenieur es erneut versucht hatte, wurden 34 dieser Aufgaben erfolgreich behoben, und 22 wurden so gut gelöst, dass sie eine zweite, strengere Prüfung bestanden.
- Die Blockade: Der Reviewer stoppte das System auch dabei, bei 35 Aufgaben einen Sieg zu beanspruchen, die eigentlich unmöglich oder fehlerhaft waren. Das ist enorm wichtig: Es bedeutet, dass das System lernte, „Ich kann das nicht“ zu sagen, anstatt eine gefälschte Lösung zu halluzinieren.
Jensecht von Code: Mathematik, Chips und Paper
Argus blieb nicht beim Beheben von Code stehen. Das Team zeigte, dass es auch andere „Long-Horizon“-Aufgaben bewältigen kann:
- Mathematische Forschung: In einer Kampagne zur Beweisführung eines komplexen mathematischen Theorems führte Argus ein Protokoll über einen Pfad, der als falsch bewiesen wurde (eine „falsifizierte Route“). Anstatt ihn zu löschen, behielt es ihn als „Betreten verboten“-Schild bei. Dies half dem System, diese Sackgasse später zu vermeiden und die Grenzen des Theorems erfolgreich zu stärken.
- Schreiben von Papern: Sie ließen sechs verschiedene Forschungsprojekte zur Erstellung wissenschaftlicher Arbeiten durchlaufen. Das System bewältigte 254 Missionen, überstand 16 große Rollbacks (bei denen es den gesamten Plan ändern musste) und schaffte es dennoch, alle sechs Paper fertigzustellen. Ein Projekt verwandelte sogar eine gescheiterte Idee in eine erfolgreiche „Negativresultat“-Studie, was beweist, dass auch das Feststellen dessen, was nicht funktioniert, eine gültige wissenschaftliche Entdeckung ist.
- Chip-Design: In einem riskanten Test entwarf Argus einen Computerchip (ACE-2). Das System schrieb den Code, prüfte das Timing, und das finale Design bestand alle strengen Hardware-Checks. Das System wusste sogar genau, was es nicht geprüft hatte (wie z. B. ob der Chip im echten Leben funktionieren würde), und listete diese Grenzen klar auf.
Das Fazentelement
Argus zeigt, dass eine KI für echte, langfristige Arbeit mehr braucht als nur ein großes Gehirn. Sie braucht ein System, das den „Chef“ vom „Arbeiter“ trennt, eine permanente Aufzeichnung darüber führt, was funktioniert hat und was nicht, und einen strengen „Reviewer“ besitzt, der sie stoppt, Antworten zu erfinden.
Das Paper legt nahe, dass eine KI durch die Nutzung dieses „verifizierungsgesteuerten“ Ansatzes schwierigere Probleme lösen, im Laufe der Zeit effizienter werden kann, ohne neu trainiert werden zu müssen, und sogar zugeben kann, wenn sie feststeckt. Es ist kein Zauberstab, der alles sofort löst, aber es ist ein massiver Schritt in Richtung einer KI, die tatsächlich mit uns an langen, komplexen Projekten arbeiten kann, ohne sich zu verlieren oder über ihren Fortschritt zu lügen. Wie die Autoren anmerken, geht es hierbei nicht nur darum, eine höhere Punktzahl in einem Test zu erreichen; es geht darum, ein System zu bauen, das in der Lage ist, zu bestehen, die Richtung zu ändern und seine eigenen Methoden zu entwickeln, um die chaotischen, langfristigen Herausforderungen der realen Welt anzugehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.