Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents
Evo-Harness führt ein selbstentwickelndes Agenten-Framework ein, das die Herausforderung des Lernens aus verrauschten One-Shot-Interaktionen in neuartigen realen Aufgaben durch den Einsatz von Context-to-Harness-Skill-Kompilierung adressiert, um Erfahrungen in wiederverwendbare, strukturierte Skill-Harnesses für kontinuierliche domänenübergreifende Verbesserung zu destillieren.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der sich rasant entwickelnden Welt der künstlichen Intelligenz ist eine spezielle Art von Software, bekannt als Large Language Model Agent, als leistungsstarkes Werkzeug zur Lösung komplexer Probleme entstanden. Diese Agenten können Anweisungen lesen, Schritte planen, digitale Werkzeuge nutzen und mit Websites oder Computersystemen interagieren, ganz ähnlich wie ein Mensch. Eine beständige Herausforderung hat jedoch ihr Potenzial begrenzt: Wenn diese Agenten bei einer Aufgabe scheitern, behandeln sie dieses Scheitern oft als Sackgasse. Sie lernen nicht natürlich aus dem Fehler, um ihn später zu vermeiden. Traditionelle Methoden zur Unterweisung dieser Systeme beinhalten meist das Sammeln von tausenden vergangenen Versuchen und deren Offline-Analyse, um Muster zu finden – ein Prozess, der langsam ist und oft von der Echtzeit-Abfolge der Arbeit entkoppelt ist. In vielen praktischen Situationen begegnet ein Agent einer neuen, schwierigen Aufgabe nur einmal, mit einer einzigen Chance auf Erfolg oder Misserfolg, was wenig Raum für die langsame Akkumulation von Daten lässt, die das traditionelle Lernen erfordert.
Forscher haben nun einen neuen Weg vorgeschlagen, wie diese digitalen Arbeiter direkt vor Ort („on the fly“) besser werden können, eine Methode, die sie „Online Harness Learning“ nennen. Anstatt zu versuchen, das Kerngehirn des Agenten neu zu trainieren, welches oft fixiert und unveränderlich ist, hängen sie ein externes Leitbuch an, das sich mit jeder neuen Erfahrung entwickelt. Dieses Leitbuch oder dieser „Harness“ fungt als eine strukturierte Sammlung von Lektionen, die aus vorangegangenen Versuchen gelernt wurden. Wenn der Agent scheitert, speichert das System den Fehler nicht einfach nur ab; es kompiliert die chaotischen Details dieses Fehlers aktiv in eine klare, wiederverwendbare Regel. Diese Regel wird dann dem Leitbuch hinzugefügt, bereit, dem Agenten zu helfen, ähnliche Herausforderungen in der Zukunft zu bewältigen. Das Ziel ist es, einen verrauschten, einmaligen Fehler in ein sauberes, handlungsrelevantes Stück Weisheit zu verwandeln, das bei verschiedenen Arten von Aufgaben angewendet werden kann.
Um diese Idee zu testen, bauten die Forscher ein System namens Evo-Harness und unterzogen es fünf verschiedenen und anspruchsvollen Benchmarks. Diese Tests reichten von der Navigation durch komplexe Websites über die Verwaltung von Software-Code-Repositories bis hin zur Ausführung präziser Befehlszeilen-Instruktionen und der Nutzung verschiedener digitaler Werkzeuge. In jedem Szenario wurde der Agent einem Strom von Aufgaben ausgesetzt, einer nach der anderen, ohne die Möglichkeit, die Pause einzulegen und das zugrunde liegende Modell neu zu trainieren. Das System wurde so konzipiert, dass es den rohen Kontext jedes Versuchs – die gegebenen Anweisungen, die unternommenen Aktionen, das Ergebnis und jegliches Feedback – aufnimmt und diesen in eine strukturierte Lektion destilliert. Wenn der Agent scheiterte, reflektierte ein spezialisierter Prozess darüber, was schiefgelaufen war, und schlug eine neue Regel oder eine Modifikation einer bestehenden Regel vor. Ein anderer Prozess entschied dann, ob diese neue Regel hinzugefügt, mit vorhandenem Wissen verschmolzen oder verworfen werden sollte, falls sie zu spezifisch für diesen einzelnen Fehlversuch war.
Die Ergebnisse dieses Experiments waren beeindruckend. Die Agenten, die das sich entwickelnde Leitbuch nutzten, übertrafen jene, die es nicht nutzten, konsistent und sie schlugen auch andere Methoden, die auf dem einfachen Abruf vergangener Beispiele oder der Speicherung unstrukturierter Erinnerungen basierten. Auf einem Benchmark, der sich auf Befehlszeilen-Aufgaben konzentrierte, war die Verbesserung besonders dramatisch, wobei die Erfolgsraten von etwa 63 Prozent auf über 73 Prozent sprangen. Dies deutet darauf darauf hin, dass die Fähigkeit, verrauschte Single-Shot-Erfahrungen in strukturierte Anleitung zu kompilieren, besonders wertvoll ist, wenn Aufgaben eine Sequenz präziser Operationen erfordern, wie etwa das Inspizieren von Dateien oder das Regenerieren aus Fehlern. Die Studie fand auch heraus, dass die Art der generierten Anleitung je nach Aufgabe variierte. Für die Web-Navigation füllte sich das Leitbuch mit Workflow-Verfahren; für das Software-Engineering konzentrierte es sich auf Verifizierungs- und Wiederherstellungsschritte; und für Denkaufgaben erfasste es domänenspezifische Logik. Diese Anpassungsfähigkeit zeigt, dass das System nicht nur Antworten auswendig lernt, sondern die zugrunde liegende Struktur der Problemlösung begreift.
Eine kritische Erkenntnis aus der Forschung ist, dass nicht jedes Feedback gleichwertig ist. Das System funktionierte am besten, wenn es klares, fundiertes Feedback aus der Umgebung erhielt, wie etwa eine spezifische Fehlermeldung oder ein Testergebnis, anstatt wenn es gebeten wurde, seinen eigenen Erfolg zu beurteilen. Wenn der Agent versuchte, sein eigenes Feedback ohne externe Evidenz zu generieren, sank seine Leistung tatsächlich unter den Basiswert, was darauf hindeutet, dass Selbstbeurteilung Verwirrung stiften kann. Darüber hinaus zeigte die Studie, dass die Größe und die Kapazität des „Gehirns“ des Agenten eine Rolle spielten. Stärkere Modelle waren besser darin, die entwickelte Anleitung zu interpretieren und zu befolgen, und profitierten signifikant mehr vom System als schwächere Modelle. Interessanterweise konnte ein kleineres Modell manchmal ein Leitbuch schreiben, das einem größeren, leistungsfähigeren Modell half, aber das Umgekehrte war nicht immer der Fall. Wenn der Agent, der die Aufgabe löste, nicht anspruchsvoll genug war, um die Anleitung zu verstehen, half die zusätzliche Information nicht und konnte die Leistung sogar behindern.
Die Forscher untersuchten auch, wie diese gelernten Fähigkeiten übertragen werden konnten. Sie fanden heraus, dass ein von einem Modell erstelltes Leitbuch für ein anderes nützlich sein konnte, und dass Fähigkeiten, die bei einer Reihe von Trainingsaufgaben gelernt wurden, die Leistung bei ungesehenen Testaufgaben verbessern konnten. Der effektivste Ansatz war jedoch, das Leitbuch kontinuierlich zu aktualisieren, während der Agent durch den Strom der Aufgaben arbeitete. Diese Echtzeit-Anpassung ermöglichte es dem System, sich an die spezifischen Eigenheiten und Fehlermodi der aktuellen Umgebung anzupassen, wodurch es selbst die besten vortrainierten Leitbücher übertraf. Die Studie kommt zu dem Schluss, dass der Schlüssel zu selbstverbessernden Agenten nicht im ständigen Nachtrainieren ihrer Kernmodelle liegt, sondern im Aufbau eines robusten, externen Systems, das das Chaos realer Fehler in eine klare, organisierte Menge von Anweisungen verwandeln kann. Indem sie das Leitbuch als ein lebendiges Dokument behandeln, das mit jeder Interaktion wächst und sich verfeinert, können diese digitalen Agenten lernen, die Unvorhersehbarkeit komplexer, realer Arbeit zu bewältigen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.