← Neueste Arbeiten
🤖 machine learning

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++ stellt ein Reinforcement-Learning-Framework für evolutionäre Suchagenten vor, das die strategische Hypothesenauswahl von der Implementierung mittels eines trainierbaren Beraters und eines Frontier-Modells entkoppelt und eine phasenadaptive Trainingsstrategie einsetzt, um eine schnellere Konvergenz und stabiles Lernen zur Testzeit über diverse ingenieurwissenschaftliche und wissenschaftliche Aufgaben hinweg zu erreichen.

Ursprüngliche Autoren: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

Veröffentlicht 2026-05-11
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine brandneue, super-effiziente Maschine zu erfinden. Sie haben einen brillanten, aber leicht chaotischen Ideen-Generator (eine kleinere KI) und einen hochqualifizierten Meister-Baumeister (eine leistungsstarke KI).

Bei den meisten früheren Versuchen, diesen Erfindungsprozess zu automatisieren, wurde dieselbe KI gezwungen, beide Aufgaben zu erledigen: eine Idee zu entwickeln und die Maschine zu bauen. Wenn die Maschine nicht funktionierte, konnte die KI nicht unterscheiden, ob die Idee schlecht war oder ob der Baumeister einfach einen Fehler gemacht hatte. Es war, als würde man den Architekten für ein undichtes Dach verantwortlich machen, obwohl das Bauunternehmen die falschen Ziegel verwendet hatte.

PACEvolve++ ist ein neues System, das dieses Problem löst, indem es die Rollen trennt und dem „Ideen-Generator" beibringt, während der Arbeit klüger zu werden. So funktioniert es, einfach erklärt:

1. Die Zwei-Teams-Strategie

Anstatt dass eine KI alles erledigt, setzt PACEvolve++ auf ein Zwei-Personen-Team:

  • Der Berater (Der Strategist): Dies ist eine kleinere, trainierbare KI. Ihre einzige Aufgabe ist es, die aktuell beste Maschine zu betrachten, neue Ideen zu brainstormen, abzuschätzen, welche davon neuartig sind, und die beste auszuwählen, die als Nächstes versucht werden soll. Sie lernt, was man versuchen sollte.
  • Das Frontier-Modell (Der Baumeister): Dies ist eine massive, leistungsstarke KI, die bereits sehr gut im Programmieren ist. Sie nimmt die vom Berater ausgewählte Idee und verwandelt sie in tatsächlichen, funktionierenden Code. Sie übernimmt die schwere Arbeit des Wie beim Bauen.

Durch diese Trennung kann das System den Berater darin schulen, besser in der Strategie zu werden, ohne sich darum kümmern zu müssen, ob der Code perfekt ist. Wenn der Code fehlschlägt, ist es ein Bauproblem, kein Strategieproblem.

2. Der „phasenadaptive" Coach

Die größte Herausforderung besteht darin, dass sich das „Spiel" ändert, je näher man der perfekten Lösung kommt. Die Arbeit argumentiert, dass man den Berater je nachdem, wie weit man in der Suche fortgeschritten ist, unterschiedlich coachen muss.

  • Phase 1: Die wilde Exploration (Frühes Spiel)

    • Die Situation: Sie fangen gerade an. Die Ideen sind völlig verstreut – einige sind verrückt, einige langweilig, einige brillant.
    • Das Coaching: Das System sagt dem Berater: „Schauen Sie sich die gesamte Gruppe von Ideen an. Welche sind im Allgemeinen besser als der Durchschnitt? Versuchen Sie, neue Richtungen zu finden!"
    • Die Analogie: Stellen Sie sich einen Scout vor, der nach einem neuen Lagerplatz sucht. Zu Beginn wirft er ein weites Netz und betrachtet viele verschiedene Täler und Hügel. Der Coach belohnt ihn dafür, irgendeinen vielversprechenden Bereich zu finden, auch wenn er noch nicht der absolut beste ist.
  • Phase 2: Die Feinabstimmung (Spätes Spiel)

    • Die Situation: Sie haben einen großartigen Ort gefunden, aber jetzt versuchen Sie nur noch, ein paar Zentimeter Höhe abzuschaben oder die Aussicht zu verbessern. Die Unterschiede zwischen den Ideen sind winzig.
    • Das Coaching: Das System ändert die Regeln. Es fragt nicht mehr: „Welche Idee ist besser als der Durchschnitt?", sondern beginnt zu fragen: „Hat diese spezifische Idee tatsächlich den Rekord für das ‚Möglichste Beste' vorangebracht?"
    • Die Analogie: Jetzt steht der Scout auf dem besten Hügel, den er gefunden hat. Der Coach interessiert sich nicht mehr für „gute" Hügel, sondern nur noch dafür, ob der Scout einen Ort findet, der streng besser ist als der aktuelle Champion. Wenn der neue Ort nur „okay" ist, erhält er keine Anerkennung. Dies verhindert, dass das System durch winzige, bedeutungslose Unterschiede verwirrt wird.

3. Warum das wichtig ist

In der Vergangenheit blieben KI-Systeme, die versuchten, Lösungen zu entwickeln, oft stecken oder stürzten ab, weil sie versuchten, dieselbe „Coaching"-Methode vom Anfang bis zum Ende anzuwenden.

  • Wenn Sie die Regeln des „frühen Spiels" zu spät anwenden, wird die KI durch winzige Unterschiede verwirrt und gerät außer Kontrolle (Instabilität).
  • Wenn Sie die Regeln des „späten Spiels" zu früh anwenden, gibt die KI die Exploration auf und wiederholt nur dieselben sicheren Ideen (Steckenbleiben).

PACEvolve++ wechselt automatisch seinen Coaching-Stil, während die Suche fortschreitet. Es beginnt mit der Förderung einer breiten Exploration und geht nahtlos dazu über, nur noch die winzigen Verbesserungen zu belohnen, die tatsächlich den Rekord brechen.

Die Ergebnisse

Die Autoren testeten dies an drei schwierigen realen Ingenieursaufgaben:

  1. Ausbalancieren von Computer-Workloads: Sicherstellen, dass verschiedene Computerchips Aufgaben gleichmäßig verteilen.
  2. Empfehlungssysteme: Verbessern, wie Apps dem Benutzer das nächste Video oder Produkt vorschlagen.
  3. Proteindesign: Vorhersagen, wie sich eine Änderung der Proteinstruktur auf seine Funktion auswirkt.

In allen drei Fällen fand PACEvolve++ schneller bessere Lösungen als frühere Methoden. Es fand nicht nur eine gute Antwort; es fand die beste Antwort schneller und ohne dass das System unterwegs abstürzte oder verwirrt wurde.

Kurz gesagt: PACEvolve++ ist ein intelligenterer Weg, einer KI beizubringen, wie man erfindet. Es teilt die Arbeit zwischen einem Strategen und einem Baumeister auf und ändert seinen Lehrstil von „geh und erkunde" zu „verfeinere die Details" genau dann, wenn die Situation es erfordert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →