← Neueste Arbeiten
🤖 AI

What Do Evolutionary Coding Agents Evolve?

Dieser Beitrag stellt EvoTrace, einen Datensatz evolutionärer Codierungsspuren, und EvoReplay, eine auf Replay basierende Methodik, vor, um zu zeigen, dass Leistungssteigerungen bei evolutionären Codierungsagenten häufig auf diverse Mechanismen wie das Nachjustieren oder Wiederverwenden bestehenden Wissens zurückzuführen sind und nicht auf echte algorithmische Innovation, was durch häufige deterministische Zyklen von Codezeilen belegt wird.

Ursprüngliche Autoren: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

Veröffentlicht 2026-05-20
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Team von KI-Programmierern vor, das versucht, ein komplexes Rätsel zu lösen, wie etwa die Entwicklung einer neuen Methode, um Kreise in eine Box zu packen, oder das Schreiben einer schnelleren Videospiel-Engine. Anstatt dass eine Person allein arbeitet, nutzen sie ein System namens Evolutionäres Codieren.

So funktioniert es: Die KI generiert einen Code-Abschnitt, testet ihn und prüft, wie gut er abschneidet. Anschließend nimmt sie kleine Änderungen (Mutationen) an diesem Code vor, testet die neue Version und behält diejenigen, die besser abschneiden. Dies wiederholt sie tausende Male und „entwickelt" den Code im Laufe der Zeit weiter, ganz ähnlich wie die Natur Tiere entwickelt.

Lange Zeit ging man davon aus, dass diese KI-Agenten brillante, brandneue Denkweisen entdecken, um Probleme zu lösen. Doch dieser Artikel stellt eine einfache, skeptische Frage: „Was entwickeln sie eigentlich?"

Um dies zu beantworten, bauten die Forscher einen massiven „Black-Box-Aufzeichner" namens EvoTrace. Stellen Sie sich dies wie einen Flugdatenschreiber für diese KI-Experimente vor. Er zeichnet nicht nur die Endpunktzahl auf, sondern jeden einzelnen Schritt, jede hinzugefügte oder gelöschte Codezeile, jeden Prompt, den die KI sah, und jeden Fehler, den sie machte. Zudem entwickelten sie ein Werkzeug namens EvoReplay, das es ihnen ermöglicht, das Experiment zu pausieren, zurückzuspulen und zu fragen: „Was wäre, wenn wir diese eine Sache ändern würden?"

Hier sind die vier Hauptentdeckungen, erläutert mit alltäglichen Analogien:

1. Der „Feinjustierer" versus der „Architekt"

Wenn die KI eine bessere Punktzahl erzielt, was hat sich dann tatsächlich geändert?

  • Die Realität: In den meisten Fällen erfindet die KI keine neue Strategie. Sie justiert lediglich die Knöpfe.
  • Die Analogie: Stellen Sie sich ein Radio vor. Die KI verbringt 90 % ihrer Zeit damit, die Lautstärke hoch- und runterzudrehen oder den Abstimmknopf leicht zu verstellen (eine Zahl von 1,85 auf 1,90 ändern). Sie entscheidet selten, ein völlig neues Radio von Grund auf zu bauen.
  • Die Erkenntnis: Die Änderungen, die tatsächlich zu großen Sprüngen in der Punktzahl führen (wie das Hinzufügen einer neuen Bibliothek oder das vollständige Umschreiben eines Codeabschnitts), sind selten. Die KI verbringt den Großteil ihrer Energie mit winzigen, langweiligen Anpassungen.

2. Der „vergessliche Gärtner" (Zyklisches Verhalten)

Dies war die überraschendste Entdeckung.

  • Die Realität: Die KI löscht Codezeilen, fügt sie jedoch einige Schritte später wieder hinzu.
  • Die Analogie: Stellen Sie sich einen Gärtner vor, der ein Unkraut ausreißt, wegwandert und dann fünf Minuten später zurückkehrt, um genau dasselbe Unkraut an genau derselben Stelle wieder zu pflanzen. Er tut dies immer und immer wieder.
  • Die Erkenntnis: Etwa 30 % des neuen Codes, den die KI hinzufügt, ist tatsächlich Code, den sie zuvor gelöscht hatte. Es ist, als hätte die KI ein kurzes Gedächtnis, vergisst, was sie gerade verworfen hat, und verschwendet Zeit damit, dieselben Ideen erneut zu „entwickeln". Dies geschieht bei fast jedem Lauf, unabhängig davon, welches KI-Modell verwendet wird.

3. Der „Geist in der Maschine" (Reproduzierbarkeit)

Wenn Sie die KI bitten, das Problem erneut mit exakt denselben Anweisungen zu lösen, wird sie dann dasselbe Ergebnis erzielen?

  • Die Realität: Nein.
  • Die Analogie: Stellen Sie sich einen Koch vor, der eine perfekte Suppe zubereitet. Wenn Sie ihn bitten, sie erneut mit exakt demselben Rezept und denselben Zutaten zuzubereiten, wird er eine andere Suppe machen. Sie wird nicht gleich aussehen, und die Zutaten könnten in einer anderen Reihenfolge sein.
  • Die Erkenntnis: Obwohl der Code anders aussieht, schmeckt die Suppe gleich. Die KI kann die hohe Punktzahl mit einem völlig anderen Codeabschnitt reproduzieren. Dies bedeutet, dass die „Punktzahl" real ist, aber die spezifische Lösung nur ein glücklicher Griff aus einem Hut ist, kein einzigartiges Meisterwerk.

4. Der „einfache Feinjustierer" (Die Lücke beim Abstimmen)

Wie viel des Erfolgs der KI beruht tatsächlich nur darauf, die richtigen Zahlen zu finden, anstatt einen neuen Algorithmus zu entdecken?

  • Die Realität: Ein großer Teil der Verbesserung resultiert aus einfacher mathematischer Feinabstimmung.
  • Die Analogie: Stellen Sie sich ein Autorennen vor. Die KI verbringt Wochen damit, einen aufwendigen neuen Motor zu bauen (die Struktur). Doch die Forscher stellten fest, dass sie fast dieselbe Geschwindigkeit erzielen könnten, wenn sie einen mittelmäßigen Motor nahmen und ein paar Stunden damit verbrachten, das Kraftstoffgemisch und den Reifendruck anzupassen (die Hyperparameter).
  • Die Erkenntnis: Bei vielen mathematischen Aufgaben kann ein einfaches Computerprogramm, das lediglich die Zahlen einer „mittleren" Lösung justiert, die Endpunktzahl der komplexen evolutionären Suche erreichen oder sogar übertreffen. Die KI hat nicht unbedingt einen neuen Weg zur Problemlösung entdeckt; sie hat lediglich die perfekten Einstellungen für einen alten Weg gefunden.

Das große Ganze

Der Artikel kommt zu dem Schluss, dass wir, wenn wir sehen, wie diese KI-Agenten bessere Punktzahlen erzielen, nicht automatisch davon ausgehen sollten, dass sie „neue Wissenschaft entdecken".

Oft tun sie lediglich Folgendes:

  1. Zahlen justieren (Hyperparameter-Optimierung).
  2. Denselben Code vergessen und sich wieder erinnern (Zyklisches Verhalten).
  3. Überanpassung an den Test (Auswendiglernen der Testantworten statt Lernen der Lektion).

Die Autoren argumentieren, dass wir, um wirklich zu verstehen, ob diese Agenten intelligent sind, die Reise (die Spur) betrachten müssen, nicht nur das Ziel (die Endpunktzahl). Wir müssen wissen, ob sie ein neues Haus bauen oder nur die Möbel im alten Haus neu anordnen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →