← Neueste Arbeiten
💬 NLP

Evaluating Agentic Optimization on Large Codebases

Die Arbeit stellt FormulaCode vor, einen Benchmark mit 957 realen Performance-Engpässen aus wissenschaftlichen Python-Repositories, der zeigt, dass fortschrittliche LLM-Agenten nach wie vor Schwierigkeiten haben, große Codebasen unter realistischen, mehrdimensionalen Optimierungsbedingungen zu verbessern.

Ursprüngliche Autoren: Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

Veröffentlicht 2026-03-18
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

🏎️ Das große Rennen: KI-Agenten gegen echte Ingenieure

Stell dir vor, du hast einen riesigen, komplexen Rennwagen (das ist ein großer Software-Codebase, wie die von Google oder Facebook). Jetzt möchtest du diesen Wagen schneller machen.

Früher haben wir KI-Modelle (die „KI-Agenten") nur getestet, ob sie einzelne kleine Reparaturen an einem Schraubenschlüssel oder einer Feder erledigen können. Das ist wie zu prüfen, ob ein Mechaniker eine Schraube richtig festziehen kann.

Aber in der echten Welt geht es darum, den ganzen Wagen zu optimieren. Man muss wissen, wie der Motor mit dem Getriebe interagiert, wie das Gewicht verteilt ist und ob eine Änderung am Lenkrad die Bremsen beeinträchtigt.

Das Paper FORMULACODE stellt genau diese große Herausforderung: Können KI-Agenten ganze Software-Systeme so optimieren, dass sie schneller laufen, ohne dabei kaputtzugehen?


🛠️ Was ist FORMULACODE? (Der neue Prüfstand)

Bisher waren die Tests für KI-Programmierer oft wie ein Fahrrad-Parcours mit künstlichen Hindernissen. Die KI musste nur eine Aufgabe lösen und bekam ein einfaches „Ja/Nein" als Feedback.

FORMULACODE ist anders. Es ist wie ein echter Rennstrecken-Test:

  1. Echte Probleme: Die Aufgaben kommen nicht aus dem Nichts, sondern sind echte Leistungsprobleme, die in großen, echten Python-Projekten (wie Pandas, SciPy oder Scikit-learn) gefunden wurden.
  2. Viele Messpunkte: Statt nur zu fragen „Funktioniert es?", messen wir 264 verschiedene Dinge gleichzeitig. Wie schnell ist der Motor? Wie viel Kraftstoff (Arbeitsspeicher) verbraucht er? Läuft er auf glatter Straße (eine Aufgabe) schneller, aber auf Schotter (eine andere Aufgabe) langsamer?
  3. Der menschliche Vergleich: Für jede Aufgabe gibt es bereits eine Lösung von einem menschlichen Experten. Die KI muss also nicht nur „gut" sein, sie muss versuchen, den menschlichen Meister zu schlagen.

🧪 Wie funktioniert der Test?

Stell dir vor, die KI ist ein junger, sehr talentierter Mechaniker, der in eine Garage geschickt wird.

  • Die Aufgabe: „Mach den Wagen schneller, aber lass ihn sicher und funktionsfähig!"
  • Die Werkzeuge: Die KI darf den Code lesen, ändern, testen und neu starten.
  • Die Bewertung:
    • Wenn die KI den Code ändert und er nicht mehr startet (Bugs), ist das ein sofortiges „Game Over".
    • Wenn der Code läuft, messen wir die Zeit.
    • Das Wichtigste: Die KI muss alle Teile des Wagens im Blick behalten. Wenn sie den Motor so drehen, dass er auf der Geraden schneller ist, aber in den Kurven schlechter wird, hat sie verloren. Das nennt man Multi-Objective Optimization (Mehrziel-Optimierung).

📊 Was haben die Forscher herausgefunden?

Die Ergebnisse sind ehrlich und zeigen, wo wir heute stehen:

  1. Die KI ist gut, aber nicht besser als der Mensch: Die KI kann Code tatsächlich schneller machen, aber die menschlichen Experten sind immer noch die Champions. Die KI schafft es oft, kleine Verbesserungen zu finden, aber sie verpasst die großen, genialen Umstrukturierungen, die ein erfahrener Ingenieur sofort sieht.
  2. Lokal vs. Global: Die KI ist gut darin, eine einzelne Funktion zu optimieren (wie einen einzelnen Zylinder zu polieren). Aber wenn es darum geht, das gesamte System zu verstehen und große Änderungen vorzunehmen, wird sie unsicher. Sie verliert oft den Überblick über das große Ganze.
  3. Die Kostenfalle: Manchmal ist die KI so teuer im Betrieb (sie braucht viele Rechenressourcen), dass sie sich gar nicht lohnt, auch wenn sie ein bisschen schneller ist. Ein menschlicher Experte findet die Lösung oft mit weniger „Gedankenarbeit" (weniger Token/Rechenleistung).
  4. Beliebte Projekte sind hart: Bei sehr bekannten Projekten (wie Pandas) ist die KI oft schwächer. Warum? Weil diese Projekte so gut optimiert sind, dass es kaum noch einfache Verbesserungen gibt. Die KI stolpert über die letzten, sehr schwierigen Hürden.

🚀 Warum ist das wichtig?

Stell dir vor, du willst ein autonomes Auto bauen. Du kannst es nicht nur mit einem Test auf einer leeren Straße testen. Du musst es im echten Verkehr, bei Regen, mit anderen Autos und unvorhersehbaren Hindernissen testen.

FORMULACODE ist dieser echte Verkehrstest für KI-Programmierer.

  • Es zeigt uns, dass KI-Agenten noch nicht bereit sind, allein die komplexen Software-Systeme der Zukunft zu verwalten.
  • Es gibt uns eine klare Landkarte, wo die KI noch scheitert (z. B. bei großen Architektur-Entscheidungen).
  • Es hilft Entwicklern, bessere KI zu bauen, die nicht nur Code schreibt, sondern Systeme versteht.

💡 Fazit in einem Satz

FORMULACODE ist wie ein großer Renn-Workshop, der beweist, dass unsere KI-Mechaniker zwar gute Schrauber sind, aber noch lernen müssen, wie man den ganzen Rennwagen so abstimmt, dass er auf jeder Strecke gewinnt – und das ohne den menschlichen Meister zu kopieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →