← Neueste Arbeiten
💻 computer science

An Empirical Investigation of Multi-Trial Consistency, Trajectory Pathologies, and Reliability Rankings in Software Engineering Agents

Dieses Paper schlägt ein umfassendes Multi-Trial-Evaluierungsframework vor, um die Konsistenz, Zuverlässigkeit und Trajektorienpathologien autonomer Software-Engineering-Agenten zu bewerten, wobei dessen operative Machbarkeit durch eine Pilotstudie demonstriert wird, die signifikante Infrastruktur-Zensurraten aufdeckt und eine Grundlage für das Überwinden von Single-Trial-Erfolgsmetriken schafft.

Ursprüngliche Autoren: Muhammad Tayyab

Veröffentlicht 2026-09-22
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Muhammad Tayyab

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen Welt der Softwareentwicklung werden riesige Bibliotheken von Code von Teams von Ingenieuren gepflegt, die sich auf automatisierte Werkzeuge verlassen, um Fehler zu finden und zu beheben. Kürzlich ist eine neue Generation künstlicher Intelligenz entstanden, die in der Lage ist, als autonome Assistenten zu agieren, die diese Codebasen lesen, Probleme verstehen und versuchen können, die notwendigen Korrekturen eigenständig zu schreiben. Diese Systeme, die oft auf großen Sprachmodellen basieren, haben gezeigt, dass sie komplexe Codierungsaufgaben in kontrollierten Tests lösen können. Eine kritische Frage bleibt jedoch unbeantwortet: Können diesen digitalen Mitarbeitern vertraut werden, um dieselbe Aufgabe jedes Mal zuverlässig zu erledigen? In der realen Welt, in der Software-Updates automatisch bereitgestellt werden, schafft ein Assistent, der einmal erfolgreich ist, beim nächsten Mal jedoch scheitert, wenn er zur exakt gleichen Sache aufgefordert wird, Chaos. Er führt Unvorhersehbarkeit ein und zwingt menschliche Entwickler dazu, die Arbeit ständig zu überprüfen, was den Zweck der Automatisierung zunichtemacht. Die Kernherausforderung besteht nicht nur darin, ob eine KI ein Problem lösen kann, sondern ob sie es konsistent lösen kann, ohne verwirrt zu werden, zufällige Fehler zu machen oder ihre Herangehensweise so zu ändern, dass das System beschädigt wird.

Ein Forscher an der University of Engineering and Technology in Lahore, Pakistan, hat einen neuen Weg vorgeschlagen, um diese Zuverlässigkeit zu messen, der über den derzeitigen Standard hinausgeht, lediglich zu zählen, wie oft eine KI im ersten Versuch erfolgreich ist. Die aktuelle Methode, bekannt als „Single-Trial Pass Rate“ (Erfolgsquote eines Einzelversuchs), behandelt eine KI wie einen Schüler bei einer einmaligen Prüfung: Wenn die Antwort korrekt ist, besteht der Schüler, ungeachtet dessen, ob er sie noch einmal hätte lösen können. Diese neue Studie argumentiert, dass dieser Ansatz für das Software-Engineering unzureichend ist. Stattdessen entwarf der Forscher ein strenges Protokoll, um diese Agenten mehrfach am selben Problem zu testen, um nach Konsistenz zu suchen. Das Ziel war es zu sehen, ob die KI in der Lage ist, ein Code-Repository zu navigieren, einen Fehler zu finden und ihn jedes Mal auf exakt dieselbe Weise zu beheben, wenn sie dazu aufgefordert wird, oder ob ihre Leistung unter wiederholter Prüfung zusammenbrechen würde.

Um dies zu testen, setzte der Forscher ein groß angelegtes Experiment mit einem spezifischen Satz realer Codierungsaufgaben auf, die aus populären Open-Source-Projekten stammen. Die Studie plante, diese Aufgaben über ein Raster verschiedener KI-Modelle und verschiedener Software-Frameworks laufen zu lassen, wobei jede Aufgabe fünfmal wiederholt wurde, um ein vollständiges Bild der Leistung zu erhalten. Vor dem eigentlichen Experiment führte der Forscher eine kleinere „Machbarkeits-Pilotstudie“ durch, um sicherzustellen, dass die Testmechanik korrekt funktioniert. Diese Pilotstudie beinhaltete die Planung von 360 Versuchen über 30 verschiedene Codierungsprobleme unter Verwendung von zwei spezifischen KI-Modellen und zwei verschiedenen Software-Scaffolding-Systemen. Allerdings wurden nur 312 dieser Versuche erfolgreich abgeschlossen und analysiert, während 48 durch externe Faktoren unterbrochen wurden. Die Forscher verfolgten jeden Schritt, den die KI unternahm, akribisch und zeichneten nicht nur auf, ob sie Erfolg hatte oder scheiterte, sondern auch, wie oft sie ihre Meinung änderte, wie oft sie Fehler bei der Nutzung von Computerwerkzeugen machte und wie oft die Testinfrastruktur selbst zusammenbrach.

Die Pilotstudie ergab, dass die Testumgebung selbst fragil ist. Von den 3emann geplanten 360 Versuchen wurden 48 durch externe Faktoren unterbrochen, wie etwa das Zeitablaufen des Cloud-Service-Providers oder das unerwartete Zurücksetzen des Computer-Containers. Dies führte zu einer Abbruchrate von 13,3 Prozent, ein Befund, der die Schwierigkeit unterstreicht, diese komplexen Tests zuverlässig durchzuführen. Noch wichtiger war jedoch, dass die Pilotstudie zeigte, dass das aktuelle Testbudget zu kurz war, um erfolgreiche Reparaturen zu produzieren. Da die KI auf nur fünf Gesprächs- oder Aktionsschritte pro Versuch begrenzt war, führte keiner der 312 abgeschlossenen Episoden zu einer erfolgreichen Reparatur. Die Agenten verbrachten ihre gesamte begrenzte Zeit einfach damit, durch den Code zu navigieren und das Problem zu verstehen, ohne jemals die Phase zu erreichen, in der sie eine Lösung anwenden könnten.

Trotz des Mangels an erfolgreichen Reparaturen in dieser kurzen Pilotphase demonstrierte die Studie erfolgreich, dass es möglich ist, detaillierte Daten darüber zu sammeln, wie sich diese Agenten verhalten. Die Forscher identifizierten spezifische Arten von Fehlern, die auftreten, wenn die KI versucht, mit dem Computersystem zu interagieren, wie etwa das Generieren von Befehlen, die der Computer nicht verstehen kann, oder der Versuch, auf Dateien zuzugreifen, die nicht existieren. Sie entwickelten auch neue Wege, um „Code Churn“ (Code-Fluktuation) zu messen, welcher verfolgt, wie sehr die KI ihre eigene Arbeit verändert, bevor sie sich auf eine endgültige Antwort festlegt. Ein hoher Grad an Churn deutet darauf hin, dass der Agent unentschlossen oder instabil ist und ständig seinen eigenen Code umschreibt, ohne einen klaren Plan zu haben. Die Studie führte zudem eine Metrik für „Tool Failure“ (Werkzeugfehler) ein, die zwischen Fehlern durch mangelhafte Argumentation der KI und Fehlern durch Abstürze des Computersystems unterscheidet.

Das Paper kommt zu dem Schluss, dass die aktuelle Methode der Evaluierung dieser KI-Agenten unvollständig ist. Indem man sich nur auf Einzelversuche konzentriert, übersieht die Industrie die „Flakiness“ (Unzuverlässigkeit), die diese Werkzeuge für den realen Einsatz unbrauchbar macht. Der Forscher argumentet, dass ein wirklich zuverlässiger Agent in der Lage sein muss, ein Problem konsistent über mehrere Durchläufe hinweg zu lösen, und nicht nur einmal durch Glück zu bestehen. Die Pilotstudie bewies, dass die notwendigen Werkzeuge zur Messung dieser Konsistenz existieren und dass die Infrastruktur die Datenerfassung bewältigen kann, auch wenn die aktuellen KI-Modelle noch nicht bereit sind, den vollen Test zu bestehen. Die Ergebnisse legen nahe, dass zukünftige Evaluierungen über einfache Pass/Fail-Scores hinausgehen müssen und detaillierte Protokolle über die Reise der KI enthalten müssen, die messen, wie oft sie stolpert, wie oft sie zögert und wie oft sie eine Aufgabe aufgrund externer Unterbrechungen nicht abschließen kann.

Das ultimative Ziel dieser Arbeit ist es, einen neuen Standard für Vertrauen in die automatisierte Softwaretechnik zu etablieren. Genau wie ein menschlicher Mitarbeiter wegen Inkonsistenz und Unzuverlässigkeit entlassen würde, muss auch ein KI-Assistent beweisen, dass er seine Aufgaben mit derselben Stabilität ausführen kann. Diese Studie behauptet nicht, dass aktuelle KI-Modelle das Problem der automatisierten Reparatur gelöst haben; tatsächlich zeigten die Pilotdaten null erfolgreiche Reparaturen unter strengen Bedingungen. Stattdessen liefert sie den Bauplan dafür, wie man diese Systeme in Zukunft richtig testet. Durch die Definition neuer Metriken für Konsistenz und das Verfolgen der spezifischen Pathologien, die zum Scheitern führen, hat der Forscher den Grundstein für eine ehrlichere und strengere Bewertung der künstlichen Intelligenz in der Softwareentwicklung gelegt. Der Weg nach vorne besteht darin, das voll angelegte Experiment mit längeren Zeitlimits und leistungsfähigeren Modellen durchzuführen, um zu sehen, ob sich die Konsistenz verbessert oder ob die Agenten lediglich in ihren Fehlern raffinierter werden. Bis dahin muss die Industrie erkennen, dass eine einzige erfolgreiche Reparatur nicht ausreicht, um Sicherheit oder Zuverlässigkeit in der komplexen Welt der Softwarewartung zu garantieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →