← Neueste Arbeiten
🤖 machine learning

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

Dieses Paper führt „Probe-and-Refine Tuning“ ein, eine Methode, die Repository-Leitdateien (AGENTS.md) iterativ mithilfe von synthetischen Bugfix-Proben optimiert, um die Leistung von Coding-Agenten auf SWE-bench Verified signifikant zu verbessern, indem die Abdeckung evaluierbarer Patches erweitert wird, anstatt die Präzision pro Patch zu erhöhen.

Ursprüngliche Autoren: Asa Shepard, Jeannie Albrecht

Veröffentlicht 2026-06-19
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Asa Shepard, Jeannie Albrecht

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie stellen einen brillanten, aber unerfahrenen Lehrling ein, um eine riesige, alte Bibliothek (das Code-Repository) zu reparieren. Der Lehrling ist klug genug, um Bücher zu lesen und kaputte Seiten zu flicken, aber er kennt die geheimen Regeln der Bibliothek nicht: welches Regal die seltenen Karten enthält, wie man den Bibliothekar um Hilfe bittet, ohne die schlafenden Katzen zu wecken, oder welche Leitern sicher zu erklimmen sind.

Ohne dieses „lokale Wissen“ wandert der Lehrling ziellos umher, klettert auf die falsche Leiter oder versucht, ein Buch in einem falschen Bereich zu reparieren, wobei er oft Dinge beschädigt.

Dieses Paper stellt eine Methode namens „Probe-and-Refine Tuning“ vor, um dieses Problem zu lösen. So funktioniert es, unter Verwendung einfacher Analogien:

Das Problem: Das „Einheits-Handbuch“

Ingenieure schreiben oft ein „Spickzettel“ (wie eine AGENTS.md-Datei) für ihre KI-Coding-Agenten.

  • Der alte Weg (Statisches Wissen): Sie bitten eine kluge KI, ein generisches Handbuch zu schreiben: „Prüfe immer den Index, bevor du etwas reparierst“ oder „Suche nach dem Haupteinstiegspunkt“. Das ist, als würde man dem Lehrling eine Karte von jeder Bibliothek der Welt geben. Es ist hilfreich, aber es sagt ihm nicht, wo sich der spezifische Geheimvorrat dieser einen Bibliothek versteckt.
  • Das Ergebnis: Der Lehrling macht zwar okay, verliert sich aber trotzdem oft.

Die Lösung: Der „Versuch-und-Irrtum“-Coach

Die Autoren entwickelten einen neuen Prozess namens Probe-and-Refine. Anstatt ein Handbuch einfach nur einmal zu schreiben, behandeln sie das Handbuch wie ein lebendiges Dokument, das durch Fehler lernt.

Man kann sich das wie einen Coach vorstellen, der einen neuen Spieler trainiert:

  1. Die Probes (Die Übungen): Der Coach erstellt 10 künstliche, fiktive Probleme (Probes), die spezifisch für diese Bibliothek sind.
  2. Der Versuch: Der Lehrling versucht, diese fiktiven Probleme mithilfe des aktuellen Handbuchs zu lösen.
  3. Die Diagnose: Der Coach beobachtet den Versuch. „Oh, du hast versucht, die Rohrleitungen in der Küche zu reparieren, aber die Rohre sind eigentlich im Keller. Und du hast vergessen, zuerst die Baupläne zu prüfen.“
  4. Die Verfeinerung: Der Coach aktualisiert das Handbuch sofort mit einer spezifischen Regel: „Für diese Bibliothek liegen die Rohrleitungen im Keller, und prüfe immer zuerst die Baupläne.“
  5. Wiederholung: Dies wird 3 bis 5 Mal durchgeführt. Das Handbuch entwickelt sich von einem generischen Leitfaden zu einem hyper-spezifischen „Insider“-Leitfaden.

Entscheidend ist: Dieser gesamte Trainingsprozess findet statt, ohne dass der Agent tatsächlich echte Bugs behebt. Es ist eine Simulationsschleife, in der die KI das Handbuch schreibt, es an fiktiven Problemen testet und das Handbuch basierend auf den Ergebnissen korrigiert.

Was sie herausfanden

Die Forscher testeten dies auf einem berühmten Coding-Benchmark (SWE-bench) in vier verschiedenen Durchläufen. Das passierte:

  • Kein Leitfaden: Der Lehrling löste 25,5 % der Probleme.
  • Generischer Leitfaden: Der Lehrling löste 28,3 % der Probleme.
  • Probe-and-Refine Leitfaden: Der Lehrling löste 33,0 % der Probleme.

Das große Geheimnis: Es geht darum, die richtige Tür zu finden, nicht darum, besser zu reparieren
Man könnte denken, das verbesserte Handbuch habe den Lehrling schlauer gemacht oder besser darin, Dinge zu reparieren. Das tat es nicht.

  • Wenn der Lehrling tatsächlich etwas repariert hat, war die Qualität der Reparatur mit beiden Handbüchern exakt gleich (etwa 5 9 % Erfolgsquote).
  • Die wahre Magie war die „Abdeckung“ (Coverage). Das verbesserte Handbuch half dem Lehrling, viel häufiger die richtige Datei zu finden, die zu reparieren war.
    • Analogie: Das generische Handbuch ließ den Lehrling an 100 Türen klopfen, aber nur 40 davon waren die richtigen. Das verfeinerte Handbuch ließ ihn an 100 Türen klopfen, und 56 davon waren die richtigen. Sobald er die richtige Tür gefunden hatte, war seine Fähigkeit, das Schloss zu reparieren, dieselbe.

Die „Schritt-Budget“-Falle

Das Paper entdeckte auch, dass der Leitfaden nur funktioniert, wenn man dem Lehrling genug Zeit gibt.

  • Wenn man dem Lehrling nur 25 Schritte gibt, um ein Problem zu lösen, hilft das schicke Handbuch nicht. Er hat keine Zeit, die komplexen Anweisungen zu befolgen.
  • Wenn man ihm 200 Schritte gibt, glänzt das schicke Handbuch. Es gibt ihm einen Workflow vor (Reproduzieren -> Verfolgen -> Reparieren), der Zeit benötigt, aber funktioniert. Oh ohne das Handbuch hetzt er einfach nur und scheitert.
  • Analogie: Wenn man jemandem sagt: „Nimm die malerische Route, um den Verkehr zu umgehen“, aber man gibt ihm nur 5 Minuten Zeit, um zur Arbeit zu kommen, wird er einfach nur die Orientierung verlieren. Man muss ihm genug Zeit geben, um die malerische Route tatsächlich nehmen zu können.

Die Warnung vor dem „Modell-Mismatch“

Die überraschendste Erkenntnis war, dass dieser Leitfaden nicht universell ist.

  • Sie versuchten, den Leitfaden, der mit einem bestimmten KI-Modell (Qwen) trainiert wurde, mit einem anderen, etwas schwächeren KI-Modell (Nemotron) zu verwenden.
  • Ergebnis: Das zweite Modell stürzte ab. Es war durch die spezifischen Anweisungen so verwirrt, dass es komplett aufhörte zu funktionieren.
  • Analogie: Es ist, als würde man einem Fahrer in einem langsamen, alten Sedan ein detailliertes High-Speed-Rennhandbuch geben. Die Anweisungen sind zu komplex für das Auto, und der Fahrer erstarrt. Der Leitfaden muss spezifisch auf das „Gehirn“ (das Modell) abgestimmt sein, das ihn lesen wird.

Zusammenfassung

Dieses Paper beweist, dass es mehr darauf ankommt, wie man die Anweisungen schreibt, als nur darauf, überhaupt Anweisungen zu haben.
Indem man eine einfache Schleife aus „erstelle ein fiktives Problem, versuche es zu lösen und korrigiere die Anweisungen basierend auf dem Scheitern“ nutzt, kann man einen generischen Leitfaden in ein spezialisiertes Expertenhandbuch verwandeln. Dies macht die KI nicht schlauer beim Reparieren von Code; es verhindert lediglich, dass sie an der falschen Stelle sucht, und ermöglicht es ihr so, ihr volles Potenzial zur Lösung von Problemen auszuschöpfen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →