← Neueste Arbeiten
💻 computer science

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

Dieses Paper stellt DeNovoSWE vor, einen groß angelegten, automatisch kuratierten Datensatz aus 4.818 Repository-weiten Generierungsinstanzen, der darauf ausgelegt ist, LLM-Agenten für langfristige Software-Engineering-Aufgaben zu trainieren, was die Leistung auf dem BeyondSWE-Doc2Repo-Benchmark signifikant von 5,8 % auf 47,2 % steigert.

Ursprüngliche Autoren: Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

Veröffentlicht 2026-06-17
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten einen Meisterarchitekten, der unglaublich talentiert darin ist, einen einzelnen kaputten Ziegel in einer Mauer zu reparieren. Er kann einen spezifischen Riss analysieren, herausfinden, warum er entstanden ist, und ihn perfekt ausbessern. Das ist das, was aktuelle KI-Coding-Assistenten gut können: kleine Fehler in bestehender Software zu beheben.

Aber was wäre, wenn Sie denselben Architekten bitten würden, einen ganzen Wolkenkratzer von Grund auf zu bauen, basierend auf einer vagen Skizze auf einer Serviette? Das ist eine viel schwierigere Aufgabe. Es erfordert die Planung des Fundaments, das Design der Aufzüge, die Verkabelung der Elektrizität und die Sicherstellung, dass jedes Zimmer logisch miteinander verbunden ist. Bis jetzt hatte die KI mit dieser „Gesamtgebäude“-Aufgabe zu kämpfen, weil sie nicht genug Übung darin hatte.

Das Problem: Ein Mangel an Bauplänen
Der Hauptgrund, warum KI Schwierigkeiten hat, ganze Software-„Wolkenkratzer“ (Repositories) von Grund auf zu bauen, ist ein Mangel an Trainingsdaten. Die meisten existierenden Trainingsdaten sind wie eine Liste von „Repariere diesen undichten Wasserhahn“ oder „Repariere dieses kaputte Fenster“. Es gibt nur sehr wenige Daten, die einer KI beibringen, wie man aus einer High-Level-Beschreibung (wie einem Benutzerhandbuch) ein vollständig funktionsfähiges, komplexes Gebäude von Grund auf erstellt.

Die Lösung: DeNovoSWE
Das Paper stellt DeNovoSWE vor, einen massiven neuen Trainingsdatensatz, der speziell darauf ausgelegt ist, der KI beizubringen, ganze Softwareprojekte von Grund auf zu bauen. Betrachten Sie dies als eine riesige Bibliothek von 4.818 „Baustellen-Herausforderungen“. In jeder Herausforderung erhält die KI eine detaillierte Menge an Anweisungen (Dokumentation) und muss das gesamte Softwaresystem passend zu diesen Anweisungen bauen.

Wie sie die Trainingsdaten erstellt haben (Die „Teile-und-Herrsche“-Strategie)
Das Erstellen eines Datensatzes dafür ist schwierig, denn man kann eine KI nicht einfach bitten, „ein Handbuch für eine komplexe App zu schreiben“, und hoffen, dass es perfekt ist. Die Autoren nutzten ein cleveres, automatisiertes Team von KI-Agenten, um die schwere Arbeit zu erledigen:

  1. Die „Teilen“-Phase: Stellen Sie sich vor, Sie versuchen, ein Handbuch für eine riesige Stadt zu schreiben. Das ist zu groß, um es auf einmal zu erledigen. Also zerlegt die KI die Stadt zuerst in Stadtteile (Capabilities). Sie identifiziert, was jeder Stadtteil macht und welche Gebäude (Code-Dateien) dazu gehören.
  2. Die „Herrschen“-Phase: Nun schreiben spezialisierte KI-Agenten das Handbuch für nur einen Stadtteil nach dem anderen.
    • Der Entwurfs-Agent (Draft Agent): Schreibt die erste Version des Handbuchs.
    • Der Kritiker-Agent (Critic Agent): Agiert wie ein strenger Editor. Er prüft das Handbuch: „Hast du vergessen zu erklären, wie die Ampeln funktionieren? Ist der Schaltplan klar?“
    • Der Reparatur-Agent (Repair Agent): Behebt die Fehler, die der Kritiker gefunden hat.
    • Dieser Zyklus wiederholt sich, bis das Handbuch perfekt ist.
  3. Der „Goldene“ Test: Sobald das Handbuch geschrieben ist, erstellt das System eine „Reinraum-Umgebung“ (Sandbox). Es nimmt den ursprünglichen Code, wirft ihn weg und lässt nur das Handbuch zurück. Dann bittet es einen anderen KI-Agenten, die Software unter Verwendung nur dieses Handbuchs wieder aufzubauen. Wenn die neue Software alle Tests besteht, gilt das Handbuch als qualitativ hochwertig und wird in den Datensatz aufgenommen.

Die KI ehrlich halten (Anti-Schummeln)
Ein großes Bedenken ist, dass die KI „schummeln“ könnte, indem sie einen Blick auf den ursprünglichen Code wirft, den sie eigentlich nachbauen sollte. Die Autoren bauten ein strenges Sicherheitssystem, um dies zu verhindern:

  • Sie entfernen alle Verläufe, Caches und versteckten Dateien.
  • Sie blockieren die KI daran, online zu gehen, um den ursprünglichen Code herunterzuladen.
  • Sie stellen sicher, dass die KI wirklich „Closed-Book“ arbeitet, also gezwungen ist, sich ausschließlich auf die Dokumentation zu verlassen, die sie erhalten hat.

Der „Schwierigkeitsgrad-Filter“
Nicht jedes Bauprojekt ist gleich. Einige sind kleine Schuppen; andere sind Wolkenkratzer. Wenn man nur die Trainingsbeispiele behält, bei denen die KI beim ersten Versuch einen perfekten Wolkenkratzer gebaut hat, verliert man alle wertvollen Lektionen aus den schwierigen Projekten, bei denen die KI fast erfolgreich war, aber ein paar Fehler gemacht hat.

Die Autoren entwickelten einen intelligenten Filter, der prüft, wie schwer ein Projekt ist.

  • Für einfache Projekte (einen kleinen Schuppen) verlangen sie eine perfekte Punktzahl.
  • Für schwere Projekte (einen Wolkenkratzer) akzeptieren sie eine etwas niedrigere Punktzahl (z. B. 80 % Erfolg), da das Erreichen eines perfekten Wolkenkratzers unglaublich schwierig ist.
    Dies stellt sicher, dass die KI sowohl von einfachen Siegen als auch von den „Fast-geschafft“-Momenten bei schwierigen Aufgaben lernt.

Die Ergebnisse
Als sie ein KI-Modell mit diesem neuen Datensatz trainierten, waren die Ergebnisse dramatisch.

  • Vor dem Training konnte die KI nur etwa 5,8 % der erforderlichen Software korrekt bauen.
  • Nach dem Training mit DeNovoSWE stieg die Erfolgsquote auf 47,2 %.

Dies beweist, dass wir, indem wir der KI die richtige Art von „Bau-Übung“ geben – das Zerlegen großer Probleme, die Nutzung strenger Editoren und das Lernen aus teilweisen Erfolgen –, beibringen können, sich vom einfachen „Ziegel-Fixer“ zu einem wahren „Software-Architekten“ zu entwickeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →