Building an Internal Coding Agent at Zup: Lessons and Open Questions
Die Studie zeigt, dass für den erfolgreichen Einsatz eines internen Coding-Agents bei Zup nicht die reine Modellqualität, sondern entscheidende Ingenieursentscheidungen wie gezieltes Tool-Design, mehrschichtige Sicherheitsmechanismen und abgestufte menschliche Aufsicht den Unterschied zwischen Prototyp und produktionsreifer Lösung ausmachen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie stellen einen neuen, hochintelligenten Assistenten ein, der für Sie programmieren soll. Er kann Code schreiben, Dateien öffnen und Befehle auf Ihrem Computer ausführen. Klingt wie ein Traum? Genau das ist das Ziel von CodeGen, einem internen Programmier-Assistenten, den das brasilianische Unternehmen Zup entwickelt hat.
Aber hier ist das Problem: Einen Assistenten zu bauen, der auf dem Papier (in Tests) brillant aussieht, ist wie einen Rennwagen zu bauen, der auf der Rennstrecke schnell ist. Ihn aber sicher durch den dichten Stadtverkehr zu steuern, ohne dass er gegen Laternenpfähle fährt oder die Leute erschreckt, ist eine ganz andere Herausforderung.
Hier ist die Geschichte von CodeGen, erzählt mit ein paar einfachen Bildern:
1. Der große Unterschied: Der Prototyp vs. Der echte Job
Viele Firmen bauen KI-Programmierer, die in isolierten Tests super gut sind. Aber im echten Arbeitsalltag einer Firma ist es chaotisch. Da gibt es alte Code-Bibliotheken, komplexe Build-Systeme und vor allem: Menschen, die Angst haben, dass der Roboter ihren Job kaputt macht.
Wenn ein KI-Assistent eine ganze Datei neu schreibt, kann er versehentlich Teile löschen, die er nicht löschen sollte (wie ein Maler, der die ganze Wand neu streicht, statt nur den Fleck zu übermalen). Wenn er Zugriff auf die Kommandozeile hat, könnte er theoretisch den Befehl rm -rf (alles löschen) ausführen. Das sind keine theoretischen Risiken – sie sind passiert.
2. Die Architektur: Wie CodeGen funktioniert
Stellen Sie sich CodeGen als ein Team aus drei Personen vor, die zusammenarbeiten:
- Der CLI (Der Bote): Das ist das Terminal auf Ihrem Computer. Es ist wie ein universeller Schlüssel, der in jedes Schloss (jede Entwicklungsumgebung) passt. Statt für jedes Programm (VS Code, IntelliJ etc.) eine eigene App zu bauen, nutzen sie einfach das Terminal, das alle schon haben.
- Das Backend (Die Zentrale): Ein Server, der die Verbindung hält. Er ist wie die Telefonzentrale, die sicherstellt, dass Nachrichten schnell ankommen.
- Der Maestro (Der Dirigent): Das ist das Herzstück. Er hält das Orchester zusammen. Er gibt der KI die Anweisungen, hört zu, was die KI sagt, schickt Befehle an den Boten und wartet auf die Antwort.
Wichtige Entscheidung: Am Anfang wollten sie eine fertige Software-Bibliothek (wie LangChain) nutzen. Aber das war wie der Versuch, einen komplexen Tanz mit einem starren Tanzpartner zu tanzen, der nur geradeaus gehen kann. CodeGen braucht aber einen Partner, der hin und her tanzen kann (Befehl senden -> Ergebnis holen -> wieder Befehl senden). Also haben sie den "Maestro" selbst gebaut. Das war mehr Arbeit am Anfang, gab ihnen aber die volle Kontrolle. Später haben sich die fertigen Bibliotheken so entwickelt, dass sie genau das können, was sie selbst schon gebaut hatten – eine Bestätigung, dass sie den richtigen Weg gewählt hatten.
3. Die Werkzeuge: Wie man den Roboter zähmt
Das ist der wichtigste Teil der Geschichte. Die Autoren sagen: Es ist nicht die Intelligenz der KI, die den Unterschied macht, sondern wie man ihr die Werkzeuge in die Hand gibt.
- Der "Edit"-Trick: Wenn Sie einer KI sagen "Schreibe die ganze Datei neu", wird sie oft den Faden verlieren oder Teile weglassen. CodeGen sagt ihr stattdessen: "Suche genau diesen Satz und ersetze ihn durch diesen anderen." Das ist wie das Ersetzen eines einzelnen Ziegels in einer Mauer, statt die ganze Mauer neu zu bauen. Das verhindert Fehler.
- Die "Lese-zuerst"-Regel: Die KI darf nichts ändern, bevor sie nicht die aktuelle Datei gelesen hat. Sonst könnte sie versuchen, Code zu ändern, der gar nicht mehr existiert (wie ein Koch, der ein Rezept ändert, ohne zu schauen, was im Kühlschrank ist).
- Die "Scharnier"-Regel für Befehle: Der Befehls-Tool (Shell) ist das mächtigste und gefährlichste Werkzeug. Es kann alles tun. Deshalb haben sie mehrere Sicherheitsschichten eingebaut:
- Manche Befehle sind komplett verboten.
- Manche erfordern, dass ein Mensch auf "OK" klickt, bevor sie ausgeführt werden.
- Alles wird protokolliert (wie ein Flugschreiber im Flugzeug).
4. Vertrauen aufbauen: Der "Schritt-für-Schritt"-Ansatz
Wie bringt man Menschen dazu, einer KI zu vertrauen? Nicht, indem man sie zwingt, sondern indem man sie langsam gewöhnt.
- Der "Genehmigungs-Modus": Am Anfang muss der Mensch jeder Änderung zustimmen. Die KI schlägt vor, der Mensch klickt auf "Ja". Das ist wie ein Fahrschüler, der noch einen Beifahrer mit dem Bremspedal hat.
- Der "Autonome-Modus": Wenn der Mensch merkt, dass die KI zuverlässig ist, kann er den Modus wechseln. Die KI darf dann selbstständig arbeiten.
- Der "Planungs-Modus": Bei schwierigen Aufgaben fragt die KI erst: "Hier ist mein Plan, was ich tun werde. Ist das okay?" Erst wenn der Mensch zustimmt, wird es ausgeführt.
Das ist wie beim Aufziehen eines neuen Haustiers: Man fängt mit kleinen Aufgaben an, bevor man ihm die Freiheit gibt, allein durch die Stadt zu laufen.
5. Die wichtigsten Lehren (in einem Satz)
Es reicht nicht, die klügste KI zu kaufen. Der Erfolg hängt davon ab, wie man die KI einschränkt, wie man ihr Werkzeuge gibt und wie man den Menschen in den Prozess einbindet.
6. Offene Fragen (Was wir noch nicht wissen)
Trotz des Erfolgs gibt es noch Rätsel:
- Wie schreibt man die "Anleitung" für Werkzeuge so, dass die KI sie immer perfekt versteht?
- Wo genau ist die Grenze zwischen dem, was die KI denkt, und dem, was der Computer kontrolliert?
- Wie verhindert man, dass die KI einen Weg findet, Sicherheitsregeln zu umgehen, wenn sie verschiedene Werkzeuge kombiniert?
- Wie merkt sich die KI Dinge über lange Zeit, ohne sich zu verirren?
Fazit
CodeGen ist ein Beweis dafür, dass der Weg von einem "coolen Demo" zu einem "echten Werkzeug" nicht nur von der KI selbst abhängt, sondern von der Ingenieurskunst dahinter. Es ist wie der Unterschied zwischen einem Sportwagen, der auf einer Teststrecke fährt, und einem Taxi, das sicher durch den Berufsverkehr navigiert. Der Schlüssel liegt nicht im Motor (der KI-Modell), sondern im Lenkrad, den Bremsen und dem Fahrer, der weiß, wann er eingreifen muss.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.