← Neueste Arbeiten
💻 computer science

Engineering Pitfalls in AI Coding Tools: An Empirical Study of Bugs in Claude Code, Codex, and Gemini CLI

Diese Studie analysiert empirisch über 3.800 öffentlich gemeldete Fehler in KI-Coding-Tools wie Claude Code, Codex und Gemini CLI, um systematische Engineering-Herausforderungen zu identifizieren und einen Fahrplan für die Entwicklung robusterer KI-Assistenten zu erstellen.

Ursprüngliche Autoren: Ruixin Zhang, Wuyang Dai, Hung Viet Pham, Gias Uddin, Jinqiu Yang, Song Wang

Veröffentlicht 2026-03-24
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ruixin Zhang, Wuyang Dai, Hung Viet Pham, Gias Uddin, Jinqiu Yang, Song Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Bild: Der neue, superkluge Bauleiter

Stell dir vor, du möchtest ein Haus bauen. Früher hast du alles selbst gemessen, gesägt und genagelt. Jetzt hast du einen superintelligenten Bauleiter (die KI), der dir sagt: „Wir brauchen eine Wand hier" und dir sogar die Pläne zeichnet. Das klingt toll, oder?

Aber in dieser Studie haben die Forscher drei dieser Bauleiter genauer unter die Lupe genommen: Claude Code, Codex und Gemini CLI. Sie haben sich nicht angesehen, wie gut die Pläne sind, sondern sich gefragt: Warum geht das Werkzeug selbst so oft kaputt?

Sie haben sich über 3.800 Beschwerden von echten Nutzern angesehen, die diese Tools im Alltag benutzt haben. Es ist, als würden sie alle Fehlerberichte in einem riesigen Korb durchsuchen, um zu verstehen, wo der Schuh drückt.

Die wichtigsten Entdeckungen (in einfachen Worten)

1. Das Problem liegt selten am „Denken" der KI

Die größte Überraschung? Die meisten Fehler (67 %) passieren gar nicht, weil die KI „dumm" ist oder falsche Pläne zeichnet.

  • Die Metapher: Stell dir vor, dein Bauleiter ist ein Genie, aber er versucht, mit einem kaputten Telefon zu sprechen, während er auf einer wackeligen Leiter steht.
  • Die Realität: Die KI selbst funktioniert oft gut. Das Problem ist, dass das Werkzeug, das die KI umgibt, schlecht gebaut ist. Die Verbindung zwischen der KI und dem Computer, den Befehlen, die sie ausführt, oder den Einstellungen, die du gemacht hast, hakt.

2. Die häufigsten Fehlerquellen (Die „Drecksarbeit")

Die Forscher haben herausgefunden, wo die meisten Probleme liegen:

  • Verbindungsprobleme (37 %): Die KI versucht, mit anderen Programmen zu sprechen (wie einem Postboten, der die Briefe nicht zustellen kann), oder die Einstellungen sind falsch. Das ist wie wenn der Bauleiter versucht, Zement zu bestellen, aber die Telefonnummer falsch ist.
  • Falsche Einstellungen: Der Nutzer hat das Werkzeug nicht richtig aufgestellt (z. B. falsche Versionen von Programmen installiert).
  • Das Ergebnis: Die KI schreit oft: „Fehler!", weil sie nicht weiß, wie sie den Befehl ausführen soll, nicht weil sie den Befehl nicht versteht.

3. Wie sieht der Fehler für den Nutzer aus?

Wenn etwas schiefgeht, was sieht man dann?

  • Der „Stumme" Terminal: Das Fenster, in dem Befehle laufen, friert ein oder zeigt kryptische Fehlercodes an.
  • Der „Geister-Befehl": Die KI sagt: „Ich habe die Datei geändert", aber auf deinem Computer ist nichts passiert.
  • Die Metapher: Es ist, als würde der Bauleiter sagen: „Ich habe die Wand gemauert", aber du siehst nur eine leere Stelle, weil der Maurer die Ziegel nie wirklich geliefert hat.

4. Wo bricht es zusammen?

Die Studie hat eine Landkarte der Software erstellt. Die meisten Brüche passieren an zwei Stellen:

  1. Der Boten-Service (Tool-Orchestrierung): Wenn die KI versucht, andere Programme zu steuern (z. B. „Öffne diese Datei" oder „Führe diesen Test aus").
  2. Die Ausführungshalle (Command Execution): Wenn die Befehle tatsächlich auf dem Computer laufen sollen.

Die eigentliche „Denk-Zone" der KI (wo sie Pläne macht) ist eigentlich recht stabil. Das Problem ist die Übergabe vom Plan zur Tat.

Was lernen wir daraus? (Die „Lehren")

Die Forscher geben drei wichtige Ratschläge an die Entwickler dieser Tools:

  1. Besser zusammenarbeiten: Die KI, das Betriebssystem und die Tools müssen wie ein gut eingespieltes Team funktionieren. Wenn die KI sagt „Ich brauche Hilfe", muss das System sofort wissen, was zu tun ist, statt zu zögern.
  2. Ehrliches Feedback: Wenn etwas schiefgeht, muss das System klar sagen: „Hey, ich kann das nicht machen, weil mein Telefon nicht funktioniert", statt nur einen Fehlercode zu werfen. Der Nutzer (und die KI) müssen wissen, was los ist.
  3. Vorsicht bei Unsicherheit: Wenn das System unsicher ist (z. B. „Ist die Datei wirklich da?"), sollte es nicht einfach blind weitermachen, sondern nachfragen oder stoppen.

Fazit

Diese Studie sagt uns: KI-Coding-Tools sind nicht kaputt, weil die KI zu dumm ist. Sie sind kaputt, weil die „Infrastruktur" um sie herum noch nicht ausgereift ist.

Es ist wie bei einem neuen, hochmodernen Auto: Der Motor (die KI) ist fantastisch, aber die Bremsen, die Lenkung und die Elektronik (die Software-Tools) hängen noch oft in den Kinderschuhen. Um diese Tools wirklich zuverlässig zu machen, müssen Entwickler nicht nur die KI verbessern, sondern vor allem die Brücken bauen, auf denen sie fahren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →