← Neueste Arbeiten
🤖 AI

Tricky2^2: Towards a Benchmark for Evaluating Human and LLM Error Interactions

Dieses Paper führt Tricky2^2 ein, einen hybriden Datensatz, der von Menschen geschriebene Defekte durch LLM-injizierte Fehler über mehrere Programmiersprachen hinweg ergänzt, um die Untersuchung darüber zu erleichtern, wie menschlich und maschinell originierte Bugs interagieren, wodurch dadurch neue Evaluierungen der Fehlerklassifizierung, -lokalisierung und -reparatur in hybriden Softwareentwicklungs-Workflows ermöglicht wird.

Ursprüngliche Autoren: Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

Veröffentlicht 2026-01-28
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bauen ein Haus. Manchmal macht der menschliche Architekt einen Fehler, wie zum Beispiel das Vergessen, eine Tür an der richtigen Stelle einzubauen. Ein anderes Mal hilft ein superintelligenter Roboter-Assistent beim Bauen, installiert aber versehentlich ein Fenster, das sich nicht öffnen lässt, oder setzt einen Ziegelstein an die falsche Stelle.

Bis jetzt haben Forscher diese beiden Arten von Fehlern hauptsächlich getrennt untersucht. Sie betrachteten Häuser mit nur menschlichen Fehlern oder Häuser mit nur Roboterfehlern. Aber in der realen Welt arbeiten Menschen und Roboter gemeinsam am selben Haus und machen oft Fehler, die sich miteinander verstricken.

Dieses Paper stellt Tricky2 vor, einen neuen „Trainingsplatz“ (oder Benchmark), der speziell darauf ausgelegt ist, zu untersuchen, was passiert, wenn menschliche Fehler und Roboterfehler im selben Code miteinander vermischt werden.

Hier ist eine Aufschlüsselung, wie sie es aufgebaut haben und was sie herausgefunden haben, unter Verwendung einfacher Analogien:

1. Das Rezept: Die Zutaten mischen

Die Forscher begannen mit einer bestehenden Sammlung von fehlerhaftem Code namens TrickyBugs. Betrachten Sie dies als eine Kiste mit Hausbauplänen, die Menschen gezeichnet haben, dabei aber Fehler gemacht haben.

Um Tricky2 zu erstellen, warfen sie die alten Baupläne nicht einfach weg. Stattdessen nahmen sie einen sehr klugen Roboter (eine KI namens GPT-5) und einen anderen, etwas anderen Roboter (OpenAI-oss-20b) und gaben ihnen eine knifflige Aufgabe:

  • Die Regel: „Sieh dir diesen Bauplan an, der bereits einen menschlichen Fehler enthält. Füge einen neuen Fehler deinerseits hinzu, aber korrigiere den menschlichen Fehler nicht. Behalte den Rest des Hauses exakt so bei, wie er ist.“
  • Das Ergebnis: Sie erstellten drei Arten von „Häusern“ (Datensätzen):
    1. Nur Mensch: Die ursprünglichen Baupläne mit nur menschlichen Fehlern.
    2. Nur Roboter: Baupläne, bei denen der Roboter einen Fehler in ein perfektes Haus eingebaut hat.
    3. Das „Hybrid-Modell“ (Mensch + Roboter): Der wichtigste Teil. Dies sind Baupläne, bei denen ein Mensch einen Fehler gemacht hat und der Roboter daraufhin einen weiteren Fehler hinzugefügt hat.

Sie taten dies für drei verschiedene „Sprachen“ (C++, Python und Java) und schufen so eine riesige Bibliothek von über 11.000 vermischten Code-Beispielen.

2. Der Test: Kann die Reparaturcrew es richten?

Sobald sie diese Bibliothek gebaut hatten, baten sie andere KI-Modelle, als „Reparaturcrews“ zu fungieren. Sie gaben der KI drei Aufgaben, um zu sehen, wie gut sie mit dem Chaos zurechtkommt:

  • Job 1: Der Detektiv (Klassifizierung): Kann die KI den Code betrachten und erraten: „Hat ein Mensch diesen Fehler gemacht, ein Roboter oder beide?“
  • Job 2: Der Spürhund (Lokalisierung): Kann die KI exakt auf die Zeile Code zeigen, in der der Fehler sich versteckt?
  • Job 3: Der Fixer (Reparatur): Kann die KI den Code tatsächlich reparieren, damit das Haus wieder funktioniert?

3. Die Überraschung: Der „Double Trouble“-Effekt

Die Forscher führten einen kleinen Test mit einigen der schwierigsten Probleme durch. Dabei machten sie folgende Entdeckung:

  • Einzelne Fehler sind einfacher: Wenn die KI versuchte, ein Haus mit nur einem menschlichen Fehler oder nur einem Roboterfehler zu reparieren, war sie recht gut darin.
  • Gemischte Fehler sind schwer: Als die KI versuchte, die Hybrid-Häuser zu reparieren (in denen ein menschlicher Fehler und ein Roboterfehler miteinander verstrickt waren), hatte sie erheblich zu kämpfen.
    • Tatsächlich konnte die KI bei einer spezifischen Art von Code (C++) keines der Hybrid-Probleme lösen, obwohl sie viele der Einzelquellen-Probleme lösen konnte.

Die Analogie: Stellen Sie sich vor, Sie versuchen, zwei Knoten zu entwirren. Wenn es nur einen Knoten ist, ist es einfach. Wenn zwei Knoten so miteinander verknotet sind, dass der eine den anderen verbirgt, wird es zum Albtraum. Das Paper legt nahe, dass die Interaktion von Mensch und KI Fehler erzeugt, die einen „Double Trouble“-Effekt (doppelten Ärger) verurslichen, der selbst die klügsten Reparaturwerkzeuge verwirrt.

4. Warum das wichtig ist

Die Autoren sagen, dass dies erst der Anfang ist. Sie behaupten nicht, dass dies bereits alle Softwareprobleme löst. Vielmehr sagen sie:

  • Wir müssen aufhören, Reparaturwerkzeuge nur an „reinem“ menschlichen Code oder „reinem“ Roboter-Code zu testen.
  • Reale Software ist eine Mischung aus beidem, und diese Mischung erzeugt einzigartige Probleme, auf die aktuelle Werkzeuge noch nicht vorbereitet sind.
  • Tricky2 ist ein neues Werkzeug für Forscher, um diese „gemischten Ursprung“-Fehler zu untersuchen, damit sie bessere Werkzeuge für die Zukunft bauen können.

Kurz gesagt, das Paper sagt: „Wir haben ein spezielles Testkit gebaut, um zu sehen, was passiert, wenn menschliche und Roboterfehler kollidieren. Wir haben festgestellt, dass es viel schwieriger ist, den Code zu reparieren, wenn sie kollidieren, und wir müssen dieses spezifische Problem untersuchen, um Software sicherer zu machen.“

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →