← Nieuwste papers
🤖 AI

Tricky2^2: Towards a Benchmark for Evaluating Human and LLM Error Interactions

Dit artikel introduceert Tricky2^2, een hybride dataset die door mensen geschreven defecten aanvult met door LLM's geïnjecteerde fouten over meerdere programmeertalen om het onderzoek naar de interactie tussen door mensen en door machines voortgebrachte bugs te faciliteren, waardoor nieuwe evaluaties van foutclassificatie, lokalisatie en reparatie in hybride softwareontwikkelingsworkflows mogelijk worden.

Oorspronkelijke auteurs: Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

Gepubliceerd 2026-01-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een huis bouwt. Soms maakt de menselijke architect een fout, zoals het vergeten van een deur op de juiste plek. Andere keren helpt een super slimme robotassistent bij het bouwen van het huis, maar installeert per ongeluk een raam dat niet open kan of plaatst een baksteen op de verkeerde plek.

Tot nu toe hebben onderzoekers deze twee soorten fouten voornamelijk afzonderlijk bestudeerd. Ze keken naar huizen met alleen menselijke fouten, of huizen met alleen robotfouten. Maar in de echte wereld werken mensen en robots samen aan hetzelfde huis, waarbij fouten vaak met elkaar verstrengeld raken.

Deze paper introduceert Tricky2, een nieuwe "trainingsgrond" (of benchmark) die specifiek is ontworpen om te bestuderen wat er gebeurt wanneer menselijke fouten en robotfouten met elkaar mengen in dezelfde code.

Hier is een overzicht van hoe ze dit hebben gebouwd en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. Het Recept: De Ingrediënten Mengen

De onderzoekers begonnen met een bestaande collectie "foutieve" code genaamd TrickyBugs. Denk aan dit als een doos met blauwdrukken van huizen die mensen hebben getekend, maar waar fouten in staan.

Om Tricky2 te creëren, hebben ze niet gewoon de oude blauwdrukken weggegooid. In plaats daarvan namen ze een zeer slimme robot (een AI genaamd GPT-5) en een andere, iets andere robot (OpenAI-oss-20b) en vroegen hen iets lastigs te doen:

  • De Regel: "Kijk naar deze blauwdruk die al een menselijke fout bevat. Voeg één nieuwe fout van jezelf toe, maar repareer de menselijke fout niet. Houd de rest van het huis exact hetzelfde."
  • Het Resultaat: Ze creëerden drie soorten "huizen" (datasets):
    1. Alleen Menselijk: De originele blauwdrukken met alleen menselijke fouten.
    2. Alleen Robot: Blauwdrukken waar de robot een fout heeft gemaakt in een perfect huis.
    3. De "Hybride" (Mens + Robot): Het belangrijkste deel. Dit zijn blauwdrukken waar een mens een fout maakte, en de robot vervolgens een andere fout bovenop de eerste fout heeft toegevoegd.

Ze deden dit voor drie verschillende "talen" (C++, Python en Java), waardoor ze een enorme bibliotheek van meer dan 11.000 gemengde codevoorbeelden creëerden.

2. De Test: Kan de Reparatieploeg het Repareren?

Zodra ze deze bibliotheek hadden gebouwd, vroegen ze andere AI-modellen om als "reparatieploeg" te fungagen. Ze gaven de AI drie taken om te zien hoe goed ze met de chaos om kunnen gaan:

  • Taak 1: De Detective (Classificatie): Kan de AI de code bekijken en raden: "Heeft een mens deze fout gemaakt, een robot, of beiden?"
  • Taak 2: De Spotter (Lokalisatie): Kan de AI precies aanwijzen op welke regel code de fout zich verbergt?
  • Taak 3: De Fixer (Reparatie): Kan de AI de code daadwerkelijk repareren zodat het huis weer werkt?

3. De Verrassing: Het "Dubbele Probleem"-effect

De onderzoekers voerden een kleine test uit met enkele van de moeilijkste problemen. Hier is wat ze ontdekten:

  • Solo Fouten zijn Makkelijker: Wanneer de AI probeerde een huis met alleen een menselijke fout, of alleen een robotfout te repareren, waren ze redelijk goed in het.
  • Gemengde Fouten zijn Moeilijk: Wanneer de AI probeerde de Hybride huizen (waar een menselijke fout en een robotfout in elkaar verstrengeld waren) te repareren, hadden ze aanzienlijk meer moeite.
    • Sterker nog, voor één specifieke type code (C++) slaagde de AI er niet in om zelfs maar één van de hybride problemen op te lossen, terwijl ze wel veel van de problemen met één bron konden oplossen.

De Analogie: Stel je voor dat je probeert twee knopen te ontwarren. Als er slechts één knoop is, is het makkelijk. Als er twee knopen zijn die zo in elkaar zijn geknoopt dat de ene de andere verbergt, wordt het een nachtmerrie. De paper suggereert dat wanneer menselijke en AI-fouten interageren, ze een "dubbel probleem"-effect creëren dat zelfs de slimste reparatietools in de war brengt.

4. Waarom Dit Belangrijk Is

De auteurs zeggen dat dit pas het begin is. Ze beweren niet dat dit alle softwareproblemen al oplost. In plaats daarvan zeggen ze:

  • We moeten stoppen met het testen van reparatietools alleen op "zuivere" menselijke code of "zuivere" robotcode.
  • Software in de echte wereld is een mix van beide, en die mix creëert unieke problemen waar huidige tools nog niet klaar voor zijn.
  • Tricky2 is een nieuw instrument voor onderzoekers om deze "gemengde oorsprong" fouten te bestuderen, zodat ze betere tools voor de toekomst kunnen bouwen.

Kortom, de paper zegt: "We hebben een speciale testkit gebouwd om te zien wat er gebeurt als menselijke en robotfouten botsen. We kwamen erachter dat wanneer ze botsen, het veel moeilijker is om de code te repareren, en we moeten dit specifieke probleem bestuderen om software veiliger te maken."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →