Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection
Het Dream-team stelt een SALSA-stijl single-pass autoregressief classificatiekader voor, gecombineerd met gebalanceerde bemonstering en conservatieve fijnafstemming, om robuuste out-of-distribution detectie van door machines gegenereerde code te bereiken, waarmee zij de CodeBERT-baseline op de SemEval-2026 Taak 13-leaderboard aanzienlijk overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een docent bent die probeert uit te vogelen of het huiswerk van een leerling door de leerling zelf is geschreven of gekopieerd van een superintelligente AI. Dit is de uitdaging waar de auteurs van dit artikel een oplossing voor zochten voor een wedstrijd genaamd SemEval-2026 Task 13.
Hier is het verhaal van hoe ze het hebben opgelost, met behulp van eenvoudige analogieën:
Het Probleem: De "Kameleon"-code
In het verleden was het detecteren van door AI geschreven code als het proberen te spotten van een kameleon in een bos. De AI kon code in veel verschillende talen schrijven (zoals Python, Java of C++) en voor veel verschillende taken. Als je een detector trainde om AI-code in Python te herkennen, faalde deze vaak wanneer de AI overschakelde naar Java. De detector was te "gespecialiseerd" en kon niet omgaan met nieuwe, onbekende situaties.
De Oplossing: Het "Eén-Woord-Antwoord"-spel
Het team van Dream Security Ltd. stelde een nieuwe manier voor om het spel te spelen, die zij SALSA noemen (Single-pass Autoregressive LLM Structured Classification).
Denk aan een normale AI-chatbot als een praatgrage papegaai. Als je vraagt: "Is deze code door AI geschreven?", zegt hij misschien: "Nou, kijkend naar de syntaxis en de variabelenamen, denk ik dat het waarschijnlijk door AI is geschreven omdat..." en schrijft dan een hele paragraaf. Dit is rommelig en moeilijk te beoordelen.
SALSA verandert de regels:
- De Prompt: Ze geven de AI een codefragment en stellen een zeer specifieke vraag: "Is dit door een machine gegenereerd?"
- De Beperking: Ze vertellen de AI: "Je mag alleen antwoorden met één enkel woord: ofwel '0' (Nee) of '1' (Ja)."
- Het Resultaat: In plaats van een lang essay, wordt de AI gedwongen een snelle, besluitvaardige keuze te maken. Het is alsof je een rechter vraagt om één enkele klap van de hamer te geven in plaats van een juridisch opini van 10 pagina's te schrijven.
De Training: "Minder is Meer"
Normaal gesproken, wanneer je een computermodel een nieuwe taak leert, kun je het heel lang drillen totdat het de specifieke voorbeelden die je gaf uit het hoofd kent. Maar de auteurs realiseerden zich dat als je een model te hard drillt op specifieke voorbeelden, het vergeet hoe het met nieuwe situaties moet omgaan (dit wordt "overfitting" genoemd).
Ze gebruikten een "Conservatieve Training"-aanpak:
- De Leersnelheid: Stel je voor dat de leersnelheid de volumeknop van een radio is. Ze draaiden het volume heel laag. Hierdoor kon het model de nieuwe taak leren zonder over zijn eigen bestaande kennis heen te schreeuwen.
- De Duur: Ze lieten het model de voorbeelden slechts één enkele keer bestuderen (één epoch). Ze ontdekten dat te lang studeren ervoor zorgde dat het model vergat hoe het een generalist moest zijn en te gespecialiseerd werd in alleen de trainingsdata.
- Evenwichtige Dieet: De trainingsdata bevatte veel meer Python-code dan Java of C++. Om te voorkomen dat het model een "alleen-voor-Python"-expert werd, dwongen ze het om een gelijke hoeveelheid van elke taal te eten, zelfs als dat betekende dat ze een deel van de extra Python-data moesten weggooien.
De Resultaten: De Baseline verslaan
De wedstrijd had een "baseline" detector (CodeBERT) die als een oude, roestige metaaldetector was. Deze behaalde een score van slechts 0.305 (zeer slecht) wanneer deze werd getest op nieuwe, onbekende talen.
Het SALSA-systeem van het Dream Security-team was als een hoogtechnologische, adaptieve scanner.
- Zero-Shot (Geen training): Zelfs zonder speciale training was hun AI redelijk (rond de 0.5).
- Met Training: Na hun zorgvuldige, "één-epoch" training bereikte hun beste systeem een score van 0.789.
Dit is een enorme sprong. Dit betekent dat hun systeem veel beter is in het opsporen van AI-code, zelfs wanneer de code is geschreven in een taal of stijl die het nog nooit heeft gezien.
De Haken en Ogen
Het artikel vermeldt een grappige eigenaardigheid: vóór de training was de AI erg verlegen. Hij was zo bang om een fout te maken dat hij bijna altijd gokte op "Door mens geschreven" (0), zelfs wanneer het door AI was. Dit zorgde ervoor dat het model een hoge "precisie" had (wanneer het AI dacht te zien, had het gelijk), maar een verschrikkelijke "recall" (het miste bijna alle AI-code). De training hielp deze verlegenheid te overwinnen, door het model te leren dapper genoeg te zijn om "Ja" te zeggen wanneer het AI ziet.
Kortom: Ze bouwden een detector die geen essays schrijft, niet de tekstboeken uit het hoofd leert en niet overweldigd raakt door nieuwe talen. Het kijkt gewoon naar de code, denkt een fractie van een seconde na, en laat een enkele, accurate "Ja" of "Nee" vallen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.