← Nieuwste papers
🤖 AI

Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets

Dit artikel introduceert SOURCETRACKER en de hybride tweestaps-pijplijn HYBRIDSOURCETRACKER, die vectorzoekopdrachten combineert met klassieke vingerafdrukken om schaalbare, hoogprecieze herkomsttracking voor door LLM's gegenereerde code mogelijk te maken door efficiënt potentiële trainingsbronnen binnen corpora op miljardenschaal te identificeren.

Oorspronkelijke auteurs: Andrea Gurioli, Davide D'Ascenzo, Federico Pennino, Maurizio Gabbrielli, Stefano Zacchiroli

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andrea Gurioli, Davide D'Ascenzo, Federico Pennino, Maurizio Gabbrielli, Stefano Zacchiroli

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een chef-kok bent die net een heerlijk nieuw gerecht heeft bedacht. Je wilt weten of je recept geïnspireerd was op een specifiek kookboek, of dat je per ongeluk het werk van een beroemde chef woord voor woord hebt gekopieerd. Stel je nu voor dat de "kok" in plaats van een mens een superintelligente AI is (een Large Language Model) die miljarden kookboeken heeft gelezen.

Het probleem is: als de AI een recept kopieert, verandert het vaak de namen van de ingrediënten (zoals het vervangen van "suiker" door "zoetstof") of herschikt het de stappen iets. Traditionele methoden om plagiaat te controleren, zijn als een bibliothecaris die elke enkele pagina van elk kookboek ter wereld moet lezen om een match te vinden. Als de bibliotheek miljarden boeken bevat, zou deze bibliothecaris jaren nodig hebben om het antwoord te vinden.

Dit artikel introduceert een nieuw, supersnel systeem genaamd SOURCETRACKER en een tweestapsproces genaamd HYBRIDSOURCETRACKER (HST) om dit probleem op te lossen. Hieronder wordt uitgelegd hoe het werkt, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Naald in een Miljard-Hooiberg"

De auteurs leggen uit dat AI-modellen soms delen van de data waarvoor ze zijn getraind "onthouden". Wanneer ze code genereren, kunnen ze een fragment produceren dat bijna identiek is aan een stukje code uit hun trainingsdata, zelfs als ze een paar variablenamen hebben gewijzigd.

  • De Oude Manier (Winnowing): Stel je voor dat je probeert een specifieke zin te vinden in een bibliotheek van miljarden boeken door elk boek van begin tot eind te lezen. Het is accuraat, maar ongelooflijk traag. Als de bibliotheek groeit, groeit de benodigde tijd mee (lineaire tijd).
  • De Nieuwe Uitdaging: Moderne AI-trainingssets zijn zo enorm (miljarden fragmenten) dat de oude "lees alles"-methode te traag is om bruikbaar te zijn.

2. De Oplossing: Een Tweestaps Recherche-team

De auteurs hebben een hybride systeem ontwikkeld dat fungeert als een tweestaps recherche-team om de oorspronkelijke bron van de code snel en accuraat te vinden.

Stap 1: De "Slimme Snuffelaar" (SOURCETRACKER)

Eerst hebben ze een gespecialiseerd AI-model gebouwd dat SOURCETRACKER heet. Denk hierbij aan een hoogopgeleide hond die een specifiek geur kan ruiken.

  • In plaats van elk woord te lezen, zet dit model een stuk code om in een "geurprofiel" (een wiskundige vector).
  • Het maakt gebruik van een high-tech database (Qdrant) die fungeert als een supersnelle kaart. In plaats van de hele bibliotheek te doorzoeken, snuffelt de hond de lucht in en wijst direct de top 100 meest waarschijnlijke boeken aan die bij het geurprofiel passen.
  • Snelheid: Deze stap is ongelooflijk snel, duurt slechts milliseconden zelfs bij miljarden boeken, omdat het gebruik maakt van een "logaritmische" zoekopdracht (zoals het vinden van een boek in een bibliotheek door eerst de index te controleren, dan het vak, dan het boek, in plaats van elke pagina te lezen).

Stap 2: De "Forensisch Expert" (Winnowing)

Zodra de "Slimme Snuffelaar" de lijst heeft ingekrompen tot de top 100 kandidaten, stapt de tweede rechercheur in. Dit is het klassieke Winnowing-algoritme.

  • Denk hierbij aan een forensisch expert die de top 100 boeken bekijkt en de vingerafdrukken op de pagina's controleert.
  • Het vergelijkt de exacte structuur van de code om te zien of het een match is, zelfs als sommige woorden zijn gewijzigd.
  • Omdat het slechts 100 boeken hoeft te controleren in plaats van miljarden, is deze stap ook zeer snel.

3. De Resultaten: Snel en Accuraat

Het artikel heeft dit systeem getest op een enorme dataset van 10 miljoen codefragmenten. Hier is wat ze hebben gevonden:

  • Korte Fragmenten: Als het codefragment zeer kort is (zoals een enkele zin), is de "Slimme Snuffelaar" niet perfect, en is de oude "Forensisch Expert" (Winnowing) nog steeds beter in het vinden van de exacte match.
  • Langere Fragmenten: Als het codefragment langer is (60 woorden of meer), presteert het Hybride Systeem (HST) eigenlijk beter dan de oude methode alleen. Het vindt vaker de juiste bron terwijl het supersnel blijft.
  • De "Bijna Juiste" Matches: De auteurs hebben ook een andere AI gebruikt om de resultaten te beoordelen. Ze ontdekten dat zelfs wanneer het systeem niet de exacte originele code vond (de "Ground Truth"), het vaak code vond die zeer vergelijkbaar was. Dit is nuttig omdat het de gebruiker vertelt: "Hé, deze code lijkt te komen uit deze familie van code, zelfs als het niet het exacte origineel is."

4. Waarom Dit Belangrijk Is

Het artikel betoogt dat voor ethische en legale AI-generatie van code, we moeten weten waar het vandaan komt.

  • Transparantie: Dit systeem helpt gebruikers te zien of hun AI-generatie van code gewoon een kopie is van het werk van iemand anders.
  • Schaalbaarheid: Het bewijst dat je plagiaat kunt controleren in een bibliotheek van miljarden boeken in de tijd die het kost om te knipperen, in plaats van jaren te wachten.

De Haken en Ogen

De auteurs zijn eerlijk over de beperkingen:

  • Je hebt de bibliotheek nodig: Om dit systeem te gebruiken, moet je toegang hebben tot de originele trainingsdata (de bibliotheek van boeken). Als de AI is getraind op geheime data die je niet kunt zien, kun je de bron niet traceren.
  • Creatieve wijzigingen: Als de AI de code te veel verandert (niet alleen variablen hernoemen, maar de logica volledig herschrijven), kan het systeem moeite hebben om de connectie te vinden.

Samenvattend: Het artikel presenteert een team van "Slimme Snuffelaar" + "Forensisch Expert" dat miljarden codefragmenten direct kan scannen om de oorspronkelijke bron van AI-generatie van code te vinden, waarbij snelheid wordt gebalanceerd met hoge nauwkeurigheid, vooral voor langere stukken code.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →