← Nieuwste papers
💻 computer science

PromptMark: A Prompt-Guided Iterative-Feedback Framework for Source Code Watermarking

PromptMark is een black-box, prompt-gestuurd framework dat detecteerbare watermerken in door AI gegenereerde broncode inbedt via gestructureerde instructies en iteratieve feedback, waarbij sterke attributie wordt bereikt zonder de functionaliteit van de code aan te tasten of toegang te vereisen tot de interne werking van het model.

Oorspronkelijke auteurs: Istiaq Ahmed Fahad, Mridha Md. Nafis Fuad, Kazi Sakib

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Istiaq Ahmed Fahad, Mridha Md. Nafis Fuad, Kazi Sakib

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een bakker bent die een zeer getalenteerde, maar onzichtbare, robotkok inhuurt om elke dag duizenden broden te bakken. Je wilt weten welk brood door je robot is gebakken en welk brood door een menselijke concurrent, maar de robot laat geen handtekening achter en het brood ziet er aan de buitenkant exact hetzelfde uit.

Dit is het probleem dat PromptMark oplost, maar in plaats van brood, gaat het over computercode die door Kunstmatige Intelligentie (AI) is geschreven.

Hier is hoe het artikel de oplossing uitlegt, onderverdeeld in eenvoudige concepten:

1. Het Probleem: De "Black Box" Chef

In de echte wereld bezitten de meeste ontwikkelaars niet de AI-modellen die ze gebruiken; ze huren ze via een "black box"-service (zoals een restaurant waar je de keuken niet kunt zien).

  • De Uitdaging: Je kunt niet in het brein van de robot kijken om te veranderen hoe hij denkt (dit wordt "white-box"-toegang genoemd). Je kunt hem alleen een recept geven (een prompt) en wachten op het gerecht (de code).
  • Het Risico: Als de AI code schrijft die kapot gaat of credit steelt, is het moeilijk te bewijzen dat het door de AI kwam. Ook, als je probeert de AI te dwingen de code op een vreemde manier te schrijven om het te markeren, kan de code stoppen met werken (zoals een robot die probeert brood te bakken met een hamer).

2. De Oplossing: Het "Green List" Recept

De onderzoekers hebben een methode ontwikkeld genaamd PromptMark. In plaats van te proberen het brein van de robot te hacken, passen ze simpelweg de instructies aan die ze aan hem geven.

Beschouw dit als het geven van een speciale regel aan de robotkok: "Voor elke nieuwe ingrediëntnaam die je verzint, moet je de naam laten beginnen met een letter uit deze specifieke 'Green List' (zoals A, B of C)."

  • De Green List: Dit is een geheime lijst met letters (bijv. A, B, C) gekozen op basis van een geheime sleutel.
  • De Red List: Dit zijn letters waarvan de robot wordt verteld ze juist te vermijden bij het beginnen van namen.
  • De Truc: De robot volgt deze regels zo goed op dat hij de namen van zijn variabelen (zoals apple_count of banana_loop) veel vaker begint met "Green"-letters dan een mens dat van nature zou doen.

3. De "Iterative Feedback" Loop: De Proeverij

Soms kan de robot de regel vergeten of code schrijven die niet werkt omdat hij te hard probeert de regel te volgen. Om dit op te lossen, gebruikt PromptMark een feedback loop:

  1. Ronde 1: De robot schrijft de code.
  2. De Controle: Een mens (of een andere computer) controleert twee dingen:
    • Werkt de code echt? (Is het brood gerezen?)
    • Heeft de robot de "Green List"-regel genoeg gevolgd? (Zijn er genoeg A, B, C namen?)
  3. De Feedback: Als de code kapot is, krijgt de robot de instructie: "Verbeter de logica." Als de code werkt maar de "Green List"-regel zwak is, krijgt de robot de instructie: "Goed gedaan, maar gebruik de volgende keer meer 'A'-namen."
  4. Ronde 2: De robot probeert het opnieuw met de nieuwe instructies.

Het blijft dit doen totdat de code perfect is en de watermerksterkte optimaal is.

4. De Detectie: De "Statistische Detective"

Hoe weet je of een stuk code door de AI is gemaakt? Je hoeft de geheime sleutel niet te kennen. Je kijkt alleen naar de namen.

  • Natuurlijke Code: Mensen noemen dingen willekeurig. Als je naar 100 variabelen kijkt, beginnen misschien 10 met een 'A', 10 met een 'B', enzovoort. Het is een gebalanceerde mix.
  • Watermerk-Code: Omdat de AI werd gedwongen de "Green List" te gebruiken, zul je een vreemd patroon zien. Misschien begint 60% van de namen met 'A', 'B' of 'C'.
  • De Test: Een statistische test (zoals een wiskundige detector) telt deze letters. Als het patroon te sterk is om een toevalstreffer te zijn, roept hij: "Dit is door de AI geschreven!"

5. Waarom het Speciaal is

De paper beweert dat deze methode om drie redenen bijzonder is:

  • Het is Onzichtbaar: De code ziet er nog steeds normaal uit en werkt perfect. Het "watermerk" is slechts een subtiel patroon in de namen, zoals een verborgen boodschap in de tekst van een liedje die je alleen opmerkt als je het patroon kent.
  • Het Werkt op Black Boxes: Je hoeft de AI niet te bezitten of de interne code ervan te zien. Je praat er gewoon tegen als een normale gebruiker.
  • Het is Veilig: De "Green List" wordt gegenereerd met behulp van een geheime sleutel (zoals een wachtwoord). Alleen iemand met die sleutel weet welke letters gezocht moeten worden, wat het moeilijk maakt voor anderen om het watermerk na te bootsen.

De Resultaten

De onderzoekers hebben dit getest op twee beroemde sets programmeerproblemen (MBPP en HumanEval) met behulp van twee verschillende AI-modellen (Gemini en Claude).

  • Succespercentage: De methode slaagde erin de code ongeveer 90% tot 98% van de tijd te markeren zonder de code te breken.
  • Kwaliteit: De code bleef net zo goed als code die zonder het watermerk is geschreven.

De Beperkingen (Wat de paper toegeeft)

  • Herbenaming-aanvallen (Renaming Attacks): Als iemand de watermerk-code neemt en handmatig alle variabelen naar iets anders verandert, verdwijnt het watermerk. De paper merkt op dat hoewel de methode goed is, het geen magie is; een vastberaden mens zou het signaal kunnen wissen door de code te herschrijven.
  • Taalspecifiek: De studie is uitgevoerd op Python-code. De paper waarschuwt dat talen met andere naamgevingsregels er anders uit kunnen gaan zien.

Kortom, PromptMark is een manier om een geheime instructie aan een AI-chef te fluisteren: "Noem je ingrediënten met deze specifieke letters," waardoor je later met behulp van wiskunde kunt bewijzen dat de AI het gerecht heeft gemaakt, zonder dat de smaak van het eten wordt aangetast.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →