← Nieuwste papers
💻 computer science

Sequential Behavioral Watermarking for LLM Agents

Dit artikel introduceert SeqWM, een sequentieel gedragswatermerkingkader dat eigendomssignalen inbedt in geschiedenis-geconditioneerde agentovergangspatronen om robuuste, positie-onafhankelijke trajectverificatie mogelijk te maken terwijl de nuttigheid van de agent behouden blijft, en dat de kwetsbaarheid van bestaande methoden overwint die handelingen behandelen als onafhankelijke proeven.

Oorspronkelijke auteurs: Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

Gepubliceerd 2026-05-13
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Black Box" Agent

Stel je voor dat je een hoogopgeleide robotassistent (een LLM-agent) huurt voor een complexe taak, zoals het plannen van een reis of het debuggen van code. Deze robot schrijft niet alleen een eindrapport; hij maakt een lange keten van beslissingen: "Ik controleer het weer", dan "Ik boek een vlucht", dan "Ik bel een taxi".

Het Probleem: Als je een lijst van deze acties ziet, hoe weet je dan welke robot ze heeft uitgevoerd?

  • Heeft jouw robot het gedaan?
  • Heeft de robot van een concurrent het gedaan?
  • Heeft een hacker de "hersenen" van je robot gestolen en een kopie gemaakt die precies hetzelfde doet?

Op dit moment is het erg moeilijk om dit te onderscheiden. De interne gedachten van de robot (de tekst die hij genereert) zijn vaak verborgen, en we zien alleen de uiteindelijke acties. Als iemand het gedrag van je robot kopieert, kunnen ze je intellectueel eigendom stelen zonder dat je het merkt.

Waarom Oude Methoden Faalden

Wetenschappers probeerden dit eerder op te lossen door een "digitale watermerk" op de woorden te plaatsen die de robot schreef (zoals een onzichtbare inktvlek op een brief).

  • De Fout: In de wereld van agents is de actie belangrijker dan de woorden. Als een robot besluit om "een taxi te bellen", kan hij dat op duizend verschillende manieren zeggen. Een watermerk op de woorden gaat verloren in de ruis.
  • De "Rond Getal" Valstrik: Sommige nieuwere methoden probeerden de acties te watermerken door ze te labelen op basis van hun volgorde (bijv. "De 1e actie moet A zijn, de 2e moet B zijn").
    • De Analogie: Stel je een dansroutine voor waarbij het watermerk is "Stap 1 is een draai, Stap 2 is een sprong". Als het publiek Stap 1 mist (misschien valt de video weg), verliezen ze het tellen. Plotseling lijkt Stap 2 op een "Stap 1", en breekt het hele watermerk. Het systeem is te fragiel; één gemiste stap ruïneert het hele bewijs.

De Oplossing: SeqWM (Het "Contextuele Dans" Watermerk)

De auteurs stellen SeqWM voor, een nieuwe manier om agents te watermerken die niet afhankelijk is van het specifieke stapnummer. In plaats daarvan kijkt het naar het patroon van beweging.

1. Het Kernidee: "Geschiedenis is de Sleutel"

In plaats van te vragen: "Wat is de 5e stap?", vraagt SeqWM: "Wat is er in de laatste paar stappen gebeurd?"

  • De Analogie: Stel je een geheime handdruk voor.
    • Oude Manier: "Als je de 5e persoon in de rij bent, geef dan een high-five." (Als iemand de rij verlaat, verschuift iedereen, en is de 5e persoon nu de 4e, dus de regel breekt).
    • SeqWM Manier: "Als de persoon voor jou een 'golf' heeft gedaan en degene daarvoor een 'knikje', dan moet jij een 'klap' geven."
    • Waarom het werkt: Het maakt niet uit of je de 5e persoon bent of de 50e. Zolang het patroon (Golf -> Knikje -> Klap) bestaat, is het watermerk er. Als iemand een stap in het midden verwijdert, verschuift het patroon slechts iets, maar houdt de rest van de dans het geheim vast.

2. Het "Multi-Kanaal" Veiligheidsnet

Om ervoor te zorgen dat het watermerk overleeft, zelfs als delen van de video worden weggeknipt, gebruikt SeqWM meerdere kanalen (alsof je 8 verschillende geheime codes tegelijkertijd hebt).

  • De Analogie: In plaats van een geheime boodschap op één stuk papier te schrijven, schrijf je het op 8 verschillende stukken papier. Als een dief één of twee verbrandt, kun je de boodschap nog steeds lezen van de resterende zes.
  • Bij SeqWM wordt de beslissing van de agent lichtjes beïnvloed op basis van 8 verschillende "geheime sleutels" die zijn afgeleid uit de recente geschiedenis. Zelfs als het gedrag van de agent rommelig is, onthult het statistische patroon over deze 8 kanalen het watermerk.

3. De "Willekeurige Sleutel" Detective

Hoe bewijs je dat het een watermerk is en niet gewoon toeval?

  • De Oude Manier: Je probeert de geheime code te raden. Als je het goed raadt, vind je het watermerk.
  • De SeqWM Manier: De detective neemt de actieserie en voert deze uit via een "simulator" met duizenden verkeerde geheime sleutels.
    • Als de serie was watermerkt met de echte sleutel, zal de score zeer hoog zijn.
    • Als je het uitvoert met verkeerde sleutels, zal de score laag zijn (zoals achtergrondruis).
    • De Analogie: Stel je voor dat je probeert een specifiek radiostation te vinden. Je stemt door 1.000 willekeurige frequenties. De meeste klinken als statisch geluid. Maar één frequentie (de echte sleutel) speelt een duidelijk liedje. Als het liedje luid genoeg is in vergelijking met het statische geluid, weet je dat het echt is. Deze methode is wiskundig bewezen eerlijk, zelfs als het gedrag van de robot raar is of de video is opgeknipt.

Wat de Experimenten Toonden

De onderzoekers testten dit op drie verschillende soorten AI-agents (één voor hulpmiddelen, één voor fysieke taken, één voor sociale simulatie) met verschillende AI-modellen.

  1. Betrouwbaarheid: SeqWM slaagde er bijna 100% van de tijd in om de "eigenaar" van het gedrag van de agent te identificeren, terwijl oudere methoden vaak faalden.
  2. Robuustheid: Toen ze "aanvallen" simuleerden door 10%, 20% of zelfs 50% van de acties te verwijderen (zoals stukken uit een video knippen), bleef SeqWM werken. De oude "rond-getal" methoden stortten direct in na slechts één verwijdering.
  3. Geen Schade: Het watermerk maakte de robot niet "dommer" en veranderde niet zijn vermogen om problemen op te lossen. Het duwde de keuzes slechts lichtjes in een richting die onzichtbaar was voor de gebruiker, maar detecteerbaar door de verificateur.

Samenvatting

SeqWM is als het plaatsen van een watermerk op de danspassen van een robot in plaats van op zijn woorden. In plaats van stappen te tellen (wat breekt als je er één mist), kijkt het naar de relatie tussen bewegingen (bijv. "Na een draai is een sprong waarschijnlijk"). Door gebruik te maken van meerdere geheime codes en een slimme statistische test, kan het bewijzen wie het gedrag van een robot heeft gecreëerd, zelfs als delen van het gedrag ontbreken of verborgen zijn. Dit beschermt de makers van AI-agents tegen het stelen of kopiëren van hun werk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →