← Nieuwste papers
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

Dit artikel introduceert TRACE, een nieuwe twee-kanaals robuuste attributie-watermerk voor LLM-agenttrajecten die vervormingsvrije actiekeuzes en onbreekbare herkomsttracking waarborgt door een op inhoud gebaseerd selectiekanaal en een op positie gebaseerd telkanaal te superponeren, waardoor het overleeft bij pogingen tot kwaadwillige verwijdering en herschrijving door wederverkopers.

Oorspronkelijke auteurs: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

Gepubliceerd 2026-07-10
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotassistent hebt gebouwd die vluchten kan boeken, pizza kan bestellen en je wifi kan repareren. Je verkoopt deze robot aan een tussenpersoon (een "reseller"), die hem vervolgens aan klanten verhuurt. Het probleem? De tussenpersoon kan proberen een goedkopere robot te sluipen, beweren dat hij hem zelf heeft gebouwd, of simpelweg de logs aanpassen om zijn sporen te wissen.

Normaal gesproken kijken we naar het "dagboek" van de robot — een logboek van elke tool die hij gebruikte en elke actie die hij ondernam — om te bewijzen wie zijn beslissingen heeft genomen. Maar als de tussenpersoon de eigenaar van het dagboek is, kan hij pagina's wissen of het verhaal herschrijven om het te laten lijken alsof hij het werk heeft gedaan. Bestaande watermerken zijn als onzichtbare inkt op de pagina's van het dagboek; als de tussenpersoon de tekst herschrijft, verdwijnt de inkt.

Maak kennis met TRACE, een nieuw soort digitale vingerafdruk die ontworpen is om te overleven, zelfs wanneer de eigenaar van het dagboek probeert het schoon te vegen. TRACE schrijft niet alleen op de pagina's; het verandert het verhaal op twee slimme, onzichtbare manieren die onmogelijk ongedaan te maken zijn zonder het dagboek zelf te vernietigen.

De Twee-Kanalen Truc

TRACE gebruikt twee verschillende "kanalen" om het bewijs te verbergen, zoals een spion die twee verschillende codes gebruikt die elkaar beschermen.

1. Het "Keuze"-kanaal (De Onzichtbare Hand)
Stel je voor dat de robot moet kiezen welke deur hij doorloopt. Er zijn vijf deuren, maar slechts één leidt naar de schat. Een normale robot kiest een deur op basis van zijn eigen logica. Het "Keuze"-kanaal van TRACE werkt als een magische, onzichtbare hand die de robot subtiel richting een specifieke deur duwt zonder de kans op succes te veranderen.

  • Hoe het werkt: Het gebruikt een geheime sleutel gebaseerd op het verhaal tot nu toe (de inhoud) om te beslissen welke deur gekozen wordt.
  • De Superkracht: Als de tussenpersoon een pagina uit het dagboek verwijdert (een "verwijderingsaanval"), springt het verhaal wel, maar de onzichtbare hand herkalibreert direct voor de volgende pagina. Het is als een GPS die direct een nieuwe route plant als je een afslag mist. Het bewijs overleeft omdat het verbonden is aan de inhoud van de keuzes, niet aan het paginanummer.
  • Het Nadeel: Als de tussenpersijn het verhaal herschrijft (bijvoorbeeld "Deur A" verandert in "De Blauwe Deur"), dan breekt dit kanaal. De onzichtbare hand zocht namelijk naar "Deur A" en raakt nu in de war.

2. Het "Aantal"-kanaal (De Sceletsleutel)
Stel je nu voor dat het dagboek van de robot is georganiseerd in groepen: één beslissing, gevolgd door een paar observaties. Het "Aantal"-kanaal van TRACE geeft niet om de woorden; het geeft om de structuur. Het voegt stiekem een "geestrecord" (een redundante notitie) toe aan sommige groepen, waardoor ze twee notities hebben in plaats van één.

  • Hoe het werkt: Het gebruikt een geheime sleutel gebaseerd op de positie van de groep (het skelet van het dagboek). Het beslist: "Groep 1 krijgt een geestnotitie, Groep 2 krijgt er geen."
  • De Superkracht: Als de tussenpersoon de tekst herschrijft (bijvoorbeeld "Deur A" verandert in "De Blauwe Deur"), blijft het aantal notities in de groep hetzelfde. De structuur blijft onaangetast. Dit kanaal is onbreekbaar tegen herschrijven omdat de tussenpersoon het aantal notities niet kan veranderen zonder de opmaat van het dagboek te breken.
  • Het Nadeel: Als de tussenpersoon pagina's verwijdert, veranderen de aantallen en raakt dit kanaal in de war.

De "Double-Blind" Verdediging

Hier zit de genialiteit: de tussenpersoon kan niet winnen.

  • Als ze pagina's proberen te verwijderen om het "Keuze"-kanaal te verbergen, blijft het "Aantal"-kanaal (dat op structuur vertrouwt) perfect.
  • Als ze de tekst proberen te herschrijven om het "Aantal"-kanaal te verbergen, blijft het "Keuze"-kanaal (dat op inhoud vertrouwt) perfect.
  • Om beide te wissen, zou de tussenpersoon 70% van het dagboek moeten verwijderen én bijna alles moeten herschrijven. Maar als ze dat doen, is het dagboek zo kapot dat het onbruikbaar is. Ze hebben dan het product dat ze probeerden te verkopen, vernietigd!

Wat de Cijfers Zeggen

De onderzoekers hebben dit getest op twee echte wereldwijde robotuitdagingen: ToolBench (korte taken, ongeveer 1,4 beslissingsstappen per taak) en ALFWorld (lange taken, ongeveer 23 tot 25 beslissingsstappen).

  • Geen Schade aan de Robot: TRACE is "vrij van vervorming" (distortion-free). De robot slaagt even vaak voor zijn taken als een robot zonder watermerk. Sterker nog, op ALFWorld slaagde de onwatergemerkte robot in 82,4% van de gevallen, terwijl TRACE in 83,6% van de gevallen slaagde. Andere watermerken die probeerden keuzes af te dwingen, verlaagden de succesratio met maar liefst 8,1 punten!
  • De Detectiescore: Op lange taken (ALFWorld) bereikte het "Keuze"-kanaal een detectiescore van z = 100. Dat is een ongelooflijk sterk signaal. Zelfs als de tussenpersoon 70% van de stappen verwijderde, bleef de score boven de detectielijn.
  • De Herschrijftest: Wanneer een superintelligente AI (de "LLM rewriter") probeerde het dagboek te herschrijven om het watermerk te verbergen, bleef de score van het "Aantal"-kanaal exact gelijk. De score bewoog niet. Ondertussen daaldeden de scores van oude watermerken (zoals de "Rood-Groen" methode) naar bijna nul.
  • De Kosten van Bedrog: Om beide kanalen tegelijk uit te schakelen, zou de aanvaller een constante fractie van de acties moeten corrumperen. Het artikel bewijst wiskundig dat je niet simpelweg kunt "bewerken" om er vanaf te komen; je moet de dienst echt kapotmaken.

Wat TRACE Uitsluit

De paper is zeer duidelijk over wat het niet doet:

  • Het is geen magisch schild tegen een tussenpersoon die simpelweg de robot vervangt door een compleet ander model. Als ze stoppen met het gebruiken van jouw robot, is er geen watermerk meer te vinden.
  • Het is geen oplossing voor korte taken als je slechts één voorbeeld hebt. Voor ToolBench (korte taken) heb je ongeveer 10 trajecten nodig om een sterk signaal te krijgen, omdat er in één enkele korte taak niet genoeg "beslissingsentropie" (willekeur) is.
  • Het vertrouwt niet op de eerlijkheid van de tussenpersoon. Het systeem is specif

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →