Synchronized Logit Steering: Real-world Steganography
Dit artikel introduceert Synchronized Logit Steering (SLS), een deterministisch steganografisch schema voor grote taalmodellen dat covert, prompt-agnostische communicatie mogelijk maakt door een gedeelde logitverdeling af te leiden uit de gegenereerde output zelf, waarbij een hoge informatiedichtheid en statistische stealth worden bereikt zonder dat de zender en ontvanger de oorspronkelijke promptcontext hoeven te delen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de stille brom van een digitale conversatie is een nieuw soort geheime taal ontstaan, een die zich in het volle zicht verbergt binnen de woorden die door kunstmatige intelligentie worden gegenereerd. Dit veld, bekend als steganografie, is de oude kunst van het zo grondig verbergen van een boodschap dat het bestaan van de boodschap zelf wordt verborgen, waardoor alleen de schijn van gewone communicatie overblijft. In tegenstelling tot cryptografie, waarbij een boodschap wordt gecodeerd om deze onleesbaar te maken voor iedereen zonder sleutel, streeft steganografie ernaar de boodschap onzichtbaar te maken voor het oog, door deze in te bedden in tekst die er volkomen natuurlijk uitziet en klinkt. Grote taalmodellen, de krachtige computerprogramma's die essays schrijven, wiskundige problemen oplossen en gesprekken voeren, zijn een nieuw front geworden voor deze praktijk. Deze modellen halen niet simpelweg feiten op; ze voorspellen het volgende woord in een zin op basis van waarschijnlijkheden, waarbij ze kiezen uit een reeks waarschijnlijke opties. Deze inherente variabiliteit betekent dat het model bij bijna elke stap van het schrijven een keuze heeft tussen verschillende woorden die allemaal zin zouden maken. Onderzoekers vragen zich al lang af of deze keuzes gebruikt kunnen worden om verborgen informatie over te dragen zonder dat de lezer ooit weet dat het er is.
Jarenlang stuitten pogingen om berichten in deze door AI gegenereerde teksten te verbergen op een aanzienlijke hindernis: de noodzaak voor een gedeelde geheime context. Stel je twee mensen voor die proberen een gecodeerd bericht te sturen met behulp van een boek als sleutel; als zij niet exact dezelfde editie hebben, of als ze naar verschillende pagina's kijken, faalt de code. Op vergelijkbare wijze vereisten eerdere methoden voor het verbergen van gegevens in AI-tekst dat de zender en ontvanger exact dezelfde begininstructies, of prompt, deelden om dezelfde lijst van waarschijnlijke woorden te berekenen. In de echte wereld, waar AI-systemen vaak privédata ophalen of gebruikmaken van verborgen interne instructies die van moment tot moment veranderen, maakte deze vereiste de techniek fragiel en onpraktisch. Als de zender en ontvanger niet met dezelfde context begonnen, zou de verborgen boodschap verloren gaan of corrupt raken. Een team van onderzoekers bij Algoverse AI heeft nu een oplossing ontwikkeld die deze afhankelijkheid volledig wegneemt, waardoor twee partijen verborgen berichten kunnen uitwisselen, zelfs als ze nooit hetzelfde startpunt zien.
De onderzoekers noemen hun methode Synchronized Logit Steering. In plaats van te vertrouwen op een gedeelde startprompt, creëert het systeem een gedeeld begrip op basis van de reeds geschreven tekst. Het proces begint met een standaard uitwisseling van woorden. Zodra een klein, overeengekomen aantal woorden—specifiek veertig tokens, wat de basisunits zijn van de tekst die het model verwerkt—is gegenereerd, gebruiken de zender en ontvanger die bestaande tekst als een nieuw, gedeeld referentiepunt. Deze "proxy prompt" fungeert als een gemeenschappelijke grond. Omdat beide partijen dezelfde woorden kunnen zien die eerder zijn verschenen, kunnen ze onafhankelijk van elkaar exact dezelfde lijst van de volgende waarschijnlijke woorden berekenen, zelfs als hun oorspronkelijke begininstructies volledig verschillend waren. Deze synchronisatie stelt hen in staat om een verborgen code af te spreken zonder ooit de geheime initiële context te hoeven delen.
Om een bericht te verzenden, kijkt de zender naar de lijst van waarschijnlijke volgende woorden die door dit gedeelde referentiepunt worden gegenereerd. Vervolgens selecteert de zender een specifiek woord, niet alleen omdat het in de zin past, maar omdat de positie op die lijst overeenkomt met een stukje van de verborgen data. Stel dat de verborgen boodschap het getal vijf vereist, dan kiest de zender het vijfde meest waarschijnlijke woord uit de lijst. De ontvanger, die hetzelfde woord ziet en dezelfde lijst met waarschijnlijkheden kent, kan simpelweg de positie van dat woord tellen om het getal vijf te achterhalen. Dit gebeurt herhaaldelijk, waarbij het systeem de "entropie", of de mate van onzekerheid, in de tekst controleert om ervoor te zorgen dat de keuze van woorden natuurlijk blijft. Het systeem verbergt alleen data wanneer het model onzeker genoeg is zodat het kiezen van een minder gebruikelijk woord niet vreemd of robotachtig klinkt.
Het team testte deze methode bij een breed scala aan taken, waaronder algemene gesprekken, complexe wiskundige redeneringen en software engineering-problemen. Ze ontdekten dat zodra de initiële veertig woorden waren vastgesteld, het statistische verschil tussen de met een verborgen boodschap gegenereerde tekst en normale tekst verwaarloosbaar werd. In technische termen daalde de divergentie tussen de twee soorten tekst onder een kritieke drempelwaarde, wat betekent dat de verborgen boodschappen statistisch ononderscheidbaar waren van gewoon schrijven. De onderzoekers ontdekten ook dat ze door dit proces in uitbarstingen te herhalen, de hoeveelheid verborgen informatie aanzienlijk konden vergroten. Hun meest effectieve configuratie, die ze een "periodic burst" noemen, stelde hen in staat om ongeveer tien keer meer data te verbergen dan eerdere pogingen met een enkele boodschap, waarbij een dichtheid van 0,20 bits per token werd bereikt. Dit betekent dat voor elk woord dat de AI schreef, een klein fractie van een bit aan geheime informatie succesvol werd ingebed zonder de flow van het gesprek te veranderen.
Ondanks het succes van de methode merkten de onderzoekers een afruil op wanneer de verborgen berichten in complexe taken werden gepakt. Wanneer het systeem probeerde data te verbergen binnen wiskundige redeneringen of softwarecode, daalde de nauwkeurigheid van de antwoorden van de AI lichtjes. Dit suggereert dat het dwingen van het model om specifieke woorden te kiezen om een boodschap te dragen, het soms kan wegsturen van het smalle pad van logica dat vereist is voor moeilijke problemen. De onderzoekers stellen voor dat het systeem in real-world toepassingen slim genoeg zou moeten zijn om te herkennen wanneer het in een technische modus is en dan te stoppen met het verbergen van berichten, om de techniek te reserveren voor meer conversationele of beschrijvende delen van de tekst. Deze adaptieve aanpak zou de kwaliteit van de AI-redenering behouden terwijl het nog steeds covert communiceren in veiligere contexten mogelijk maakt.
De implicaties van dit werk zijn tweeledig. Enerzijds demonstreert het een robuuste manier om AI-content te watermerken of de oorsprong van tekst te verifiëren zonder een gedeelde geheime sleutel nodig te hebben, wat nuttig kan zijn voor het beschermen van intellectueel eigendom. Anderzijds belicht het een kwetsbaarheid in hoe AI-systemen communiceren, waarbij wordt aangetoond dat agenten potentieel kunnen coördineren of data kunnen exfiltreren zonder menselijk toezicht. De onderzoekers benadrukken dat het begrijpen van hoe deze verborgen kanalen worden gebouwd, de eerste stap is naar het bouwen van verdedigingen ertegen. Ze suggereren dat toekomstige beveiligingssystemen kunnen zoeken naar ongebruikelijke patronen in woordkeuzes of de statistische signaturen die deze synchronisatie mogelijk maken, kunnen verstoren. Uiteindelijk bevestigt de studie dat het vermogen om berichten in AI-tekst te verbergen niet slechts een theoretische mogelijkheid is, maar een praktische realiteit, die rustig opereert binnen de natuurlijke flow van taal, wachtend om ontdekt te worden door degenen die weten waar ze moeten kijken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.