← Nieuwste papers
🤖 machine learning

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences

Dit artikel introduceert FLIPS, een nieuwe methode voor fingerprinting op instantieniveau die gebruikmaakt van de bias in pseudo-willekeurige sequenties om verschillende configuraties van hetzelfde Large Language Model nauwkeurig te onderscheiden, waardoor een kritiek gat in AI-regulering wordt gedicht door de identificatie van specifieke uitgerolde gedragingen mogelijk te maken in plaats van enkel de herkomst van het model.

Oorspronkelijke auteurs: Gurvan Richardeau, Gohar Dashyan, Erwan Le Merrer, Gilles Tredan

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Gurvan Richardeau, Gohar Dashyan, Erwan Le Merrer, Gilles Tredan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Het is Niet Alleen de Motor, Maar Ook de Bestuurder

Stel je voor dat je een zeer krachtige auto hebt (een Large Language Model, of LLM). Normaal gesproken, wanneer de politie of toezichthouders een auto willen identificeren, kijken ze naar de motor (de gewichten van het model). Als de motor hetzelfde is, gaan ze ervan uit dat het dezelfde auto is.

Maar dit paper betoogt dat dat niet genoeg is. Twee auto's met exact dezelfde motor kunnen heel verschillend rijden, afhankelijk van:

  • Wie er rijdt? (De systeemprompt/instructies).
  • Hoe snel ze rijden? (De temperatuurinstelling).
  • Welke brandstof ze gebruiken? (Kwantisering of fine-tuning).

Een auto kan veilig en beleefd zijn met de ene bestuurder, maar roekeloos en giftig met een andere. Huidige methoden om AI-modellen te identificeren zijn als het kijken naar alleen de motor; ze negeren de bestuurder en de instellingen. Dit paper introduceert een nieuwe methie genaamd FLIPS die werkt als een kentekenplaatlezer. Het identificeert niet alleen het automodel; het identificeert de specifieke instantie van die auto in zijn huidige configuratie.

Het Probleem: De "Robuustheid"-valstrik

Bestaande AI-fingerprinting tools werden gebouwd om intellectueel eigendom te beschermen (zoals het betrappen van iemand die de code van een model heeft gestolen). Om dit te doen, zijn ze ontworpen om "robuust" te zijn—wat betekent dat ze kleine veranderingen negeren. Ze willen zeggen: "Ja, dit is het Llama-3 model," zelfs als de instellingen zijn veranderd.

Het Dilemma van de Toezichthouder:
Toezichthouders (zoals de EU AI Act) geven niet om de originele code; ze geven om het gedrag. Als een bedrijf beweert dat hun AI "veilig" is, maar ze passen de instellingen aan om het "onveilig" te maken, moet de toezichthouder die specifieke, gevaarlijke versie kunnen oppikken. Huidige tools zijn "blind" voor deze veranderingen omdat ze zijn ontworpen om deze juist te negeren.

De Oplossing: FLIPS (De "Willekeur"-test)

De auteurs hebben een tool ontwikkeld genaamd FLIPS (Fingerprinting LLMs via Pseudo-random Sequences). Zo werkt het, met een eenvoudige analogie:

De Analogie: De Muntworp-test
Stel je voor dat je een persoon vraagt om 100 keer een munt op te gooien en de resultaten op te schrijven (Kop/Munt).

  • Een perfect willekeurige muntworp produceert een rommelig, onvoorspelbaar patroon.
  • Een mens die probeert "nep-willekeur" te simuleren, valt vaak in subtiele patronen (bijv. ze vermijden het drie keer achter elkaar gooien van "Kop" omdat dat te onwaarschijnlijk voelt).

Hoe FLIPS werkt:

  1. De Vraag: De toezichthouder vraagt de AI om een reeks willekeurige binaire tokens te genereren (zoals "0" en "1" of "auto" en "zon").
  2. De Fout: AI-modellen zijn slecht in het zijn van echt willekeurig. Ze hebben verborgen "biases" of "gewoontes" gebaseerd op hun specifieke gewichten, instellingen en instructies.
  3. De Vingerafdruk: FLIPS haalt de output van de AI door een batterij van statistische tests (de NIST-suite, wat een rigoureuze wiskundige examen is voor willekeur).
  4. Het Resultaat: Hoewel de AI probeert willekeurig te zijn, laat het een unieke "vingerafdruk" van zijn fouten achter.
    • Voorbeeld: Model A gooit misschien per ongeluk te vaak "0" na een "1". Model B vermijdt misschien "000".
    • FLIPS meet deze minuscule, specifieke biases om precies te identificeren welke versie van de AI aan het praten is.

De Resultaten: De "Slechte" Versies Betrappen

De onderzoekers testten dit op 237 verschillende versies van 25 verschillende AI-modellen. Ze veranderden de temperatuur, de instructies en verwijderden zelfs veiligheidsfilters (een proces genaamd "abliteration").

  • Oude Methode (LLMmap): Wanneer gevraagd werd om tussen een veilig model en een "gehackte" onveilige versie van hetzelfde model te onderscheiden, faalde de oude methode jammerlijk. Het dacht dat ze dezelfde auto waren (95% van de tijd zat het ernaast). Het was te "robuust."
  • FLIPS: Het identificeerde de specifieke versie correct in 96% van de gevallen in een gesloten test (waar het alle opties kende) en in 90% van de gevallen in een open test (waar het moest zeggen "ik ken deze niet" als het niet in de database stond).

Belangrijkste bevinding: FLIPS kan het verschil zien tussen een veilige AI en een gevaarlijke, aangepaste versie van diezelfde AI met slechts een klein aantal vragen (zo minstens 8 queries).

Waarom dit Belangrijk is voor Regulering

De auteurs vergelijken FLIPS met een kentekenplaat.

  • Kentekenplaten: Ze zijn gemakkelijk te vervalsen, maar ze zijn de standaard manier waarop de politie een specifieke auto identificeert op de weg. Ze hoeven niet onder de motorkap te kijken om te weten of een auto te hard rijdt of de verkeerde kant op rijdt.
  • FLIPS: Het stelt toezichthouders in staat om de "kentekenplaat" van een AI te controleren zonder dat ze toegang nodig hebben tot de private code (gewichten) van het bedrijf.

Als een bedrijf zegt: "Wij draaien de veilige versie van onze AI," kan een toezichthouder FLIPS gebruiken om een paar willekeurige vragen te stellen. Als de antwoorden de "onveilige vingerafdruk" laten zien, weet de toezichthouder dat het bedrijf liegt of de instellingen heeft gewijzigd, zonder dat hij de interne code hoeft te zien.

Samenvatting

  • Het Probleem: Huidige AI-identificatietools negeren instellingen die het gedrag van een AI veranderen.
  • De Oplossing: FLIPS gebruikt het onvermogen van de AI om perfecte willekeur te genereren om een unieke "vingerafdruk" te creëren voor elke specifieke configuratie.
  • Het Voordeel: Toezichthouders kunnen snel verifiëren of een ingezette AI de veilige, goedgekeurde versie is of een gevaarlijke, aangepaste versie, met behulp van zeer weinig vragen en zonder toegang tot private code.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →