← Nieuwste papers
💬 NLP

PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction

Dit artikel introduceert PTP, een black-box-methode voor bijna exacte prompt-reconstructie die vanaf de basis een expliciet invers taalmodel traint via voorspelling van het vorige token op synthetische gegevens gegenereerd door het doel-LLM, waarmee het eerdere semantische reconstructiemethoden overtreft in nauwkeurigheid en overdraagbaarheid.

Oorspronkelijke auteurs: Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha, Amit Sethi

Gepubliceerd 2026-08-03
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha, Amit Sethi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je voor een magische, alwetende robot staat die ervan houdt om verhalen te vertellen. Je geeft het een geheime beginzin, en het spuugt direct een lang, fascinerend verhaal uit. Zo werken moderne "Large Language Models" (LLM's): ze zijn als superintelligente autocomplete-engines die het volgende woord in een zin voorspellen, één voor één, om een reactie op te bouwen. Maar hier is het lastige deel: als je alleen het einde van het verhaal ziet (de reactie), kun je dan precies achterhalen wat het begin was (de prompt)? Het is alsoen te raden wat de eerste zet in een schaakspel was door alleen naar het uiteindelijke schaakmat te kijken. Meestal is dit bijna onmogelijk omdat veel verschillende beginzinnen tot dezelfde afsluiting kunnen leiden. Wetenschappers proberen dit "inversie"-puzzelstukje op te lossen om te begrijpen hoe deze AI-geesten werken, om ze te betrappen als ze geheimen onthullen, of om te zien of we ze kunnen misleiden. De meeste eerdere pogingen vereisten dat men in de hersenen van de robot keek (toegang tot de interne code) of gebruikmaakte van enorme hoeveelheden externe data om het startpunt te raden.

Maak nu kennis met de onderzoekers die besloten een andere truc te proberen. In plaats van te proberen de geest van de robot te lezen of te raden op basis van externe kennis, bouwden zij een "reverse robot" (omgekeerde robot). Ze leerden deze nieuwe robot om achteruit te denken. Terwijl de originele robot leert door te vragen: "Wat komt er nu?", leert de nieuwe robot door te vragen: "Wat kwam er eerder?". Ze hadden niet de geheime code van de originele robot nodig of een gigantische bibliotheek aan externe boeken. In plaats daarvan speelden ze een spel met de originele robot: ze voerden het willekeurige beginwoorden en namen de verhalen op die het vertelde op. Daarna voerden ze die verhalen in de juiste volgorde in hun nieuwe "reverse robot", waarbij ze de verhalen achterstevoren invoerden, om de woorden te voorspellen die er vóór moesten zijn gekomen. Het is alsof je een film achterstevoren afspeelt en probeert te voorspellen welke scène er net gebeurde. Het resultaat? Deze nieuwe methode, genaamd Previous-Token Prediction (PTP), kan de oorspronkelijke beginzin met verrassende nauwkeurigheid reconstrueren, zelfs wanneer de robot een "black box" is (wat betekent dat we niet in de machine kunnen kijken). Het suggereert dat we, door simpelweg de richting van hoe we de AI onderwijzen om te draaien, een krachtige manier kunnen ontsluiten om de gedachten ervan terug te spoelen.

De Magie van het Terugspoelen van de Tijd

Beschouw een Large Language Model (LLM) als een zeer praatgrage vriend die heel goed is in het afmaken van je zinnen. Als je zegt: "Er was eens een...", zegt hij misschien: "draak". Als je zegt: "De lucht is...", zegt hij misschien: "blauw". Deze vriend werkt door te kijken naar wat je net hebt gezegd en het volgende woord te raden. Dit wordt "Next-Token Prediction" genoemd. Dit is hoe ze verhalen schrijven, vragen beantwoorden en met ons chatten.

Maar wat als je alleen het antwoord van de vriend hebt en precies wilt weten wat je vroeg? Misschien heb je een geweldig verhaal gehoord en wil je weten wat de exacte vraag was die het startte, of misschien wil je zien of de vriend een geheime instructie verbergt. Dit is het "inversie"-probleem. Het is moeilijk omdat veel verschillende vragen tot hetzelfde antwoord kunnen leiden. Als je vriend zegt: "Ik hou van pizza", had je kunnen vragen: "Wat is je favoriete eten?", of "Wat vind je lekker eten op vrijdagen?", of zelfs "Vertel me over je dieet".

De Oude Manier vs. De Nieuwe Truk

Voordat dit artikel verscheen, probeerden wetenschappers dit op te lossen door ofwel:

  1. In de hersenen te gluren: Naar de interne wiskunde (logits) van de robot kijken om de vraag terug te ontwerpen. Dit is alsof je een puzzel probeert op te lossen terwijl je een röntgenbril draagt.
  2. Een gigantische referentiegids te gebruiken: Een aparte AI trainen op miljoenen vraag-antwoordparen van het internet om de vraag te raden. Dit is alsof je een detective inhuurt die elk boek in de bibliotheek heeft gelezen.

Het probleem met deze oude manieren is dat ze vaak speciale toegang vereisen (die je niet hebt bij een "black box"-model) of enorme hoeveelheden externe data. Ze hebben ook de neiging om een vraag te raden die dezelfde betekenis heeft, maar niet exact dezelfde woorden gebruikt.

De "Backwards Robot" Oplossing

De auteurs van dit artikel, werkend met modellen van IIT Bombay en Adobe Research, kwamen met een slimme, zelfvoorzienende oplossing. Ze hadden geen röntgenbril nodig of een bibliotheek. Ze hadden alleen de robot zelf nodig.

Zo hebben ze hun "Backwards Robot" gebouwd:

  1. De Opstelling: Ze namen de doelrobot (de robot die ze wilden inverteren) en speelden een spel met hem. Ze voerden hem elk enkel woord uit zijn vocabulaire als startpunt en lieten hem een kort verhaal genereren.
  2. De Twist: Ze namen die verhalen en draaiden ze om. Als de robot "The cat sat" schreef, maakten ze er "sat cat The" van.
  3. De Training: Ze trainden een gloednieuwe, kleine robot (een "inverse model") vanaf nul met behulp van deze omgekeerde verhalen. Deze nieuwe robot leerde een nieuwe vaardigheid: Previous-Token Prediction. In plaats van te voorspellen wat er volgt, leerde het te voorspellen wat er voorafging.
    • Analogie: Stel je voor dat je leert autorijden door alleen video's te kijken van een auto die achteruit rijdt. Uiteindelijk word je zo goed in achteruitrijden dat als je een geparkeerde auto ziet, je perfect het pad kunt voorspellen dat hij heeft afgelegd.
  4. De Fine-Tuning: Om ervoor te zorgen dat de robot als een mens sprak, gaven ze het een paar echte voorbeelden van vragen en antwoorden (uit een dataset genaamd ShareGPT) en leerden het deze ook om te draaien.

De Resultaten: De Tape Terugspoelen

Toen ze deze nieuwe methode testten, waren de resultaten indrukwekkend. Ze gebruikten een model genaamd Qwen3-0.6B en ontdekten dat hun "Backwards Robot" de oorspronkelijke prompt (de vraag) met hoge nauwkeurigheid kon reconstrueren.

  • Exact Match: Ongeveer 64,77% van de tijd was de gereconstrueerde prompt exact hetzelfde als de originele. Dit is een grote prestatie, omdat eerdere methoden vaak alleen de betekenis goed kregen, niet de exacte woorden.
  • Token F1: Ze scoorden 63,64, een maatstaf voor hoe goed de individuele woorden overeenkwamen.
  • Semantische Gelijkenis: Zelfs wanneer de woorden niet identiek waren, was de betekenis zeer dichtbij (Cosine Similarity van 86,13).

Het artikel liet ook zien dat deze "Backwards Robot" behoorlijk flexibel is. Zelfs als ze hem trainden op het type robot van één model (Qwen) en hem vroegen om de prompts voor een ander type robot te raden (zoals LLaMA of GPT-4o), werkte het nog steeds redelijk goed. Het was niet perfect op de exacte woorden (omdat verschillende robots verschillende woordenboeken gebruiken), maar het kreeg de betekenis goed. Dit suggereert dat de robot een algemene "logica" heeft geleerd over hoe je gedachten terug ontwerpt, en niet slechts een specifieke truc voor één model.

Waarom Dit Belangrijk Is

Het artikel betoogt dat deze aanpak beter is dan de oude manieren om een paar redenen:

  • Het is een "Black Box" Oplossing: Je hoeft de interne code of gewichten van de robot niet te zien. Je hoeft alleen maar met hem te praten.
  • Het is Zelfvoorzienend: Het heeft geen enorme externe database van vragen en antwoorden nodig. Het genereert zijn eigen trainingsdata door met de doelrobot te spelen.
  • Het is Getrouw: Omdat het leert van het exacte omgekeerde van het voorwaartse proces, kan het de exacte woorden reconstrueren, niet alleen de algemene gedachte.

De auteurs merken echter voorzichtig op dat dit geen toverstaf is die alles oplost. Als de robot die je probeert te inverteren een volledig ander pakket symbolen (vocabulaire) of een zeer andere hersenstructuur gebruikt, wordt de exacte woord-voor-woord reconstructie moeilijker. Ook kost het genereren van de trainingsdata veel vragen aan de robot, wat traag kan zijn.

Het Grote Plaatje

In eenvoudige bewoordingen laat dit artikel zien dat als je wilt weten wat een robot dacht voordat hij sprak, je hem niet hoeft open te breken of een detective hoeft in te huren. Je hoeft alleen maar een nieuwe robot te leren om achteruit te denken. Door het script om te draaien en een model te trainen om te voorspellen "wat eraan voorafging" in plaats van "wat er volgt", creëerden de auteurs een hulpmiddel waarmee de tape van AI-gesprekken met verrassende precisie kan worden teruggespoeld. Het is een speelse maar krachtige herinnering dat je soms, om de toekomst te begrijpen, gewoon naar het verleden in omgekeerde volgorde moet kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →