← Nieuwste papers
💬 NLP

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

Het artikel stelt Token-Level Off-Policy Labeling (TOPL) voor, een trainingsparadigma dat post-training herformuleert als een taak voor het voorspellen van de correctheid op tokenniveau om sterke generalisatie buiten de distributie en interpreteerbare modelupdates te bereiken bij getrouwe generatietaken zoals samenvatting en machinevertaling.

Oorspronkelijke auteurs: Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia

Gepubliceerd 2026-07-21
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Hallucinatiejacht: AI leren om de eigen fouten te herkennen

Stel je voor dat je een zeer slimme, zeer snelle robot probeert te leren hoe hij een verhaal moet schrijven. Je geeft hem een boek, en hij hoort een samenvatting te schrijven. Maar soms wordt de robot een beetje té creatief. Hij kan bijvoorbeeld zeggen dat een beroemde wetenschapper in een andere stad of op een verkeerde dag is geboren. Wij noemen deze fouten "hallucinaties". In de wereld van Kunstmatige Intelligentie (AI) is dit een groot probleem. Als de robot dingen verzint, kunnen we hem niet vertrouwen bij het helpen met echte taken, zoals het vertalen van talen of het samenvatten van nieuws.

Om dit op te lossen, hebben wetenschappers verschillende trainingsmethoden geprobeerd. Eén populaire manier is "Reinforcement Learning", wat lijkt op een videogame waarin de robot punten krijgt voor goede antwoorden en punten verliest voor slechte antwoorden. Dit is echter vaak traag en ingewikkeld omdat de robot miljoenen keren moet oefenen om te leren. Een andere manier is "Off-Policy" leren, wat lijkt op het bestuderen van het antwoordensleutel van een leraar in plaats van zelf de toets te maken. Het is sneller, maar de robot raakt soms nog steeds in de war wanneer hij een vraag ziet die hij nog niet eerder heeft gezien. De grote vraag die onderzoekers stellen is: Hoe kunnen we deze snelle, eenvoudige methoden beter laten werken, vooral wanneer de robot geconfronteerd wordt met nieuwe, lastige situaties?

De Nieuwe Strategie: De "Token Detective"

Dit artikel introduceert een nieuwe trainingsmethode genaamd Token-Level Off-Policy Labeling, of kortweg TOPL. Denk aan een "token" als een enkel woord of een klein stukje van een woord in een zin. Normaal gesproken trainen we AI door het te vragen het volgende woord in een zin te voorspellen, zoals een spelletje "vul het gat in". Maar TOPL verandert het spel volledig. In plaats van de robot te vragen het volgende woord te schrijven, verandert TOPL de robot in een detective.

Stel je voor dat je een samenvatting hebt geschreven door de robot. Sommige delen zijn waar (zoals "Marie Curie werd geboren in Polen"), en sommige delen zijn verzonnen leugens (zo als "Marie Curie werd geboren in Slowakije"). TOPL traint de robot om naar elk afzonderlijk woord in die samenvatting te kijken en te vragen: "Is dit woord waar, of is dit woord een leugen?" Het geeft een simpel "Ja" of "Nee" label aan elk woord. Door dit te doen, leert de robot het verschil te zien tussen een feitelijke token en een gehallucineerde token, in plaats van alleen maar te proberen het volgende woord in een reeks te raden.

Hoe het werkt: De magie van "Sturen"

De onderzoekers gebruikten een speciaal hulpmiddel genaamd LoRA (Low-Rank Adaptation) om de robot deze detectivevaardigheid te leren. Je kunt LoRA zien als een set kleine, afneembare zijwieltjes of een "stuurset" die je op het brein van de robot klikt.

Hier is het slimme deel: De onderzoekers ontdekten dat het brein van de robot op deze manier vanzelf in twee delen splitst wanneer hij dit leert.

  1. De Detector (LoRA-A): Dit deel werkt als een radar. Het scant de verborgen gedachten van de robot en bepaalt: "Is dit specifieke woord feitelijk juist?" Het scheidt de "goede" woorden van de "slechte" woorden.
  2. Het Stuur (LoRA-B): Zodra de detector een "slecht" woord opspoort, vertelt het het stuur om de gedachten van de robot in een andere richting te duwen. Het is als een GPS die zegt: "Je rijdt richting een leugen; sla linksaf richting de waarheid."

Het artikel suggereert dat TOPL zo goed werkt omdat het niet alleen de juiste antwoorden uit het hoofd leert; het leert de eigen gedachten weg te sturen van leugens en naar feiten, zelfs wanneer het nieuwe onderwerpen tegenkomt die het nog niet eerder heeft gezien.

Wat ze vonden: Beter dan de rest

De onderzoekers testten deze nieuwe "Detective"-methode op 11 verschillende datasets met betrekking tot documentsamenvatting. Ze vergeleken TOPL met andere populaire methoden, waaronder standaard training (SFT), sequence-level preference optimization (DPO) en andere token-level methoden.

  • Het resultaat: TOPL presteerde consequent beter dan alle andere methoden, vooral wanneer de robot werd getest op nieuwe, onbekende data (out-of-distribution). Het was het meest accuraat in het feitelijk houden van de samenvattingen.
  • De verrassing: De onderzoekers probeerden ook een versie van hun methode die naar de hele zin keek in plaats van naar individuele woorden (genoemd SOPL). Dit werkte minder goed. Dit bewijst dat de "detective"-aanpak nodig heeft om naar de kleine, individuele stukjes (tokens) te kijken om effectief te zijn. Kijken naar het grote plaatje is niet genoeg; je moet de leugens woord voor woord vangen.
  • De transfer: Ze probeerden dit ook op machinevertaling (het veranderen van de ene taal naar de andere). TOPL werkte daar ook geweldig, wat suggereert dat deze "detective"-vaardigheid nuttig is voor veel verschillende schrijftaken, niet alleen voor samenvattingen.

Wat ze uitsloten

Het artikel wijst er zorgvuldig op wat niet werkt.

  • Willekeurig raden: Als je de robot willekeurige labels geeft (door te zeggen dat leugens waar zijn en waarheden leugens zijn), raakt de robot in de war en presteert hij slecht. Dit laat zien dat de robot daadwerkelijk het verschil moet leren tussen waarheid en leugen, en niet alleen een patroon moet memoriseren.
  • Gewoon "Token-Level" is niet genoeg: Simpelweg naar woorden kijken één voor één is niet de magische saus. Andere methoden die ook woord voor woord kijken, presteerden niet zo goed als TOPL. De specifieke manier waarop TOPL de robot traint om het onderscheid te maken tussen waarheid en leugen, is wat het verschil maakt.
  • De "Finale" lagen: De onderzoekers ontdekten dat als je de zijwieltjes (LoRA) op de allerlaatste lagen van het brein van de robot plaatst, dit de boel juist verslechtert. De beste resultaten kwamen voort uit het trainen van de "middelste" lagen. Het lijkt erop dat de middelste lagen de plek zijn waar de robot het zware werk doet van het begrijpen van feiten, terwijl de laatste lagen alleen bedoeld zijn voor het uitspugen van de laatste woorden.

De kern van het verhaal

De auteurs suggereren dat TOPL een krachtige nieuwe manier is om AI eerlijker te maken. Door het model te trainen om als een criticus te fungeren die elk afzonderlijk woord beoordeelt op waarachtigheid, en vervolgens dat oordeel te gebruiken om het denken van het model te "sturen", creëerden ze een systeem dat veel moeilijker te misleiden is. Hoewel ze het probleem van AI-hallucinaties nog niet definitief hebben "opgelost", suggereren hun experimenten sterk dat deze "token-level detective"-aanpak een grote stap voorwaarts is, die een eenvoudigere en effectievere manier biedt om AI aan de feiten te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →