← Nieuwste papers
💻 computer science

DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models

Het artikel stelt DeMTS voor, een nieuw raamwerk voor hallucinatiedetectie voor Diffusion Large Language Models dat denoising-trajecten behandelt als multivariate tijdreeksen om volledige token-stap structurele informatie te behouden, waardoor het bestaande methoden overtreft door effectief complexe patronen zoals inconsistente convergentie en cross-token foutpropagatie te vangen.

Oorspronkelijke auteurs: Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

Gepubliceerd 2026-08-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie is een nieuwe generatie tekstgenererende machines opgekomen, die afwijkt van de traditionele methode van het schrijven van één woord na het andere in een strikte lijn. In plaats daarvan genereren deze modellen, bekend als diffusion large language models, tekst via een proces van iteratieve verfijning. Stel je een wazige afbeelding voor die langzaam scherp wordt; vergelijkbaar hiermee beginnen deze modellen met een rommelige, ruisachtige reeks woorden en poetsen deze stap voor stap op totdat er een coherente zin ontstaat. Hoewel deze aanpak unieke voordelen biedt in snelheid en flexibiliteit, deelt het een kritiek gebrek met zijn voorgangers: de neiging om te hallucineren. Dit is geen geval van de machine die droomt, maar eerder een falen van de feitencontrole, waarbij het model vloeiende, zelfverzekerd klinkende zinnen produceert die volledig onjuiste of ononderbouwde informatie bevatten. Het detecteren van deze fouten is moeilijk omdat de uiteindelijke output er vaak perfect uitziet, waardoor de fouten die tijdens de chaotische tussenstadia van creatie plaatsvonden, verborgen blijven.

Onderzoekers proberen deze fouten al lang te vangen door naar het uiteindelijke antwoord te kijken of door te controleren hoe onzeker het model op specifieke momenten was. Echter, een nieuwe studie suggereert dat deze methoden vaak de meest veelzeggende aanwijzingen missen. Het probleem is dat bestaande detectietools de neiging hebben de complexe geschiedenis van hoe het model de tekst creëerde af te vlakken. Ze kijken ofwel alleen naar de tijdlijn van het creatieproces of alleen naar de individuele woorden, waardoor ze de rijke, tweedimensionale kaart van hoe onzekerheid evolueerde over zowel de tijd als de specifiek gevormde woorden, effectief weggooien. Door deze data te comprimeren, verliezen ze het vermogen om te zien hoe een fout in één deel van de zin door kan werken naar de rest om deze te corrumperen, of hoe verschillende woorden niet tegelijkertijd kunnen slagen in het vastleggen van een zelfverzekerde waarheid.

Om dit op te lossen, heeft een team van wetenschappers een nieuw framework ontwikkeld genaamd DeMTS, dat het gehele creatieproces van een zin behandelt als een complex, meerlagig signaal in plaats van een eenvoudige lijst met stappen. In plaats van de interne signalen van het model in een enkele lijn te dwingen, organiseerden de onderzoekers de data om de relatie tussen elk woord en elk moment van het creatieproces te behouden. Ze realiseerden zich dat de ruwe posities van woorden in een zin niet stabiel genoeg zijn om betrouwbaar te volgen, aangezien dezelfde positie in verschillende zinnen verschillende betekenissen kan hebben. Om dit te oplossen, creëerden ze een systeem dat de ruisende, verschuivende signalen van het model groepeert in stabiele, consistente categorieën. Denk erbij aan het sorteren van een chaotische stapel gemengde puzzelstukjes in afzonderlijke, gelabelde dozen op basis van hun vorm en kleur, in plaats van te proberen ze te volgen op basis van hun oorspronkelijke, verwarrende volgorde.

Zodra deze stabiele groepen waren gevormd, pasten de onderzoekers een dynamische modelleringstechniek toe om te kijken hoe deze groepen over de tijd heen met elkaar interageerden en veranderden. Ze ontdekten dat hallucinaties een duidelijk vingerafdruk achterlaten in dit proces. In een waarheidsgetrouw antwoord hebben de verschillende delen van de zin de neiging om samen in een zelfverzekerde staat te komen. In een gehallucineerd antwoord vertoont het model echter vaak tekenen van "inconsistente convergentie", waarbij sommige woorden zeer zelfverzekerd worden terwijl andere wankel en onzeker blijven. Bov�elijk observeerden zij "cross-token fault propagation", waarbij een instabiel of onjuist woord ervoor zorgt dat naburige woorden afdrijven van de waarheid, wat een kettingreactie van fouten creëert die zich door de zin verspreidt. Door deze specifieke patronen van instabiliteit en interactie te volgen, kan het nieuwe systeem een leugen opsporen voordat deze zelfs volledig is uitgesproken.

De onderzoekers testten deze aanpak op twee verschillende large language models over drie verschillende vraag-antwoord-datasets, variërend van algemene kennis tot complexe redeneertaken. De resultaten toonden aan dat deze nieuwe methode de bestaande technieken aanzienlijk overtrof en foutieve informatie met een veel hogere nauwkeurigheid identificeerde. Cruciaal is dat het systeem efficiënt en robuust bleef, wat bewees dat het zijn bevindingen kon generaliseren naar nieuwe soorten vragen zonder dat het voor elk specifiek onderwerp opnieuw getraind hoefde te worden. De studie demonstreert dat door de volledige, tweedimensionale structuur van hoe deze modellen denken te respecteren — waarbij zowel de tijdlijn als de woordrelaties intact blijven — we veel betere waarborgen kunnen bouwen tegen de subtiele, zelfverzekerde fouten die moderne kunstmatige intelligentie teisteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →