← Nieuwste papers
💻 computer science

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

Dit artikel introduceert een uniforme benchmark voor het detecteren van hallucinaties op span-niveau over diverse gestructureerde inputs zoals code en tool-outputs, waarbij wordt aangetoond dat een gefinetuned Qwen3.5-2B-model bestaande detectoren en zero-shot judges op deze complexe domeinen significant overtreft, terwijl het concurrerend blijft op natuurlijke taal RAG-benchmarks.

Oorspronkelijke auteurs: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

Gepubliceerd 2026-07-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, snel pratende assistent inhuurt om een rapport voor je te schrijven. Je geeft ze een stapel referentieboeken (de "context") en een specifieke vraag. Ze typen razendsnel een antwoord uit.

Het probleem? Soms worden zelfs de slimste assistenten een beetje creatief. Ze verzinnen een feit, halen een getal door elkaar, of citeren een pagina die niet in je boeken staat. Dit wordt een hallucinatie genoemd.

Al een tijdje bouwen onderzoekers "factcheckers" om deze fouten te betrappen, maar die werkten vooral wanneer de assistent schreef over normale onderwerpen zoals geschiedenis of wetenschap met gewone tekst.

Dit artikel introduceert een nieuwe, veel moeilijkere factchecker die ontworpen is voor de moderne wereld, waarin assistenten ook computercode schrijven, logs van softwaretools samenvatten en gestructureerde documenten lezen zoals tabellen en handleidingen.

Hier is een uitsplitsing van wat ze hebben gedaan, gebruikmakend van alledaagse analogieën:

1. Het Probleem: De "Code" en "Log" Blinde Vlek

Stel je voor dat je assistent een monteur is.

  • Oude Factcheckers: Goed in controleren of de monteur zegt: "De auto is rood" terwijl de auto eigenlijk blauw is.
  • De Nieuwe Realiteit: De monteur schrijft nu een complex reparatiehandboek (code) of leest een digitaal diagnose-scherm (tool output). Als de monteur één verkeerd commando schrijft zoals turn_off_engine in plaats van turn_on_engine, kan de hele auto kapotgaan. Of als ze een onderdeelnummer opgeven dat niet bestaat, mislukt de bestelling.
  • De Kloof: Bestaande factcheckers waren als een mens die een roman leest; ze wisten niet hoe ze een enkele foutieve regel in een computerprogramma of een specifieke fout in een softwarelog moesten herkennen. Ze konden het verschil niet zien tussen een echte technische term en een verzonnen term.

2. De Oplossing: Een "Zoek de Verschillen"-spel

De auteurs bouwden een enorme nieuwe trainingsgrond (een benchmark) om computers te leren hoe ze deze gespecialiseerde factcheckers kunnen zijn.

  • Hoe ze de data maakten: Ze begonnen met perfecte, correcte antwoorden (zoals een perfect reparatiehandboek). Vervolgens gebruikten ze een "hallucinatie-injector" (denk aan een ondeugende redacteur) om kleine, gelokaliseerde leugens erin te smokkelen.
    • Voorbeeld: Ze veranderden een echte functienaam set_device in een nepnaam set_active_device.
    • Ze zeiden niet alleen "Dit antwoord is fout." Ze markeerden de exacte tekens waar de leugen plaatsvond.
  • De Variëteit: Ze creëerden meer dan 74.000 voorbeelden die het volgende beslaan:
    • Code: Echte GitHub software-fixes.
    • Tool Output: Logs van softwaretools (zoals foutmeldingen of zoekresultaten).
    • Gestructureerde Docs: Onderzoekspapers, README-bestanden en Wikipedia-pagina's met tabellen en lijsten.
    • Normale Tekst: Standaard vragen en antwoorden (om er zeker van te zijn dat ze niet vergaten hoe ze normale tekst moeten controleren).

3. De Nieuwe Detective: "LettuceDetect"

Ze trainden een nieuw AI-model (een 2-miljard parameter versie van een model genaamd Qwen) om de detective te spelen.

  • De Taak: De detective kijkt naar de Aanvraag (Request), de Referentieboeken en het Antwoord van de assistent. Het moet met een vinger wijzen naar de exacte leugen en zeggen: "Dit specifieke woord is verzonnen," of "Dit nummer is fout."
  • De Resultaten:
    • Op Code en Tools: De nieuwe detective is een superheld. Het betrapte 60% van de leugens in code en tool logs.
    • De Competitie: De oude "off-the-shelf" factcheckers (zoals LettuceDetect-large) en zelfs gigantische, slimme AI-rechters (Zero-shot LLMs) betrapten slechts ongeveer 17% tot 22% van de leugens in code. Ze waren in feiling essentieel blind voor technische fouten.
    • Op Normale Tekst: De nieuwe detective is nog steeds erg goed in het controleren van normale tekst (scoort vergelijkbaar met de beste bestaande systemen), wat bewijst dat hij zijn algemene kennis niet is verloren bij het leren lezen van code.

4. Waarom "Span-Level" Belangrijk Is

Het artikel benadrukt dat ze niet alleen zeggen "Verwerp dit antwoord." Ze doen aan Span-Level Detectie.

  • Analogie: Stel je voor dat een student een essay van 10 pagina's schrijft. Eén zin is een leugen.
    • Oude Manier: "Faal het hele essay." (Te streng, de andere 9 pagina's kunnen perfect zijn).
    • Nieuwe Manier: "Markeer de ene zin die een leugen is." (Precies en behulpzaam).
  • In code is dit cruciaal. Als een programma 100 regels heeft en slechts één regel is fout, wil je niet het hele programma weggooien; je wilt alleen die ene regel repareren.

Samenvatting

Dit artikel presenteert een nieuwe, verenigde "waarheidsdetector" die de rommelige, technische realiteit van moderne AI-assistenten kan aan. Het gaat verder dan alleen het controleren van eenvoudige tekst om kleine, gevaarlijke fouten in code, softwarelogs en gestructureerde documenten op te sporen.

Hun nieuwe model, LettuceDetect-Qwen-2B, is aanzienlijk beter in het vinden van deze technische leugens dan eerdere tools, vooral wanneer de assistent code schrijft of softwarelogs leest, terwijl het tegelijkert drukt een top-tier factchecker blijft voor normale taal. Ze hebben al hun data en modellen vrijgegeven zodat anderen dit "zoek de verschillen"-spel kunnen gebruiken om betere, betrouwbaardere AI-systemen te bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →