Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs
Dit artikel introduceert een schaalbare "needle-in-a-haystack"-benchmark om long-context LLM's te evalueren, waarbij wordt onthuld dat de prestaties aanzienlijk worden belemmerd door "Distributional Collapse" wanneer bewijs verspreid is en een "Safety Tax" waarbij anti-hallucinatie prompts modellen ertoe brengen om geldige informatie overmatig conservatief af te wijzen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technisch Samenvatting: Niet alle naalden worden gevonden
Probleemstelling
Terwijl Large Language Models (LLM's) overgaan naar het gebruik van enorme contextvensters (tot 1 miljoen tokens) als werkgeheugen voor autonome agenten, blijft hun betrouwbaarheid in realistische scenario's onbewezen. Huidige evaluatiemethoden, primair de enkelvoudige feit "Needle-in-a-Haystack" (NIAH) test, falen om de complexiteit van realwerkelijke bewijsvoering te vatten, die vaak verspreid is in plaats van aaneengesloten. Bovendien vertrouwen productieomgevingen steeds vaker op strikte anti-hallucinatie (AH) prompts (bijv. "Verzin er niets bij") om trouw te garanderen, maar de afruil tussen verminderde fabricage en de onderdrukking van valide, inferentie-rijke responsen is slecht begrepen. Dit artikel adresseert de kloof in het begrip van hoe fact distributie, contextlengte en veiligheidsbeperkingen interageren om retrieval-fouten en redeneerinstorting te veroorzaken in long-context LLM's.
Methodologie
De auteurs introduceren een model-agnostisch, uitgebreid benchmarking-framework dat ontworpen is om retrieval en redeneren onder realistische condities te testen.
- Corpus Constructie: Om "parametrische geheugenlekken" te elimineren (waarbij modellen antwoorden op basis van vooraf getrainde kennis in plaats van context), maakt de studie gebruik van La Comédie Humaine van Honoré de Balzac. Dit continue fictieve universum maakt het mogelijk om synthetische, verhaal-congruente feiten ("naalden") te injecteren die het model uitsluitend uit de verstrekte context moet ophalen. Een stuksgewijze recursieve context-contractiemethode werd gebruikt om variabele contextlengtes te genereren terwijl de narratieve coherentie behouden bleef.
- Experimenteel Ontwerp: Het framework evalueert vier dimensies: effectieve contextlengte, feit-distributie, hallucinatiegedrag onder beperkingen, en vergelijkbare modelprestaties.
- Protocol A (Uniforme Sweep): Een bivariabele sweep die contextlengte (10%–100% van maximale capaciteit) en feit-diepte (10%–100%) varieert om faalfronten in kaart te brengen.
- Protocol B (Probabilistische Distributie): De context wordt vastgezet op 100% capaciteit terwijl tien verschillende feit-zinnen worden geïnjecteerd volgens negen statistische distributies (bijv. Uniform, Normaal, Lorentziaans, Arcsine) om realistische informatieverspreiding te simuleren.
- Prompting Strategieën: Twee condities worden getest:
- Standaard Prompt: Vraagt om het meest logische antwoord of inferentie.
- Anti-Hallucinatie (AH) Prompt: Instrueert expliciet het model om te weigeren te antwoorden als informatie niet aanwezig is ("Verzin er niets bij").
- Evaluatie Metrieken: De studie scheidt prestaties in drie afzonderlijke capaciteiten:
- Letterlijke Extractie: Letterlijke reproductie van expliciete feiten.
- Logische Inferentie: Het afleiden van conclusies ondersteund door meerdere feiten (niet-abductief redeneren).
- Trouw (Faithfulness): Het vermogen om fabricages te vermijden.
- Geëvalueerde Modellen: Vier productieschaal modellen werden getest: Gemini-2.5-flash (1M context), ChatGPT-5-mini (272k), Claude-4.5-haiku (~175k), en Deepseek-v3.2-chat (128k).
Belangrijkste Bijdragen
- Identificatie van "Distributional Collapse": Het artikel definieert een systemische faalmodus waarbij de modelprestaties significant degraderen, niet omdat informatie ontbreekt, maar omdat bewijs verspreid is over de context. Dit is onderscheidend van standaard positionele bias (bijv. "lost-in-the-middle"), omdat het zelfs voorkomt wanneer feiten aan de randen zijn geplaatst als ze op een manier statistisch geclusterd zijn die de aandachtmechanismen van het model overweldigt.
- Kwantificering van de "Safety Tax": De auteurs formaliseren de "Safety Tax" als de meetbare degradatie in accuratesse (specifiek recall en inferentie) veroorzaakt door over-conservatieve weigeringsmechanismen. Ze demonstreren dat AH-prompts kunnen leiden tot het afwijzen van valide, op bewijs gebaseerde antwoorden, met name wanneer feiten diep begraven of verspreid zijn.
- Uitgebreid Benchmark Framework: De studie biedt een schaalbaar, model-agnostisch framework dat verder gaat dan enkelvoudige feit-extractie om logische inferentie en trouw te evalueren onder probabilistische feit-distributies.
Resultaten
- Schaalbaarheid en Stabiliteit: Gemini-2.5-flash en Deepseek-v3.2-chat vertoonden opmerkelijke stabiliteit, waarbij ze bijna perfecte accuratesse behielden over hun volledige contextbereiken (tot 1M tokens) en een hoge ruimtelijke invariantie toonden ten opzichte van feit-distributie.
- Prestatie-kliffen: ChatGPT-5-mini en Claude-4.5-haiku vertoonden significante fragiliteit. ChatGPT-5-mini liet een scherpe prestatiedaling zien voorbij 100k tokens en een unieke "prestatie-klif" bij de 50% dieptemarkering. Claude-4.5-haiku leed onder een "U-vormige" degradatie, waarbij logische inferentie daalde naar bijna 50% in middelste contextintervallen.
- Impact van de Safety Tax: Onder AH-prompts daalde de letterlijke extractie-accuratesse van ChatGPT-5-mini van 90,3% (geaggregeerd) naar 72,0% bij maximale capaciteit. Het model verviel frequent in weigeringsresponsen wanneer naalden diep begraven waren, wat visueel werd weergegeven als een "rode zone" van systematisch falen.
- Distributional Collapse: Wanneer feiten werden verdeeld volgens centrale clustering-distributies (bijv. Normaal, Lorentziaans), stortten de extractie- en inferentiescores van ChatGPT-5-mini naar 0% onder AH-prompts. Statistische significantietoetsing (Fisher's Exact Test, ) bevestigde dat deze instorting een structurele kwetsbaarheid is en geen datasetruis. In contrast hiermee behielden Gemini en Deepseek een hoge robuustheid, ongeacht de distributie.
- Positionele vs. Distributionele Bias: De studie weerlegt de verwarring tussen distributionele instorting en positionele bias. Modellen faalden zelfs wanneer feiten aan de uiterste randen waren geplaatst (Arcsine-distributie) als de cognitieve belasting van het volgen van verspreide feiten hoog was, wat bewijst dat het synthetiseren van verspreid bewijs een onafhankelijke systemische fout is.
Betekenis en Claims
Het artikel claimt dat de nominale contextwindow-grootte een slechte proxy is voor effectief informatiegebruik. De bevindingen benadrukken twee kritieke risico's voor langdurige agentische workflows:
- Stille Fouten: "Distributional Collapse" fungeert als een stille faalmodus waarbij agenten effectief "vergeten" wat zij eerder hebben waargenomen, simpelweg omdat bewijs verspreid is, wat leidt tot foutieve beslissingen in kritieke domeinen zoals juridische discovery of medische analyse.
- Adversariële Kwetsbaarheid: De geïdentificeerde faalmodi suggereren een potentieel voor adversariële exploitatie, waarbij kritieke informatie verborgen kan worden voor automatische audits door het te verspreiden over een document of door de "Safety Tax" te wapenen om over-conservatieve weigeringen af te dwingen.
- Alignment Trade-offs: De kwantificering van de Safety Tax onthult een fundamentele spanning in huidige alignment-strategieën, waarbij strikte anti-hallucinatie protocollen onbedoeld valide redeneren onderdrukken.
De auteurs concluderen dat betrouwbare inzet vereist dat de prioriteit wordt gegeven aan effectieve contextlengte en robuustheid tegen feit-distributie boven ruwe token-aantallen. Zij pleiten voor het gebruik van hun distributie-bewuste testpipeline om modellen te valideren tegen Distributional Collapse en Safety Tax vóór enterprise-implementatie, in plaats van te vertrouwen op traditionele benchmarks die prestaties mogelijk overschatten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.