Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking
Dit artikel introduceert de Format Sensitivity Index (FSI) en de Parseability Sensitivity Index (PSI) om aan te tonen dat kleine verschillen in de opmaak van prompt-wrappers leiden tot significante, modelafhankelijke scorevariaties en het niet naleven van instructies, waarbij wordt betoogd dat het nauwkeurigheid van benchmarks zonder rekening te houden met deze variantie statistisch fragiel is.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een jurylid bent bij een talentenjacht, maar in plaats van naar de zangers te luisteren, mag je alleen hun songteksten lezen. Stel je nu voor dat sommige zangers de opdracht krijgen om hun songteksten op een blanco vel papier te schrijven, terwijl anderen gedwongen worden om ze in een chique, rigide JSON-doos te schrijven, en anderen weer hun woorden moeten verpakken in een specifieke "BEGIN/END"-sandwich.
Je zou verwachten dat het talent van de zanger hetzelfde blijft, toch? Het liedje zou niet moeten veranderen omdat het papier veranderde. Maar volgens dit onderzoek van Deep Pankajbhai Mehta van Adobe is dat precies wat er gebeurt met AI-modellen. Het "papier" (de prompt wrapper) doet er zo veel toe dat het de hele ranglijst kan omdraaien, waardoor een genie een amateur lijkt en een amateur een genie.
De Grote Formaat-Schudding
De onderzoekers voerden een enorm experiment uit, waarbij ze 14o,000 antwoorden genereerden van vier verschillende AI-modellen (variërend van 7 miljard tot 72 miljard "hersencellen") over zeven verschillende vraag-antwoordsessies. Ze testten vijf verschillende "wrapper"-stijlen:
- Plain: Alleen het antwoord.
- JSON: Strikt computerformaat.
- Structured: Key-value paren.
- Structured with Delimiters: Key-value paren met speciale tags zoals
<BEGIN ANSWER>. - Deliberate: Een kladblok om na te denken, gevolgd door het antwoord.
Het resultaat? De modellen waren extreem gevoelig voor deze formatteringregels. Voor sommige modellen zorgde het veranderen van de wrapper ervoor dat hun nauwkeurigheid wild fluctueerde. Eén model, Phi-4, was een totale dramaqueen: de nauwkeurigheid van het model sprong met een enorme 0,763 (een enorme marge) door het veranderen van de wrapper. In contrast hiermee was de reus Qwen-2.5-72B een relaxte rockster, die nauwelijks bewoog met een schommeling van slechts 0,024.
Het "Kun Je Dit Lezen?" Probleem
Waarom veranderden de scores zo erg? Het artikel suggereert dat dit niet kwam omdat de AI plotseling slimmer of dommer werd in de eigenlijke vragen. Het was vooral een compliance-probleem (nalevingsprobleem).
Denk aan een verkoopautomaat die alleen munten accepteert. Als je probeert een bankbiljet erin te stoppen (zelfs als het een geldig biljet is), wijst de machine het af. In de studie, toen de AI probeerde een strikte JSON-regel te volgen maar per ongeluk een markdown code fence toevoegde (zoals een klein ``` symbool), kon de machine (de antwoord-extractor) het niet lezen. Het antwoord werd gemarkeerd als "onparseerbaar", wat als een fout antwoord werd geteld.
De gegevens tonen een sterke link: wanneer de AI niet "parseerbaar" (machineleesbaar) was, stortte de nauwkeurigheid vaak naar bijna nul. Voor het Phi-4 model met de strikte JSON-wrapper produceerde het in 85,3% van de generaties outputs die begonnen met een markdown code fence, wat resulteerde in een parseerbaarheid van slechts 2,8% en een nauwkeurigheid van 0,7%. De onderzoekers ontdekten dat "parseerbaarheid" een grote voorspeller van succes was, wat ongeveer 82% van de resterende verschillen in scores verklaarde nadat rekening was gehouden met het model en de taak.
Wat Dit Betekent voor de Toekomst
Het artikel betoogt dat het rapporteren van één enkel nauwkeurigheidsgetal voor een AI vergelijkbaar is met het rapporteren van één enkele temperatuur zonder te zeggen of het in Fahrenheit of Celsius is—het is misleidend. Als een keuze voor een wrapper een score met 0,76 kan veranderen, dan is dat enkele getal "statistisch fragiel".
De auteurs suggerelen dat we, wanneer we AI testen, niet zomaar één wrapper moeten kiezen en hopen op het beste. In plaats daarvan moeten we:
- De reeks scores over verschillende wrappers rapporteren (zoals een "gevoeligheidsindex").
- Controleren of de antwoorden daadwerkelijk parseerbaar zijn.
- Voorzichtig zijn met het gebruik van strikte formattering in real-world applicaties, tenzij de AI door zijn decoder (het deel dat de tekst genereert) wordt gedwongen de regels te volgen, en niet alleen door de prompt.
De Kern van het Verhaal
Dit onderzoek zegt niet dat AI kapot is; het zegt dat onze meetlat wiebelig is. De "Format Sensitivity Index" (FSI) en de "Parseability Sensitivity Index" (PSI) zijn nieuwe instrumenten om te meten hoeveel de score van een model afhangt van de wrapper. De bevindingen suggereren dat voor sommige modellen de keuze van de wrapper belangrijker is dan de werkelijke intelligentie van het model. Totdat we dit oplossen, kan de "beste" AI op een ranglijst simpelweg de AI zijn die toevallig de specifieke formatteringstijl van de persoon die de test heeft gebouwd, leuk vond.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.