← Nieuwste papers
💬 NLP

Structured Output Collapses Answer Diversity Across 44 Language Models

Deze studie toont aan dat het opvragen van gestructureerde uitvoerformaten zoals JSON, zelfs zonder schema-afdwinging, de diversiteit van antwoorden aanzienlijk vermindert en de convergentie van modellen naar dominante reacties verhoogt over 44 taalmodellen, wat onthult dat enkel het register van de prompt — en niet de decoderingsbeperkingen — een meetbare homogenisering van modelgedrag drijft.

Oorspronkelijke auteurs: Tapan Parikh

Gepubliceerd 2026-07-22
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tapan Parikh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het geheime leven van AI: Wanneer beleefdheid de code ontmoet

Stel je voor dat je praat met een gigantische, superintelligente bibliotheek die bijna alles heeft gelezen wat ooit geschreven is. Deze bibliotheek is een Artificial Intelligence, of "AI", en staat bekend om haar vermogen om te chatten, grappen te vertellen en verhalen te schrijven. Maar hier zit de crux: terwijl mensen houden van chatten in rommelige, vloeiende zinnen, spreken computers niet zo. Computers spreken in strikte, georganiseerde boxen die "gestructureerde data" worden genoemd, zoals JSON of XML. Denk aan het verschil tussen een dichter die een vrije vorm sonnet schrijft en een kassière die artikelen scant bij een kassa, waarbij elk item in een specifieke gleuf moet passen.

Al een lange tijd bestuderen wetenschappers hoe deze AI's zich gedragen wanneer ze chatten als dichters. Ze stellen vragen als: "Noem een boom," en kijken wat de AI zegt. Meestal, als je 44 verschillende AI's deze vraag stelt, kunnen ze allemaal verschillende bomen kiezen, of ze kunnen per ongeluk allemaal dezelfde kiezen. Dit paper stelt een eenvoudige maar lastige vraag: Wat gebeurt er als we stoppen met de AI te vragen om te chatten als een dichter en haar dwingen te antwoorden als een kassière? Verandert de AI van mening? Wordt ze saaier? Of blijft ze hetzelfde? Dit is belangrijk omdat de AI waar je tegen praat op je telefoon heel anders kan zijn dan de AI die daadwerkelijk de software op de achtergrond aanstuurt, en we moeten weten of dat verschil invloed heeft op hoe de wereld werkt.


De grote persoonlijkheidsverschuiving van AI

In dit onderzoek gebruikten onderzoekers een beroemde test genaamd de "One-Word Census". Stel je een spelshow voor waarbij 44 verschillende AI-modellen 31 vragen krijgen, zoals "Noem een boom" of "Kies een woord." In het originele spel beantwoordden de AI's de vragen gewoon in gewone Engelse taal. De onderzoekers ontdekten dat de AI's, zelfs zonder regels, de neiging hadden om het eens te worden over bepaalde antwoorden (zo zoals "oak" voor een boom), maar dat ze nog steeds enige persoonlijkheid en variatie vertoonden.

Vervolgens veranderden de onderzoekers de regels. Ze veranderden de vragen niet, en ze gebruikten geen speciale computertrucs om de antwoorden af te dwingen. Ze voegden simpelweg één kleine instructie toe aan het einde van de prompt: "Reply with JSON only."

JSON is een manier van data schrijven die lijkt op een klein doosje met een label, zoals {"word": "oak"}. Het is de taal die software gebruikt om met andere software te communicen. De onderzoekers wilden zien of alleen het vragen aan de AI om in dit formaat te spreken, zou veranderen wat de AI besluit te zeggen.

De grote ontdekking: De "Format Tax"

De resultaten waren verrassend. Wanneer de AI's werden gedwongen om in JSON te antwoorden, werden ze veel meer aan elkaar gelijk. De variëteit in antwoorden daalde scherp.

  • Vóór de verandering: In gewone chat werd het meest voorkomende antwoord (de "modus") ongeveer 41% van de tijd gekozen.
  • Na de verandering: In JSON sprong datzelfde antwoord naar 64% van de tijd.
  • De variëteit: Het aantal unieke woorden dat de AI's bedachten, daalde van 52 verschillende woorden naar slechts 36.

De onderzoekers noemen dit een "progressieve format tax" (vormatbelasting). Het is als een belasting op uniek zijn. De AI's die het meest creatief en uniek waren in gewone chat, verloren het meeste van hun persoonlijkheid wanneer ze in JSON moesten spreken. Eén specifieke AI, die het meest "exploratief" was (het meest geneigd om ongebruikelijke antwoorden te kiezen), verloor 1,31 bits van haar onderscheidend vermogen. Dat is alsof de helft van haar unieke karakter verdwijnt, puur omdat ze haar antwoord in een doosje moest plaatsen.

Het is geen glitch, het is een "Register"

Je zou kunnen denken dat de AI in de war raakte of dat de computer haar dwong om hetzelfde antwoord te kiezen. Maar de studie sloot dat uit.

  • Geen "Cooling" truc: Soms, wanneer mensen willen dat een AI minder willekeurig is, draaien ze de "temperature" knop omlaag. De onderzoekers controleerden dit en vonden dat de "temperature" niet veranderde. De AI's waren nog steeds even willekeurig in hun denken; ze kozen alleen andere willekeurige dingen.
  • Geen decoding fout: Ze testten ook of de computer het antwoord afdwong door andere woorden te blokkeren. Ze ontdekten dat zelfs zonder dat de computer iets blokkeerde, alleen al het vragen om JSON ervoor zorgde dat de AI van gedachten veranderde. De verandering vindt plaats in de hersenen van de AI (haar "reactie op het register"), en niet in de mond van de computer (de decoder).

Denk aan een persoon die zich anders gedraagt op een feestje versus tijdens een sollicitatiegesprek. Op een feestje (gewone chat) kan die persoon wilde verhalen vertellen en vreemde woorden gebruiken. Tijdens een sollicitatiegesprek (JSON) wordt die persoon plotseling heel professioneel en kiest zij de "veilige", standaard antwoorden. De AI is niet kapot; ze is gewoon aan het "code-switchen".

De "Slijper", niet de "Re-indexer"

De studie vond dat de AI niet begon met het kiezen van nieuwe antwoorden. Ze verdubbelde simpelweg haar inzet op de antwoorden die ze al leuk vond.

  • In 28 van de 31 categorieën was het populairste antwoord in gewone chat ook het populairste antwoord in JSON.
  • De weinige keren dat het antwoord veranderde (zoals de overstap van "chess" naar "Monopoly" voor een bordspel), gebeurde dit omdat het oorspronkelijke favoriete antwoord zwak was. Het JSON-formaat fungeerde als een "slijper", waardoor de favoriete keuze van de AI nog sterker werd, in plaats van de keuze volledig te veranderen.

De "Persoonlijkheid" zit in het Formaat

Een van de interessantste bevindingen is dat de "persoonlijkheid" van een AI afhangt van het formaat.

  • Sommige AI's hebben een "standaardantwoord" waar ze van houden. Bijvoorbeeld, één AI hield ervan om "gouda" te zeggen voor kaas in gewone chat. Maar wanneer er om JSON werd gevraagd, stopte ze met het zeggen van "gouda" en viel ze terug op het antwoord dat de massa koos.
  • Omgekeerd ontwikkelden sommige AI's juist nieuwe defaults specifiek voor JSON. Eén AI zei 0% van de tijd "cerulean" voor de kleur blauw in chat, maar 100% van de tijd in JSON.
  • Dit betekent dat een AI niet slechts één persoonlijkheid heeft. Ze heeft een "chat-persoonlijkheid" en een "JSON-persoonlijkheid". Die kunnen totaal verschillend zijn.

Waarom gebeurt dit?

De onderzoekers testten verschillende formaten om te zien wat de verandering veroorzaakte.

  • JSON en XML: Deze formaten, die worden gebruikt voor tools en software, zorgden ervoor dat de AI's instortten naar dezelfde antwoorden.
  • YAML en CSV: Dit zijn ook dataformaten, maar de AI's veranderden hun antwoorden niet zo sterk.
  • Haakjes: Wanneer er werd gevraagd om het antwoord simpelweg tussen vierkante haken te zetten [antwoord], werden de AI's juist diverser.

Dit suggereert dat de verandering niet alleen over "structuur" gaat. Het gaat over de specifieke formaten die AI's getraind zijn om te gebruiken voor tools. Omdat AI's getraind zijn om JSON te gebruiken om met softwaretools te communiceren, triggert het vragen om JSON een "tool-modus" die hen conservatiever en uniformer maakt.

Wat dit voor jou betekent

Het paper sluit af met een praktische waarschuwing. We beoordelen AI-modellen meestal op hoe ze met ons chatten in gewone Engelse taal. We denken dat de "beste" AI degene is die de meest interessante, diverse antwoorden geeft in een chatvenster. Maar dit onderzoek laat zien dat wanneer diezelfde AI daadwerkelijk door software wordt gebruikt (wat bijna altijd JSON vereist), ze veel saaier en uniformer wordt.

Als jij een app bouwt die AI gebruikt om films aan te bevelen, een boom te kiezen of ideeën te brainstormen, dan kan de AI die je in het chatvenster ziet veel creatiever zijn dan de AI die daadwerkelijk jouw app aanstuurt. De "JSON-versie" van de AI is meetbaar minder divers. De kloof tussen de AI waarmee we praten en de AI die het werk doet, is een vaste prijs van het formaat, en geen zeldzaam ongeluk.

Kortom: als je wilt weten wat een AI echt denkt, vraag haar dan niet alleen om te chaten. Vraag haar om een formulier in te vullen. Je zult misschien verrast zijn door hoeveel saaier ze wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →