← Nieuwste papers
🤖 machine learning

Language models suffer from a curse of ambiguity

Dit artikel identificeert en theoretisch analyseert een "vloek van ambiguïteit" in grote taalmodellen, waarbij wordt aangetoond dat ambigue volgende-tokenverdelingen inherent moeilijker nauwkeurig te leren zijn vanwege verhoogde capaciteitseisen, embedding-groottes, trainingsstappen en versterkte samplingruis, een bevinding die is gevalideerd door zowel synthetische als real-world experimenten.

Oorspronkelijke auteurs: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

Gepubliceerd 2026-08-18
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne computers die schrijven en spreken, zijn gebouwd op een simpel, krachtig idee: ze voorspellen het volgende woord in een zin door te kijken naar de woorden die eraan voorafgingen. Dit proces vindt plaats, woord voor woord, zoals een persoon die een verhaal doordenkt en de meest waarschijnlijke volgende stap kiest op basis van wat er al is gezegd. Jarenlang hebben ingenieurs zich gericht op het verbeteren van deze machines in het vinden van het enkel meest voor de hand liggende antwoord. Maar naarmate deze systemen geavanceerder worden, wordt er steeds vaker van hen gevraagd om situaties aan te kunnen waarin er geen enkel voor de hand liggend antwoord is. Wanneer een zin op veel verschillende, even redelijke manieren kan eindigen, moet de machine leren om zijn vertrouwen te spreiden over al die mogelijkheden, in plaats van alleen de bovenste te kiezen. Dit vermogen om onzekerheid te begrijpen, wordt cruciaal, vooral nu deze machines de trainingsdata voor hun eigen toekomstige versies gaan schrijven. Als ze er niet in slagen het volledige spectrum aan mogelijkheden te vatten, riskeren ze een nauwe, repetitieve lus te creëren die de kwaliteit van hun eigen leerproces degradeert.

Een team onderzoekers aan de Stanford University heeft een fundamentele barrière ontdekt die deze taak verrassend moeilijk maakt. Ze ontdekten dat hoe ambivalenter een situatie is — wat betekent dat er meer plausibele volgende woorden zijn — hoe moeilijker het voor de machine is om de juiste verdeling van waarschijnlijkheden te leren. Ze noemen dit de "vloek van ambiguïteit". Het is niet alleen een kwestie van de machine die iets langzamer is of meer data nodig heeft; de moeilijkheid zit ingebakken in de architectuur van de neurale netwerken die deze modellen aandrijven. De onderzoekers toonden aan dat naarmate het aantal mogelijke juiste antwoorden toeneemt, de machine aanzienlijk meer interne opslagruimte, grotere interne representaties van woorden en veel meer stappen van training vereist om de wiskunde correct uit te voeren. Zelfs wanneer de machine het eindelijk leert, introduceert het proces van het kiezen van één woord uit de vele mogelijkheden een type ruis dat voorkomt dat het ooit de werkelijke verdeling van de taal perfect kan evenaren.

Om te begrijpen waarom dit gebeurt, brak het team het probleem af naar de kleinste onderdelen. Ze behandelden de uiteindelijke besluitvormingslaag van de machine als een eenvoudige classifier die een context mapt naar een set mogelijke uitkomsten. In hun experimenten creëerden ze synthetische taken waarbij ze de exacte grondwaarheid kenden: een specifiek aantal woorden was even waarschijnlijk als volgend op een gegeven frase. Ze ontdekten dat het opslaan van een patroon met tien mogelijke uitkomsten ongeveer tien keer meer capaciteit vereiste dan het opslaan van een patroon met slechts één. Het is alsof de machine voor elke mogelijke optie die hij moet onthouden, een aparte, onderscheidende route moet bouwen. Bovendien ontdekten ze dat de interne "woordenschat" die de machine gebruikt om deze contexten vast te houden, groter moet worden om de ambiguïteit te accommoderen. Als de machine probeert een situatie met veel geldige eindes te representeren met een representatie die te klein is, kan het simpelweg niet tussen de opties onderscheiden, ongeacht hoeveel er getraind wordt.

De moeilijkheid strekt zich uit voorbij alleen opslag. De onderzoekers analyseerden ook hoe de machine in de loop van de tijd leert. Ze vonden dat wanneer een situatie veel mogelijke uitkomsten heeft, het leerproces veel langzamer begint. Omdat de machine elk specifiek correct woord minder frequent ziet wanneer er veel van zijn, is het signaal dat het ontvangt om de interne instellingen aan te passen zwakker. Dit betekent dat het langer duurt voordat er vooruitgang wordt geboekt. Nog erger is dat de handeling van het trainen op echte data, waarbij de machine op elk moment slechts één willekeurig voorbeeld van het juiste volgende woord ziet, een aanhoudende fout introduceert. Wanneer het doel een enkel, zeker woord is, kan de machine dit uiteindelijk perfect leren. Maar wanneer het doel een spreiding van vele woorden is, creëert de willekeur van het zien van slechts één voorbeeld per stap een foutenplafond waar de machine niet overheen kan klimmen. Hoe lang er ook getraind wordt, het zal altijd net niet perfect zijn, niet in staat om de ware spreiding van waarschijnlijkheden perfect te repliceren.

Het team bevestigde deze bevindingen niet alleen in hun gecontroleerde, synthetische tests, maar ook in grote taalmodellen die getraind zijn op real-world tekst. Door te analyseren hoe deze modellen presteerden op werkelijke data, observeerden ze dezelfde kenmerken: naarmate de ambiguïteit van een context toenam, werden de voorspellingen van het model minder accuraat, en had het de neiging om waarschijnlijkheidsmassa te lekken naar woorden die daar niet thuishoorden. Dit suggere than de vloek van ambiguïteit een universele eigenschap is van deze systemen, die alles beïnvloedt van kleine experimentele modellen tot de enorme, biljoenen-parameters tellende systemen die vandaag de dag worden gebruikt. De onderzoekers stellen dat deze beperking geen bug is die met een eenvoudige software-update kan worden opgelost, maar een fundamentele beperking van hoe deze netwerken onzekerheid representeren.

Deze ontdekking verandert hoe we moeten denken over de capaciteiten van kunstmatige intelligentie. Het suggereert dat hoewel het opschalen van de omvang van deze modellen helpt, het het kernprobleem van ambiguïteit niet oplost. Zelfs de grootste modellen zullen altijd moeite blijven houden met het perfect modelleren van situaties met veel plausibele uitkomsten, waardoor een restfractie van de waarheid ongeleerd blijft. Dit heeft praktische implicaties voor hoe we deze systemen vertrouwen. In velden waar precisie belangrijk is, zoals medische diagnose of juridische redenering, moeten we ons ervan bewust zijn dat de vertrouwensdistributie van het model inherent ruizig kan zijn wanneer het antwoord niet eenduidig is. Het werk biedt een nieuw kader voor het begrijpen van wanneer we de output van een machine moeten vertrouwen en wanneer de onzekerheid ervan een teken is van een diepere structurele beperking in plaats van een gebrek aan data. Uiteindelijk onthult het paper dat precies datgene wat de menselijke taal rijk en flexibel maakt — het vermogen om veel verschillende dingen op veel verschillende manieren te zeggen — ook precies datgene is dat het voor een machine het moeilijkst maakt om te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →