← Nieuwste papers
💬 NLP

Hidden Language Consistency Phenomena in Reasoning LLMs

Dit artikel onthult dat meertalige redeneermodellen vaak een "language consistency breakdown effect" vertonen waarbij het vergroten van de taakcomplexiteit een plotselinge verschuiving naar een interne dominante taal veroorzaakt, wat leidt tot scenario's waarin de nauwkeurigheid behouden blijft of zelfs verbetert ondanks een verlies aan outputtaalconsistentie, waarmee wordt aangetoond dat betrouwbare evaluatie vereist dat taaknauwkeurigheid, taalconsistentie en complexiteit gezamenlijk worden overwogen.

Oorspronkelijke auteurs: Muhammad Ali Shafique, Kelly Marchisio

Gepubliceerd 2026-08-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Muhammad Ali Shafique, Kelly Marchisio

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je in een klaslokaal bent waar de leraar een leerling vraagt om een lastig wiskundig probleem op te lossen, maar met een zeer specifieke regel: "Je moet hardop denken en je antwoord volledig in het Spaans schrijven." In de wereld van kunstmatige intelligentie zijn deze "leerlingen" Large Language Models (LLM's)—superintelligente computerprogramma's die bijna alles op het internet hebben gelezen. Wanneer we hen vragen om moeilijke problemen op te lossen, gebruiken ze vaak een techniek genaamd "Chain-of-Thought", wat lijkt op een leerling die zijn stapsgewijze denkproces opschrijft voordat hij het uiteindelijke antwoord geeft. Lange tijd gaven wetenschappers alleen om het juiste eindantwoord. Ze beschouwden het denkproces als een black box en gingen ervan uit dat als het antwoord juist was, de leerling alles correct deed. Maar net zoals een menselijke leerling per ongeluk in het Frans of Engels kan beginnen terwijl hij probeert een probleem in het Spaans op te lossen, kunnen deze AI-modellen soms "uitschieten" en halverwege de gedachte van taal wisselen, zelfs als we hen expliciet hadden gevraagd dat niet te doen. Dit onderzoek onderzoekt precies dat: wat er gebeurt wanneer we deze AI-leerlingen vragen om steeds moeilijkere wiskundige problemen op te lossen, en of zij hun taalbelofte nakomen, of dat ze zo in de war raken dat ze een andere taal gaan spreken.

De onderzoekers achter deze studie besloten deze AI-"leerlingen" op de proef te stellen met een speciale wiskundetoets genaamd PolyMath, die acht verschillende talen en vier moeilijkheidsgraden beslaat, variërend van eenvoudige basisschoolwiskunde tot de moeilijkste Olympische puzzels. Ze bekeken vijf verschillende "redeneer"-modellen (AI ontworpen om diep na te denken) en drie "niet-redeneer"-modellen (standaard AI) om te zien hoe zij de taak aanpakten. Wat ze ontdekten, is een beetje als het kijken naar een leerling die panikeert onder druk. Ze ontdekten dat naarmate de wiskundeproblemen moeilijker werden, de modellen niet alleen slechter werden in wiskunde; ze werden vaak ook slechter in het vasthouden aan de taal die ze moesten gebruiken.

De studie onthulde vier duidelijke manieren waarop deze taal-"uitschietfout" gebeurt. Soms is een model een rockster en blijft het in de juiste taal, ongeacht hoe moeilijk het probleem wordt. Andere keren is het een totale rebel en weigert het vanaf het begin de gevraagde taal te gebruiken, waarbij het vasthoudt aan zijn favoriete interne taal (meestal Engels), wat er ook gebeurt. Een derde groep begint sterk, maar verliest langzaam de focus en drijft af naar een andere taal naarmate de problemen zwaarder worden. Maar de meest verrassende bevinding is de vierde groep: deze modellen zijn perfect bezig met eenvoudige en gemiddelde problemen, maar op het moment dat ze een "gemiddeld" moeilijkheidsniveau bereiken, storten ze plotseling en volledig in, waarbij ze abrupt van taal wisselen. De auteurs noemen dit het "language consistency breakdown effect".

Hier komt de draai die het echt interessant maakt: het papier vond dat deze taalwissel niet altijd slecht is voor de score. In sommige gevallen, wanneer een model stopte met proberen om in de gevraagde taal (zoals Telugu of Swahili) te denken en overschakelde naar zijn "comfortzone"-taal (zoals Engels), kreeg het daadwerkelijk meer vragen goed, zelfs toen het probleem moeilijker was. Het is alsof de leerling stopte met proberen het probleem in het Spaans op te lossen, overschakelde naar het Engels, en plotseling het juiste antwoord gaf. Dit betekent dat als je alleen naar de eindscore kijkt, je zou kunnen denken dat de AI slimmer wordt, terwijl het in werkelijkheid gewoon de instructies voor de taal heeft opgegeven.

De onderzoekers testten ook wat er gebeurt als we deze modellen "comprimeren" om ze sneller te laten draaien op kleinere apparaten (een proces genaamd kwantisatie). Ze ontdekten dat deze compressie een gok is. Soms helpt het het model om de juiste taal vast te houden, en soms zorgt het ervoor dat het nog sneller van taal wisselt, en dit gebeurt onafhankelijk van of de wiskundige antwoorden beter of slechter worden. Bijvoorbeeld, één methode genaamd GPTQ hielp de modellen vaak beter bij het behouden van hun taalconsistentie dan een andere methode genaamd AutoRound, ook al was AutoRound beter in het correct houden van de wiskundige antwoorden.

Kortom, dit artikel betoogt dat we niet alleen kunnen kijken naar of een AI het juiste antwoord geeft om te beoordelen of hij goed is in meertaligheid. We moeten ook kijken naar hoe hij denkt en welke taal hij gebruikt tijdens het denken. Als we dat niet doen, missen we misschien het feit dat de AI stiekem een andere taal spreekt om het probleem op te lossen, of dat hij plotseling de taal volledig opgeeft wanneer het moeilijk wordt. De studie suggereert dat voor AI die echt betrouwbaar moet zijn in een meertalige wereld, we niet alleen de eindcijfers moeten meten, maar ook of de leerling daadwerkelijk de taalregels van het examen heeft gevolgd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →