← Nieuwste papers
💬 NLP

The Effect of Scripts and Formats on LLM Numeracy

Dit artikel onthult dat grote taalmodellen aanzienlijke nauwkeurigheidsverliezen lijden bij het verwerken van numerieke expressies in ondervertegenwoordigde schriften of formaten, maar toont aan dat gerichte prompting-strategieën deze ongelijkheid effectief kunnen verminderen.

Oorspronkelijke auteurs: Varshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Varshini Reddy, Craig W. Schmidt, Seth Ebner, Adam Wiemerslage, Yuval Pinter, Chris Tanner

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student hebt die bijna elk boek ter wereld heeft gelezen. Deze student is een wiskundig genie en kan complexe optel- en vermenigvuldigingsproblemen direct oplossen. Maar er is een addertje onder het gras: deze student heeft alleen ooit getallen gezien zoals we die op de standaard manier in het Engels gebruiken (zoals 1, 2, 3).

Dit artikel gaat over wat er gebeurt wanneer je deze superintelligente student vraagt om wiskunde te doen met getallen die geschreven zijn in andere "talen" of "stijlen" die ze nog niet veel hebben gezien.

De belangrijkste ontdekking: De "Script Belasting"

De onderzoekers ontdekten dat wanneer ze de standaard getallen vervingen door andere schriften — zoals १, २, ३ (Devanagari) of ۱, ۲, ۳ (Perzisch-Arabisch) — de wiskundige vaardigheden van de student drastisch daalden.

Denk hierover als volgt: Als je een chef-kok vraagt om een perfect biefstuk te bereiden, kan hij dat gemakkelijk doen. Maar als je hem een recept geeft dat geschreven is in een taal die hij niet leest, of als je hem vertelt de uien te snijden met een lepel in plaats van een mes, kan hij de ingrediënten laten vallen of het vlees laten aanbranden. De chef weet nog steeds hoe hij moet koken, maar het formaat van de instructies verwarde hem.

Het artikel noemt dit de "Script Belasting" (Script Tax). Het is een boete die de AI betaalt simpelweg omdat de getallen in een andere vorm worden gepresenteerd. Hoewel het wiskundige probleem exact hetzelfde is (bijv. "5 + 5"), maakt de AI 66% tot 87% vaker fouten als de getallen niet in de standaard Engelse stijl staan.

Waarom gebeurt dit?

Het artikel wijst naar twee hoofdoorzaken:

  1. Het "Trainingsdieet": De AI werd getraind op een enorme hoeveelheid tekst van het internet. Het grootste deel van die tekst gebruikt standaard Engelse getallen. Het is alsof de student alleen maar appels heeft gegeten; wanneer je hem plotseling een peer geeft, weet hij niet meer hoe hij er goed op moet kauwen.
  2. Het "Token"-probleem: AI leest tekst niet zoals mensen dat doen; het breekt tekst op in kleine stukjes die "tokens" worden genoemd.
    • Standaard getallen (zoals 123) zijn misschien één of twee stukjes.
    • Sommige andere schriften breken hetzelfde getal op in veel kleine, verwarrende stukjes.
    • Het artikel vond dat hoe meer "stukjes" een getal wordt opgedeeld, hoe moeilijker het voor de AI is om de wiskunde te doen. Het is alsof je probeert een puzzel op te lossen waarbij iemand de afbeelding in 100 kleine stukjes heeft gesneden in plaats van 10 grote stukken.

Het goede nieuws: We kunnen het oplossen met "Hints"

De onderzoekers vonden niet alleen een probleem; ze vonden ook een manier om te helpen. Ze probeerden verschillende manieren om de vraag te stellen (dit wordt "prompting" genoemd):

  • Gewoon beleefd vragen: "Los dit alstublieft op." -> Faalde nog steeds.
  • De taal vertellen: "Dit is geschreven in het Thais." -> Faalde nog steeds.
  • Een spiekbriefje geven (Mapping): De AI een lijst tonen zoals "Dit symbool betekent 1, dit symbool betekent 2." -> Beter, maar niet perfect.
  • De Magische Truk (Few-Shot Prompting): Dit was de winnaar. De onderzoekers gaven de AI eerst een paar voorbeelden.
    • Voorbeeld 1: "Hier is een probleem in het Thais: 1 + 1 = 2. Hier is het antwoord."
    • Voorbeeld 2: "Hier is nog een voorbeeld..."
    • Nu: "Los deze op."

Door de AI een paar voorbeelden te geven van hoe ze met deze vreemde getalstijlen om moeten gaan, schoot de prestatie omhoog. Het is also려 de student eerst een paar oefenopdrachten in de nieuwe taal te laten maken voordat het echte examen begint. Plotseling konden ze de wiskunde perfect uitvoeren.

De Formatteringswending

Het artikel keek ook naar hoe getallen gegroepeerd worden. In de VS schrijven we grote getallen als 1,000,000 (komma's elke drie cijfers). In Europa schrijven ze misschien 1.000.000 (punten) of 1 000 000 (spaties).

De AI raakte ook in de war door deze stijlen. De AI hanteerde de Amerikaanse stijl perfect, maar had moeite met de Europese stijlen. Interessant genoeg verwarde de AI deze getalformaten vaak met zaken als IP-adressen (bijv. 192.168.1.1), die veel voorkomen in de trainingsdata maar geen wiskundige problemen zijn.

De Kern van het Verhaal

Het artikel concludeert dat deze AI-modellen niet "slecht in wiskunde" zijn. Ze zijn eigenlijk best goed in de logica. Het probleem is dat ze fragiel zijn. Ze vertrouwen sterk op het zien van getallen in de specifieke, vertrouwde manier waarin ze zijn onderwezen.

Als je wilt dat een AI wiskunde voor je doet in een andere taal of met andere getalstijlen, kun je het niet simpelweg rechtstreeks vragen. Je moet het een klein duwtje geven: geef eerst een paar voorbeelden, of leg precies uit hoe de symbolen werken. Zodra je dat doet, verdwijnt de "Script Belasting" en wordt de wiskunde weer eenvoudig.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →