← Nieuwste papers
💬 NLP

ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models

Dit paper introduceert ArabicNumBench, een uitgebreide benchmark die aantoont dat hoewel bepaalde grote taalmodellen hoge nauwkeurigheid bereiken bij het lezen van Arabische cijfers, ze vaak falen in het genereren van gestructureerde output, waardoor een onderscheid wordt gemaakt tussen numerieke precisie en instructie-opvolging.

Oorspronkelijke auteurs: Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan

Gepubliceerd 2026-02-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep van 71 verschillende robots hebt, allemaal ontworpen om Arabisch te begrijpen. Je geeft ze een taak: "Lees dit getal voor mij uit." Het klinkt simpel, maar er zit een enorme valkuil in.

In de Arabische wereld gebruiken ze twee soorten cijfers:

  1. De "Oosterse" cijfers: De cijfers die eruitzien als Arabische letters (0, 1, 2...).
  2. De "Westerse" cijfers: De cijfers die wij gebruiken (0, 1, 2...).

Deze robots moeten niet alleen het juiste getal begrijpen, maar ook precies doen wat je zegt: het antwoord in een strakke, gestructureerde vorm geven (bijvoorbeeld: "Het antwoord is 50"), in plaats van een rommelig verhaal te vertellen.

Dit onderzoek, genaamd ArabicNumBench, is als een grote test voor deze robots. Hier is wat ze ontdekten, vertaald naar alledaags taalgebruik:

1. De "Lees-je-de-krant" versus "Doe-precies-wat-ik-zeg"

De grootste verrassing in dit onderzoek is dat slim zijn niet hetzelfde is als gehoorzaam zijn.

  • De slimme maar ondeugende robot: Sommige robots (zoals de Google Gemini) zijn super slim. Als je ze vraagt "Hoeveel is 50?", zeggen ze het juiste antwoord bijna altijd. Maar als je zegt: "Geef me alleen het getal", dan vertellen ze je een heel verhaal over het getal, met extra zinnen en geen duidelijk antwoord. Ze zijn als een briljante student die het examen haalt, maar de instructies op het antwoordblad negeert.
  • De gehoorzame robot: Een paar andere robots (zoals Qwen en Llama) doen precies wat je zegt. Ze geven het juiste antwoord én houden zich aan de regels.

Het onderzoek laat zien dat veel robots het juiste antwoord kunnen geven, maar faals als je ze vraagt om het antwoord in een specifiek formaat te geven. Voor een computerprogramma is dat een ramp: de computer kan het antwoord niet "lezen" als het in een rommelig verhaal verpakt zit.

2. De "Voorbeeld-les" (Few-Shot) is de sleutel

Stel je voor dat je iemand leert een taak.

  • Zonder voorbeeld (Zero-shot): Je zegt: "Doe dit." De robot raakt in paniek en gunt 28% van de keren het juiste antwoord.
  • Met een voorbeeld (Few-shot): Je zegt: "Kijk, hier is een voorbeeld van hoe ik het wil. Doe het zo." De robot schiet omhoog naar 74% correct.
  • Met een voorbeeld én uitleg (Few-shot CoT): Je zegt: "Kijk, hier is een voorbeeld. En hier is hoe ik erbij denk: stap 1, stap 2, stap 3. Doe het zo."

Dit laatste werkt wonderbaarlijk goed! De robots halen dan 80% correct. Het is alsof je de robot niet alleen het antwoord geeft, maar ook de "denktrucs" leert om het antwoord te vinden. Dit is de beste manier om ze te laten werken.

3. De "Gouden Zes"

Van de 71 robots die getest werden, waren er slechts 6 die echt goed waren in alles: ze gaven het juiste antwoord én hielden zich perfect aan de regels.
De rest? De meeste waren ofwel te slordig, ofwel te koppig. Zelfs als je ze heel duidelijk instructies gaf, bleven ze maar in hun eigen stijl praten.

4. Waarom is dit belangrijk?

Vroeger keken mensen alleen naar het cijfer: "Hoeveel procent van de vragen had de robot goed?"
Dit onderzoek zegt: "Nee, wacht even! Als de robot het antwoord goed heeft, maar het antwoord zit verstopt in een rommelig verhaal, dan is hij voor een echte computerapplicatie onbruikbaar."

Het is alsof je een kok hebt die de beste pizza ter wereld bakt, maar die pizza altijd in een vuilniszak serveert in plaats van op een bord. Voor een klant (of een computer) is dat geen oplossing.

De conclusie in één zin

Als je een robot wilt die Arabische getallen goed kan lezen in een echte applicatie, moet je niet alleen kijken naar hoe slim hij is, maar ook naar hoe goed hij luistert. En de beste manier om hem te laten luisteren, is door hem goede voorbeelden te geven én te laten zien hoe hij moet nadenken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →