← Nieuwste papers
💬 NLP

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

Dit artikel introduceert UrduBench, een gestandaardiseerde Urdu-redeneringsbenchmark die is gecreëerd via een contextueel ensemble-vertalingskader met human-in-the-loop-validatie, wat significante uitdagingen onthult in meerstaps- en symbolische redenering voor grote taalmodellen terwijl het een schaalbare methodologie vestigt voor het evalueren van talen met weinig middelen.

Oorspronkelijke auteurs: Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

Gepubliceerd 2026-01-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante student hebt die complexe wiskundige problemen kan oplossen en lastige vragen in het Engels kan beantwoorden. Stel je nu voor dat je wilt testen of deze student hetzelfde kan in het Urdu, een taal met minder digitale middelen. Het probleem is dat als je een machine vraagt de Engelse testvragen naar het Urdu te vertalen, de vertaling misschien onhandig is, de betekenis verliest of zelfs de regels van het spel verandert. De student kan falen, niet omdat hij niet slim is, maar omdat de test zelf kapot is.

Dit artikel, getiteld "UrduBench," gaat over het bouwen van een eerlijke, hoogwaardige test voor Large Language Models (LLMs) in het Urdu. Hier is hoe ze het deden en wat ze vonden, eenvoudig uitgelegd:

1. Het Probleem: De "Broken Translation" Valstrik

Denk aan het vertalen van een logische puzzel zoals het vertalen van een recept. Als je de ingrediëntenlijst apart van de bereidingsinstructies vertaalt, kan het eindresultaat onsmakelijk zijn. Op dezelfde manier vertaalden bestaande methoden Urdu-testvragen vaak woord voor woord zonder naar het grotere geheel te kijken. Dit veroorzaakte "contextfragmentatie", waarbij de vraag en de antwoordopties niet meer logisch bij elkaar pasten.

2. De Oplossing: De "Vertaalteam" Aanpak

De auteurs gebruikten niet slechts één vertaler. Ze bouwden een contextueel ensemble framework, wat lijkt op het inhuren van een team van vier verschillende expertvertalers (IndicTrans2, NLLB, Qwen en Gemini) om tegelijkert aan dezelfde vraag te werken.

  • Het Team: Ze vertaalden de volledige vraag en alle bijbehorende antwoordopties samen als één blok, zodat het verhaal intact bleef.
  • De Redacteur: Ze gebruikten een superintelligente AI (GPT-5.1) om als redacteur te fungeren, door de vier vertalingen te vergelijken en de beste delen van elke vertaling aan elkaar te naaien.
  • De Menselijke Controle: Ten slotte controleerden echte menselijke experts die vloeiend zijn in zowel Engels als Urdu de resultaten. Zij fungeerden als de "kwaliteitscontroleurs" die de meest natuurlijke en nauwkeurige versie kozen.

Dit proces creëerde UrduBench, een collectie van vier beroemde redeneertests (Wiskunde, Common Sense, Wetenschap en Logica) die perfect naar het Urdu zijn vertaald.

3. Het Experiment: De "Urdu Olympiade"

Toen ze de eerlijke test hadden, nodigden ze diverse AI-modellen uit om deze af te leggen. Ze testten modellen van verschillende groottes (van kleine modellen met 1 miljard parameters tot enorme modellen met 12 miljard parameters) en van verschillende typen (sommigen specifiek getraind voor redeneren, anderen gewoon voor het opvolgen van instructies).

Ze vroegen de modellen om problemen op drie manieren op te lossen:

  • Direct: Geef gewoon het antwoord.
  • Chain-of-Thought (CoT): "Laat je werk zien" stap voor stap.
  • Few-Shot: "Hier zijn enkele voorbeelden, probeer het nu zelf."

4. De Resultaten: Wat de Modellen Leerden

Het papier toonde verschillende interessante zaken aan, die samengevat kunnen worden met deze metaforen:

  • Wiskunde is moeilijker dan Common Sense: De modellen hadden veel meer moeite met wiskundige problemen met meerdere stappen (zoals de MGSM en MATH-500 tests) dan met common sense vragen. Het is alsook dat de modellen je gemakkelijk kunnen vertellen dat "een kat vacht heeft", maar dat ze struikelen over complexe algebra in het Urdu.
  • Groot is niet altijd beter: Normaal gesproken betekent een grotere motor een snellere auto. Maar in het Urdu reed een iets kleiner model (Gemma-3-4B) eigenlijk beter dan sommige grotere modellen. Dit suggereert dat hoe het model is getraind (specifiek de blootstelling aan Urdu) belangrijker is dan alleen de ruwe grootte.
  • De "Redeneer" Specialist versus de "Generalist": Modellen die specifiek zijn ontworpen als "redeneerexperts" presteerden geweldig op wiskunde, maar versloegen de algemene "instructie-volgende" modellen niet altijd bij common sense vragen. Een specialist in wiskunde te zijn, maakte hen niet automatisch tot een meester in alle Urdu-taken.
  • De Taalverwarringstest: Dit was een cruciale bevinding. De onderzoekers controleerden of de modellen antwoordden in puur Urdu of dat ze per ongeluk terugvielen op het Engels (code-switching). Ze ontdekten dat modellen die strikt in het Urdu bleven, veel beter presteerden. Als een model in de war raakte en talen mengde, daalde hun redeneervermogen. Het is als een chef die in een andere taal begint te praten terwijl hij kookt; het gerecht kan erdoor verpest worden.

5. De Conclusie

Het artikel concludeert dat je, om slimme AI voor talen met weinig middelen zoals het Urdu te bouwen, niet simpelweg Engelse tests kunt vertalen en op het beste moet hopen. Je hebt een human-in-the-loop proces nodig om te garanderen dat de vertaling de logica behoudt.

Ze vonden ook dat voor een AI om goed te kunnen redeneren in het Urdu, deze linguïstisch consistent moet zijn. Als de AI de weg kwijtraakt en talen begint te mengen, treedt de hersenmist in en faalt de test.

Kortom: De auteurs hebben een hoogwaardige, door mensen geverifieerde "Urdu Olympiade" gebouwd voor AI. Ze ontdekten dat hoewel AI beter wordt, het nog steeds worstelt met complexe wiskunde in het Urdu, en dat de sleutel tot succes is om de taal zuiver te houden en de vertaling contextbewust te maken. Ze hebben hun test en data beschikbaar gesteld voor anderen om te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →