← Nieuwste papers
💬 NLP

IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages

Dit paper introduceert IndicIFEval, een benchmark voor het evalueren van instructievolgende vaardigheden van taalmodellen in 14 Indiase talen, waarbij wordt vastgesteld dat hoewel modellen goed presteren in het volgen van formatteerregels, ze aanzienlijk achterblijven bij lexische en meertalige taken vergeleken met het Engels.

Oorspronkelijke auteurs: Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan

Gepubliceerd 2026-02-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

IndicIFEval: De "Rekenles" voor AI in 14 Indiase Talen

Stel je voor dat je een groep slimme robots (AI-modellen) hebt die alles kunnen lezen en schrijven. Tot nu toe zijn deze robots vooral getraind op het Engels. Ze zijn als topstudenten die een examen in het Engels hebben gehaald met vliegeren. Maar wat gebeurt er als je ze vraagt om een opdracht te doen in het Hindi, Tamil of Bengaals? Kunnen ze dan nog steeds precies doen wat je zegt, of raken ze in de war?

Dit is precies wat de onderzoekers van IndicIFEval wilden weten. Ze hebben een nieuwe test ontwikkeld om te kijken of deze slimme robots ook goed kunnen luisteren in 14 verschillende talen uit India.

Het Probleem: De "Vertaal-Valstrik"

Vaak denken mensen: "Als je een robot een Engelse opdracht geeft en die vertaalt naar het Hindi, is het probleem opgelost." Maar dat is niet zo.

Stel je voor dat je een robot vraagt: "Schrijf een verhaal en gebruik het woord 'koffie' precies drie keer."
Als je dit simpelweg vertaalt, kan het zijn dat het woord 'koffie' in het Hindi niet meer logisch voelt, of dat de robot de structuur van de zin niet meer begrijpt. Het is alsof je iemand vraagt om een gebouwd huis te schilderen, maar je geeft ze verf die alleen op hout werkt, terwijl het huis van baksteen is. De robot probeert het, maar het resultaat is rommelig.

De Oplossing: Twee Soorten Tests

De onderzoekers hebben twee soorten tests bedacht, zoals twee verschillende sporten om de conditie van de robot te meten:

  1. De Vertaal-Test (IndicIFEVAL-TRANS):
    Dit is als een vertaalwedstrijd. Ze nemen de originele Engelse opdrachten en vertalen ze zorgvuldig naar de Indiase talen. Ze kijken of de robot nog steeds de regels volgt, zelfs als de taal verandert.

    • Voorbeeld: "Schrijf een tekst in het Engels" wordt vertaald naar "Schrijf een tekst in het Hindi".
  2. De "Echte Leven"-Test (IndicIFEVAL-GROUND):
    Dit is interessanter. Hier maken ze opdrachten die natuurlijk klinken in die taal. Ze gebruiken echte verhalen, lokale contexten en woorden die mensen in India echt gebruiken.

    • Voorbeeld: In plaats van een vertaalde opdracht over "de President van de VS", vragen ze de robot: "Schrijf een gedicht over de monsoons in Kerala en gebruik het woord 'regen' precies twee keer." Dit voelt veel meer als een echte vraag die iemand in India zou stellen.

Wat hebben ze ontdekt?

De resultaten zijn een mix van goed nieuws en een flinke waarschuwing:

  • Het formaat is oké, maar de woorden zijn lastig: De robots zijn heel goed in het volgen van strakke regels, zoals "gebruik een lijstje" of "schrijf in JSON-formaat". Maar als ze specifieke woorden moeten gebruiken of moeten tellen (bijv. "gebruik dit woord 3 keer"), raken ze in de war. Het is alsof ze de vorm van de zin kunnen nabootsen, maar de inhoud niet goed begrijpen.
  • Engels is nog steeds de koning: Zelfs de slimste robots doen het veel slechter in Indiase talen dan in het Engels. Het is alsof ze in het Engels een marathon lopen in 2 uur, maar in het Hindi pas na 4 uur aankomen.
  • Grote robots doen het beter: Hoe meer "hersencellen" (parameters) een robot heeft, hoe beter hij het doet. Maar zelfs de grootste robots hebben nog steeds moeite met de kleinere, minder bekende Indiase talen.
  • Het "Denk"-effect: Sommige robots hebben een "denk-modus" (waarbij ze eerst even nadenken voordat ze antwoorden). Dit helpt hen enorm om de kloof tussen Engels en de Indiase talen te overbruggen. Het is alsof ze een evenwichtslat nemen om niet te vallen.

Waarom is dit belangrijk?

India heeft honderden miljoenen mensen die deze talen spreken. Als AI-assistenten (zoals chatbots) niet goed kunnen luisteren in hun eigen taal, blijven ze een tool voor slechts een klein deel van de wereld.

Met IndicIFEval hebben de onderzoekers een meetlat neergelegd. Het is als een "rekenles" voor AI: het laat zien waar de robots nog moeten oefenen. Ze hopen dat deze test ervoor zorgt dat de robots in de toekomst niet alleen Engels spreken, maar ook écht kunnen luisteren en begrijpen in de talen van de Indiase bevolking.

Kortom: De robots zijn slim, maar ze moeten nog veel leren om de nuances van Indiase talen te begrijpen. Deze nieuwe test helpt hen om van "vertaler" naar "echte gesprekspartner" te groeien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →