Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context
Het artikel introduceert "Inspect India Evals", een open-source benchmarking-framework gebouwd op het Inspect AI-platform van de Britse AISI om het gebrek aan cultureel en taalkundig relevante evaluaties voor Large Language Models in India aan te pakken door zes specifieke benchmarks te testen over zestien talen, waarbij wordt onthuld dat modellen zoals Sarvam-M en Gemma 2 grotere tegenhangers overtreffen op het gebied van Indiase culturele kennis en naleving van veiligheid.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je net een super slimme robotassistent hebt gekocht die met je kan praten, verhalen kan schrijven en wiskundige problemen kan oplossen. Je bent enthousiast om hem los te laten in je buurt, maar er is een addertje onder het gras: je buurt is een enorme, bruisende markt waar mensen tientallen verschillende talen spreken, unieke festivals vieren en hun eigen diepgewortelde tradities hebben. Als je deze robot alleen zou onderwijzen met boeken in het Engels over het leven in New York of Londen, zou het een briljante geleerde zijn, maar een verschrikkelijke buurman. Het zou per ongeluk een lokale oudere kunnen beledigen, een culturele grap kunnen missen, of erger nog, gevaarlijk advies kunnen geven omdat het de lokale regels niet "begrijpt". Dit is de wereld van Large Language Models (LLMs)—AI-hersenen die getraind zijn op enorme hoeveelheden tekst. De grote vraag die wetenschappers zich nu stellen is: Zijn deze AI-hersenen klaar om mensen te helpen in plaatsen zoals India, waar de cultuur en talen ongelooflijk divers zijn?
Om dit te beantwoorden, hebben onderzoekers een manier nodig om de robots te testen. Meestal gebruiken ze standaardtests zoals "MMLU" of "TruthfulQA", die lijken op rijexamens ontworpen voor snelwegen in Europa. Maar rijden in India is anders; de wegen zijn smaller, de verkeersregels zijn uniek en de oriëntatiepunten zijn totaal anders. Als je een auto alleen test op Europese snelwegen, weet je niet of hij een chaotische Indiase straatmarkt aan kan. Dit paper introduceert een nieuwe, open-source "rijproef" die specifiek voor India is gebouwd, genaamd Inspect India Evals. Het controleert of AI-modellen in 16 verschillende Indiase talen kunnen spreken, de Indiase sociale dynamiek begrijpen (zoals het complexe kastenstelsel en religieuze diversiteit) en veilig blijven wanneer ze lastige vragen krijgen over Indiase digitale ID-systemen en betaal-apps.
De Grote Test: Een Nieuwe Kaart voor AI
De auteurs van dit paper, werkend samen met de Indiase overheid (het Ministerie van Elektronica en Informatie Technologie), realiseerden zich dat de bestaande AI-tests de plank misslaan. Ze bouwden een framework genaamd Inspect India Evals, dat als een hindernisbaan met zes uitdagingen is ontworpen, specifiek voor de Indiase context. In plaats van alleen te vragen: "Kun je dit wiskundig probleem oplossen?", vroegen ze: "Kun je dit wiskundige probleem oplossen in het Tamil?" of "Kun je me vertellen hoe ik me kan registreren voor een overheids-ID zonder per ongels iemand te leren hoe hij een vervalsing maakt?".
Het framework bevat zes specifieke uitdagingen:
- Multilingual MMLU: Een kennis test vertaald naar 16 Indiase talen (zoals Hindi, Bengaals en Tamil) om te zien of de AI de feiten echt begrijpt of gewoon gokt.
- BharatBBQ: Een bias-test die controleert of de AI stereotypen koestert over Indiase kasten, religies of regio's, in plaats van alleen Amerikaanse ras- of genderkwesties.
- DPI Safety: Een veiligheidscontrole voor de Indiase "Digital Public Infrastructure" (zoals Aadhaar voor ID en UPI voor betalingen). Het test of de AI weigert te helpen bij fraude, maar nog steeds behulpzame vragen beantwoordt.
- Multilingual Safety: Controleren of de AI schadelijke verzoeken afwijst (zoals "hoe hack ik een bank") zelfs wanneer dit in een regionale taal wordt gevraagd.
- Jailbreak Resistance: Proberen de AI te misleiden om de regels te breken via gesprekken met meerdere stappen in verschillende talen.
- Indian Cultural Knowledge: Een test van diepe culturele feiten, van de Grondwet tot landbouwbeleid.
De Race: Wie Haalde de Test?
De onderzoekers lieten vijf verschillende open-source AI-modellen door deze hindernisbaan gaan. Deze modellen varieerden in grootte van 8 miljard tot 32 miljard "parameters" (denk hierbij aan het aantal verbindingen in de AI-hersenen). Ze testten modellen zoals Sarvam-M 24B (een India-gericht model), Gemma 2 27B, Qwen 2.5 32B, DeepSeek-R1 14B, en Llama 3.1 8B.
Dit is wat ze vonden, en het is een beetje een verrassing:
- De Lokale Held Wint: Het Sarvam-M 24B model, dat specifiek is afgestemd op Indiase talen en cultuur, kwam overall als winnaar uit de bus. Het behaalde een gemiddelde score van 74,4%. Het was vooral goed in het begrijpen van de Indiase cultuur (een score van 60,0%) en het perfect afhandelen van digitale veiligheidsvragen (100%). Het versloeg zelfs grotere, krachtigere modellen op het gebied van culturele kennis.
- De Veiligheidsster: Gemma 2 27B kwam heel dichtbij als tweede met een gemiddelde van 72,1%. Het was een perfecte veiligheidswachter, met 100% op bias-tests en digitale veiligheid, hoewel het iets meer moeite had met diepe culturele feiten.
- De Redeneerrobot Strijdt: DeepSeek-R1 14B staat bekend als een "redeneermodel" dat heel diep nadenkt voordat het antwoordt. Het excelleerde in de test voor feitelijke redenering in meerdere talen met een score van 80,6%. Echter, het faalde jammerlijk bij veiligheid en culturele kennis, met slechts 20% op digitale veiligheid en 10% op culturele feiten. Het was zo gefocust op "denken" dat het vergat om veilig of cultureel bewust te zijn.
- De Grote Modellen Wonnen Niet: Opvallend genoeg garandeerde het hebben van meer parameters (een groter brein) geen overwinning. De Qwen 2.5 32B (een model met 32 miljard parameters) scoorde op veel gebieden lager dan de kleinere Sarvam-M 24B. Dit suggereert dat voor India gespecialiseerde training belangrijker is dan alleen de ruwe grootte.
De "India Fairness Index"
Om al deze cijfers inzichtelijk te maken, creëerden de auteurs een enkele score genaamd de India Fairness Index (IFI). Deze score combineert veiligheid, bias en feitelijke nauwkeurigheid in één getal.
- Gemma 2 27B behaalde de hoogste IFI-score van 83,1%.
- Sarvam-M 24B volgde op de voet met 76,6%.
- DeepSeek-R1 14B zakte naar 65,2%, wat aantoont dat slim zijn niet genoeg is als je niet veilig bent.
- Llama 3.1 8B scoorde het laagst met 51,6%.
Het Oordeel: Veiligheid is Overal, Cultuur is Moeilijk
Een van de meest interessante bevindingen was dat alle vijf de modellen perfect waren in het weigeren van schadelijke verzoeken in meerdere talen. Ze scoorden allemaal 100% op de "Multilingual Safety" test. Of er nu in het Engels, Hindi of Tamil werd gevraagd om iets kwaadwillends te doen, ze zeiden allemaal "nee". Dit is goed nieuws!
Echter, de modellen hadden aanzienlijke moeite met Indiase Culturele Kennis. Het gespecialiseerde model (Sarvam) scoorde 60%, terwijl de anderen tussen de 10% en 30% schommelden. Dit suggereert dat standaard wereldwijde AI-training niet genoeg is; je hebt specifieke training nodig over de Indiase geschiedenis, festivals en sociale structuren om het goed te doen.
De auteurs merkten ook een afruil op: DeepSeek-R1 liet zien dat modellen die ontworpen zijn voor complexe redeneringen soms kunnen worden misleid om veiligheidsregels te breken (slechts 40% weerstand tegen jailbreaks), terwijl modellen zoals Gemma en Sarvam veel taaier waren (80% weerstand).
Wat Dit Betekent
Het paper concludeert dat we niet zomaar een AI die in het Westen is getraind, in India kunnen droppen. Het is alsof je een Formule 1-auto probeert te besturen op een modderige dorpsweg; hij is misschien snel, maar hij zal vastlopen of crashen. De resultaten suggereren dat voor AI om echt nuttig en veilig te zijn in India, het een gespecialiseerde afstemming nodig heeft voor lokale talen en culturen.
De auteurs benadrukken voorzichtig dat deze resultaten gebaseerd zijn op een "pilotstudie" met een klein aantal testvragen (slechts 5 samples per taak). Hoewel de trends duidelijk zijn, suggereren ze dat er meer testen met grotere groepen vragen nodig zijn om absoluut zeker te zijn. Maar de boodschap is helder: Gespecialiseerde, cultureel bewuste modellen zijn de toekomst van AI in India, en we hebben betere tests nodig om te controleren of ze veilig zijn voordat we ze loslaten.
De code en data voor deze nieuwe "rijproef" zijn nu openbaar beschikbaar voor iedereen om te gebruiken, zodat ontwikkelaars de beste, veiligere AI voor het meest diverse land ter wereld kunnen blijven bouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.