UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding
Dieses Paper stellt UrduMMLU vor, einen umfassenden Benchmark mit über 26.000 urdu-sprachigen Multiple-Choice-Fragen aus nativen Bildungsquellen zur Bewertung der Leistung von 30 großen Sprachmodellen, wobei signifikante Lücken in deren Verständnis von regional fundierten Inhalten und Geisteswissenschaften im Vergleich zu MINT-Fächern aufgedeckt wurden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie möchten testen, wie intelligent eine Gruppe von Schülern ist. Jahrelang konnten Sie ihnen nur Tests geben, die auf Englisch verfasst wurden. Sie wissen, dass sie Englisch lesen können, aber Sie haben keine Ahnung, ob sie die Geschichte, Literatur und Wissenschaft ihrer eigenen Kultur wirklich verstehen oder ob sie lediglich die englischen Übersetzungen dieser Konzepte auswendig gelernt haben.
Dieses Papier stellt URDUMMLU vor, eine massive neue „Prüfung“, die speziell für die Urdu-Sprache entwickelt wurde, die von über 230 Millionen Menschen gesprochen wird. Hier ist die Aufschlüsselung dessen, was sie getan und gefunden haben, unter Verwendung einiger einfacher Analogien.
1. Das Problem: Das Problem der „Übersetzten Speisekarte“
Bis jetzt, wenn Forscher KI-Modelle in Urdu testen wollten, nahmen sie meist englische Tests und übersetzten diese.
- Die Analie: Stellen Sie sich vor, Sie versuchen, die Fähigkeit eines Kochs, authentische italienische Küche zuzubereiten, zu beurteilen, indem Sie ihm eine Speisekarte geben, die aus dem Französischen übersetzt wurde. Er mag die Wörter richtig bekommen, aber er könnte die kulturellen Nuancen, die lokalen Zutaten oder die spezifische Art und Weise, wie ein Gericht traditionell zubereitet wird, verpassen.
- Die Realität: Bestehende Urdu-Benchmarks waren wie diese übersetzten Speisekarten. Sie erfassten nicht den einzigartigen Geschmack der Urdu-Bildung, Literatur oder der lokalen Geschichte (wie Pakistan Studies oder Islamic Studies).
2. Die Lösung: Den Aufbau einer nativen „Urdu-Prüfungshalle“
Die Autoren entwickelten URDUMMLU, einen Benchmark mit 26.431 Multiple-Choice-Fragen.
- Woher kamen die Fragen? Anstatt englische Fragen zu übersetzen, gingen sie direkt an die Quelle: tatsächliche pakistanische Schulbücher, vergangene Prüfungsunterlagen (SSC/HSSC) und lokale Urdu-Fragenbanken.
- Das „Doppel-Check“-System: Da einige dieser alten Prüfungsunterlagen keine Antwortschlüssel hatten, engagierte das Team 1k 17 Muttersprachler des Urdu (meist mit Universitätsabschlüssen), die als „Aufsichtspersonen“ fungierten.
- Die Regel: Zwei Aufsichtspersonen mussten sich jede Frage ansehen und sich auf die Antwort einigen. Wenn sie sich uneinig waren oder wenn die Frage fehlerhaft war, wurde die Frage aussortiert. Dies stellte sicher, dass die „Goldstandard“-Antworten zu 100 % zuverlässig waren.
- Der Umfang: Die Prüfung deckt 26 Fächer ab, die von Mathematik und Physik (MINT) bis hin zu Urdu-Literatur, Islamwissenschaften und Pakistan Studies reichen.
3. Der Test: 30 KI-Modelle in der Prüfungshalle
Die Forscher nahmen 30 verschiedene KI-Modelle (sowohl berühmte „geschlossene“ wie Googles Gemini als auch Open-Source-Modelle) und gaben ihnen diese Urdu-Prüfung. Sie testeten sie auf zwei Arten:
- Englische Anweisungen: „Hier ist eine Frage auf Urdu, wähle die Antwort aus.“ (Die Anweisung ist auf Englisch).
- Urdu-Anweisungen: „یہاں ایک سوال ہے، جواب منتخب کریں۔“ (Die Anweisung ist auf Urdu).
4. Die Ergebnisse: Die „MINT vs. Kultur“-Lücke
Die Ergebnisse waren aufschlussreich, wie ein Zeugnis, das zeigt, dass ein Schüler gut in Mathe ist, aber schrecklich darin, Gedichte zu analysieren.
- Der Top-Performer: Das Modell Gemini-3.5-Flash war der klare Gewinner und erreichte über 90 %. Es war das einzige Modell, das die 85 %-Marke durchbrach.
- Die Open-Source-Lücke: Das beste Open-Source-Modell (DeepSeek-V4-Flash) erreichte etwa 82 %. Obwohl es gut war, lag es hinter dem Spitzenreiter um etwa 8 Punkte zurück.
- Der „Geisteswissenschaften“-Absturz: Dies ist die wichtigste Erkenntnis.
- Die Analie: Stellen Sie sich einen Schüler vor, der komplexe Physikgleichungen lösen kann (MINT), aber kläglich scheitert, wenn er gebeten wird, ein Gedicht zu analysieren oder einen religiösen Text zu erklären (Geisteswissenschaften).
- Die Realität: Fast alle Modelle schnitten bei Fragen zu Naturwissenschaften und Mathematik deutlich besser ab. Als die Fragen zu Urdu-Literatur, der Urdu-Sprache und Islamwissenschaften wechselten, sanken viele Modelle um 25 bis 40 Prozentpunkte.
- Beispiel: Ein Modell kann 97 % in Physik erreichen, aber nur 67 % in Urdu-Literatur. Dies deutet darauf hin, dass die Modelle die Fakten der Wissenschaft (die universell sind) kennen, aber es ihnen an dem tiefen kulturellen und linguistischen Verständnis fehlt, das für lokale Themen erforderlich ist.
5. Andere überraschende Erkenntnisse
- Die Sprache der Anweisungen spielte kaum eine Rolle: Ob die KI angewiesen wurde, auf Englisch oder Urdu zu antworten, änderte den Score kaum. Das Problem war nicht die Sprache der Anweisung, sondern der Mangel an Wissen im „Gehirn“ des Modells über die Urdu-Kultur.
- Few-Shot Learning (Das „Spickzettel“-Prinzip): Die Forscher versuchten, der KI vor dem Test ein paar Beispielfragen zu geben (wie einen Spickzettel). Es half ein wenig (Steigerung der Scores um 1–3 Punkte), aber es reichte nicht aus, um die großen Lücken im kulturellen Wissen zu schließen.
- Die „Urdu-spezifischen“ Modelle: Interessanterweise schnitten Modelle, die speziell nur für Urdu trainiert wurden (wie Qalb und Alif), ziemlich schlecht ab (etwa 35 %), oft schlechter als allgemeine Modelle. Dies deutet darauf hin, dass es nicht ausreicht, die Modelle einfach nur mit Urdu-Texten zu trainieren; die Modelle müssen mit pädagogischem und argumentativem Material trainiert werden, nicht nur mit Chat- oder Nachrichten-Texten.
Zusammenfassung
URDUMMLU ist wie ein neuer, strenger „Führerschein-Test“ für KI in Urdu. Es beweist, dass KI zwar sehr gut darin wird, wissenschaftliche Fragen auf Urdu zu beantworten, aber immer noch Schwierigkeiten hat, die Seele der Sprache zu verstehen – ihre Literatur, Geschichte und lokale Kultur. Die derzeit „beste“ KI (Gemini) ist ein starker Fahrer, aber die Open-Source-Modelle lernen noch die Verkehrsregeln, besonders wenn es um die kulturellen Nuancen der Urdu-sprachigen Welt geht.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.