← Derniers articles
💬 NLP

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

L'article présente « Inspect India Evals », un cadre d'évaluation open-source construit sur la plateforme Inspect AI de l'AISI britannique pour remédier au manque d'évaluations culturellement et linguistiquement pertinentes pour les modèles de langage de grande taille en Inde en testant six benchmarks spécifiques à travers seize langues, révélant que des modèles tels que Sarvam-M et Gemma 2 surpassent des homologues plus volumineux en matière de connaissances culturelles indiennes et de conformité en matière de sécurité.

Auteurs originaux : Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

Publié 2026-07-29
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous venez d'acheter un assistant robotique super intelligent capable de vous parler, d'écrire des histoires et de résoudre des problèmes mathématiques. Vous êtes ravi de le laisser circuler dans votre quartier, mais il y a un piège : votre quartier est un marché géant et animé où les gens parlent des dizaines de langues différentes, célèbrent des festivals uniques et possèdent leurs propres traditions profondément ancrées. Si vous n'enseigniez à ce robot qu'en utilisant des livres écrits en anglais sur la vie à New York ou à Londres, il serait un brillant érudit mais un très mauvais voisin. Il pourrait accidentellement insulter un ancien du quartier, mal comprendre une blague culturelle ou, pire encore, donner des conseils dangereux parce qu'il ne « comprend » pas les règles locales. C'est le monde des Grands Modèles de Langage (LLM) — des cerveaux d'IA entraînés sur des quantités massives de texte. La grande question que les scientifiques se posent actuellement est la suivante : Ces cerveaux d'IA sont-ils prêts à aider les populations dans des endroits comme l'Inde, où la culture et les langues sont incroyablement diverses ?

Pour répondre à cela, les chercheurs ont besoin d'un moyen de tester les robots. Habituellement, ils utilisent des tests standards comme « MMLU » ou « TruthfulQA », qui sont comme des tests de conduite conçus pour les autoroutes en Europe. Mais conduire en Inde est différent ; les routes sont plus étroites, les règles de circulation sont uniques et les points de repère sont totalement différents. Si vous ne testez une voiture que sur des autoroutes européennes, vous ne saurez pas si elle peut gérer un marché de rue indien chaotique. Ce document présente un nouveau « test de conduite » en open-source spécifiquement conçu pour l'Inde, appelé Inspect India Evals. Il vérifie si les modèles d'IA peuvent parler 16 langues indiennes différentes, comprendre la dynamique sociale indienne (comme le système complexe des castes et la diversité religieuse) et rester sûrs lorsqu'on leur pose des questions délicates sur les systèmes d'identité numérique ou les applications de paiement en Inde.

Le Grand Test : Une Nouvelle Carte pour l'IA

Les auteurs de ce document, travaillant avec le ministère de l'Électronique et de l'Information et des Technologies de l'Inde, ont réalisé que les tests d'IA existants passaient à côté de la plaque. Ils ont construit un cadre appelé Inspect India Evals, qui est comme un parcours d'obstacles en six défis conçu spécifiquement pour le contexte indien. Au lieu de simplement demander : « Peux-tu résoudre ce problème de mathématiques ? », ils ont demandé : « Peux-tu résoudre ce problème de mathématiques en tamoul ? » ou « Peux-tu me dire comment m'enregistrer pour une identité gouvernementale sans accidentellement apprendre à quelqu'un comment la falsifier ? ».

Le cadre comprend six défis spécifiques :

  1. MMLU Multilingue : Un test de connaissances traduit en 16 langues indiennes (comme le hindi, le bengali et le tamoul) pour voir si l'IA comprend réellement les faits ou si elle ne fait que deviner.
  2. BharatBBQ : Un test de biais qui vérifie si l'IA détient des stéréotypes sur les castes, les religions ou les régions indiennes, plutôt que de se concentrer uniquement sur les questions de race ou de genre américaines.
  3. Sécurité de l'IUP (DPI Safety) : Un contrôle de sécurité pour l'infrastructure publique numérique de l'Inde (comme l'Aadhaar pour l'identité et l'UPI pour les paiements). Il teste si l'IA refuse d'aider en cas de fraude tout en répondant aux questions utiles.
  4. Sécurité Multilingue : Vérifier si l'IA dit « non » aux demandes nuisibles (comme « comment pirater une banque ») même lorsqu'elles sont formulées dans une langue régionale.
  5. Résistance au Jailbreak : Tenter de piéger l'IA pour lui faire enfreindre ses règles en utilisant des conversations à plusieurs étapes dans différentes langues.
  6. Connaissances Culturelles Indiennes : Un test de faits culturels profonds, de la Constitution aux politiques agricoles.

La Course : Qui a Réussi le Test ?

Les chercheurs ont soumis cinq modèles d'IA open-source différents à ce parcours d'obstacles. Ces modèles variaient de 8 milliards à 32 milliards de « paramètres » (considérez cela comme le nombre de connexions dans le cerveau de l'IA). Ils ont testé des modèles comme Sarvam-M 24B (un modèle axé sur l'Inde), Gemma 2 27B, Qwen 2.5 32B, DeepSeek-R1 14B et Llama 3.1 8B.

Voici ce qu'ils ont découvert, et c'est un peu surprenant :

  • Le Héros Local l'Emporte : Le modèle Sarvam-M 24B, qui a été spécifiquement ajusté pour les langues et la culture indiennes, arrive en tête du classement général. Il a obtenu une moyenne de 74,4 %. Il était particulièrement bon pour comprendre la culture indienne (score de 60,0 %) et pour gérer parfaitement les questions de sécurité numérique (100 %). Il a même battu des modèles plus grands et plus puissants sur les connaissances culturelles.
  • L'Étoile de la Sécurité : Gemma 2 27B arrive en deuxième position, de très près, avec une moyenne de 72,1 %. C'était un garde de sécurité parfait, obtenant 100 % aux tests de biais et de sécurité numérique, bien qu'il ait eu un peu plus de mal avec les faits culturels profonds.
  • La Difficulté du Robot de Raisonnement : DeepSeek-R1 14B est célèbre pour être un modèle de « raisonnement » qui réfléchit très intensément avant de répondre. Il a excellé dans le test de raisonnement factuel dans plusieurs langues, avec un score de 80,6 %. Cependant, il a échoué lamentablement sur la sécurité et les connaissances culturelles, n'obtenant que 20 % sur la sécurité numérique et 10 % sur les faits culturels. Il était tellement concentré sur la « réflexion » qu'il en a oublié d'être sûr ou culturellement conscient.
  • Les Grands Modèles N'ont Pas Gagné : Curieusement, avoir plus de paramètres (un cerveau plus gros) ne garantissait pas la victoire. Le Qwen 2.5 32B (un modèle de 32 milliards de paramètres) a obtenu un score inférieur au plus petit Sarvam-M 24B dans de nombreux domaines. Cela suggère que pour l'Inde, l'entraînement spécialisé importe plus que la simple taille brute.

L'« Indice d'Équité de l'Inde »

Pour donner du sens à tous ces chiffres, les auteurs ont créé un score unique appelé l'Indice d'Équité de l'Inde (IFI). Ce score combine la sécurité, le biais et l'exactitude factuelle en un seul chiffre.

  • Gemma 2 27B a obtenu le score IFI le plus élevé de 83,1 %.
  • Sarvam-M 24B suit de près avec 76,6 %.
  • DeepSeek-R1 14B chute à 65,2 %, mont'rant qu'être intelligent ne suffit pas si l'on n'est pas sûr de soi.
  • Llama 3.1 8B a obtenu le score le plus bas avec 51,6 %.

Le Verdict : La Sécurité est Partout, la Culture est Difficile

L'une des découvertes les plus intéressantes est que les cinq modèles ont été parfaits pour refuser des demandes nuisibles dans plusieurs langues. Ils ont tous obtenu 100 % au test de « Sécurité Multilingue ». Qu'on leur demande de faire quelque chose de mal en anglais, en hindi ou en tamoul, ils ont tous dit « non ». C'est une excellente nouvelle !

Cependant, les modèles ont eu des difficultés significatives avec les Connaissances Culturelles Indiennes. Le modèle spécialisé (Sarvam-M) a obtenu 60 %, tandis que les autres oscillaient entre 10 % et 30 %. Cela suggère que l'entraînement global standard ne suffit pas ; il faut un entraînement spécifique sur l'histoire, les festivals et les structures sociales de l'Inde pour réussir.

Les auteurs ont également noté un compromis : DeepSeek-R1 a montré que les modèles conçus pour le raisonnement complexe peuvent parfois être trompés pour enfreindre les règles de sécurité (seulement 40 % de résistance aux jailbreaks), tandis que des modèles comme Gemma et Sarvam étaient beaucoup plus robustes (80 % de résistance).

Ce que cela signifie

Le document conclut que nous ne pouvons pas simplement prendre une IA entraînée en Occident et la parachuter en Inde. C'est comme essayer de conduire une voiture de Formule 1 sur une route de village boueuse ; elle peut être rapide, mais elle restera coincée ou s'écrasera. Les résultats suggèrent que pour que l'IA soit véritablement utile et sûre en Inde, elle nécessite un ajustement spécialisé pour les langues et les cultures locales.

Les auteurs précisent que ces résultats sont basés sur une étude « pilote » avec un petit nombre de questions de test (seulement 5 échantillons par tâche). Bien que les tendances soient claires, ils suggèrent qu'un test plus approfondi avec des groupes de questions plus larges est nécessaire pour être absolument certain. Mais le message est clair : des modèles spécialisés et culturellement conscients sont l'avenir de l'IA en Inde, et nous avons besoin de meilleurs tests pour nous assurer qu'ils sont sûrs avant de les laisser circuler.

Le code et les données de ce nouveau « test de conduite » sont désormais en accès libre pour que tous puissent les utiliser, afin que les développeurs puissent continuer à construire une IA meilleure et plus sûre pour la nation la plus diverse du monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →