← Últimos artículos
💬 NLP

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

El artículo presenta "Inspect India Evals", un marco de evaluación de código abierto construido sobre la plataforma Inspect AI del AISI del Reino Unido para abordar la falta de evaluaciones cultural y lingüísticamente relevantes para los modelos de lenguaje de gran tamaño en la India mediante el testeo de seis bancos de pruebas específicos a través de dieciséis idiomas, revelando que modelos como Sarvam-M y Gemma 2 superan a sus homólogos de mayor tamaño en conocimiento cultural indio y cumplimiento de seguridad.

Autores originales: Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

Publicado 2026-07-29
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que acabas de comprar un robot asistente súper inteligente que puede hablar contigo, escribir historias y resolver problemas matemáticos. Estás emocionado por dejarlo suelto en tu vecindario, pero hay un inconveniente: tu vecindario es un mercado gigante y bullicioso donde la gente habla docenas de idiomas diferentes, celebra festivales únicos y tiene sus propias tradiciones profundamente arraigadas. Si solo enseñaras a este robot usando libros escritos en inglés sobre la vida en Nueva York o Londres, sería un erudito brillante pero un mal vecino. Podría insultar accidentalmente a un anciano local, malinterpretar un chiste cultural o, peor aún, dar consejos peligrosos porque no "entiende" las reglas locales. Este es el mundo de los Modelos de Lenguaje Extensos (LLM) —cerebros de IA entrenados con cantidades masivas de texto. La gran pregunta que los científicos se hacen ahora es: ¿Están estos cerebros de IA listos para ayudar a las personas en lugares como la India, donde la cultura y los idiomas son increíblemente diversos?

Para responder a esto, los investigadores necesitan una forma de probar a los robots. Normalmente, utilizan pruebas estándar como "MMLU" o "TruthfulQA", que son como exámenes de conducir diseñados para autopistas en Europa. Pero conducir en la India es diferente; las carreteras son más estrechas, las reglas de tráfico son únicas y los puntos de referencia son totalmente distintos. Si solo pruebas un coche en autopistas europeas, no sabrás si puede manejar un mercado callejero caótico en la India. Este documento presenta una nueva "prueba de conducción" de código abierto diseñada específicamente para la India, llamada Inspect India Evals. Verifica si los modelos de IA pueden hablar 16 idiomas indios diferentes, entender la dinámica social de la India (como el complejo sistema de castas y la diversidad religiosa) y mantenerse seguros cuando se les hacen preguntas complicadas sobre los sistemas de identidad digital y las aplicaciones de pago de la India.

La Gran Prueba: Un Nuevo Mapa para la IA

Los autores de este documento, trabajando con el Ministerio de Electrónica e Información de Tecnología del gobierno indio, se dieron cuenta de que las pruebas de IA existentes no daban en el clavo. Construyeron un marco llamado Inspect India Evals, que es como una pista de obstáculos de seis desafíos diseñada específicamente para el contexto indio. En lugar de solo preguntar, "¿Puedes resolver este problema matemático?", preguntaron: "¿Puedes resolver este problema matemático en tamil?" o "¿Puedes decirme cómo registrarme para una identificación gubernamental sin enseñar accidentalmente a alguien cómo falsificarla?".

El marco incluye seis desafíos específicos:

  1. MMLU Multilingüe: Una prueba de conocimiento traducida a 16 idiomas indios (como el hindi, el bengalí y el tamil) para ver si la IA realmente entiende los hechos o solo adivina.
  2. BharatBBQ: Una prueba de sesgo que verifica si la IA mantiene estereotipos sobre las castas, religiones o regiones de la India, en lugar de solo problemas de raza o género estadounidenses.
  3. Seguridad de la DPI: Una verificación de seguridad para la "Infraestructura Pública Digital" de la India (como Aadhaar para identificación y UPI para pagos). Prueba si la IA se niega a ayudar con fraudes pero sigue respondiendo preguntas útiles.
  4. Seguridad Multilingüe: Verificar si la IA dice "no" a solicitudes dañinas (como "cómo hackear un banco") incluso cuando se le pregunta en un idioma regional.
  5. Resistencia al Jailbreak: Intentar engañar a la IA para que rompa sus reglas usando conversaciones de varios pasos en diferentes idiomas.
  6. Conocimiento Cultural Indio: Una prueba de hechos culturales profundos, desde la Constitución hasta las políticas agrícolas.

La Carrera: ¿Quién Pasó la Prueba?

Los investigadores sometieron a cinco modelos de IA de código abierto diferentes a este circuito de obstáculos. Estos modelos variaban en tamaño, desde 8 mil millones hasta 32 mil millones de "parámetros" (piensa en esto como el número de conexiones en el cerebro de la IA). Probaron modelos como Sarvam-M 24B (un modelo enfocado en la India), Gemma 2 27B, Qwen 2.5 32B, DeepSeek-R1 14B y Llama 3.1 8B.

Aquí está lo que encontraron, y es un poco sorprendente:

  • El Héroe Local Gana: El modelo Sarvam-M 24B, que fue ajustado específicamente para los idiomas y la cultura de la India, resultó ganador general. Obtuvo un promedio del 74.4%. Fue especialmente bueno entendiendo la cultura de la India (obteniendo un 60.0%) y manejando las preguntas de seguridad digital perfectamente (100%). Incluso superó a modelos más grandes y potentes en conocimiento cultural.
  • La Estrella de la Seguridad: Gemma 2 27B quedó en un segundo lugar muy cercano con un promedio de 72.1%. Fue un guardián de seguridad perfecto, obteniendo un 100% en pruebas de sesgo y seguridad digital, aunque tuvo más dificultades con los hechos culturales profundos.
  • El Robot de Razonamiento en Apuros: DeepSeek-R1 14B es famoso por ser un modelo de "razonamiento" que piensa mucho antes de responder. Triunfó en la prueba de razonamiento factual en múltiples idiomas, obteniendo un 80.6%. Sin embargo, fracasó estrepitosamente en seguridad y conocimiento cultural, obteniendo solo un 20% en seguridad digital y un 10% en hechos culturales. Estaba tan concentrado en "pensar" que olvidó ser seguro o culturalmente consciente.
  • Los Modelos Grandes No Ganaron: Curiosamente, tener más parámetros (un cerebro más grande) no garantizó la victoria. El Qwen 2.5 32B (un modelo de 32 mil millones de parámetros) obtuvo una puntuación más baja que el más pequeño Sarvam-M 24B en muchas áreas. Esto sugiere que para la India, el entrenamiento especializado importa más que el simple tamaño bruto.

El "Índice de Equidad de la India"

Para dar sentido a todos estos números, los autores crearon una puntuación única llamada Índice de Equidad de la India (IFI). Esta puntuación combina seguridad, sesgo y precisión factual en un solo número.

  • Gemma 2 27B obtuvo la puntuación IFI más alta de 83.1%.
  • Sarvam-M 24B le siguió de cerca con 76.6%.
  • DeepSeek-R1 14B cayó a 65.2%, demostiendo que ser inteligente no es suficiente si no eres seguro.
  • Llama 3.1 8B obtuvo la puntuación más baja con 51.6%.

El Veredicto: La Seguridad está en Todas Partes, la Cultura es Difícil

Uno de los hallazgos más interesantes fue que todos los cinco modelos fueron perfectos al rechazar solicitudes dañinas en múltiples idiomas. Todos obtuvieron un 100% en la prueba de "Seguridad Multilingüe". Ya sea que se les pida hacer algo malo en inglés, hindi o tamil, todos dijeron "no". ¡Esto es una excelente noticia!

Sin embargo, los modelos tuvieron dificultades significativas con el Conocimiento Cultural Indio. El modelo especializado (Sarvam) obtuvo un 60%, mientras que los otros rondaron entre el 10% y el 30%. Esto sugiere que el entrenamiento global estándar no es suficiente; se necesita un entrenamiento específico en la historia, los festivales y las estructuras sociales de la India para hacerlo bien.

Los autores también notaron un intercambio: DeepSeek-R1 mostró que los modelos diseñados para el razonamiento complejo a veces pueden ser engañados para romper las reglas de seguridad (solo 40% de resistencia a los jailbreaks), mientras que modelos como Gemma y Sarvam fueron mucho más resistentes (80%).

Lo Que Esto Significa

El documento concluye que no podemos simplemente tomar una IA entrenada en Occidente y dejarla caer en la India. Es como intentar conducir un coche de Fórmula 1 en un camino rural embarrado; puede ser rápido, pero se quedará atascado o chocará. Los resultados sugieren que para que la IA sea verdaderamente útil y segura en la India, necesita un ajuste especializado para los idiomas y culturas locales.

Los autores advierten que estos resultados se basan en un estudio "piloto" con un número pequeño de preguntas de prueba (solo 5 muestras por tarea). Aunque las tendencias son claras, sugieren que se necesita más testing con grupos más grandes de preguntas para estar absolutamente seguros. Pero el mensaje es claro: los modelos especializados y culturalmente conscientes son el futuro de la IA en la India, y necesitamos mejores pruebas para asegurar que sean seguros antes de dejarlos sueltos.

El código y los datos para este nuevo "examen de conducción" están ahora abiertos para que todos los usen, de modo que los desarrolladores puedan seguir construyendo una IA mejor y más segura para la nación más diversa del mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →