← Últimos artículos
💬 NLP

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

El artículo presenta ChiKhaPo, un referente multilingüe a gran escala que cubre más de 2700 idiomas con ocho subtareas diseñadas para evaluar las capacidades de comprensión y generación léxica de los modelos de lenguaje de gran tamaño, revelando que incluso los modelos de vanguardia tienen dificultades con la competencia lingüística básica en la gran mayoría de las lenguas escritas del mundo.

Autores originales: Emily Chang, Niyati Bafna

Publicado 2026-06-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Emily Chang, Niyati Bafna

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante y súper inteligente de libros escritos en miles de idiomas diferentes. Contratas a un nuevo bibliotecario brillante (un Modelo de Lenguaje Extenso, o LLM) para que te ayude a encontrar palabras específicas y traducirlas. Quieres saber: ¿Este bibliotecario realmente entiende las palabras, o solo está adivinando basándose en los pocos idiomas que ha estudiado más?

Este artículo presenta un nuevo test llamado ChiKhaPo (pronunciado Chi-Kha-Po) para responder exactamente a esa pregunta. El nombre proviene de un dicho que significa "paso a paso", porque los autores creen que necesitamos dar pasos pequeños y cuidadosos para entender cómo funcionan realmente estos modelos de IA en los idiomas del mundo.

Aquí está el desglose de lo que hicieron, utilizando algunas analogías cotidianas:

1. El Problema: El "Salón VIP" de los Idiomas

Actualmente, la mayoría de las pruebas para la IA son como salones VIP. Solo permiten la entrada a unas pocas docenas de "Idiomas de Altos Recursos" (como el inglés, el español o el francés). Estos son idiomas con muchísimos datos en internet.

  • La Realidad: Existen más de 3,800 idiomas escritos en el mundo. La gran mayoría están fuera de estos salones VIP.
  • La Brecha: No sabemos si la IA puede manejar los otros 3,700+ idiomas. Podría ser un genio en inglés, pero estar completamente perdido cuando se le pide traducir una palabra en un idioma de bajos recursos.

2. La Solución: El "Examen Multilingüe Masivo" (ChiKhaPo)

Los autores construyeron un examen masivo que cubre más de 2,700 idiomas. En lugar de pedirle a la IA que escriba un ensayo complejo o resuelva un problema matemático (tareas que son difíciles), se centraron en lo básico: la Competencia Léxica.

  • La Analogía: Piensa en esto como probar el vocabulario de un estudiante antes de pedirle que escriba una novela. ¿Puede reconocer una palabra? ¿Puede decir qué significa? ¿Puede usarla en una oración?

El examen tiene 8 secciones diferentes (subtareas) para probar estas habilidades desde diferentes ángulos:

  • Traducción de Palabras: "¿Cuál es la palabra para 'lluvia' en malayo?" (Traducción directa).
  • Traducción de Palabras con Contexto: "En esta historia sobre una tormenta, ¿qué significa la palabra 'ujan'?" (Usando pistas de contexto).
  • Modelado Condicionado por Traducción: Se le da a la IA una oración en un idioma y esta tiene que predecir la siguiente palabra en la traducción. (Como un juego de "completar el espacio en blanco").
  • Traducción de Bolsa de Palabras (Bag-of-Words): La IA traduce una oración completa y la prueba verifica si obtuvo bien las palabras individuales, incluso si la estructura de la oración es un poco desordenada.

3. Los Resultados: La IA tiene dificultades con lo básico

Los autores probaron 6 de las IA más inteligentes disponibles hoy en día en este examen.

  • El Hallazgo: Incluso los mejores modelos tuvieron dificultades significativas, especialmente con los idiomas de bajos recursos.
  • La Brecha "Comprensión vs. Generación": Los modelos fueron mejores entendiendo una palabra (leerla y saber qué significa) que generándola (decir o escribir la palabra por sí mismos).
    • Analogía: Es como una persona que puede leer un menú en un idioma extranjero y saber qué es la "sopa", pero cuando se le pide que la pida, se queda bloqueada y no puede decir la palabra.
  • La Brecha "Ricos vs. Pobres": Los modelos funcionaron mucho mejor en idiomas que tienen muchos datos (Altos Recursos) en comparación con los de pocos datos (Bajos Recursos). La brecha de rendimiento fue enorme.

4. Por qué esto importa (Según el artículo)

El artículo argumenta que no podemos asumir que una IA es "multilingüe" solo porque funciona bien en inglés.

  • El "Proxy" (Indicador) Descubierto: Encontraron que si una IA es buena traduciendo palabras sueltas (la prueba simple), generalmente es buena traduciendo oraciones completas (la prueba compleja). Esto significa que la prueba simple de palabras es una forma barata y fácil de comprobar si una IA está lista para un trabajo más difícil.
  • El Objetivo: Los autores quieren poner de relieve la desigualdad lingüística. Actualmente, el PLN (Procesamiento de Lenguaje Natural) es injusto porque ignora miles de idiomas. ChiKhaPo es una herramienta para obligar a los investigadores a prestar atención a estos idiomas descuidados y construir una IA mejor y más justa.

Resumen

ChiKhaPo es un examen de vocabulario gigante y paso a paso para la IA a través de más de 2,700 idiomas. Revela que incluso los modelos de IA más inteligentes son actualmente "ciegos a las palabras" para la mayoría de los idiomas del mundo. A menudo pueden entender una palabra pero luchan por producirla, y funcionan terriblemente en idiomas que no tienen muchos datos en línea. Los autores esperan que esta prueba anime a la comunidad de la IA a dejar de centrarse solo en los idiomas "VIP" y comenzar a construir modelos que realmente entiendan al mundo entero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →