← Últimos artículos
💬 NLP

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

Este artículo presenta OMGEval, el primer referente de evaluación generativa multilingüe de código abierto que cuenta con 804 preguntas abiertas rigurosamente verificadas y localizadas culturalmente en cinco idiomas para evaluar y mejorar las capacidades multilingües de los modelos de lenguaje de gran tamaño.

Autores originales: Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

Publicado 2026-02-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has construido un bibliotecario brillante y omnisciente que puede hablar todos los idiomas del mundo. Quieres probar si este bibliotecario es verdaderamente inteligente en todas las culturas, o si solo es un "experto local" que entiende la cultura de los Estados Unidos.

Este artículo presenta OMGEval, que es esencialmente una prueba de "licencia de conducir" multicultural para estos bibliotecarios de IA (Modelos de Lenguaje Extensos).

Aquí está el desglose de lo que hicieron los autores, utilizando analogías simples:

1. El Problema: El sesgo de la "Televisión Americana"

La mayoría de las pruebas actuales para la IA son como ver un programa de televisión que solo se transmite en inglés y habla de festividades, comida e historia estadounidense.

  • El problema: Si le preguntas a una IA: "¿Cuál es la comida tradicional para el Día de Acción de Gracias?", responderá correctamente: "Pavo". Pero si le preguntas a un hablante de chino: "¿Cuál es la comida tradicional para el Festival del Bote del Dragón?", una IA entrenada solo con datos estadounidenses podría confundirse o dar una respuesta incorrecta porque no entiende la cultura local.
  • La afirmación del artículo: La mayoría de las pruebas existentes se centran demasiado en el inglés. No comprueban si la IA entiende que en Rusia, la Pascua implica pasteles específicos, o que en España, hay dulces específicos para el Día de Todos los Santos.

2. La Solución: OMGEval (La prueba del "Guía Turístico Local")

Los autores crearon una nueva prueba llamada OMGEval. En lugar de simplemente traducir preguntas del inglés a otros idiomas (lo que sería como poner subtítulos en inglés a una película rusa), ellos reescribieron las preguntas para que se ajustaran a la cultura local.

  • La analogía: Imagina una pregunta de examen sobre "Vacaciones de Verano".
    • La forma antigua (Traducción): "¿A dónde van los estadounidenses para las vacaciones de verano?" (Respuesta: Hawái).
    • La forma de OMGEval (Localización): "¿A dónde va la gente china para las vacaciones de verano?" (Respuesta: Sanya).
    • Por qué importa: Ambas preguntas tratan sobre "lugares de vacaciones de verano", pero el contexto cultural es diferente. OMGEval asegura que la IA conozca la versión local de la historia, no solo la estadounidense.

3. Cómo lo construyeron

El equipo no utilizó simplemente un robot para traducir cosas; utilizaron un equipo de expertos humanos (lingüistas) para actuar como editores culturales.

  • El proceso: Tomaron 804 preguntas abiertas (como acertijos, hechos o temas de escritura creativa) y las adaptaron para 5 idiomas: chino, ruso, francés, español y árabe.
  • El "toque humano": Si una pregunta mencionaba a una celebridad estadounidense específica, la cambiaban por una figura local famosa. Si mencionaba un festivo estadounidense específico, lo cambiaban por un festival local. Hicieron esto para asegurar que la IA fuera probada en su capacidad de entender esa cultura específica, no solo su capacidad para traducir palabras.

4. Cómo calificaron a la IA

Dado que los humanos no pueden leer miles de respuestas en cinco idiomas instantáneamente, utilizaron a GPT-4 (una IA muy avanzada) como el árbitro.

  • El juego: Pidieron a los modelos de IA que respondieran las preguntas. Luego, le pidieron a GPT-4 que comparara dos respuestas, una al lado de la otra, y decidiera cuál era mejor.
  • La verificación: También hicieron que humanos reales calificaran una pequeña muestra para asegurarse de que el "Árbitro de IA" fuera justo. Los resultados mostraron que el Árbitro de IA era muy preciso (con un acuerdo de aproximadamente el 90% con los humanos).

5. Los Resultados: ¿Quién pasó la prueba?

Probaron varios modelos de IA diferentes, incluyendo grandes modelos comerciales (como GPT-4) y modelos de código abierto (modelos gratuitos que cualquiera puede descargar).

  • El ganador: GPT-4 fue el único modelo que puntuó consistentemente por encima del 50% (es decir, venció a la base de referencia más de la mitad de las veces). Fue el "estudiante estrella".
  • La dificultad: Los modelos de código abierto (como Guanaco, Phoenix y otros) tuvieron dificultades significativas.
    • La brecha: Mientras que GPT-4 podía manejar bien los matices culturales, los modelos de código abierto a menudo cometían errores factuales o perdían el contexto cultural. Por ejemplo, cuando se les preguntaba por la primera película de un famoso director chino, algunos modelos de código abierto daban el año equivocado o el título de la película equivocado, mientras que GPT-4 lo hacía correctamente.
  • La conclusión: Existe una gran brecha entre los modelos comerciales de alto nivel y los modelos de código abierto en lo que respecta a la comprensión de diferentes culturas. Los modelos de código abierto son como estudiantes que estudiaron el libro de texto pero fallaron al entender el dialecto local.

Resumen

OMGEval es una prueba nueva y más justa que comprueba si los modelos de IA entienden las diversas culturas del mundo, no solo la versión estadounidense del mundo. El artículo muestra que, si bien la mejor IA (GPT-4) es bastante buena en esto, muchos otros modelos todavía están luchando por entender el "sabor" local de diferentes idiomas y culturas. Los autores esperan que esta prueba ayude a la comunidad a construir una IA mejor y más consciente culturalmente en el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →