← Últimos artículos
💬 NLP

A multilingual hallucination benchmark: MultiWikiQHalluA

Este artículo presenta MultiWikiQHalluA, una evaluación de alucinaciones multilingüe que abarca 306 idiomas, y lo utiliza para demostrar que las tasas de alucinación son significativamente más altas en idiomas de recursos limitados y modelos más pequeños, mientras que los modelos más grandes obtienen el mejor rendimiento en los idiomas europeos evaluados.

Autores originales: Freja Thoresen, Dan Saattrup Smart

Publicado 2026-05-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Freja Thoresen, Dan Saattrup Smart

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot muy inteligente y multilingüe que ama leer artículos de Wikipedia y responder preguntas sobre ellos. Le preguntas: "¿Cuál es la capital de Islandia?" y responde: "Reikiavik". ¡Genial! Pero a veces, este robot se vuelve un poco demasiado creativo. Podría decir: "Reikiavik está ubicada en la luna" o "La capital es una ciudad llamada 'Ice-berg'". Aunque la frase suene fluida y segura, está completamente inventada. En el mundo de la IA, a esto lo llamamos alucinación.

Este artículo es como una nueva prueba de "detector de mentiras" para robots, pero en lugar de verificar solo el inglés, los investigadores crearon una prueba que funciona para 306 idiomas diferentes, incluidos algunos que rara vez son vistos por las computadoras (como el islandés).

Aquí está la historia de cómo lo hicieron, explicada de forma sencilla:

1. El Problema: El "Mentidor Fluido"

La mayoría de las pruebas para la honestidad de los robots solo verifican el inglés. Es como solo verificar la licencia de conducir de un piloto en una ciudad y asumir que puede conducir con seguridad en todas las demás. Los investigadores querían saber: ¿Los robots mienten con más frecuencia cuando hablan idiomas que conocen menos?

Definieron la "alucinación" específicamente como fidelidad. Esto significa: ¿Se mantuvo el robot fiel a la historia que le contaste?

  • Robot Bueno: Lee una historia sobre un gato y luego dice: "El gato es naranja".
  • Robot Alucinando: Lee una historia sobre un gato y luego dice: "El gato en realidad es un dragón". (Suena plausible, pero no está en la historia).

2. La Solución: Crear una "Fábrica de Noticias Falsas"

Para entrenar su detector de mentiras, los investigadores necesitaban una gran pila de ejemplos donde el robot mintió. Pero no querían esperar a que los robots mintieran naturalmente; eso toma demasiado tiempo.

Así que, construyeron una fábrica sintética:

  • Tomaron un enorme conjunto de datos de preguntas y respuestas reales (MultiWikiQA) que cubre 306 idiomas.
  • Utilizaron una IA súper inteligente (GPT-5) para reescribir intencionalmente las respuestas correctas, haciéndolas sonar creíbles pero factualmente incorrectas según el texto fuente.
  • Lo hicieron para 306 idiomas, creando una biblioteca gigante de "respuestas falsas".
  • Luego entrenaron una IA más pequeña y especializada (un "clasificador a nivel de token") para detectar estas mentiras. Piensa en este clasificador como un corrector ortográfico de la verdad. En lugar de verificar si una palabra está bien escrita, verifica si una palabra específica en una oración pertenece a la historia original o si es una invención hecha.

Entrenaron estos "correctores ortográficos de la verdad" para 30 idiomas europeos y los probaron en cuatro: inglés, alemán, danés e islandés.

3. El Experimento: Probando a los Robots

Los investigadores tomaron cinco modelos de IA diferentes (desde uno pequeño hasta uno gigante) y les pidieron que respondieran preguntas en esos cuatro idiomas. Luego, pasaron las respuestas por su nuevo "corrector ortográfico de la verdad" para ver cuántas mentiras estaban ocultas en el texto.

4. Los Resultados: El Tamaño Importa, pero el Idioma Importa Más

Esto es lo que encontraron, usando algunas analogías simples:

  • El "Robot Pequeño" Tiene Dificultades: El modelo de IA más pequeño (Qwen3-0.6B) fue el peor mentiroso. Fue como un estudiante que no estudió lo suficiente y solo adivinó. En islandés, el 60% de sus respuestas contenía al menos una mentira.
  • Los "Robots Grandes" Son Mejores: Los modelos más grandes y potentes (como los de 70 mil millones de parámetros) fueron mucho mejores para ceñirse a los hechos. Eran los "estudiantes honoríficos" del grupo.
  • La "Brecha Lingüística": Este es el hallazgo más importante. Los robots mintieron mucho más a menudo en idiomas que conocían menos.
    • Inglés y alemán (idiomas que los robots conocen muy bien): Muy pocas mentiras.
    • Danés e islandés (idiomas que los robots conocen menos): Muchas más mentiras.
    • El islandés fue el más difícil. Incluso los mejores robots mintieron más aquí que en inglés. Es como pedirle a un chef que cocine un plato que nunca ha visto antes; es más probable que adivine mal los ingredientes.

5. Un Giro Sorprendente

Podrías pensar: "Cuanto más grande es el robot, menos miente". Pero no es tan simple. A veces un robot de tamaño mediano fue mejor que uno gigante, dependiendo del idioma. Esto sugiere que cómo fue entrenado el robot (qué idiomas estudió) importa tanto como qué tan grande es.

6. El Truco (El Problema del "Token")

Los investigadores también notaron una peculiaridad técnica. En idiomas como el islandés, la computadora divide las palabras en muchas piezas diminutas (tokens) para entenderlas. En inglés, podría ver una palabra como una sola pieza. En islandés, esa misma palabra podría ser cinco piezas.

  • La Analogía: Imagina revisar una oración en busca de errores. Si la revisas palabra por palabra, podrías encontrar 1 error. Si la revisas letra por letra, podrías encontrar 5 errores solo porque la palabra es más larga.
  • Los investigadores advierten que su "conteo de mentiras" podría parecer más alto para el islandés en parte porque las palabras se cortan en más piezas, dando al detector más oportunidades de encontrar una "mentira", incluso si el significado es el mismo.

Resumen

El artículo presenta una nueva herramienta de código abierto que puede detectar cuándo los modelos de IA están inventando cosas en 306 idiomas. Encontraron que, aunque los modelos más grandes son generalmente más honestos, los robots son significativamente más propensos a alucinar en idiomas con los que están menos familiarizados, como el islandés. Han publicado sus conjuntos de datos de "noticias falsas" y sus "detectores de verdad" para que cualquiera los use.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →