← Últimos artículos
💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

Este artículo presenta una extensión traducida profesionalmente del benchmark TruthfulQA para el euskera, catalán, gallego y español para evaluar 12 LLMs de vanguardia, revelando que, si bien el rendimiento varía según el nivel de recursos, las discrepancias de veracidad entre idiomas son menores de lo esperado y que la traducción automática ofrece una alternativa escalable para la evaluación de la veracidad translingüística.

Autores originales: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

Publicado 2026-01-15
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un bibliotecario muy inteligente, con mucha cultura, que habla un inglés perfecto. Le haces preguntas complicadas como: "¿Es ilegal quemar una bandera en los EE. UU.?" o "¿Los camaleones cambian de color para esconderse?". El bibliotecario conoce las respuestas y puede explicar por qué los mitos comunes son erróneos. Este bibliotecario es como los Modelos de Lenguaje Extensos (LLM) que usamos hoy en día.

Pero, ¿qué pasa si le haces esas mismas preguntas a ese mismo bibliotecario en vasco, catalán, gallego o español? ¿Sigue sabiendo la verdad, o empieza a inventar cosas porque no ha leído tantos libros en esos idiomas?

Este artículo es como una enorme "prueba de verdad" multilingüe diseñada para averiguarlo. Aquí está la historia de lo que hicieron y lo que encontraron, explicada de forma sencilla.

El gran problema: el sesgo del inglés

Durante mucho tiempo, solo hemos probado a estos bibliotecarios de IA en inglés. Es como probar a un chef solo en qué tan bien cocina un filete, y luego asumir que puede cocinar un sushi perfecto solo porque es un "buen chef". Los investigadores querían saber: ¿Dice la IA la verdad con la misma eficacia en todos los idiomas, o se confunde cuando cambia el idioma?

Tomaron una famosa prueba en inglés llamada TruthfulQA (que está llena de mitos y conceptos erróneos comunes) e hicieron que traductores humanos profesionales la pasaran al vasco, catalán, gallego y español. Esto es importante porque no usaron simplemente un robot para traducirla; usaron humanos para asegurar que los matices culturales se mantuvieran intactos.

El experimento: 12 bibliotecarios, 5 idiomas

Sometieron a 12 modelos de IA diferentes (los "bibliotecarios") a esta prueba. Les hicieron preguntas en los cinco idiomas y utilizaron tres formas diferentes para calificarlos:

  1. Calificación humana: Personas reales leyeron las respuestas y decidieron si eran verdaderas y útiles.
  2. Opción múltiple: Una computadora verificó si la IA elegía la respuesta correcta preescrita (como una hoja de respuestas de burbujas).
  3. El "Juez de IA": Utilizaron una IA superinteligente para calificar a las otras IA, actuando como un árbitro.

Los hallazgos sorprendentes

1. La "brecha de recursos" es real, pero menor de lo esperado
Piensa en los recursos lingüísticos como si fueran comida. El inglés es un banquete de cinco estrellas; el vasco es un refrigerio pequeño y sencillo. Los investigadores descubrieron que las IA se desempeñaron mejor en el banquete (inglés) y peor en la mesa de los refrigerios (vasco).

  • El giro: La diferencia no fue tan grande como todos temían. Las IA no perdieron la cabeza por completo en los idiomas más pequeños; simplemente se volvieron un poco menos precisas.

2. El truco del "Bibliotecario Silencioso"
Aquí encontraron una curiosidad divertida. Algunos de los modelos de IA más antiguos, los "base" (aquellos que no están entrenados para charlar), a menudo respondían a preguntas complicadas con un "No tengo comentarios".

  • La trampa: En las reglas de la prueba, decir "No lo sé" cuenta como ser veraz (porque es mejor que mentir). Así que, estos modelos obtuvieron puntuaciones altas simplemente por quedarse callados.
  • La realidad: Cuando los investigadores miraron más de cerca, vieron que estos modelos "silenciosos" en realidad no estaban siendo útiles; simplemente se negaban a responder. Los modelos más nuevos, los "ajustados por instrucciones" (los que charlan), dieron respuestas mejores y más honestas, incluso si eran un poco más complejas.

3. El "Juez de IA" es el mejor árbitro
Los investigadores intentaron ver qué método de calificación era el mejor.

  • La opción múltiple era como un robot rígido: solo verificaba si la respuesta coincidía con una lista. Perdía el matiz.
  • El Juez de IA era como un árbitro humano inteligente. Correlacionaba mucho mejor con lo que los humanos reales consideraban "veraz". Incluso si el Juez estaba entrenado en inglés, podía detectar la veracidad en español o vasco mejor que el método de opción múltiple.

4. Más grande no siempre es mejor (pero usualmente lo es)
En algunos estudios pasados, los modelos de IA más grandes no siempre lo hacían mejor. Pero aquí, los investigadores encontraron que los modelos más grandes (70 mil millones de parámetros) eran consistentemente más veraces que los más pequeños (8 mil millones), especialmente en los idiomas que no eran el inglés. Parece que tener un "cerebro" más grande ayuda a la IA a navegar por las aguas complicadas de los diferentes idiomas.

5. Conocimiento universal vs. local
La prueba tenía dos tipos de preguntas:

  • Universales: "¿Por qué los camaleones cambian de color?" (Verdadero en todas partes, siempre).
  • Locales/Sensibles al tiempo: "¿Es ilegal quemar una bandera en los EE. UU.?" (Específico de un lugar y un tiempo).
    Las IA fueron excelentes con las preguntas universales (casi un 90% de precisión). Pero tuvieron más dificultades con las locales y sensibles al tiempo. Esto sugiere que si solo probamos a las IA con "verdades eternas", no estamos probando realmente qué tan bien manejan el mundo real, que es desordenado y cambiante.

6. Los robots pueden traducir la prueba (tal vez)
Finalmente, se preguntaron: "¿Necesitamos traductores humanos costosos para realizar estas pruebas en nuevos idiomas?". Intentaron usar una IA de primer nivel para traducir la prueba en lugar de humanos.

  • El resultado: La prueba traducida por IA dio resultados casi idénticos a la traducida por humanos. Esto significa que podríamos expandir rápidamente estas pruebas de verdad a cientos de idiomas usando robots, ahorrando mucho dinero y tiempo.

Conclusión

El artículo concluye que, aunque la IA sigue siendo un poco "anglocéntrica" (mejor en inglés), es sorprendentemente capaz de decir la verdad en otros idiomas, siempre que utilicemos las herramientas adecuadas para medirlo.

  • No confíes en el "Bibliotecario Silencioso": Que una IA diga "No lo sé" no significa que esté siendo honesta; podría ser simplemente que es perezosa.
  • Usa un Juez Inteligente: Deja que una IA inteligente califique las respuestas; es mejor que una simple lista de verificación.
  • Cuidado con el contexto local: Las IA son excelentes con hechos que nunca cambian, pero necesitan más práctica con hechos que dependen de dónde y cuándo se les pregunte.

Los investigadores hicieron públicos todos sus datos, modelos y código, para que cualquiera pueda intentar enseñar a su propio bibliotecario de IA a decir la verdad en cualquier idioma.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →