← Últimos artículos
💻 computer science

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

El artículo presenta KnowHal, un benchmark exhaustivo que unifica la evaluación de alucinaciones de entidades, atributos, relaciones y conocimiento en Modelos de Lenguaje Grandes Multimodales mediante un novedoso diseño de preguntas emparejadas, revelando que los errores relacionados con el conocimiento y la aceptación de premisas falsas siguen siendo desafíos significativos para los modelos actuales.

Autores originales: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

Publicado 2026-08-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot superinteligente a entender el mundo. Este robot, llamado Modelo de Lenguaje Grande Multimodal (o MLLM por sus siglas en inglés), es como un estudiante brillante que puede mirar una imagen y leer un libro al mismo tiempo. Es increíble describiendo lo que ve, como decir: "Esa es una manzana roja sobre una mesa de madera". Pero a veces, este robot se vuelve un poco demasiado creativo. Podría mirar la foto de un gato y decirte con total confianza: "Este gato está pilotando una nave espacial", aunque los gatos no pueden volar y no hay ninguna nave espacial en la foto. Esto se llama "alucinación". Es como si el robot estuviera soñando despierto cuando se supone que debería estar trabajando.

¿Por qué es esto importante? Porque queremos confiar estos robots en trabajos importantes, como ayudar a los médicos a diagnosticar enfermedades o guiar coches autónomos. Si un robot empieza a inventar cosas, los resultados podrían ser peligrosos. Los científicos han estado intentando construir pruebas para detectar estos sueños despiertos. La mayoría de estas pruebas comprueban si el robot puede identificar correctamente cosas simples en una imagen, como "¿Hay un perro?" o "¿Es el perro de color marrón?". Pero hay una parte truculenta: a veces el robot conoce los hechos del mundo (como que "los perros tienen cola"), pero se confunde cuando la imagen no coincide, o inventa hechos que ni siquiera están en la foto. Hasta ahora, no teníamos una prueba única y justa que comprobara tanto lo que el robot ve como lo que sabe sobre el mundo, todo de una sola vez.

Aquí entra KnowHal, una nueva y astuta prueba diseñada para detectar estos sueños despiertos de una forma totalmente nueva. Piensa en KnowHal como un juego de "encuentra las diferencias", pero para cerebros robóticos. Los investigadores construyeron una enorme colección de 1.800 pares de imagen y pregunta, que cubren 10 áreas diferentes de la vida, desde los deportes hasta la música. Para cada una de las imágenes, crearon dos tipos de preguntas: preguntas "Positivas", que preguntan sobre cosas que realmente están en la foto o hechos verdaderos sobre el objeto, y preguntas "Negativas", que son trampas truculentas. Estas trampas suenan muy plausibles pero en realidad son mentiras. Por ejemplo, si una imagen muestra un perro real, una pregunta positiva es "¿De qué color es el perro?". Una trampa negativa podría ser "¿De qué color es el sombrero azul invisible del perro?".

Los investigadores probaron 14 cerebros robóticos diferentes en este nuevo juego. Encontraron algunas cosas sorprendentes. Primero, los robots eran generalmente capaces de responder a las preguntas "Positivas", pero tropezaban gravemente cuando se enfrentaban a las trampas "Negativas". Es como un estudiante que sabe sus datos matemáticos perfectamente pero se deja engañar por una pregunta que dice: "Si 2 más 2 es igual a 5, ¿cuánto es 2 más 2?". Los robots a menudo decían "5" en lugar de corregir la mentira. Esto demuestra que incluso los robots más inteligentes no son muy buenos diciendo: "Espera, eso no es cierto", cuando están siendo engañados.

La mayor sorpresa fue que la parte más difícil para casi todos los robots fue la dimensión del "Conocimiento". Aquí es donde el robot tiene que usar los hechos que aprendió de libros o de internet, no solo lo que ve en la imagen. Incluso los mejores robots se equivocaron más a menudo en las preguntas de conocimiento que en las preguntas visuales simples. Esto sugiere que, aunque estos robots están mejorando en su capacidad de ver, todavía tienen dificultades para separar lo que ven de lo que creen saber.

El estudio también analizó cómo el tamaño del cerebro del robot afectaba su rendimiento. Descubrieron que los cerebros más grandes generalmente lo hacían mejor, pero incluso los más grandes seguían teniendo problemas con las preguntas truculentas de "Conocimiento" y las trampas "Negativas". Esto nos dice que hacer al robot más grande no es una solución mágica; necesitamos enseñarles a ser más cuidadosos y escépticos.

En resumen, el artículo presenta KnowHal, un nuevo referente que empareja preguntas reales con otras falsas y truculentas para poner a prueba qué tan bien los robots distinguen la verdad de la ficción. Los resultados sugieren que, aunque nuestros amigos de la IA se están volviendo más inteligentes, todavía tienen un largo camino por delante antes de que puedan ser plenamente confiables para detectar una mentira o admitir que no saben la respuesta. Los autores creen que esta nueva prueba ayudará a que los futuros robots sean más fiables y menos propensos a inventar historias.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →