← Últimos artículos
💬 NLP

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

Este artículo presenta MM-THEBench, un benchmark exhaustivo diseñado para evaluar las alucinaciones en los pasos de razonamiento intermedio de los modelos de lenguaje grandes multimodales, abordando la brecha en las evaluaciones existentes que pasan por alto los procesos de pensamiento internos de los modelos de razonamiento post-entrenados.

Autores originales: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Publicado 2026-02-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un equipo de detectives súper inteligentes y multitalentosos (estos son los Modelos de Lenguaje Grande Multimodales de Razonamiento, o MLLM). Estos detectives son excelentes mirando una imagen, leyendo un gráfico o viendo un video, y luego resolviendo un misterio.

En el pasado, estos detectives simplemente gritaban su respuesta final: "¡El sospechoso es el mayordomo!". Pero recientemente, han sido entrenados para pensar en voz alta antes de hablar. Escriben una larga lista de pistas y pasos lógicos (llamados Cadena de Pensamientos o CoT, por sus siglas en inglés) para explicar cómo llegaron a esa conclusión.

¿El problema? A veces, incluso si el detective escribe una lista de pasos larga y sofisticada, algunos de esos pasos son mentiras totales (alucinaciones). Sin embargo, por pura suerte o saltándose las mentiras, todavía gritan la respuesta final correcta.

Este artículo presenta una nueva herramienta llamada MM-THEBENCH para atrapar a estos detectives en el acto de mentir durante su proceso de pensamiento.

El Nuevo Campo de Entrenamiento para Detectives: MM-THEBENCH

Piensa en MM-THEBENCH como un "Test de Detector de Mentiras" de alta tecnología diseñado específicamente para el proceso de pensamiento, no solo para la respuesta final.

1. Los Tres Tipos de Mentiras (La Taxonomía)
Los autores se dieron cuenta de que, cuando un detective miente, generalmente cae en una de tres categorías. Crearon una lista de verificación para detectarlos:

  • La Mentira de "Falsa Memoria" (Conocimiento): El detective inventa un hecho que aprendió en la escuela. Ejemplo: "Sé por un hecho que la Torre Eiffel está en Londres". (No lo está).
  • La Mentira de "Mala Vista" (Percepción): El detective mira la foto pero ve cosas que no están ahí. Ejemplo: "Veo un coche rojo en la imagen", cuando el coche es en realidad azul. (Mala vista).
  • La Mentira de "Mala Lógica" (Razonamiento): El detective ve las cosas correctas pero conecta los puntos de forma errónea. Ejemplo: "El coche es azul, y los coches azules son rápidos, por lo tanto este coche es un Ferrari". (Mala lógica).

2. El Sistema de Calificación (Rúbricas)
En lugar de solo verificar si la respuesta final es correcta o incorrecta, MM-THEBENCH descompone el pensamiento del detective en diminutos pasos atómicos.

  • Imagina un problema de matemáticas. La solución del "Estándar de Oro" tiene 5 pasos específicos.
  • El sistema verifica el proceso de pensamiento de 20 pasos del detective contra esos 5 pasos de oro.
  • Pregunta: "¿Realmente viste el coche? ¿Sabías la regla sobre los triángulos? ¿Hiciste bien la matemática?".
  • Otorga una puntuación para cada uno de los pasos, marcando exactamente dónde ocurrió la "mentira".

Lo Que Encontraron (Los Resultados)

Los autores probaron 14 de los modelos de detectives más inteligentes del mundo (incluyendo grandes nombres como GPT-5, Claude y Gemini) usando esta nueva prueba. Esto es lo que descubrieron:

1. La Trampa de la "Respuesta Correcta"
Que un detective obtenga la respuesta correcta no significa que haya pensado correctamente.

  • Analogía: Imagina a un estudiante haciendo un examen de matemáticas. Escribe un párrafo de tonterías, inventa números y tiene una lógica errónea, pero luego adivina el número final y acierta.
  • Hallazgo: Muchos modelos obtuvieron la respuesta correcta a pesar de que sus "pasos de pensamiento" estaban llenos de alucinaciones. El proceso de pensamiento no era una explicación fiel de cómo resolvieron el problema.

2. La Diferencia entre "Mala Vista" y "Mala Lógica"
Este fue un descubrimiento sorprendente:

  • Alucinaciones de Percepción (Mala Vista): Estas ocurren todo el tiempo. Los modelos a menudo identifican erróneamente objetos o colores. Sin embargo, esto rara vez arruina la respuesta final. El modelo puede pensar que un coche es rojo cuando es azul, pero aun así logra determinar que el coche se está moviendo.
  • Alucinaciones de Razonamiento (Mala Lógica): Estas son raras, pero mortales. Si el modelo comete un error en la lógica (por ejemplo, "Si A entonces B" cuando en realidad es "Si A entonces C"), la respuesta final es casi siempre incorrecta.
  • Conclusión: Es mejor tener un detective con mala vista que uno con el cerebro roto.

3. El Problema del "Sobrepensar"
El artículo encontró que cuando se obliga a los modelos a pensar durante más tiempo (más pasos), no necesariamente se vuelven más inteligentes.

  • Analogía: Imagina a un detective que sigue tomando notas. Las primeras 5 notas son brillantes. Las siguientes 15 son solo él divagando, repitiéndose a sí mismo o inventando nuevos hechos.
  • Hallazgo: A medida que el pensamiento se vuelve más largo, la "precisión" cae. Los modelos generan muchos pasos extra, inútiles o alucinados solo para llenar el espacio. Están "sobrepensando" y alejándose de la verdad.

La Conclusión

El artículo argumenta que ya no podemos confiar simplemente en la respuesta final que nos da un modelo. Necesitamos mirar cómo llegó a ella.

MM-THEBENCH es como una lupa que nos obliga a mirar el cuaderno de notas del detective. Nos muestra que, aunque estos modelos de IA están mejorando en la resolución de problemas, su "pensamiento" interno es a menudo desordenado, lleno de pequeñas mentiras y, a veces, completamente desconectado de la realidad. Para que sean verdaderamente confiables, necesitamos arreglar su proceso de pensamiento, no solo sus respuestas finales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →