← Últimos artículos
💬 NLP

The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?

Este artículo sostiene que la decodificación contrastiva no logra mitigar genuinamente las alucinaciones de objetos en los modelos de lenguaje multimodales de gran tamaño, revelando que su éxito aparente en evaluaciones como POPE es meramente una ilusión causada por ajustes de distribución rudimentarios y una reducción a la búsqueda codiciosa en lugar de una verdadera supresión de alucinaciones.

Autores originales: Hao Yin, Guangzong Si, Zilei Wang

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hao Yin, Guangzong Si, Zilei Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El "Truco de Magia" que no era Magia

Imagina que tienes un asistente robot muy inteligente pero un poco confundido (un Modelo de Lenguaje Grande Multimodal, o MLLM) que mira imágenes y responde preguntas sobre ellas. A veces, este robot se equivoca: podría decir que hay un "plátano azul" en la foto de uno amarillo. Esto se llama una alucinación.

Durante un tiempo, los investigadores han estado utilizando una técnica llamada Decodificación Contrastiva para solucionar esto. Afirmaban que era como un "filtro de alucinaciones" que podía detectar las mentiras del robot y detenerlas.

Este artículo argumenta que este "filtro" en realidad no está funcionando. En su lugar, la mejora en las puntuaciones de las pruebas del robot es el resultado de dos trucos ingeniosos que lo hacen parecer más inteligente sin hacerlo realmente más veraz.


Analogía 1: El Truco del "Sabelotodo Complaciente" (Ajuste Unidireccional)

La Configuración:
Imagina un concurso de preguntas donde el presentador pregunta: "¿Hay una silla en esta imagen?".

  • El Problema: El robot es naturalmente tímido y tiende a decir "No" con demasiada frecuencia, incluso cuando hay una silla.
  • El "Arreglo": El método de Decodificación Contrastiva actúa como un entrenador que le susurra al robot: "¡Oye, si no estás 100% seguro, simplemente di que 'Sí'!".

Lo que Realmente Sucede:

  • En la prueba específica utilizada (benchmark POPE), las preguntas se dividen 50/50 entre "Sí" y "No".
  • Debido a que el robot originalmente decía "No" demasiado, forzarlo a decir "Sí" con más frecuencia equilibra accidentalmente la puntuación. Parece que el robot está mejorando en su trabajo.
  • La Trampa: El robot no está mirando la imagen mejor. Solo está adivinando "Sí" con más frecuencia. Si lo pruebas en un conjunto diferente de preguntas donde el "Sí" ya es la respuesta común, este truco hace que el robot sea peor porque empieza a decir "Sí" a todo, incluso cuando está equivocado.

La Prueba del Artículo:
Los autores probaron un arreglo "falso". Simplemente añadieron una nota a las instrucciones del robot diciendo: "Por favor, intenta responder 'Sí' siempre que sea posible".

  • Resultado: Este arreglo falso mejoró las puntuaciones de la prueba tanto como el complejo método de "Decodificación Contrastiva".
  • Conclusión: La mejora no fue porque el robot aprendiera a ver mejor; fue simplemente porque se le dijo al robot que dijera "Sí" con más frecuencia.

Analogía 2: La "Red de Seguridad" que se convierte en una Camisa de Fuerza (Restricción de Plausibilidad Adaptativa)

La Configuración:
Cuando el robot responde, normalmente elige una palabra de una lista de posibilidades. A veces utiliza un método de "muestreo" (sampling), que es como lanzar un dado para elegir una palabra de la parte superior de la lista. Esto añade variedad, pero puede provocar errores.

El "Arreglo":
El método de Decodificación Contrastiva incluye una regla llamada "Restricción de Plausibilidad Adaptativa". Se supone que es una red de seguridad que evita que el robot elija palabras extrañas o imposibles.

Lo que Realmente Sucede:

  • Los autores descubrieron que esta "red de seguridad" es tan estricta que corta casi todas las opciones de la lista.
  • Obliga al robot a dejar de lanzar los dados y simplemente elegir la respuesta más obvia cada vez.
  • En términos técnicos, convierte una estrategia de Muestreo flexible en una búsqueda Codiciosa (Greedy Search) rígida (siempre eligiendo la opción principal).
  • La Trampa: En esta prueba específica, elegir la opción principal (Greedy Search) resulta mejor que lanzar los dados. Así que el "arreglo" mejoró la puntuación no porque detuviera las alucinaciones, sino porque obligó al robot a dejar de ser creativo y simplemente ser aburridamente predecible.

La Prueba del Artículo:
Los autores tomaron la regla de la "red de seguridad" y la aplicaron a un robot estándar sin ninguno de los sofisticados trucos de la "Decodificación Contrastiva".

  • Resultado: La puntuación del robot saltó significativamente, casi igualando a los métodos sofisticados.
  • Conclusión: El método sofisticado no hizo el trabajo pesado; la simple regla de la "red de seguridad" lo hizo. Y dado que esa regla solo obliga al robot a ser predecible, no soluciona la causa raíz de las alucinaciones.

El Veredicto Final

El artículo concluye que las "mejoras de rendimiento" observadas en estos modelos son un espejismo.

  1. No se trata de la verdad: Los métodos no están haciendo que los modelos entiendan mejor las imágenes.
  2. Se trata de sesgo: Solo están desplazando las respuestas del robot para que coincidan con el equilibrio específico de la prueba (decir "Sí" con más frecuencia).
  3. Se trata de rigidez: Están obligando al robot a dejar de adivinar y simplemente elegir la respuesta más obvia, lo cual funciona en esta prueba específica pero no resuelve el problema subyacente de las mentiras.

En resumen: El artículo dice: "Dejen de celebrar estos métodos como una cura para las alucinaciones. Solo están jugando un juego con las puntuaciones de las pruebas, no arreglando el cerebro del robot".

Los autores sugieren que para solucionar realmente las alucinaciones, necesitamos métodos que realmente ayuden al robot a ver la imagen correctamente, no solo métodos que engañen a la prueba para obtener una puntuación más alta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →