← Últimos artículos
🤖 machine learning

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

El artículo propone ViPSy, un marco de dos etapas que sintetiza datos de preferencia visualmente fundamentados y alineados con políticas para mitigar significativamente las alucinaciones en los modelos de visión-lenguaje, logrando un nuevo rendimiento de vanguardia en las evaluaciones de alucinación al tiempo que mejora las capacidades visuales generales.

Autores originales: Yunhun Nam, Jongheon Jeong

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yunhun Nam, Jongheon Jeong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un Modelo de Lenguaje-Visión (VLM) como un crítico de arte muy inteligente y culto que tiene los ojos vendados mientras un amigo le describe la pintura. El problema es que este crítico a veces se deja llevar tanto por su propio conocimiento de la historia del arte que empieza a describir cosas que en realidad no están en la pintura —como afirmar que hay un águila dorada en un cuadro de un jardín tranquilo solo porque "los jardines suelen tener águilas" en sus datos de entrenamiento—. Esto se llama alucinación.

El artículo presenta un nuevo método llamado ViPSy (Síntesis de Preferencias Impulsada por la Visión) para solucionar esto. Piensa en ViPSy como un campo de entrenamiento ingenioso diseñado para enseñar al crítico a mirar la pintura real en lugar de confiar en su imaginación.

Así es como funciona ViPSy, desglosado en dos etapas sencillas:

Etapa 1: El "Control de Realidad" (Síntesis Semántica de Autocaptura)

Imagina que quieres saber exactamente qué hay en una foto, pero no estás seguro de si tu memoria te está engañando.

  1. La Descripción: Primero, la IA observa la foto original y escribe una descripción detallada de ella (como un pie de foto).
  2. La Re-imaginación: Luego, toma esa descripción y le pide a otra IA (un generador de texto a imagen) que dibuje una nueva imagen basada únicamente en esas palabras.
  3. La Comparación: Hace esto varias veces, creando algunas "re-imaginaciones" ligeramente diferentes de la foto original.
  4. Encontrar el Punto Común: El sistema compara la foto original con estos nuevos dibujos. Pregunta: "¿Qué objetos aparecen en la foto original Y también aparecen en casi todos los nuevos dibujos?"
    • Si la foto original tiene un camión rojo, y los nuevos dibujos (basados en la descripción) también mantienen un camión rojo, eso es un hecho sólido.
    • Si la foto original tiene un árbol, pero los nuevos dibujos olvidan el árbol o lo cambian constantemente, el sistema sabe que ese detalle podría ser dudoso.

El resultado de esta etapa es una "Pista Visual" (Visual Cue). Piensa en esta pista como una lista de verificación confiable de los objetos más indiscutibles y sólidos de la imagen (por ejemplo, "Camión Rojo", "Árbol", "Cielo Azul"). Elimina las conjeturas.

Etapa 2: La "Práctica Guiada" (Auto-destilación Condicionada por Pistas)

Ahora que la IA tiene su lista de verificación confiable, vuelve a practicar la descripción de la foto.

  1. La Ronda de Práctica: La IA intenta describir la foto de nuevo, pero esta vez se ve obligada a tener en cuenta la lista de verificación de la "Pista Visual". Es como decirle al crítico: "Debes mencionar el camión rojo y el árbol, y no inventes nada".
  2. Generación de Opciones: La IA genera varias descripciones basadas en esta guía. Algunas serán muy precisas; otras podrían todavía fallar al añadir un objeto falso (como un "coche azul" que no está ahí).
  3. El Juez: Una IA "Juez", muy inteligente, observa todas estas opciones. Compara cada una con la foto original y elige:
    • El Ganador: La descripción que se ciñó a la lista de verificación y a la foto perfectamente.
    • El Perdedor: La descripción que alucinó (se inventó cosas).

La Lección Final (Alineación de Preferencias)

El sistema toma estos pares de "Ganador vs. Perdedor" y le enseña al modelo de IA principal: "La próxima vez, debes hablar como el Ganador, no como el Perdedor".

Al hacer esto, la IA aprende a confiar en la evidencia visual (la lista de verificación) por encima de sus propios sesgos internos (lo que cree que debería haber allí).

¿Por qué es esto mejor que los métodos antiguos?

El artículo argumenta que los métodos anteriores tenían dos fallos principales:

  • El Método de "Edición": Algunos métodos simplemente tomaban una respuesta incorrecta y la editaban manualmente para que fuera correcta. El artículo dice que esto es como un profesor reescribiendo el ensayo de un estudiante; el estudiante no aprende cómo escribirlo por sí mismo, y el resultado final se siente antinatural.
  • El Método de "Adivinanza Aleatoria": Otros métodos simplemente pedían a la IA que adivinara muchas veces y elegían la mejor. El artículo dice que esto a menudo falla porque la IA sigue dependiendo de su imaginación en lugar de mirar de cerca la imagen.

ViPSy es especial porque utiliza la propia "imaginación" de la IA (su forma natural de hablar) pero la guía con una estricta lista de verificación visual. Esto permite que la IA suene natural mientras se le obliga a ser veraz.

Los Resultados

El artículo afirma que, al usar este método, la IA mejoró mucho en no inventar cosas.

  • Redujo las "alucinaciones" (inventar objetos) aproximadamente un 35% en una prueba y un 24% en otra, superando a todos los métodos anteriores.
  • También mejoró en tareas generales, como comprender escenas complejas y reconocer objetos, demostando que obligar a la IA a mirar la imagen realmente agudizó sus "ojos", no solo silenció su "boca".

En resumen, ViPSy le enseña a la IA a dejar de adivinar y empezar a mirar, utilizando un ciclo ingenioso de describir, redibujar y comparar para encontrar la verdad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →