Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution
SIRA es un marco de decodificación contrastiva interno sin entrenamiento que mitiga las alucinaciones en los grandes modelos de visión y lenguaje generando una referencia contrafactual dominada por el prior lingüístico dentro del mismo transformador mediante atención enmascarada en las capas posteriores, reduciendo así la dependencia de herramientas externas y de pasadas forward adicionales mientras se preserva la cobertura descriptiva.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente muy inteligente y bien informado (un Modelo de Lenguaje y Visión Grande) que intenta describir una imagen que acabas de mostrarle. A veces, este asistente se vuelve un poco demasiado seguro de lo que cree ver, en lugar de lo que realmente está allí. Podría decir: "Veo una bicicleta roja", cuando la imagen es en realidad solo una forma borrosa que podría ser una bicicleta, o podría inventar detalles porque ha leído tantas historias sobre bicicletas que su cerebro rellena los huecos. Esto se llama alucinación.
El artículo presenta un nuevo truco inteligente llamado SIRA para evitar que esto ocurra, sin necesidad de volver a entrenar al asistente ni contratar a una segunda persona para verificar el trabajo.
El problema con los trucos antiguos
Anteriormente, para evitar que el asistente mintiera, los investigadores probaban un método como este:
- Mostrarle al asistente la imagen original.
- Luego, mostrarle una versión borrosa o alterada de la misma imagen.
- Comparar las dos respuestas. Si el asistente cambia su historia cuando la imagen está borrosa, quizás estaba adivinando.
El defecto: Esto es como pedirle a alguien que describa un cuadro y luego pedirle que describa el mismo cuadro mientras lleva gafas empañadas. La versión con "gafas empañadas" no es una comparación justa porque los propios lentes distorsionan la imagen. Es desordenado, tarda el doble (tienes que mirar la imagen dos veces por separado) y la distorsión podría crear nuevos errores.
La solución SIRA: El "prefijo compartido"
SIRA adopta un enfoque diferente. En lugar de alterar la imagen, altera el proceso de pensamiento interno del asistente mientras aún está pensando.
Piensa en el cerebro del asistente como una línea de montaje de fábrica con muchas estaciones (capas) que procesan la imagen y la pregunta.
- El inicio compartido: El asistente comienza mirando la imagen y la pregunta juntas. Construye una comprensión sólida de la escena en las primeras estaciones de la fábrica. Esto es el "prefijo compartido". SIRA asegura que ambas versiones del asistente coincidan en esta comprensión inicial.
- La bifurcación: Una vez formada la comprensión inicial, SIRA divide el proceso en dos pistas paralelas que se ejecutan dentro del mismo cerebro:
- Pista A (La vista completa): El asistente continúa observando los detalles de la imagen mientras termina su oración.
- Pista B (La vista "ciega"): El asistente continúa desde exactamente el mismo punto de partida, pero en las estaciones posteriores, está vendado frente a los detalles específicos de la imagen. Solo puede confiar en su conocimiento general y en la oración que ya ha comenzado a escribir.
Cómo corrige la mentira
Ahora, SIRA compara las dos pistas en cada paso de la escritura de la oración:
- Si el asistente dice: "Veo un perro", y tanto la Pista A (viendo al perro) como la Pista B (vendada) dicen "perro" con alta confianza, SIRA sabe que esto probablemente sea solo una suposición basada en el lenguaje común (quizás los perros son comunes en las historias). Reduce la puntuación para "perro" porque la versión vendada no necesitaba la imagen para decirlo.
- Si el asistente dice: "Veo un elefante morado", y la Pista A dice "elefante morado" (porque lo ve) pero la Pista B dice "de ninguna manera, eso no está en la historia" (porque no puede verlo), SIRA sabe que la imagen es la única razón de esta afirmación. Aumenta la puntuación para "elefante morado".
Por qué es mejor
- Sin pasos extra: No necesita mirar la imagen dos veces. Lo hace todo de una sola vez, simplemente dividiendo el proceso de pensamiento interno.
- Sin distorsiones desordenadas: No desenfoca la imagen. Simplemente "apaga" temporalmente la entrada visual para una versión del proceso de pensamiento, manteniendo el resto del contexto perfectamente alineado.
- Sin entrenamiento necesario: Funciona inmediatamente en modelos existentes. No tienes que enseñarle nada nuevo al modelo.
El resultado
En las pruebas, SIRA logró evitar que los asistentes inventaran objetos que no estaban allí (como un "plátano" que no aparece en la foto) mientras les permitía describir con precisión las cosas reales. Es como tener un "control de realidad" integrado que ocurre instantáneamente dentro del propio cerebro del modelo, asegurando que lo que dicen esté realmente respaldado por lo que ven, y no solo por lo que esperan ver.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.