← Últimos artículos
🤖 AI

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

El artículo propone ST-Veto, un método que no requiere entrenamiento que mejora los Modelos de Lenguaje Multimodales de Difusión aprovechando la predicción de Taylor de segundo orden y el anclaje visual para vetar tokens inestables o débilmente anclados durante el proceso de generación agnóstico al orden, mejorando así significativamente la precisión del razonamiento sin entrenamiento ni costes adicionales.

Autores originales: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras no solo leen palabras o miran imágenes, sino que realmente pueden entender cómo encajan para resolver acertijos. Esta es la emocionante frontera de los "Modelos de Lenguaje y Visión", un tipo de inteligencia artificial que actúa como un detective superinteligente, combinando lo que ve con lo que sabe. Durante mucho tiempo, estos detectives trabajaron como una persona escribiendo una historia palabra por palabra, de principio a fin. Este método, llamado generación "autorregresiva", es excelente para pensar paso a paso, pero tiene un gran defecto: si el detective comete un error al principio, no puede volver fácilmente atrás para corregirlo sin reescribir toda la historia. Simplemente siguen acumulando más errores sobre el primero.

Recientemente, los científicos descubrieron una nueva forma en que estos detectives de IA pueden trabajar, llamada "difusión". En lugar de escribir una historia desde cero, imagina que la IA comienza con una página llena de espacios en blanco (o "máscaras") y lentamente los va llenando, refinando sus suposiciones una y otra vez. Es como mirar una foto borrosa que se enfoca lentamente. Este nuevo método es más rápido y permite que la IA vea toda la imagen a la vez, corrigiendo errores sobre la marcha. Pero aquí está el truco: aunque este nuevo método es excelente en velocidad, a veces se confunde sobre qué completar primero. Podría elegir una palabra que suena bien pero que en realidad no coincide con la imagen, o podría quedarse estancada en una suposición que cambia de opinión cada segundo. La gran pregunta era: ¿cómo ayudamos a este nuevo tipo de IA a pensar con claridad y a aferrarse a la verdad sin ralentizarla o enseñarle nuevos trucos?

Entra ST-Veto, una estrategia ingeniosa propuesta por investigadores para ayudar a estos modelos de IA de "difusión" a pensar mejor. Piensa en el proceso de la IA como un grupo de amigos tratando de decidir qué pedir para cenar. En la forma antigua, elegirían un plato, lo dejarían fijo y pasarían al siguiente. En la nueva forma de difusión, todos gritan ideas al mismo tiempo y luego se ponen de acuerdo lentamente sobre las mejores. El problema es que, a veces, un amigo grita "¡Pizza!" porque suena divertido, pero luego cambia de opinión por "Ensalada" un segundo después, o tal vez simplemente ama la palabra "Pizza" pero la foto en el menú es claramente una hamburguesa.

ST-Veto actúa como un árbitro sabio que observa a todo el grupo. Utiliza dos herramientas especiales para decidir qué ideas son seguras de mantener y cuáles deben desecharse. Primero, comprueba la estabilidad. Pregunta: "¿Esta idea acaba de aparecer o ha sido constante?". Si una palabra cambia de opinión constantemente (como un amigo que dice "Pizza", luego "Tacos", luego "Pizza" otra vez), el árbitro utiliza un truque matemático llamado "predicción de Taylor" para detectar esa inestabilidad y dice: "No, eso es demasiado inestable, intentemos una opción diferente". Segundo, comprueba la vinculación visual. Mira la imagen y pregunta: "¿Esta palabra realmente coincide con lo que vemos?". Si la IA quiere decir "tenedor" pero la imagen muestra claramente un "cuchillo", el árbitro usa la "atención" para ver que la IA no está mirando realmente el cuchillo y veta la palabra "tenedor".

El artículo muestra que, al usar este método de "Veto y Cambio" (Veto-and-Swap), la IA puede intercambiar sus suposiciones tambaleantes o desajustadas por otras más seguras y precisas sin necesidad de ningún entrenamiento adicional ni ralentizar el proceso. Cuando los investigadores probaron esto en acertijos de razonamiento difíciles que involucran tanto imágenes como texto, ST-Veto ayudó a la IA a ser hasta un 9% más correcta de lo que era antes. Es como darle a la IA un par de gafas que le ayudan a ver qué ideas son sólidas y cuáles son solo fantasías, lo que conduce a respuestas más inteligentes, ya sea resolviendo problemas científicos o describiendo escenas complejas. Lo mejor de todo es que es una actualización gratuita que funciona ahora mismo, haciendo que estos poderosos nuevos modelos de IA sean mucho más confiables sin cambiar cómo fueron construidos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →