← Últimos artículos
💻 computer science

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

El artículo presenta LaViT, un marco que cierra la brecha de percepción en la destilación multimodal al alinear pensamientos visuales latentes y trayectorias de atención en lugar de incrustaciones estáticas, permitiendo que los modelos compactos alcancen un rendimiento de razonamiento visual superior que rivaliza con sistemas propietarios más grandes.

Autores originales: Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

Publicado 2026-08-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot a resolver un misterio. En el mundo de la Inteligencia Artificial, existe un tipo especial de robot llamado Modelo de Lenguaje Grande Multimodal (MLLM). Piensa en ellos como detectives superinteligentes que pueden leer pistas (texto) y mirar fotos de la escena del crimen (imágenes) al mismo tiempo. Durante mucho tiempo, estos robots fueron excelentes describiendo lo que veían, pero cuando se trataba de razonar —figurar por qué sucedió algo o resolver un acertijo difícil— a menudo se quedaban estancados. Veían la imagen, luego dejaban de mirar y simplemente adivinaban la respuesta basándose en lo que sabían por haber leído libros. Es como un detective que ve una huella de barro, pero luego ignora la huella y adivina al culpable basándose en una corazonada.

Recientemente, los científicos descubrieron un nuevo truco llamado "razonamiento latente". En lugar de escribir cada paso de su pensamiento en palabras (como una larga entrada de diario), estos robots comenzaron a comprimir sus pensamientos en "susurros" invisibles y continuos dentro de su cerebro. Es más rápido y eficiente. Pero aquí está el problema: cuando los científicos intentaron enseñar a robots más pequeños y económicos a aprender de otros más grandes y listos (un proceso llamado destilación), algo extraño sucedió. Los robots pequeños aprendieron a decir las palabras correctas, pero no estaban mirando realmente las partes adecuadas de la imagen; solo estaban imitando la voz del maestro sin entender las pistas visuales. Es como un estudiante que aprueba un examen memorizando la clave de respuestas pero fallando en comprender la lección. Este artículo, LaViT, interviene para arreglar este vínculo roto entre "decir lo correcto" y "mirar en el lugar correcto".


El fallo del "Ver pero no Mirar"

Los investigadores detrás de LaViT notaron un fenómeno extraño que llaman la Brecha de Percepción. Imagina que tienes a un chef maestro (el modelo "Maestro") y a un joven aprendiz (el modelo "Estudiante"). El aprendiz observa al chef cocinar un plato complejo. Si solo le pides al aprendiz que escriba la receta, podría escribir las palabras perfectamente: "Añadir dos tazas de harina, batir durante tres minutos". Pero si le pides que realmente lo haga, podría verter la harina en el suelo porque nunca observó realmente las manos del chef; solo memorizó el texto.

En el mundo de la IA, los investigadores descubrieron que cuando entrenaban modelos pequeños para copiar las respuestas de modelos grandes, los modelos pequeños se volvían excelentes en la "mimética de texto". Podían producir la respuesta correcta, como "El punto A está más cerca", pero sus "ojos" internos (atención visual) estaban mirando partes completamente diferentes e irrelevantes de la imagen. Estaban dependiendo de trucos lingüísticos —adivinando basándose en frases comunes— en lugar de observar realmente la evidencia visual. Es como un estudiante que aprueba un examen memorizando la clave de respuestas pero fallando en comprender la lección.

La Solución: LaViT (Pensamientos Visuales Latentes)

Para solucionar esto, el equipo creó LaViT, un nuevo marco de entrenamiento que obliga al robot estudiante a "pensar" visualmente antes de hablar. En lugar de solo copiar la respuesta final, LaViT obliga al estudiante a generar primero una serie de "tokens de pensamiento" invisibles. Piensa en estos tokens como un boceto mental o un monólogo interno silencioso donde el robot se dice a sí mismo: "Bien, necesito mirar las sombras aquí, y el ángulo allá, antes de decidir qué punto está más cerca".

La magia de LaViT reside en dos trucos principales:

  1. Alinear el "Ojo Interno": El sistema no solo verifica si la respuesta final del estudiante coincide con la del maestro. Verifica la "mirada" del estudiante. Obliga al estudiante a reconstruir el mapa de atención visual del maestro: el camino específico que los ojos del maestro recorrieron a través de la imagen. Si el maestro miró la sombra para determinar la profundidad, el estudiante debe mirar la sombra también, incluso si el estudiante aún no ha dicho una palabra.
  2. El Currículo de "Puerta de Enlace Sensorial": Esta es la parte más lúdica. Imagina que estás enseñando a alguien a montar en bicicleta. Si dejas que vea la carretera inmediatamente, podría simplemente dejarse llevar y nunca aprender a mantener el equilibrio. Si le vendan los ojos por completo, se estrellará. LaViT utiliza un mecanismo de "Puerta de Enlace Sensorial Curricular". Al principio del entrenamiento, bloquea parcialmente la visión directa de la imagen del estudiante. Fuerza al estudiante a confiar enteramente en esos "tokens de pensamiento" invisibles para descubrir las cosas. A medida que el estudiante mejora, la "venda" se levanta lentamente, permitiéndole ver la imagen de nuevo, pero ahora ya ha aprendido a procesar las pistas visuales internamente. Esto evita que el robot tome el "camino fácil" de simplemente adivinar basándose en el texto.

Lo que Encontraron

Los resultados fueron sorprendentemente poderosos. Los investigadores probaron su nuevo modelo de 3 mil millones de parámetros (que es relativamente pequeño y compacto) contra modelos mucho más grandes e incluso contra algunos de los modelos propietarios más avanzados disponibles.

  • El "Pequeño Gigante": Su diminuto modelo de 3B, entrenado con LaViT, superó a modelos más grandes de 7B e incluso venció al famoso GPT-4o en varias tareas complejas de razonamiento visual. Por ejemplo, en una tarea llamada "Profundidad Relativa" (figurar qué objeto está más cerca), LaViT obtuvo un 78.23%, mientras que GPT-4o obtuvo un 64.52%.
  • Corrigiendo las Alucinaciones: El estudio demostró que, sin este método, los modelos suelen "alucinar" (inventar cosas) cuando no miran de cerca. LaViT redujo esto significativamente, mejorando el rendimiento en pruebas de percepción de grano fino hasta en un +16.94%.
  • Estabilidad: Los investigadores también descubrieron que LaViT no solo copió al maestro; de hecho, se volvió más estable. Mientras que el modelo maestro gigante a veces tenía una mirada "tambaleante" (mirando puntos ligeramente diferentes para imágenes similares), el estudiante LaViT aprendió a enfocarse con precisión láser, ignorando el ruido de fondo y centrándose en los detalles críticos.

Por qué es Importante

Este artículo sugiere que el secreto para hacer a la IA más inteligente no es solo hacer los modelos más grandes o alimentarlos con más datos. Se trata de enseñarles cómo mirar. Al obligar a la IA a alinear sus "pensamientos visuales" internos con sus palabras finales, LaViT crea un modelo que realmente entiende lo que ve, en lugar de solo adivinar lo que debería decir. Es la diferencia entre un robot que memoriza un mapa y un robot que realmente aprende a navegar por el terreno. Los autores proponen que este enfoque podría ser una forma más eficiente de construir una IA poderosa, demostrando que un cerebro más pequeño y bien entrenado puede a menudo superar a uno más grande y distraído.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →