← Últimos artículos
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV es un modelo multimodal grande y unificado que mejora la eficiencia y el rendimiento del razonamiento al reemplazar la generación de imágenes completas con un paradigma compacto de actualización visual guiado por un enrutador de similitud temporal, respaldado por un nuevo conjunto de datos de razonamiento entrelazado a gran escala llamado StructCoT.

Autores originales: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Publicado 2026-07-10
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando una compleja partida de "Simón dice" con un amigo robot, pero en lugar de solo escuchar, tienes que dibujar cada uno de los pasos del juego en una pizarra para mostrarle a tu amigo lo que está pasando.

La forma antigua: El artista excesivo
Actualmente, la mayoría de los modelos de IA avanzados que intentan resolver problemas con imágenes (como descifrar un laberinto o un acertijo matemático) funcionan como un artista muy meticuloso, pero ligeramente ineficiente. Digamos que el juego comienza con la imagen de una mesa con una taza encima.

  • Paso 1: La IA dibuja toda la mesa con la taza.
  • Paso 2: La regla del juego dice: "Mueve la taza hacia la izquierda". La IA, sin embargo, borra toda la pizarra y vuelve a dibujar toda la mesa nuevamente, incluyendo la taza, las patas de la mesa, el fondo y las sombras, solo para mostrar que la taza se movió una pulgada.
  • Paso 3: "Rota la taza". La IA lo borra todo y vuelve a dibujar toda la mesa otra vez.

El texto llama a esto "generación de imagen completa". Los autores argumentan que esto es un enorme desperdicio de energía y espacio. Es como reescribir el diccionario entero cada vez que quieres cambiar una sola palabra en una oración. La IA pasa la mayor parte de su tiempo redibujando cosas que no han cambiado en absoluto, lo que la hace lenta y, a veces, provoca que cometa errores en los detalles (como cambiar el color de la taza por accidente porque olvidó cómo era antes).

La nueva forma: DeltaV, el artista de las "pegatinas"
El papel presenta un nuevo modelo llamado DeltaV. En lugar de redibujar toda la escena, DeltaV actúa como un hábil artista de pegatinas.

  • Paso 1: Dibuja la mesa con la taza (el "Estado Base").
  • Paso 2: Cuando la taza debe moverse, DeltaV no redibuja la mesa. Simplemente dibuja una pequeña "pegatina" que muestra la taza moviéndose hacia la izquierda y la pega sobre el lugar anterior. Ignora las patas de la mesa y el fondo porque no cambiaron.
  • Paso 3: Cuando la taza rota, simplemente añade una pequeña "pegatina de rotación".

Este enfoque se denomina actualizaciones visuales. El documento sugiere que, al dibujar solo los cambios (el "Delta"), la IA ahorra una cantidad masiva de trabajo. En sus pruebas, este método redujo el número de "tokens de dibujo" (la tinta digital utilizada para crear la imagen) en un 55.6% de promedio, sin que las imágenes se vieran peor.

El botón de "Parada" inteligente: El enrutador TSIM
Podrías preguntarte: "¿Y si el cambio es enorme? ¿Qué pasa si toda la escena explota?".
DeltaV tiene un gestor inteligente integrado llamado Enrutador TSIM. Piensa en esto como un supervisor que observa qué tan diferente es la nueva escena de la anterior.

  • Si el cambio es pequeño (como mover una taza), el supervisor dice: "Solo usa unas pocas pegatinas".
  • Si el cambio es masivo (como si toda la habitación cambiara), el supervisor dice: "De acuerdo, usa más pegatinas para asegurarte de hacerlo bien".

El papel midió esto comprobando qué tan bien podía la IA reconstruir la imagen. Descubrieron que si seguían añadiendo tokens después de cierto punto, la imagen no mejoraba mucho. Así, el Enrutador TSIM detiene la adición de tokens una vez que el "esfuerzo extra" deja de ser rentable. Esto asegura que la IA no pierda tiempo en pasos simples, pero que no escatime en los complejos.

El campo de entrenamiento: StructCoT
Para enseñar a DeltaV a hacer esto, los investigadores no pudieron usar simplemente libros de acertijos antiguos. Construyeron un nuevo conjunto de entrenamiento masivo llamado StructCoT.

  • Contiene 1.05 millones de muestras.
  • Cubre 44 tipos diferentes de tareas, que van desde acertijos lógicos y problemas matemáticos hasta planificación robótica y preguntas científicas.
  • El documento argumenta que los conjuntos de datos anteriores eran demasiado pequeños o se centraban solo en cosas específicas como laberintos, mientras que StructCoT le da a la IA una educación mucho más amplia sobre cómo cambian los estados visuales a lo largo del tiempo.

Los resultados: ¿Funcionó?
El documento informa que cuando probaron DeltaV:

  • Resolvió problemas de razonamiento multimodal un 3.3% mejor que el antiguo método de "redibujarlo todo".
  • A pesar de que DeltaV es un modelo más pequeño (2B de parámetros), superó a modelos de código abierto mucho más grandes en un promedio del 8.4% en estas tareas de razonamiento.
  • También superó a un modelo comparable llamado Qwen3-VL-2B en un 5.9% en pruebas externas.

Lo que el documento descarta
Los autores son muy claros sobre lo que no funciona. Argumentan explícitamente contra la idea de que necesitamos generar una imagen completa y de alta resolución en cada paso del razonamiento. Sugieren que intentar hacer esto crea "redundancia de tokens visuales" (desperdicio de tinta digital) y en realidad perjudica la capacidad de la IA para razonar porque se distrae redibujando cosas que no importan. También señalan que, si bien este método es excelente para el razonamiento, podría no ser el mejor para tareas que requieren detalles extremadamente finos (como detectar una diminuta mota de polvo), donde una imagen completa aún podría ser necesaria.

La conclusión
El documento sugiere que el futuro del razonamiento de la IA no consiste en dibujar todo el mundo una y otra vez. En su lugar, se trata de pensar en términos de "¿qué cambió?". Al centrarse solo en las actualizaciones, DeltaV se vuelve más rápido, más eficiente y sorprendentemente mejor resolviendo acertijos complejos que sus primos más pesados que dibujan imágenes completas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →