← Últimos artigos
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

O DeltaV é um modelo multimodal grande e unificado que aumenta a eficiência e o desempenho de raciocínio ao substituir a geração de imagem completa por um paradigma compacto de atualização visual guiado por um roteador de similaridade temporal, apoiado por um novo conjunto de dados de raciocínio intercalado em larga escala chamado StructCoT.

Autores originais: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Publicado 2026-07-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está jogando uma complexa partida de "O Mestre Mandou" com um amigo robô, mas em vez de apenas ouvir, você tem que desenhar cada passo do jogo em um quadro branco para mostrar ao seu amigo o que está acontecendo.

O Jeito Antigo: O Artista Exaustivo
Atualmente, a maioria dos modelos avançados de IA que tentam resolver problemas com imagens (como decifrar um labirinto ou um enigma matemático) trabalham como um artista muito detalhista, porém ligeiramente ineficiente. Digamos que o jogo comece com a imagem de uma mesa com uma xícara sobre ela.

  • Passo 1: A IA desenha a mesa inteira com a xícara.
  • Passo 2: A regra do jogo diz: "Mova a xícara para a esquerda". A IA, no entanto, apaga o quadro branco inteiro e redesenha a mesa toda novamente, incluindo a xícara, as pernas da mesa, o fundo e as sombras, apenas para mostrar a xícara se movendo um centímetro.
  • Passo 3: "Gire a xícara". A IA apaga tudo e redesenha a mesa inteira novamente.

O artigo chama isso de "geração de imagem completa". Os autores argumentam que isso é um enorme desperdício de energia e espaço. É como reescrever o dicionário inteiro toda vez que você quer mudar uma única palavra em uma frase. A IA gasta a maior parte do tempo redesenhando coisas que nem mudaram, o que a torna lenta e, às vezes, faz com que ela erre detalhes (como mudar a cor da xícara por acidente porque esqueceu como ela era antes).

O Novo Jeito: DeltaV, o Artista de "Adesivos"
O artigo apresenta um novo modelo chamado DeltaV. Em vez de redesenhar toda a cena, o DeltaV age como um artista de adesivos inteligente.

  • Passo 1: Ele desenha a mesa com a xícara (o "Estado Base").
  • Passo 2: Quando a xícara precisa se mover, o DeltaV não redesenha a mesa. Ele apenas desenha um pequeno "adesivo" mostrando a xícara se movendo para a esquerda e cola esse adesivo sobre o lugar antigo. Ele ignora as pernas da mesa e o fundo porque eles não mudaram.
  • Passo 3: Quando a xícara gira, ele apenas adiciona um pequeno "adesivo de rotação".

Essa abordagem é chamada de atualizações visuais. O artigo sugere que, ao desenhar apenas as mudanças (o "Delta"), o DeltaV economiza uma quantidade massiva de trabalho. Em seus testes, este método reduziu o número de novos "tokens de desenho" (a tinta digital usada para criar a imagem) em 55,6% em média, sem tornar as imagens piores.

O Botão de "Parar" Inteligente: O Roteador TSIM
Você pode se perguntar: "E se a mudança for enorme? E se a cena inteira explodir?"
O DeltaV possui um gerente inteligente integrado chamado Roteador TSIM. Pense nisso como um supervisor que observa o quão diferente a nova cena é da anterior.

  • Se a mudança for pequena (como mover uma xícra), o supervisor diz: "Use apenas alguns adesivos".
  • Se a mudança for massiva (como o quarto inteiro mudando), o supervisor diz: "Ok, use mais adesivos para garantir que acertamos".

O artigo mediu isso verificando o quão bem a IA conseguia reconstruir a imagem. Eles descobriram que, se continuassem adicionando tokens após certo ponto, a imagem não melhorava muito. Assim, o Roteador TSIM para de adicionar tokens assim que o "esforço extra" deixa de valer a pena. Isso garante que a IA não perca tempo com passos simples, mas não economize demais em passos complexos.

O Campo de Treinamento: StructCoT
Para ensinar o DeltaV a fazer isso, os pesquisadores não poderiam usar apenas livros de quebra-cabeças antigos. Eles construíram um novo e massivo conjunto de treinamento chamado StructCoT.

  • Ele contém 1,05 milhão de amostras.
  • Abrange 44 tipos diferentes de tarefas, variando de enigmas de lógica e problemas matemáticos a planejamento de robôs e questões científicas.
  • O artigo argumenta que os conjuntos de dados anteriores eram muito pequenos ou focados apenas em coisas específicas, como labirintos, enquanto o StructCoT oferece à IA uma educação muito mais ampla sobre como os estados visuais mudam ao longo do tempo.

Os Resultados: Funcionou?
O artigo relata que, quando testaram o DeltaV:

  • Ele resolveu problemas de raciocínio multimodal 3,3% melhor do que o antigo método de "redesenhar tudo".
  • Embora o DeltaV seja um modelo menor (2B de parâmetros), ele superou modelos de código aberto muito maiores em uma média de 8,4% nessas tarefas de raciocínio.
  • Também superou um modelo comparável chamado Qwen3-VL-2B em 5,9% em benchmarks externos.

O Que o Artigo Descarta
Os autores são muito claros sobre o que não funciona. Eles argumentam explicitamente contra a ideia de que precisamos gerar uma imagem completa e de alta resolução em cada passo do raciocínio. Eles sugerem que tentar fazer isso cria "redundância de tokens visuais" (desperdício de tinta digital) e, na verdade, prejudica a capacidade de raciocínio da IA, pois ela se distrai redesenhando coisas que não importam. Eles também observam que, embora este método seja ótimo para o raciocínio, pode não ser o melhor para tarefas que exigem detalhes extremamente finos (como detectar um minúsculo grão de poeira), onde uma imagem completa ainda pode ser necessária.

A Conclusão
O artigo sugere que o futuro do raciocínio de IA não é sobre desenhar o mundo inteiro repetidamente. Em vez disso, é sobre pensar em termos de "o que mudou?". Ao focar apenas nas atualizações, o DeltaV torna-se mais rápido, mais eficiente e surpreendentemente melhor em resolver quebra-cabeças complexos do que seus primos mais pesados que desenham a imagem completa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →