← Últimos artigos
💬 NLP

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

O artigo propõe o paradigma "Pensar com Vídeo", que utiliza modelos de geração de vídeo como o Sora-2 como meio unificado para raciocínio multimodal, demonstrando através do novo benchmark VideoThinkBench que essa abordagem supera ou iguala os modelos de linguagem e visão atuais em tarefas visuais e textuais.

Autores originais: Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

Publicado 2026-04-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça complexo.

Até agora, a inteligência artificial (IA) tinha duas formas principais de "pensar":

  1. Pensando com Texto: Como um estudante escrevendo uma prova, usando palavras para deduzir a resposta.
  2. Pensando com Imagens: Como um pintor que desenha um esboço rápido para entender a geometria de um problema.

Mas esses métodos têm limitações. O texto é estático (não mostra movimento) e a imagem é um momento congelado (não mostra o processo). É como tentar entender um filme assistindo apenas a uma foto ou lendo o roteiro sem ver a ação.

Aqui entra o novo conceito do artigo: "Pensar com Vídeo" (Thinking with Video).

A Grande Ideia: O Quadro Negro Mágico

Os pesquisadores propõem que a IA deve usar vídeos para raciocinar. Pense nisso como um quadro negro mágico e animado.

Em vez de apenas escrever a resposta final ou mostrar uma imagem estática, a IA gera um vídeo curto onde ela:

  • Desenha em tempo real: Se o problema é sobre luz refletindo em um espelho, a IA "desenha" o raio de luz se movendo no vídeo até encontrar o ponto certo.
  • Simula o movimento: Se é um labirinto, a IA "anda" pelo caminho no vídeo, testando as curvas até achar a saída.
  • Fala enquanto faz: A IA narra o que está fazendo ("Agora vou somar estes números...") enquanto escreve no quadro.

É como se a IA tivesse uma mente que não apenas calcula, mas visualiza e simula o processo de pensamento, exatamente como um humano faria ao resolver um problema no papel.

O Teste: O "VideoThinkBench"

Para ver se essa ideia funciona, os criadores inventaram um novo teste chamado VideoThinkBench (o Banco de Testes do Pensamento em Vídeo). Eles dividiram os desafios em duas categorias:

  1. Desafios Visuais (Onde o vídeo brilha):

    • Exemplo: "Onde dois raios de luz se cruzam?"
    • Resultado: A IA (chamada Sora-2) foi incrível. Ela conseguiu desenhar o caminho da luz no vídeo e acertar o ponto de cruzamento melhor do que os melhores "olhos de computador" atuais. Foi como se ela tivesse um olho de águia que consegue prever o movimento.
  2. Desafios de Texto e Matemática (A surpresa):

    • Exemplo: Resolver problemas matemáticos complexos ou perguntas de conhecimento geral.
    • Resultado: Aqui foi a grande surpresa. A IA conseguiu resolver problemas de matemática (como GSM8K e MATH) com uma precisão impressionante (quase 93% de acerto), quase tão bem quanto os modelos mais avançados de texto. Ela escreveu a solução no vídeo e falou a resposta.

O Segredo: Como ela faz isso?

Os pesquisadores investigaram como a IA conseguiu fazer isso e descobriram algumas coisas fascinantes:

  • Aprendizado por Exemplos: Assim como uma criança aprende vendo vários exemplos, a IA ficou muito melhor quando recebeu mais exemplos de como resolver o problema antes de tentar ela mesma.
  • A "Voz" da Resposta: Curiosamente, a IA muitas vezes acertava a resposta falada no áudio do vídeo, mesmo que o texto escrito no vídeo estivesse um pouco bagunçado ou ilegível. Isso sugere que a parte de "raciocínio" está funcionando, mas a parte de "escrever letras bonitas" ainda precisa de polimento.
  • O "Reescritor" Interno: Eles suspeitam que a IA tem um "secretário" interno (um modelo de reescrita de prompts) que transforma a pergunta difícil em uma lista de passos simples e visuais antes de começar a gerar o vídeo. É como se alguém lesse o problema, transformasse em um roteiro de desenho animado e depois entregasse para o animador.

Por que isso é importante?

Este trabalho sugere que o futuro da Inteligência Artificial pode não ser apenas "ler e escrever" ou "ver e classificar", mas sim simular o mundo.

Ao usar vídeos, a IA pode:

  • Entender processos dinâmicos (como algo caindo, girando ou mudando de cor).
  • Unificar a visão e a linguagem em um único fluxo contínuo, como fazemos nós humanos quando imaginamos algo.

Em resumo:
O artigo diz que a IA está evoluindo de um "leitor de livros" para um "ator de cinema" que pensa. Em vez de apenas dar a resposta, ela nos mostra o filme do pensamento dela, desenhando, movendo e explicando o caminho até a solução. Isso pode ser o próximo grande salto para criar máquinas que realmente entendem e raciocinam sobre o mundo real, e não apenas sobre dados estáticos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →