← Últimos artigos
💻 computer science

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

O VideoCoCo introduz um framework de motor duplo agêntico que aproveita código executável do Blender como uma cadeia de pensamento em nível de processo para gerar vídeos fisicamente consistentes, primeiro criando um rascunho espaciotemporal determinístico e depois refinando-o em um resultado fotorrealista, superando significativamente os baselines existentes em benchmarks de consistência física.

Autores originais: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou
Publicado 2026-07-31
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine tentar ensinar um robô a assar um bolo apenas sussurrando: "Faça algo delicioso". O robô pode entender a palavra "delicioso", mas sem uma receita, ele não tem ideia se deve misturar os ovos antes da farinha, quanto tempo deve assar ou por que o bolo não deve se transformar em um tijolo. Este é o dilema atual no mundo da geração de vídeo por Inteligência Artificial. Cientistas estão construindo modelos que podem transformar descrições de texto em imagens em movimento, mas esses "sonhadores" de IA frequentemente lutam contra as leis da física. Eles podem fazer uma bola flutuar para cima em vez de cair, ou um copo estraçalhar antes de atingir o chão, porque a IA está adivinhando a sequência de eventos em vez de compreender verdadeiramente como o mundo funciona.

Para corrigir isso, pesquisadores estão procurando uma maneira de fazer a IA "pensar" antes de agir, um conceito conhecido como Cadeia de Pensamento (Chain-of-Thought). Em vez de pular diretamente para a imagem final, a IA é incentivada a criar um plano intermediário. Pense nisso como um arquiteto desenhando plantas antes de construir uma casa, ou um chef escrevendo uma receita antes de cozinhar. O grande questionamento é: que tipo de planta é a melhor? É uma lista de palavras? Alguns esboços rudimentares? Ou algo mais preciso? Este é o enigma que o artigo VideoCoCo se propõe a resolver, visando fazer com que os vídeos gerados por IA não sejam apenas bonitos, mas que realmente obedeçam às regras da realidade.


A Magia do "Código como CoT": Uma Dupla Dinâmica de Motores

Conheça o VideoCoCo, um novo sistema que atua como um diretor superinteligente e um artista talentoso trabalhando juntos para criar vídeos que não quebrem as leis da física. Os pesquisadores perceberam que, quando a IA tenta adivinhar como uma cena evolui apenas a partir de um comando de texto, ela frequentemente erra a "história". Por isso, deram à IA uma nova ferramenta: código executável.

Pense no processo desta forma:

  1. O Diretor (O Agente de Codificação): Quando você dá à IA um comando como "uma manteiga derretendo em uma panela quente", o Diretor não apenas imagina a cena. Em vez disso, ele escreve um programa de Blender (um conjunto de instruções de computador). Este código é como uma receita rigorosa e inquebrável. Ele diz explicitamente ao computador: "Coloque um bloco de manteiga aqui. Ligue o calor. Faça a manteiga amolecer, ceder e espalhar-se por exatamente 5 segundos". Como se trata de um código, ele deve rodar exatamente como escrito. Não é um palpite; é uma simulação.
  2. O Sandbox (O Mecanismo de Simulação): O computador executa este código em um parquinho seguro e isolado chamado "sandbox". O resultado ainda não é um filme bonito; é um rascunho determinístico. Imagine uma animação rudimentar de argila branca. Parece um esboço feito de massinha, mas é perfeitamente preciso em seu movimento. A manteiga derrete exatamente como a física diz que deveria, porque o código a forçou a acontecer.
  3. O Artista (O Mecanismo de Geração de Vídeo): Agora, o segundo motor entra em cena. Este é o artista que pega esse esboço rudimentar de argila branca e pinta por cima para transformá-lo em um filme real de alta definição. Como o artista já possui a versão perfeita em "massinha" para copiar, ele não precisa adivinhar como a manteiga deve se mover. Ele apenas se concentra em fazê-la parecer brilhante, dourada e deliciosa.

Por que esta abordagem é um divisor de águas

O artigo argumenta que os métodos anteriores tentavam fazer coisas demais ao mesmo tempo. Alguns modelos de IA tentavam escrever um plano de texto (como "a manteiga derrete"), mas o texto é vago. Outros tentavam adivinhar o próximo quadro de um vídeo, mas isso é como tentar pintar uma obra-prima olhando para uma foto borrada da anterior.

O VideoCoCo diz: "Pare de adivinhar a física. Apenas simule-a."

Ao usar o código como a "Cadeia de Pensamento", o sistema separa a lógica do movimento da beleza da imagem. O código cuida do "o que acontece e quando", enquanto o editor de vídeo cuida do "como isso se parece". Esta é uma mudança enorme porque transforma um jogo de adivinhação em um processo de duas etapas onde a primeira etapa é 100% confiável.

A Prova está no Pudim (e na Física)

Os pesquisadores testaram seu sistema em dois grandes desafios: PhyGenBench e VBench-2.0. Estes são como exames para IA, testando especificamente se os vídeos seguem as regras do mundo real, como gravidade, calor e como os materiais se comportam.

  • Os Resultados: Antes do VideoCoCo, a IA de base (chamada OmniWeaving) pontuou uma média de 0,475 no teste de física. Após adicionar o sistema "Code-as-CoT", a pontuação saltou para 0,558. No outro teste (VBench-2.0), a pontuação disparou de 52,18% para 77,88%.
  • O Momento "Aha!": As maiores melhorias ocorreram em áreas onde a IA costuma falhar mais: dinâmica térmica (como calor e derretimento) e dinâmica de materiais (como as coisas quebram ou fluem). Isso prova que o rascunho de código estava realmente ensinando à IA como a física funciona, não apenas tornando o vídeo mais bonito.

O que o Artigo Descarta

É importante notar o que o VideoCoço não é. O artigo argumenta explicitamente contra a ideia de que podemos apenas treinar uma IA maior para "aprender" a física a partir de milhões de vídeos. Eles descobriram que, sem um plano explícito e executável (o código), a IA ainda tem dificuldade em acertar a sequência de eventos. Eles também mostram que ter apenas um plano de texto rudimentar ou alguns quadros-chave não é suficiente; o plano precisa ser um código executável que o computador possa realmente rodar para criar um rascunho.

O Problema e o Futuro

Embora os resultados sejam impressionantes, o artigo é honesto sobre as limitações. O sistema é atualmente um pouco mais lento porque precisa escrever o código, rodar uma simulação e depois pintar o vídeo. É como ter um arquiteto e um pintor brilhantes, mas leva um pouco mais de tempo do que apenas tirar uma foto. Além disso, o sistema é limitado pela complexidade do simulador Blender; coisas supercomplexas como água giratória e caótica ainda podem ser difíceis de simular perfeitamente no momento.

No entanto, os autores sugerem que esta abordagem "Code-as-CoT" é uma nova maneira poderosa de pensar sobre a IA. Em vez de esperar que a IA entenda o mundo magicamente, podemos dar a ela uma ferramenta para construir um modelo do mundo primeiro, e então deixá-la criar a arte baseada nessa fundação sólida. É um lembrete de que, às vezes, a melhor maneira de criar algo belo é primeiro construir algo que funcione.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →