← Últimos artigos
💻 computer science

Token Radius Attention for Efficient Video Generation

O Token Radius Attention (TRA) é um framework livre de treinamento que acelera eficientemente Video Diffusion Transformers ao mapear dinamicamente a entropia da consulta para raios de atenção dependentes de tokens, alcançando acelerações significativas com perda mínima de qualidade enquanto retém apenas 9-19% das interações de atenção.

Autores originais: Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

Publicado 2026-08-04
📖 3 min de leitura☕ Leitura rápida

Autores originais: Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando pintar um mural imenso e móvel em uma parede que se estende por quilômetros. Para fazer a imagem parecer real, você precisa olhar para cada única pincelada que já fez e decidir como ela se conecta com aquela que está pintando agora. No mundo da inteligência artificial, é exatamente isso que os "Video Diffusion Transformers" fazem. Eles são os artistas digitais criando vídeos deslumbrantes do zero, mas para fazer um vídeo parecer suave e realista, o computador tem que verificar cada pixel individual contra todos os outros pixels em todo o vídeo. Isso é como tentar apertar a mão de cada pessoa em um estádio enquanto você está parado em um único lugar; é incrivelmente minucioso, mas leva uma quantidade enorme de tempo e energia. Os cientistas chamam isso de "atenção densa", e este é o motivo pelo qual criar vídeos de IA de alta qualidade é atualmente lento e caro. A grande questão que os pesquisadores estão fazendo é: Podemos tornar a IA mais inteligente sobre com quem ela aperta a mão, para que ela pule as partes chatas e foque apenas nas conexões importantes, sem estragar a imagem?

Este artigo apresenta uma nova estratégia inteligente chamada Token Radius Attention (TRA) para resolver esse problema. Em vez de tratar cada parte do vídeo da mesma forma, os autores descobriram que diferentes partes do vídeo na verdade precisam de quantidades diferentes de atenção. Pense nisso como uma festa: alguns convidados estão em uma conversa séria e profunda e só precisam ouvir as pessoas logo ao lado deles (baixa atenção), enquanto outros estão dançando freneticamente e precisam ficar de olho em toda a sala (alta atenção). Os pesquisadores descobriram que poderiam prever exatamente quanta "atenção" cada parte do vídeo precisa apenas medindo o quão "confuso" ou "espalhado" está o seu foco atual. Eles chamam essa medição de "entropia".

Usando essa percepção, a equipe construiu um sistema que atua como um guarda de raio inteligente. Para cada pequena parte do vídeo (chamada de "token"), o sistema calcula um círculo de tamanho personalizado ao redor dela. Se a peça estiver focada e calma, o círculo é pequeno, e a IA olha apenas para seus vizinhos imediatos. Se a peça for caótica ou complexa, o círculo cresce para incluir mais vizinhos. Isso acontece automaticamente sem que a IA precise parar e classificar cada uma das possibilidades, o que economiza uma quantidade massiva de tempo. O resultado é um gerador de vídeo que mantém de 9% a 19% das conexões originais, mas roda de 1,56 a 2,05 vezes mais rápido, produzindo vídeos que parecem tão bons quanto as versões lentas e pesadas. Os autores testaram isso em vários modelos diferentes de criação de vídeo e descobriram que funciona consistentemente bem, provando que você não precisa verificar tudo para obter um ótimo resultado — você só precisa verificar as coisas certas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →