← Últimos artigos
💻 computer science

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

O artigo propõe o **STC (Streaming Token Compression)**, um framework hierárquico e plug-and-play que acelera VideoLLMs de streaming ao reduzir a latência de codificação e preenchimento através do cache de recursos temporais e da poda de tokens visuais redundantes.

Autores originais: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

Publicado 2026-02-12
📖 3 min de leitura☕ Leitura rápida

Autores originais: Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando assistir a uma transmissão de futebol ao vivo, mas a sua internet é lenta e o seu computador é antigo. Para não travar, você precisa de um jeito inteligente de processar as imagens sem ter que "reler" cada detalhe de cada milissegundo, certo?

Este artigo científico apresenta uma solução chamada STC (Streaming Token Compression). Ele foi criado para ajudar as Inteligências Artificiais (os chamados VideoLLMs) a "entenderem" vídeos em tempo real (como uma live ou o que uma câmera de segurança vê) de forma muito mais rápida e sem gastar tanta energia.

Para explicar como ele funciona, vamos usar duas analogias:


1. O STC-Cacher: O "Observador de Detalhes" 🕵️‍♂️

(Para acelerar a parte visual - o ViT)

Imagine que você está observando uma estátua em uma praça. Se você ficar olhando para ela por 10 minutos, a estátua não muda, certo? Se você tentasse desenhar cada detalhe da estátua a cada segundo, você ficaria exausto e perderia tempo à toa.

O STC-Cacher funciona como um observador inteligente:

  • O que ele faz: Ele escolhe um "momento de referência" (a estátua parada). Nos segundos seguintes, em vez de desenhar tudo de novo, ele apenas pergunta: "Algo mudou?".
  • A mágica: Se um pássaro voar na frente da estátua, ele desenha apenas o pássaro (o "token dinâmico"). Se nada mudou, ele simplesmente copia o desenho anterior (o "token estático").
  • Resultado: Ele economiza um esforço enorme de "desenho" (processamento), focando apenas no que é novo e importante.

2. O STC-Pruner: O "Editor de Notícias" ✂️

(Para acelerar a parte do pensamento - o LLM)

Depois que a imagem é processada, a IA precisa "pensar" sobre ela. Mas vídeos geram uma quantidade absurda de informações (milhares de pequenos pedaços de dados chamados "tokens"). É como se a IA recebesse um livro de 5.000 páginas para ler a cada segundo para te dar uma resposta. Isso trava o cérebro dela!

O STC-Pruner age como um editor de jornal super ágil:

  • O que ele faz: Antes de entregar o texto para a IA ler, ele faz uma "limpeza". Ele usa dois critérios (âncoras) para decidir o que jogar fora:
    1. Âncora do Passado: "Eu já vi isso nos últimos segundos?" (Se sim, descarta).
    2. Âncora do Presente: "Isso é apenas o fundo da imagem ou é algo relevante?" (Se for só o céu azul ou uma parede branca, descarta).
  • A mágica: Ele só deixa passar para o "cérebro" da IA o que for novidade (algo que não estava no passado) e relevante (algo que se destaca no cenário atual).
  • Resultado: Em vez de ler 5.000 páginas, a IA lê apenas um resumo de 100 páginas com o que realmente importa. Ela responde muito mais rápido!

Resumo da Ópera 🚀

Os pesquisadores criaram uma "hierarquia de economia":

  1. Primeiro nível (Cacher): Não gaste energia processando o que é repetido visualmente.
  2. Segundo nível (Pruner): Não gaste tempo pensando em informações que não acrescentam nada à história.

O resultado prático? A IA consegue entender vídeos ao vivo com quase a mesma precisão de antes, mas sendo muito mais rápida (reduzindo o tempo de espera em quase metade!) e consumindo muito menos recursos computacionais. É como dar "superpoderes de foco" para a inteligência artificial.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →