← Últimos artigos
💬 NLP

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE é um framework de professor-aluno que acelera o treinamento de modelos de linguagem grandes multimodais através da poda adaptativa de tokens redundantes usando funções de perda de orientação e estimativas de dificuldade, alcançando convergência mais rápida e desempenho superior enquanto reduz significativamente o consumo total de tokens.

Autores originais: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

Publicado 2026-04-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô muito inteligente a entender vídeos. No momento, a maneira padrão de fazer isso é como forçar o robô a ler cada palavra única em um roteiro, mesmo as chatas como "o", "é" ou "e", enquanto ele assiste a um filme. Isso é incrivelmente lento, caro e desperdiça muita energia porque o robô está fazendo trabalho desnecessário.

O artigo apresenta um novo método chamado REGATE (Elisão Adaptativa de Tokens Guiada por Referência). Pense no REGATE como um treinador de estudos super eficiente que ajuda o robô a aprender mais rápido, dizendo exatamente quais palavras focar e quais pular.

Veja como funciona, usando analogias simples:

1. O Problema: Ler Todo o Roteiro

Na maneira antiga (Treinamento Padrão), o robô processa cada "token" (um bloco de texto) em uma descrição de vídeo.

  • A Analogia: Imagine que você está tentando aprender um novo idioma lendo um livro onde cada palavra única é destacada em neon brilhante. Você passa horas encarando palavras comuns como "o" e "um", que na verdade não lhe ensinam muito sobre a história. Você fica cansado e aprende devagar.

2. A Solução: O "Professor" e o "Aluno"

O REGATE usa uma equipe de duas pessoas:

  • O Aluno: Este é o modelo principal do robô que estamos tentando treinar. Ele olha tanto para o vídeo quanto para o texto.
  • O Professor: Esta é uma versão "congelada" (inalterável) do robô que apenas vê o texto. Ele não pode ver o vídeo.

Como eles trabalham juntos:
O Professor olha para uma frase e pergunta: "Posso adivinhar o que esta palavra significa apenas lendo o texto, sem ver o vídeo?"

  • Se a palavra for "o" ou "é", o Professor diz: "Fácil! Eu sei isso."
  • Se a palavra for "vermelho", "girando" ou "misturando", o Professor diz: "Uau, não consigo adivinhar isso sem ver a imagem! Esta palavra precisa do vídeo."

3. A "Pontuação de Dificuldade"

O REGATE combina o palpite do Professor com o próprio histórico do Aluno.

  • A Analogia: Imagine que o Aluno está fazendo uma prova de prática. O REGATE mantém um registro de quais perguntas o Aluno continua errando.
  • Se o Professor disser: "Você precisa do vídeo para esta palavra", E o Aluno tiver tido dificuldades com palavras semelhantes antes, o REGATE marca essa palavra como "Alta Prioridade".
  • Se o Professor disser: "Eu conheço esta palavra", e o Aluno já a dominou, o REGATE a marca como "Pular".

4. O Resultado: O "Pulo Inteligente"

Durante o treinamento, o REGATE cria uma máscara. Ele diz ao robô: "Leia estas palavras importantes, mas pule as chatas."

  • A Analogia: Em vez de ler a página inteira do livro página por página, o robô agora lê apenas as frases destacadas que realmente fazem a história avançar. Ele ignora as palavras de preenchimento.
  • O Benefício: O robô faz 40% menos trabalho (processa menos tokens), mas aprende tão bem, ou até melhor, porque não está desperdiçando energia com coisas que já conhece.

O que o Artigo Afirma (Os Resultados)

Os autores testaram isso em três tipos diferentes de robôs de aprendizado de vídeo:

  1. VideoChat2
  2. VideoLLaMA2
  3. InternVL3.5

Eles descobriram que:

  • Velocidade: Os robôs atingiram seu desempenho máximo duas vezes mais rápido do que o habitual.
  • Eficiência: Eles usaram apenas 38% dos tokens (palavras/blocos) em comparação com o método padrão.
  • Precisão: Em muitos casos, os robôs treinados com REGATE ficaram na verdade mais inteligentes do que os treinados da maneira antiga, especialmente em perguntas complexas sobre vídeo.
  • Sem Custo Extra: Este método não requer construir um novo robô ou adicionar partes extras; apenas muda como o robô lê durante o treinamento.

Resumo

O REGATE é como um filtro inteligente para treinar IA. Em vez de fazer a IA ler cada palavra única em um roteiro, ele usa um especialista "apenas texto" para identificar quais palavras realmente precisam do contexto do vídeo para serem compreendidas. Ao pular as palavras fáceis e redundantes, a IA aprende mais rápido, usa menos eletricidade e frequentemente acaba sendo mais inteligente do que se tivesse lido tudo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →