← Últimos artigos
🤖 machine learning

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

Este artigo propõe o DualSpeed, um framework de treinamento rápido-lento que combina a poda de tokens visuais para eficiência com um modo auxiliar de sequência completa e autodestilação para resolver desajustes entre treinamento e inferência, acelerando assim o treinamento de MLLMs em até 4,0×\times sem comprometer o desempenho.

Autores originais: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

Publicado 2026-02-04
📖 4 min de leitura☕ Leitura rápida

Autores originais: Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um aluno muito inteligente (um Modelo de Linguagem Grande Multimodal) a entender o mundo mostrando a ele milhares de imagens.

O Problema: O Gargalo de "Informação Demais"
Atualmente, esses modelos são como alunos que ficam sobrecarregados. Quando você mostra uma imagem, o computador a decompõe em centenas ou até milhares de pequenos pedaços chamados "tokens visuais". É como se você entregasse ao aluno um livro de 1.000 páginas para cada única imagem, mesmo que a maioria das páginas seja apenas espaço em branco ou padrões repetitivos.

Tentar ler todas essas páginas leva uma eternidade. Isso torna o treinamento desses modelos incrivelmente lento, caro e faminto por energia.

A Ideia Antiga: O Erro do "Recortar e Colar"
Os pesquisadores perceberam que muitas dessas páginas são inúteis. Eles tentaram uma técnica chamada Poda de Tokens Visuais (Visual Token Pruning), que é como usar um marca-texto para riscar as páginas chatas e redundantes antes de mostrar o livro ao aluno. Isso funciona muito bem para testar o aluno mais tarde (inferência), tornando-os mais rápidos.

Mas quando tentaram usar esse método durante o treinamento, o tiro saiu pela culatra. Isso criou um "descompasso".

  • A Analogia: Imagine que você treinou o aluno apenas com um resumo de 10 páginas de um livro. Então, no exame final, você entrega a ele o livro completo de 1.000 páginas. O aluno entraria em pânico e falharia porque nunca aprendeu a lidar com a versão completa. Ele se acostumou demais com a versão curta.

A Solução: DualSpeed (O Acampamento de Treinamento "Rápido-Lento")
Os autores deste artigo, Dingkun Zhang e sua equipe, criaram um novo framework de treinamento chamado DualSpeed. Pense nisso como um acampamento de treinamento de duas vias que alterna de volta e para frente aleatoriamente para resolver o problema do descompasso.

  1. A Via Rápida (A Prática Veloz):

    • A maior parte do tempo (cerca de 90% das sessões), o modelo treina no "Modo Rápido".
    • Aqui, eles usam a técnica de "poda" para cortar os tokens visuais inúteis. O modelo aprende rapidamente com os resumos curtos e eficientes.
    • Para ajudar o modelo a lembrar qual versão ele está olhando, eles adicionam uma pequena "etiqueta de nome" invisível (chamada de Isolador de Modo) no início do resumo curto. Isso diz ao modelo: "Ei, esta é a versão condensada; foque nos detalhes principais".
  2. A Via Lenta (A Revisão do Livro Completo):

    • Ocasionalmente (cerca de 10% do tempo), o modelo muda para o "Modo Lento".
    • Aqui, eles mostram ao modelo a imagem completa, não podada (todas as 1.000 páginas).
    • Para garantir que o modelo não fique preguiçoso durante essas sessões raras, eles usam um truque chamado Autodestilação (Self-Distillation). O "Modo Rápido" (que já aprendeu muito) atua como um professor, sussurrando as respostas para o aluno do "Modo Lento". Isso garante que o aluno aprenda a versão completa de forma eficaz, embora a veja com menos frequência.

O Resultado: O Melhor dos Dois Mundos
Ao misturar esses dois modos, o modelo obtém a velocidade da Via Rápida, mas mantém a capacidade de lidar com o mundo completo e complexo da Via Lenta.

  • Velocidade: Eles treinaram modelos de 2,1 a 4,0 vezes mais rápido do que antes.
  • Desempenho: Apesar da velocidade, os modelos não ficaram mais burros. Eles mantiveram mais de 99% de seu desempenho original.
  • Flexibilidade: O modelo final é inteligente o suficiente para lidar tanto com os resumos curtos (se você quiser velocidade depois) quanto com as imagens completas (se você quiser o máximo de precisão).

Em Resumo
O artigo afirma que, ao usar um sistema de alternância "Rápido-Lento", eles podem ensinar esses enormes modelos de IA muito mais rápido sem fazê-los esquecer como ler os livros completos. Eles descobriram que cerca de 90% dos tokens visuais são realmente redundantes durante o treinamento e que, ao cortá-los de forma inteligente (enquanto ocasionalmente praticam com a versão completa), podem economizar uma quantidade enorme de tempo e dinheiro sem perder a inteligência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →