Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
Este artigo propõe o DualSpeed, um framework de treinamento rápido-lento que combina a poda de tokens visuais para eficiência com um modo auxiliar de sequência completa e autodestilação para resolver desajustes entre treinamento e inferência, acelerando assim o treinamento de MLLMs em até 4,0 sem comprometer o desempenho.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um aluno muito inteligente (um Modelo de Linguagem Grande Multimodal) a entender o mundo mostrando a ele milhares de imagens.
O Problema: O Gargalo de "Informação Demais"
Atualmente, esses modelos são como alunos que ficam sobrecarregados. Quando você mostra uma imagem, o computador a decompõe em centenas ou até milhares de pequenos pedaços chamados "tokens visuais". É como se você entregasse ao aluno um livro de 1.000 páginas para cada única imagem, mesmo que a maioria das páginas seja apenas espaço em branco ou padrões repetitivos.
Tentar ler todas essas páginas leva uma eternidade. Isso torna o treinamento desses modelos incrivelmente lento, caro e faminto por energia.
A Ideia Antiga: O Erro do "Recortar e Colar"
Os pesquisadores perceberam que muitas dessas páginas são inúteis. Eles tentaram uma técnica chamada Poda de Tokens Visuais (Visual Token Pruning), que é como usar um marca-texto para riscar as páginas chatas e redundantes antes de mostrar o livro ao aluno. Isso funciona muito bem para testar o aluno mais tarde (inferência), tornando-os mais rápidos.
Mas quando tentaram usar esse método durante o treinamento, o tiro saiu pela culatra. Isso criou um "descompasso".
- A Analogia: Imagine que você treinou o aluno apenas com um resumo de 10 páginas de um livro. Então, no exame final, você entrega a ele o livro completo de 1.000 páginas. O aluno entraria em pânico e falharia porque nunca aprendeu a lidar com a versão completa. Ele se acostumou demais com a versão curta.
A Solução: DualSpeed (O Acampamento de Treinamento "Rápido-Lento")
Os autores deste artigo, Dingkun Zhang e sua equipe, criaram um novo framework de treinamento chamado DualSpeed. Pense nisso como um acampamento de treinamento de duas vias que alterna de volta e para frente aleatoriamente para resolver o problema do descompasso.
A Via Rápida (A Prática Veloz):
- A maior parte do tempo (cerca de 90% das sessões), o modelo treina no "Modo Rápido".
- Aqui, eles usam a técnica de "poda" para cortar os tokens visuais inúteis. O modelo aprende rapidamente com os resumos curtos e eficientes.
- Para ajudar o modelo a lembrar qual versão ele está olhando, eles adicionam uma pequena "etiqueta de nome" invisível (chamada de Isolador de Modo) no início do resumo curto. Isso diz ao modelo: "Ei, esta é a versão condensada; foque nos detalhes principais".
A Via Lenta (A Revisão do Livro Completo):
- Ocasionalmente (cerca de 10% do tempo), o modelo muda para o "Modo Lento".
- Aqui, eles mostram ao modelo a imagem completa, não podada (todas as 1.000 páginas).
- Para garantir que o modelo não fique preguiçoso durante essas sessões raras, eles usam um truque chamado Autodestilação (Self-Distillation). O "Modo Rápido" (que já aprendeu muito) atua como um professor, sussurrando as respostas para o aluno do "Modo Lento". Isso garante que o aluno aprenda a versão completa de forma eficaz, embora a veja com menos frequência.
O Resultado: O Melhor dos Dois Mundos
Ao misturar esses dois modos, o modelo obtém a velocidade da Via Rápida, mas mantém a capacidade de lidar com o mundo completo e complexo da Via Lenta.
- Velocidade: Eles treinaram modelos de 2,1 a 4,0 vezes mais rápido do que antes.
- Desempenho: Apesar da velocidade, os modelos não ficaram mais burros. Eles mantiveram mais de 99% de seu desempenho original.
- Flexibilidade: O modelo final é inteligente o suficiente para lidar tanto com os resumos curtos (se você quiser velocidade depois) quanto com as imagens completas (se você quiser o máximo de precisão).
Em Resumo
O artigo afirma que, ao usar um sistema de alternância "Rápido-Lento", eles podem ensinar esses enormes modelos de IA muito mais rápido sem fazê-los esquecer como ler os livros completos. Eles descobriram que cerca de 90% dos tokens visuais são realmente redundantes durante o treinamento e que, ao cortá-los de forma inteligente (enquanto ocasionalmente praticam com a versão completa), podem economizar uma quantidade enorme de tempo e dinheiro sem perder a inteligência.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.