← Últimos artigos
💻 computer science

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

O artigo apresenta o Eddy-VL 1.9B, um modelo de incorporação multimodal comprimido projetado para implantação em borda que alcança 91,7% do desempenho de seu professor de 2,13B, enquanto reduz os parâmetros em 9,5% e a latência em 10% por meio de poda estrutural orientada por sondagem e destilação de conhecimento em camadas.

Autores originais: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Publicado 2026-07-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os computadores podem "ver" e "ler" ao mesmo tempo, compreendendo a imagem de um gato sentado em um tapete tão bem quanto entendem as palavras "gato no tapete". Este é o reino da IA multimodal, um ramo da ciência onde as máquinas aprendem a conectar imagens, texto e vídeo em uma única linguagem compartilhada. Para fazer isso, esses modelos de IA agem como gigantes tradutores, transformando tudo o que veem em uma longa lista de números chamada embedding. Pense em um embedding como uma impressão digital única para um conteúdo; se duas impressões digitais forem muito semelhantes, o computador sabe que o conteúdo está relacionado.

No entanto, há um problema. Os tradutores mais inteligentes são geralmente os mais pesados. Eles são como supercomputadores massivos baseados na nuvem que precisam de uma conexão de internet constante e de alta velocidade para funcionar. Mas e se você estiver em um porão secreto, em uma sala de evidências policiais ou em uma estação de campo remota onde a internet foi cortada? Você precisa de um tradutor que seja inteligente o suficiente para entender pistas complexas, mas pequeno o suficiente para caber em um laptop local ou em um dispositivo portátil. Este é o desafio da implantação na borda (edge deployment): fazer com que a IA poderosa funcione offline, rapidamente e sem precisar de uma conexão com a nuvem.

Apresentamos o Eddy-VL 1.9B, um novo modelo projetado especificamente para essas situações "air-gapped" (isoladas), onde a privacidade e a velocidade são tudo. Os pesquisadores por trás deste projeto começaram com um modelo professor muito inteligente, porém muito pesado, chamado Qwen3-VL-Embedding-2B. Este professor é como um professor brilhante com 28 camadas de pensamento profundo, mas é volumoso demais para carregar em uma mochila. A equipe fez uma pergunta simples: Podemos encolher este professor sem fazer com que ele esqueça como ensinar?

Eles não apenas cortaram pedaços aleatórios; usaram uma estratégia inteligente chamada poda estrutural (structural pruning). Imagine o cérebro do professor como um edifício de 28 andares. Os pesquisadores usaram uma "sonda" especial para medir o quanto cada andar estava repetindo o trabalho dos andares imediatamente acima e abaixo dele. Eles descobriram quatro andares específicos que estavam realizando muito trabalho redundante — como ter quatro máquinas de xerox idênticas em linha quando uma bastaria. Eles removeram esses quatro andares, reduzindo o edifício de 28 para 24 andares.

Mas aqui está a parte difícil: quando você remove andares de um edifício, as pessoas que moram no último andar podem se perder. Para corrigir isso, a equipe utilizou a destilação em camadas (layered distillation). Pense nisso como um mestre arquiteto (o professor original de 28 andares) guiando um novo arquiteto menor (o estudante de 24 andares). O professor não diz apenas "construa"; ele mostra ao aluno exatamente como pensar em cada etapa. Eles usaram uma técnica chamada CKA (que mede o quão semelhantes são os pensamentos de duas camadas) para garantir que as camadas intermediárias do aluno estivessem pensando exatamente como as do professor, e usaram um método especial "Matryoshka" para a resposta final, garantindo que o aluno pudesse fornecer respostas de diferentes tamanhos dependendo da necessidade.

O resultado é o Eddy-VL 1.9B. É um modelo com cerca de 1,93 bilhão de parâmetros, pesando 3,85 GB — pequeno o suficiente para caber em muitos dispositivos modernos. Em testes, este modelo "encolhido" conseguiu manter cerca de 91,7% da inteligência do professor original. Enquanto o professor original pontuou 68,9 em um teste massivo de 78 tarefas diferentes (chamado MMEB-V2), o Eddy-VL pontuou 63,2. Isso pode parecer uma queda, mas lembre-se, o modelo perdeu quatro camadas inteiras de pensamento! Sem os truques especiais de ensino, a pontuação teria despencado para 56,8. O processo de destilação recuperou com sucesso 6,4 pontos desse terreno perdido.

O modelo também obteve um ganho de velocidade. Como possui menos camadas para processar, ele roda cerca de 10% mais rápido que o original, levando 136,4 milissegundos por imagem em vez de 150,0 milissegundos. Isso pode não parecer uma diferença enorme, mas em uma investigação do mundo real, onde você está escaneando milhares de fotos apreendidas offline, esses segundos extras se somam a horas de tempo economizado.

Os pesquisadores foram cuidadosos ao notar onde o modelo ainda tem dificuldades. Embora tenha se tornado quase tão bom quanto o professor em entender relações complexas entre palavras e imagens (pontuando 86,1% em um teste comparado aos 86,4% do professor), ele ainda teve um pouco de dificuldade com um tipo específico de quebra-cabeça chamado Winoground, onde pontuou 6,8 contra os 8,5 do professor. Isso sugere que, embora o modelo seja excelente para recuperação geral, alguns enigmas lógicos muito complexos ainda exigem o cérebro completo e não podado.

Em última análise, o Eddy-VL 1.9B não é uma solução mágica que resolve todos os problemas, mas é uma ferramenta poderosa para um trabalho muito específico. Ele prova que você pode pegar uma IA massiva e dependente da nuvem e comprimi-la em um pacote leve e pronto para uso offline sem perder muito de sua alma. Para investigadores, especialistas forenses e qualquer pessoa que trabalhe em lugares onde a internet é um luxo que não podem permitir, este modelo oferece uma maneira de manter as luzes acesas e a inteligência alta, diretamente na borda da rede.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →