← Últimos artigos
🤖 AI

ZAYA1-VL-8B Technical Report

O artigo apresenta o ZAYA1-VL-8B, um modelo compacto visão-linguagem de misturas de especialistas com 9,2 bilhões de parâmetros que aproveita adaptadores LoRA específicos para visão e atenção bidirecional para alcançar desempenho competitivo ou superior a modelos maiores de última geração em diversos benchmarks de compreensão visual.

Autores originais: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Um "Super-Cérebro" Compacto para Imagens e Texto

Imagine que você tem um bibliotecário brilhante (o modelo de linguagem) que sabe tudo sobre livros, mas nunca viu uma imagem. Agora, imagine que você quer dar a esse bibliotecário um par de óculos para que ele possa entender fotos, gráficos e diagramas.

A equipe da Zyphra Technologies construiu o ZAYA1-VL-8B, um novo tipo de "Modelo Visão-Linguagem". Pense nele como um cérebro compacto e altamente eficiente que pode ler texto e olhar para imagens simultaneamente. Mesmo sendo relativamente pequeno (8 bilhões de parâmetros), ele desempenha tão bem ou melhor do que modelos muito maiores e mais caros em tarefas como contar objetos, ler texto dentro de imagens (OCR) e resolver quebra-cabeças visuais.

Os Dois Ingredientes Secretos

O artigo destaca dois "truques" específicos que a equipe usou para tornar esse modelo pequeno tão inteligente.

1. Os Óculos "Apenas Visão" (Adaptadores LoRA Específicos de Visão)

  • O Problema: Geralmente, quando um modelo olha para uma imagem e lê texto, ele usa exatamente os mesmos "músculos" internos (parâmetros) para ambos. É como tentar tocar piano e bateria com as mesmas mãos ao mesmo tempo; os sinais podem se misturar.
  • A Solução: A equipe adicionou "óculos" especiais e leves (chamados adaptadores LoRA) especificamente para a parte do cérebro que processa imagens.
  • A Analogia: Imagine que o bibliotecário tem uma mesa principal para ler livros. Em vez de construir um novo escritório inteiro para olhar fotos, eles apenas penduraram uma lupa especializada e um filtro de cor sobre a mesa existente. Agora, quando o bibliotecário olha para uma foto, ele usa essas ferramentas especiais para ver detalhes com mais clareza, sem precisar contratar mais funcionários ou construir um prédio maior. Isso torna o modelo "específico de modalidade" (bom em imagens) sem torná-lo enorme.

2. A "Visão Panorâmica" (Atenção Bidirecional)

  • O Problema: Modelos de IA padrão leem texto da esquerda para a direita, como uma frase. Se você os forçar a olhar para uma imagem da mesma maneira, eles podem olhar para o canto superior esquerdo e nunca "olhar de volta" para o canto inferior direito para ver como se conectam. É como tentar entender uma pintura olhando apenas para uma pincelada de cada vez, sem nunca recuar para ver a imagem completa.
  • A Solução: A equipe mudou as regras para que, quando o modelo olha para uma imagem, cada parte da imagem possa "falar" com todas as outras partes instantaneamente.
  • A Analogia: Em vez de ler uma imagem como uma linha de texto (da esquerda para a direita), o modelo adota uma visão panorâmica. Ele pode ver o céu, as montanhas e o rio todos de uma só vez e entender como se relacionam imediatamente. Isso ajuda o modelo a entender a estrutura da "imagem completa" de uma imagem muito melhor.

Como Eles o Treinaram: O "Currículo"

A equipe não apenas jogou dados no modelo; eles o ensinaram em etapas, como um aluno indo à escola:

  1. Jardim de Infância (Alinhamento): Eles começaram ensinando o modelo a descrever imagens simples usando fotos de baixa resolução. Eles congelaram o "cérebro" e treinaram apenas os "óculos" (o adaptador) para garantir que os dados de imagem falassem a mesma língua que o texto.
  2. Ensino Fundamental (Pré-treinamento): Eles liberaram o modelo completo e alimentaram-no com 30 milhões de exemplos de imagens e texto. Crucialmente, começaram com imagens pequenas e aumentaram gradualmente a resolução, ensinando o modelo a lidar com tudo, desde ícones minúsculos até fotos massivas em alta definição.
  3. Ensino Médio (Expansão de Embedding): Eles ensinaram ao modelo um novo vocabulário especificamente para apontar para coisas. Adicionaram "palavras" (tokens) especiais que permitem ao modelo dizer: "Olhe para este ponto específico" ou "Desenhe uma caixa ao redor daquele objeto".
  4. Pós-Graduação (Ajuste de Instrução): Finalmente, deram ao modelo 20 milhões de tarefas complexas, como responder perguntas sobre um gráfico ou encontrar um objeto específico em um quarto bagunçado, para polir suas habilidades de raciocínio.

O Que Ele Pode Fazer (Os Resultados)

O artigo testou o ZAYA1-VL-8B contra outros modelos de ponta. Aqui está no que ele se destacou:

  • Lendo Texto em Imagens: É muito bom em Reconhecimento Óptico de Caracteres (OCR), ou seja, consegue ler texto dentro de uma foto, como um sinal de rua ou um documento.
  • Contagem: Se você mostrar a ele uma foto de um bando de pássaros, ele consegue contá-los com precisão.
  • Apontar e Caixas de Limites: Se você pedir para ele "apontar para o carro vermelho", ele pode fornecer as coordenadas exatas desse carro.
  • Eficiência: Ele alcança esses resultados usando significativamente menos poder de computação (parâmetros ativos) do que seus concorrentes. É como um carro híbrido que obtém a mesma quilometragem que um carro que consome muita gasolina, mas usa metade do combustível.

Resumo

O ZAYA1-VL-8B é uma demonstração de que você não precisa de um modelo massivo e inchado para entender imagens e texto. Ao dar ao modelo ferramentas especializadas para imagens (os "óculos") e permitir que ele veja a imagem inteira de uma só vez (a "visão panorâmica"), a equipe criou uma IA pequena, eficiente e altamente capaz que agora está aberta para qualquer pessoa usar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →