← Últimos artigos
💻 computer science

BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs

O artigo apresenta o BidirLM, uma abordagem open-source que adapta modelos generativos causais (como Gemma3 e Qwen3) em codificadores bidirecionais omnimodais de alto desempenho, superando limitações anteriores ao introduzir uma fase de mascaramento prévio, uma estratégia de fusão de pesos para evitar o esquecimento catastrófico e a integração de capacidades especializadas de diversos domínios.

Autores originais: Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline Hudelot, Pierre Colombo

Publicado 2026-04-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline Hudelot, Pierre Colombo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chef de cozinha extremamente talentoso (o modelo de linguagem causal, como o Gemma ou o Qwen). Esse chef é mestre em uma coisa: cozinhar prato por prato, seguindo uma receita passo a passo, do início ao fim. Ele é ótimo em gerar texto, como escrever um livro ou responder a uma pergunta, mas ele olha apenas para o que já escreveu para decidir a próxima palavra. Ele não consegue olhar para o prato todo de uma vez para entender o contexto completo de uma só vez.

Agora, imagine que você precisa que esse mesmo chef se torne um crítico gastronômico. Um crítico precisa ler o prato inteiro, olhar para todos os ingredientes ao mesmo tempo, entender como eles se relacionam e dar uma nota. Ele precisa de uma visão "bidirecional" (olhar para frente e para trás).

O problema é que transformar esse chef gerador em um crítico é difícil. Se você tentar apenas mudar a regra do jogo, ele esquece como cozinhar bem (esquecimento catastrófico) ou não aprende a criticar direito.

Aqui entra o BidirLM, a "receita mágica" apresentada neste artigo. Vamos explicar como eles fizeram isso usando analogias simples:

1. O Problema: O Chef que só olha para frente

Os modelos de IA atuais (LLMs) são como esse chef: eles são ótimos em criar coisas, mas ruins em entender coisas complexas de uma só vez. Para entender bem, a gente precisa de modelos "bidirecionais" (como o BERT), que olham para o texto inteiro de uma vez. Mas criar esses modelos do zero é caro e demorado.

2. A Solução: A "Fase de Máscara" (O Treino de Revisão)

Os autores descobriram que, para transformar o chef em crítico, você não pode apenas pedir para ele tentar criticar. Você precisa de um treino intermediário.

  • A Analogia: Imagine que você pede para o chef ler um texto, mas você cobre (mascara) algumas palavras com um post-it. O chef precisa adivinhar o que está escondido usando o contexto de todo o texto (antes e depois).
  • A Descoberta: Muitos pesquisadores pularam essa etapa e foram direto para o treino final. O BidirLM mostrou que pular essa etapa é um erro. É como tentar ensinar alguém a dirigir sem primeiro ensinar a olhar pelo retrovisor. Essa fase de "adivinhar palavras escondidas" é o segredo para o modelo aprender a olhar para os dois lados.

3. O Desafio: Esquecer o que se sabia (Amnésia)

Quando você treina esse chef para ser crítico, ele começa a esquecer como cozinhar os pratos originais. Isso é chamado de "esquecimento catastrófico". É como se, ao estudar para ser médico, ele esquecesse como andar de bicicleta.

  • A Solução Dupla (O "Mix" e a "Fusão"):
    1. A Fusão de Pesos (Model Merging): Em vez de treinar o modelo do zero, eles pegaram o "chef original" (que sabe cozinhar) e o "chef crítico" (que acabou de aprender) e misturaram os pesos das duas versões, como se fossem duas massas de bolo. A metade da massa é do chef original, a outra metade é do crítico. O resultado é um modelo que sabe cozinhar e criticar, sem esquecer nada.
    2. A Mistura de Dados Leve: Eles também adicionaram um pouco de "comida variada" (dados de matemática, código, outras línguas) ao treino. Não precisa ser muita coisa (apenas 20%), mas é o suficiente para lembrar o modelo de que o mundo é grande e diverso.

4. O Grande Truque: Montar com Peças de Lego (Composição)

A parte mais genial do BidirLM é como eles lidam com modalidades diferentes (áudio, imagem).

  • A Analogia: Imagine que você tem um modelo de texto, um modelo de visão (que entende imagens) e um modelo de áudio (que entende voz). Normalmente, para juntar tudo isso, você teria que construir um novo robô do zero.
  • O BidirLM faz diferente: Eles pegam o "corpo" (o cérebro) do modelo de texto e encaixam as cabeças (os olhos e os ouvidos) dos modelos especializados.
    • Eles fundem o cérebro do modelo de texto com o cérebro do modelo de visão e do modelo de áudio.
    • O resultado? Um modelo "Omni" (tudo-em-um) que entende texto, vê imagens e ouve sons, tudo ao mesmo tempo.
    • O Pulo do Gato: Eles conseguiram fazer isso sem precisar treinar o modelo do zero. Foi como montar um carro novo usando o motor de um carro de corrida, as rodas de um SUV e o chassi de um caminhão, e tudo funcionou perfeitamente.

5. O Resultado: O Super-Modelo

O BidirLM é o resultado final dessa receita:

  • É um modelo que entende o texto inteiro de uma vez (bidirecional).
  • Não esqueceu o que aprendeu antes (graças à fusão de pesos).
  • Consegue entender imagens e sons sem precisar ser um monstro gigante (é mais leve e eficiente).
  • É Open Source (código aberto), então qualquer pessoa pode usar e melhorar.

Resumo da Ópera:
Os autores pegaram modelos de IA que só sabiam "falar" (gerar texto), ensinaram a eles a "olhar para trás" (usando a máscara), misturaram com o conhecimento original para não esquecerem nada e, por fim, colaram "óculos e fones de ouvido" neles para que pudessem ver e ouvir. O resultado é um modelo versátil, inteligente e que funciona melhor do que os concorrentes, tudo isso sem precisar de milhões de dólares em treinamento do zero. É como transformar um carro de Fórmula 1 em um carro de turismo que, além de ser rápido, sabe dirigir na neve e no mar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →