← Últimos artigos
💬 NLP

Training Hybrid Block Diffusion Language Models with Partial Bidirectionality

Este artigo apresenta o BDLM Mamba-H, um modelo de linguagem de difusão híbrido que restringe a varredura Mamba bidirecional aos blocos de denoising ativos para permitir o cache exato, alcançando assim uma perplexidade superior e um throughput de inferência de contexto longo significativamente maior em comparação com as linhas de base de difusão de sequência total e baseadas em atenção existentes.

Autores originais: Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

Publicado 2026-07-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Pranshu Chaturvedi, Parth Shroff, Tarun Suresh, Hangoo Kang, Kaiyue Wen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história muito longa, mas tem uma regra estrita: você só consegue se lembrar das últimas poucas páginas que escreveu. Toda vez que quer escrever a próxima frase, você tem que voltar até o início do seu caderno, ler cada palavra que escreveu até agora e, só então, decidir o que escrever em seguida.

Isso é exatamente como os atuais "Large Language Models" (chatbots de IA) lutam com contextos longos. À medida que a conversa fica mais longa, a IA tem que "reler" todo o histórico toda vez que gera uma única nova palavra. Isso é lento e desperdiça muita energia, como tentar correr uma maratona carregando uma mochila pesada que fica mais pesada a cada passo.

O artigo apresenta uma nova maneira de treinar esses modelos de IA, chamada BDLM Mamaba-H, que resolve esse problema mudando a forma como a IA "lembra" e "pensa".

Aqui está a divisão usando analogias simples:

1. O Problema: A "Mochila Pesada"

Os modelos de IA atuais funcionam como um aluno fazendo uma prova que precisa reler o livro inteiro antes de responder a cada pergunta.

  • O Problema: À medida que a história fica mais longa, a "mochila" (memória) fica muito pesada. O computador passa mais tempo movimentando dados (largura de banda de memória) do que realmente pensando (computação).
  • A Solução Antiga: Alguns pesquisadores tentaram tornar a mochila mais leve usando um tipo diferente de memória (chamado "Mamba"). Outros tentaram escrever várias frases de uma vez em vez de uma por uma (chamado "Block Diffusion").
  • A Falha: Quando os pesquisadores tentaram combinar essas duas ideias, isso quebrou. O sistema de memória "Mamba" precisava olhar para a história inteira de trás para frente para funcionar adequadamente. Mas, se você olha para a história inteira de trás para frente, não consegue salvar um "marcador" para as partes que já terminou. Você tem que reler tudo toda vez.

2. A Solução: O "Escaneamento Reverso Local"

Os autores propõem um truque inteligente: Olhar para trás apenas dentro do parágrafo atual.

Imagine que você está escrevendo um livro capítulo por capítulo.

  • O Jeito Antigo (Reverso Total): Para escrever uma nova frase, você relê o livro inteiro da última página até a página um, toda vez.
  • O Novo Jeito (BDLM Mamba-H):
    1. A Parte "Limpa": Assim que um capítulo é finalizado, você o coloca em um cofre seguro. Você cria um "cartão de resumo" simples (um cache) para esse capítulo. Você nunca mais precisa abrir o cofre; basta usar o cartão de resumo.
    2. A Parte "Ativa": Enquanto você está escrevendo o capítulo atual, você tem permissão para olhar para trás e para frente dentro desse capítulo específico para garantir que as frases fluam bem.
    3. A Magia: Como você só olha para trás dentro do capítulo atual, os cartões de resumo dos capítulos finalizados permanecem válidos e não precisam ser atualizados.

3. Os Resultados: Velocidade e Inteligência

Os pesquisadores testaram este novo método contra métodos antigos com dois objetivos principais: manter a IA inteligente e torná-la rápida.

  • É inteligente? Sim. Quando testaram a IA em um teste padrão de compreensão de leitura (C4-en), o novo modelo (BDLM Mamba-H) na verdade obteve as melhores pontuações entre os modelos menores (87 milhões de parâmetros). Mesmo quando tornaram o modelo maior (350 milhões de parâmetros), ele permaneceu tão inteligente quanto os outros modelos de topo.
  • É rápido? Diferença enorme.
    • Em um comprimento médio (65.000 palavras), o novo modelo foi 19,7 vezes mais rápido que o antigo método de "reverso total".
    • Em um comprimento muito longo (262.000 palavras), foi 3,7 vezes mais rápido que o melhor método de "bloco" que não utilizava Mamba.

A Conclusão

Pense neste novo modelo como um escritor que aprendeu a marcar capítulos finalizados para não ter que relê-los, enquanto ainda consegue editar o capítulo atual livremente.

Ao restringir o "olhar para trás" apenas ao bloco atual de texto, a IA pode gerar histórias muito longas sem ficar sobrecarregada pelo tráfego de memória. O artigo afirma que isso torna esta uma arquitetura prática e poderosa para lidar com contextos longos, provando que você pode ter tanto velocidade quanto escrita de alta qualidade sem precisar reprocessar todo o histórico para cada nova palavra.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →