← Últimos artigos
🤖 machine learning

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

Este artigo apresenta o Scratchpad Patching (SP), uma técnica que desacopla a computação do tamanho do patch em modelos de linguagem ao nível de byte, inserindo dinamicamente scratchpads transitórios para mitigar o atraso do patch, permitindo assim patches maiores para reduzir os custos de cache KV e de computação sem sacrificar a qualidade da modelagem.

Autores originais: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ler um livro muito longo, mas tem uma regra estrita: você só pode olhar para o texto em grandes pedaços, como pegar um punhado de páginas de cada vez. É assim que os modelos de IA modernos "baseados em patches" funcionam. Em vez de ler palavra por palavra (tokens), eles leem byte por byte (o código bruto do computador para letras) em grupos chamados patches.

O problema com essa abordagem de "pegar um punhado" é um fenômeno que os autores chamam de Atraso do Patch (Patch Lag).

O Problema: O Punhado "Desatualizado"

Imagine que você está lendo um parágrafo. Você pega um pedaço de texto (um patch) para processar.

  • A Última Página: Quando você chega à última página daquele pedaço, você tem a imagem completa do que acabou de ler. Você pode fazer uma suposição perfeita sobre o que vem a seguir.
  • A Primeira Página: Mas quando você está na primeira página daquele mesmo pedaço, você ainda não viu o resto do pedaço! Você é forçado a adivinhar com base no pedaço anterior que leu.

Se seus pedaços forem enormes (digamos, 16 bytes de comprimento), os primeiros 15 bytes estão adivinhando com base em informações "desatualizadas" do passado. Quanto maior o pedaço, mais longo dura esse "atraso" e pior a IA fica em prever a próxima letra.

Geralmente, você tem que escolher:

  1. Pedacinhos Pequenos: Grande precisão, mas a IA tem que fazer muito trabalho (lento e caro).
  2. Pedacinhos Grandes: Rápido e barato, mas a IA comete mais erros porque está adivinhando muito à frente.

A Solução: O "Bloco de Rascunho"

Os autores apresentam um truque inteligente chamado Patching de Bloco de Rascunho (Scratchpad Patching - SP).

Pense assim: você ainda está pegando aqueles grandes punhados de páginas (patches) para manter as coisas eficientes. Mas, dentro da sua mão, você tem um bloco de rascunho transitório.

Enquanto você olha para as primeiras páginas do pedaço, você anota rapidamente notas no seu bloco de rascunho.

  • A Magia: Essas notas são temporárias. Você as usa para atualizar sua compreensão imediatamente para que possa fazer melhores suposições para as próximas páginas.
  • O Problema: Assim que você termina o pedaço e passa para o próximo, você joga o bloco de rascunho fora. Você não o mantém na sua memória de longo prazo (o "cache KV").

Isso permite que a IA tenha a velocidade de pedaços grandes (porque ela só salva o resultado final do pedaço) mas a inteligência de pedaços pequenos (porque ela atualizou seu conhecimento no meio do pedaço).

Como Ela Sabe Quando Usar o Bloco de Rascunho?

A IA não usa o bloco de rascunho para cada letra individual; isso seria muito lento. Em vez disso, ela usa um sistema de "semáforo" baseado em Entropia (uma palavra chique para "surpresa" ou "incerteza").

  • Baixa Surpresa: Se o texto for chato e previsível (como "o gato sentou-se no..."), a IA ignora o bloco de rascunho. Ela sabe o que está por vir.
  • Alta Surpresa: Se o texto ficar complexo ou imprevisível (como um nome de variável de código súbito ou um símbolo estranho), a IA aciona o bloco de rascunho. Ela diz: "Espere, isso é importante! Deixe-me pausar e reavaliar tudo o que vi até agora neste pedaço antes de adivinhar a próxima letra."

Os Resultados: O Melhor dos Dois Mundos

O artigo mostra que este método funciona como um interruptor mágico:

  1. Qualidade sem o Custo: Mesmo ao usar pedaços muito grandes (16 bytes), a IA com Blocos de Rascunho desempenha quase tão bem quanto se estivesse lendo byte por byte.
  2. Economia de Memória: Como o bloco de rascunho é descartado imediatamente, a IA não precisa armazenar memória extra. Ela mantém o "cache KV" (a memória de curto prazo da IA) 16 vezes menor do que um modelo padrão byte por byte.
  3. Velocidade Flexível: Você pode aumentar ou diminuir o "interruptor do bloco de rascunho" após o modelo ser treinado. Se você precisa que seja super rápido, você desliga os blocos de rascunho. Se precisa que seja mais inteligente, você os liga. Você não precisa retreinar o modelo para fazer isso.

Analogia de Resumo

Imagine que você é um chef cozinhando um enorme ensopado.

  • Método Antigo (Patching Padrão): Você prova o ensopado apenas uma vez a cada 10 minutos. Se você adicionar um ingrediente picante no minuto 1, você não prova novamente até o minuto 10. Até lá, o sabor pode estar errado.
  • Novo Método (Patching com Bloco de Rascunho): Você ainda só dá uma "prova oficial" completa a cada 10 minutos para registrar a receita. Mas, no intervalo, você mergulha uma colher sempre que o cheiro muda drasticamente (alta entropia) para ajustar seu tempero imediatamente. Você joga a colher fora após provar, para não ter que lavar um milhão de colheres (memória), mas seu ensopado fica perfeito.

O artigo prova que, ao adicionar esses "testes de sabor" temporários (blocos de rascunho), você pode cozinhar uma panela enorme de ensopado (processar texto longo) rapidamente, barato e com sabor perfeito.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →