← Últimos artigos
🤖 machine learning

COBS: Cumulant Order Block Sparse Attention

Este artigo introduz o COBS, um método de atenção esparsa em blocos que melhora o desempenho de recuperação de contexto longo ao utilizar um seletor inovador com estatísticas de segunda ordem comprimidas para aproximar melhor a massa de atenção, reduzindo assim significativamente a lacuna de qualidade em relação à atenção densa, mantendo a eficiência de hardware.

Autores originais: Alexander Tian, Aditya Ghai, Sanjit Neelam, Zaal Vasania, Akshay Mishra

Publicado 2026-07-13
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Alexander Tian, Aditya Ghai, Sanjit Neelam, Zaal Vasania, Akshay Mishra

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando encontrar uma agulha específica em um palheiro enorme, mas o palheiro é tão grande que você não consegue olhar para cada pedaço de palha sem que seu cérebro (ou computador) fique sem fôlego. Este é o problema enfrentado pelos modelos de IA modernos quando tentam ler documentos muito longos. Eles têm que se lembrar de tudo o que leram até agora, e verificar cada token de memória é lento e caro.

Para resolver isso, pesquisadores tentaram um atalho chamado Block Sparse Attention (Atenção Esparsa por Blocos). Em vez de olhar para cada pedaço de palha, eles decidiram olhar para pequenos feixes de palhas (chamados de "blocos") e apenas escolher os mais interessantes para examinar de perto. É como contratar um batedor para escanear alguns feixes e dizer quais deles podem conter a agulha.

O Problema: O Batedor Era Simples Demais

O artigo estuda um método popular chamado NSA (Native Sparse Attention). Neste sistema, o batedor olha para um feixe de palhas e faz um palpite rápido sobre se ele é importante. O artigo descobriu que este batedor estava usando um truque muito simples: ele olhava apenas para a posição média das palhas no feixe.

Pense da seguinte forma: Imagine dois feixes de palhas.

  • Feixe A tem palhas todas compactadas juntas no meio.
  • Feixe B tem palhas espalhadas desordenadamente, algumas muito à esquerda e outras muito à direita.

Se você olhar apenas para a posição média, ambos os feixes parecem exatamente iguais! Mas, na realidade, o Feixe B é muito mais provável de conter a agulha porque cobre mais terreno. Os batedores antigos (métodos de primeira ordem) eram cegos para essa "dispersão" ou "curvatura". Eles eram como alguém tentando adivinhar a forma de uma nuvem apenas olhando para o seu ponto central; eles perdiam as bordas fofas que realmente importavam.

A Solução: COBS (O Batedor Mais Inteligente)

Os autores propõem um novo método chamado COBS (Cumulant Order Block Sparse Attention). Em vez de dar apenas a posição média, o batedor do COBS carrega um mapa minúsculo e comprimido que mostra não apenas onde as palhas estão em média, mas como elas estão espalhadas.

Em termos matemáticos, o artigo chama isso de "estatística de segunda ordem" ou "covariância". Em nossa analogia, é como se o batedor percebesse: "Ei, este feixe é largo e bagunçado, então tem uma chance maior de ter a agástica!". Ao manter essa informação extra (mas comprimindo-a para que não ocupe muito espaço), o COBS pode fazer palpites muito melhores.

Os Resultados: Um Salto Gigantesco

A equipe testou isso em um desafio famoso chamado 32k RULER benchmark (um teste de 11 tarefas diferentes de recuperação de contexto longo). Aqui está o que eles descobriram:

  • O Jeito Antigo (NSA MLP): O batedor simples obteve uma pontuação de 0,2999. Ele estava com dificuldades para encontrar as agulhas.
  • O Jeito Perfeito (OSA): Se você pudesse magicamente saber a resposta exata sem quaisquer atalhos (chamado de "oracle"), você obteria uma pontuação de 0,9040.
  • O Novo Jeito (COBS): O batedor inteligente com o mapa de dispersão obteve uma pontuação de 0,8195.

Isso significa que o COBS fechou cerca de 86% da lacuna entre o antigo método problemático e o método perfeito. Isso é uma melhoria enorme!

O Custo: Vale a Pena?

Geralmente, tornar-se mais inteligente significa trabalhar mais. Mas o COBS é eficiente.

  • O método antigo leu uma certa quantidade de dados.
  • O método perfeito (que lê tudo) lê 15,15 vezes mais dados do que o COBS.
  • O COBS lê apenas 1,21 vez mais dados do que o antigo método problemático.

Portanto, o COBS leva você quase ao nível da perfeição realizando apenas um pouco mais de trabalho do que o antigo método simples.

O Que o Artigo Diz "Não"

Os autores foram muito cuidadosos para descartar algumas ideias que poderiam parecer bons atalhos, mas que na verdade não funcionam:

  1. Apenas adicionar mais complexidade à média: Eles tentaram usar uma rede neural sofisticada (MLP) para tornar o palpite da "média" mais inteligente, mas isso não ajudou muito. O problema não era a complexidade da média; era que a própria média era a ferramenta errada. Você precisa da informação de "dispersão", não de uma média melhor.
  2. Olhar para a "dispersão" em uma caixa simples: Outro método tentou adivinhar a dispersão olhando para o mínimo e o máximo das palhas (uma caixa). Isso ajudou um pouco, mas não era tão preciso quanto o mapa de dispersão do COBS.
  3. Adicionar matemática ainda mais complexa (Terceira ordem): Os autores testaram adicionar uma "assimetria" (uma medida de quão desequilibrada é a dispersão). Surpreendentemente, isso tornou as coisas piores em níveis de baixa complexidade, fazendo com que o modelo ficasse confuso. Só ajudou quando o modelo já era muito complexo e estava falhando, agindo como um curativo em vez de uma solução. Eles decidiram manter a "dispersão" (segunda ordem) como o ponto ideal.

Quão Certos Eles Estão?

O artigo é muito confiante nesses números porque realizou experimentos controlados. Eles não apenas adivinharam; eles mediram o desempenho no teste 32k RULER e descobriram que o COBS superou consistentemente os métodos antigos. Eles também verificaram que isso não prejudicou a capacidade do modelo de entender frases curtas (não prejudicou) e que realmente ajudou o modelo a prever a próxima palavra em textos longos melhor do que os métodos antigos.

No entanto, os autores são honestos sobre os limites:

  • Eles testaram isso em um modelo com cerca de 1,2 bilhão de parâmetros. Eles não sabem com certeza se funciona exatamente da mesma forma em os modelos massivos usados pelas grandes empresas de tecnologia, embora a matemática sugira que deva funcionar.
  • Eles treinaram o modelo em um tipo específico de dados sintéticos (estilo RULK R) para testar. Embora esta seja uma forma padrão de testar a habilidade de contexto longo, os dados do mundo real podem se comportar de forma ligeiramente diferente.

A Conclusão

O artigo mostra que, para encontrar agulhas em um palheiro de forma eficiente, você não pode apenas olhar para o centro do feixe. Você precisa saber como o feixe está espalhado. Ao adicionar um mapa minúsculo e comprimido dessa dispersão, o COBS permite que os modelos de IA leiam documentos longos com muito mais precisão sem torná-los lentos, diminuindo a distância entre o "bom o suficiente" e o "perfeito" com um esforço mínimo adicional.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →