← Últimos artigos
💬 NLP

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

O CoSA é um framework de atenção esparsa de dois estágios e livre de treinamento que acopla um Proxy Sensível ao Kernel com um Kernel de Pulo Ordenado para otimizar dinamicamente a seleção e o salto de blocos, alcançando aumentos significativos na velocidade de inferência e redução de latência para LLMs de contexto longo, mantendo alta precisão sob orçamentos computacionais restritos.

Autores originais: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

Publicado 2026-07-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ler uma enciclopédia massiva de 128.000 páginas para responder a uma única pergunta. No mundo da Inteligência Artificial, essas "enciclopédias" são chamadas de Grandes Modelos de Linguagem (LLMs), e o processo de "leitura" é como elas entendem o contexto. O problema é que a maneira padrão como esses modelos leem é como um bibliotecário que insiste em ler cada página do livro, da primeira palavra até a última, antes mesmo de poder começar a pensar na sua pergunta. À medida que o livro fica mais longo, essa abordagem de "ler tudo" torna-se dolorosamente lenta e cara, como tentar correr uma maratona carregando uma mochila cheia de tijolos.

Para corrigir isso, cientistas tentaram ensinar o bibliotecário a ser um pouco mais seletivo, uma técnica chamada "atenção esparsa" (sparse attention). Em vez de ler todas as páginas, o modelo tenta adivinhar quais páginas são importantes e pula o resto. Geralmente, isso envolve duas etapas: primeiro, um "proxy" rápido (um adivinhador veloz) olha para o livro e marca as páginas importantes com uma lista simples de "Sim" ou "Não". Segundo, um "kernel" (o trabalhador real) segue essa lista e faz o trabalho pesado. É um sistema decente, mas tem uma falha: quando o livro fica enorme e você precisa ser muito rigoroso sobre quais páginas pular para economizar tempo, o adivinhador rápido começa a cometer erros, e o trabalhador apenas segue a lista ruim cegamente. O resultado é que o modelo torna-se mais rápido, mas começa a esquecer detalhes importantes, como um bibliotecário que pula o clímax da história porque achou que era entediante.

É aqui que entra um novo método chamado CoSA (Atenção Esparsa Co-Projetada). Os pesquisadores por trás do CoSA perceberam que o "adivinhador" e o "trabalhador" estavam trabalhando isoladamente, o que fazia o sistema falhar sob pressão. Eles decidiram redesenhar todo o processo para que os dois trabalhem juntos como uma equipe. Em vez de apenas entregar ao trabalhador uma lista simples de "Sim/Não", o novo "adivinhador" (chamado de Kernel-Aware Proxy, ou KAP) entrega uma lista de prioridades. Ele não diz apenas "leia esta página"; ele diz: "Leia esta página primeiro, depois esta, depois aquela".

Aqui está o truque de mágica: o trabalhador (chamado de Ordered-Skipping Kernel, ou OSK) usa essa lista de prioridades para reorganizar a ordem em que lê as páginas. Ao ler as páginas mais críticas primeiro, o trabalhador constrói uma "pontuação contínua" do que é importante muito cedo no processo. Como ele sabe as coisas mais importantes logo de início, pode pular com confiança ainda mais páginas mais adiante no processo sem se confundir. É como se você estivesse lendo um romance de mistério e o detetive lhe dissesse: "Leia os três primeiros capítulos para encontrar o assassino, depois você pode pular com segurança os próximos cinquenta capítulos de dicas de jardinagem".

O artigo mostra que essa abordagem de trabalho em equipe é um divisor de águas. Quando testado em modelos lendo contextos de até 128.000 tokens (aproximadamente o tamanho de um romance longo), o CoSA conseguiu acelerar a parte da "atenção" do processo em 4,93 vezes e reduziu o tempo para gerar a primeira palavra em 2,53 vezes. Crucialmente, ele fez isso sem que o modelo perdesse sua capacidade de entender a história ou resolver problemas complexos de raciocínio. Os pesquisadores descobriram que, ao permitir que o proxy e o kernel conversassem entre si e compartilhassem uma ordem específica de operações, eles podiam ser muito mais agressivos ao pular o trabalho, mantendo o modelo inteligente. Acontece que, no mundo da IA, saber quando ler uma página é tão importante quanto saber qual página ler.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →