AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents
O artigo AGORA propõe um método de compressão de prompts baseado em adaptadores e isento de inferência para agentes de LLM que supera as limitações estruturais dos compressores extrativos existentes em nível de token ao isolar um piso estrutural como o principal gargalo de qualidade e alcançar compressão adaptativa de 1,0 a 11,5 vezes por meio de um avaliador aprendido, mantendo desempenho próximo ao de dados não comprimidos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um agente LLM como um detetive altamente qualificado tentando resolver um mistério. Para resolver o caso, o detetive examina um caderno longo cheio de pistas, ações que ele tomou e o que viu em seguida. À medida que a investigação avança, esse caderno fica enorme — às vezes com mais de 100.000 palavras. Se o caderno ficar grande demais, o detetive fica sobrecarregado e não consegue pensar com clareza.
O problema é: Como você encolhe esse caderno sem apagar as pistas que realmente importam?
O Problema: O Tipo "Errado" de Redutor
Pesquisadores tentaram usar "resumidores" padrão (chamados de compressores em nível de token) que funcionam muito bem para tarefas normais de leitura, como resumir uma notícia. Essas ferramentas funcionam apagando palavras que parecem "previsíveis" ou "chatas".
Mas, para um agente detetive, essa abordagem é um desastre. O artigo chama isso de "Destruição da Gramática de Ação".
Aqui está a analogia:
Imagine que o caderno do detetive contém uma instrução específica: "Procurar por [sapatos vermelhos tamanho 42]."
- As palavras "Procurar", "por" e os colchetes
[]são a gramática de ação. São os comandos que dizem ao computador o que fazer. - No entanto, como essas palavras são tão comuns e previsíveis em inglês, o resumidor padrão pensa: "Ah, 'por' e colchetes são chatos. Vou apagá-los para economizar espaço."
- O Resultado: O caderno agora diz apenas "sapatos vermelhos tamanho 42."
- A Falha: O ambiente do computador vê isso e diz: "Não sei o que fazer com isso. Não é um comando." O agente falha ou trava.
O artigo testou 17 cenários diferentes e descobriu que todas as vezes que usaram esses resumidores padrão, o desempenho do agente colapsou para quase zero, mesmo que tenham economizado espaço com sucesso. A ferramenta estava funcionando perfeitamente, mas estava apagando as únicas coisas que faziam o agente funcionar.
A Solução: AGORA (O Sistema de Arquivamento Inteligente)
Os autores criaram um novo sistema chamado AGORA. Em vez de agir como um limpador de palavras, o AGORA age como um arquivista inteligente que entende a estrutura do caderno do detetive.
O AGORA funciona em três camadas simples:
O Andar "Nunca-Tocar" (Analizador Estrutural):
O AGORA tem uma regra: "Nunca apague as Instruções do Sistema, a Pista Atual ou os dois últimos passos."- Analogia: Imagine que o caderno do detetive tenha um post-it vermelho nas duas últimas páginas e na capa. O AGORA diz: "Não importa o que aconteça, mantemos essas páginas exatamente como estão." Isso garante que o agente sempre saiba o que está fazendo e o que acabou de acontecer.
A "Pontuação de Relevância" (O Classificador de 125M Parâmetros):
Para as páginas mais antigas do caderno, o AGORA usa uma IA pequena e rápida (um modelo de 125 milhões de parâmetros) para perguntar: "Se removermos essa pista antiga, o detetive tomará uma decisão diferente agora?"- Se a resposta for "Não, essa pista antiga não importa", ela é apagada.
- Se a resposta for "Sim, essa pista é crítica", ela permanece.
- Ponto Chave: Isso acontece em cerca de 2 milissegundos. Não pede a uma IA gigante para reescrever a história; apenas verifica se a página é importante.
O Preenchimento "Avarento":
Uma vez que as páginas "Nunca-Tocar" estão seguras, o AGORA preenche o espaço restante com as pistas antigas mais importantes até que o caderno fique pequeno o suficiente.
Por Que Isso é Importante
- Sem Custo Extra: A maioria dos outros métodos tenta resumir o caderno pedindo a uma segunda IA gigante que faça o trabalho. Isso custa dinheiro e tempo extras para cada etapa. O AGORA faz isso sem pedir a uma segunda IA, economizando dinheiro e tempo.
- Funciona: Em 8 dos 9 cenários de teste diferentes, o AGORA manteve o agente operando em 75% ou mais de sua velocidade e precisão originais, mesmo com um caderno muito menor.
- Adaptável: Ele descobre automaticamente quanto encolher o caderno. Às vezes o encolhe em 1x (um pouco), às vezes em 11x (muito), dependendo de quanto "enchimento" há no histórico.
A Conclusão
O artigo prova que você não pode tratar o histórico de um agente de IA como um livro normal. Você deve respeitar a "gramática" de seus comandos. O AGORA é uma maneira leve, rápida e gratuita de manter a memória do agente limpa sem apagar acidentalmente as instruções que fazem ele funcionar. É a diferença entre um resumidor que apaga a placa de "Pare" de um mapa rodoviário e um sistema de arquivamento que mantém o mapa legível, mas remove os nomes de ruas antigos e irrelevantes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.