← Últimos artigos
💻 computer science

Tessera: Lossless-First, Vendor-Free Session Compression for Long-Horizon Agent Harnesses

Tessera é um proxy de compressão de sessão independente de fornecedor e com foco em perda zero que reduz custos de tokens e latência para agentes de LLM de longo horizonte ao empregar um sistema de memória de três camadas para reescrever deterministicamente o histórico da conversa, preservando o acesso verificável aos dados originais via Model Context Protocol.

Autores originais: Mohammad Mosafer

Publicado 2026-09-14
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Mohammad Mosafer

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, um tipo específico de software chamado agente atua como um trabalhador digital. Esses agentes não apenas conversam; eles realizam tarefas usando ferramentas, lendo arquivos e executando comandos. Para fazer isso, eles dependem de um grande modelo de linguagem, um poderoso programa de computador que entende e gera linguagem humana. No entanto, esses modelos têm um limite de memória. Cada vez que o agente dá um passo, ele deve enviar todo o histórico de sua conversa de volta ao modelo para que o modelo saiba o que aconteceu até agora. À medida que uma sessão cresce, envolvendo dezenas de arquivos e centenas de comandos, esse histórico torna-se massivo. Enviar tudo toda vez é lento e caro.

Para resolver isso, engenheiros tentaram dois truques principais. O primeiro é simplesmente cortar as partes mais antigas da conversa, mantendo apenas as mensagens mais recentes. Isso economiza espaço, mas corre o risco de deletar fatos importantes, como uma senha ou a localização de um arquivo, que o agente pode precisar mais tarde. O segundo truque é pedir ao modelo que resuma as partes antigas em uma história mais curta. Isso também é arriscado porque o resumo pode perder um detalhe crucial ou inventar um novo, e não há como verificar se o resumo é preciso. Ambos os métodos forçam uma escolha entre economizar dinheiro e manter a verdade.

Um pesquisador chamado Mohammad Mosafer propôs uma abordagem diferente que se recusa a fazer essa escolha. Ele construiu um sistema chamado Tessera, que atua como um intermediário inteligente entre o agente e o modelo. Em vez de deletar informações antigas ou reescrevê-las em um resumo, o Tessera comprime a conversa encontrando e removendo cópias exatas e quase duplicatas. Ele mantém o texto original seguro em uma área de armazenamento separada e substitui as partes repetidas na conversa principal por ponteiros minúsculos e precisos. Se o agente precisar ver o texto antigo novamente, ele pode solicitá-lo, e o sistema recupera o original exato instantaneamente. Este método permite que o agente trabalhe com um histórico de conversa muito mais curto sem perder nenhum fato ou depender da tecnologia de uma empresa específica.

O cerne do problema reside em como esses agentes funcionam. Quando um agente executa um comando, ele recebe um resultado. Se ele executar o mesmo comando novamente, frequentemente obterá o mesmo resultado exato. Em uma sessão longa, o agente pode ler o mesmo arquivo de log várias vezes ou verificar o mesmo status repetidamente. Como o agente envia todo o histórico a cada vez, ele acaba enviando os mesmos grandes blocos de texto repetidamente. O Tessera percebe essa repetição. Ele varre o histórico da conversa e identifica quando um pedaço de texto é idêntico a algo enviado anteriormente. Em vez de enviar o texto completo novamente, ele envia um marcador curto que diz: "Isto é o mesmo texto de três passos atrás". O modelo ainda pode ler o marcador e entender o contexto, mas a quantidade de dados sendo enviados é drasticamente reduzida.

O Tessera vai além de apenas encontrar cópias exatas. Ele também procura por textos que são quase iguais, como um arquivo de log que mudou apenas algumas palavras. Quando encontra essas quase duplicatas, ele envia uma pequena nota descrevendo apenas as mudanças, em vez do arquivo inteiro. Ele também lida com grandes blocos de dados, como longas listas de números ou código, removendo a formatação desnecessária e mantendo apenas a estrutura essencial. Tudo isso acontece sem usar um grande modelo de linguagem para tomar decisões. O sistema usa regras determinísticas simples, o que significa que sempre produzirá o mesmo resultado para a mesma entrada. Isso torna o processo rápido e confiável, adicionando apenas alguns milissegundos ao tempo de envio de uma mensagem.

Para testar se este sistema realmente funciona, o pesquisador criou um ambiente controlado. Ele construiu um gerador que cria sessões de agentes falsas preenchidas com dados realistas, como respostas JSON, logs de serviço e saídas de comandos. Nessas sessões, ele plantou fatos específicos e únicos, como um código aleatório ou uma configuração específica, em posições aleatórias. Ele então passou as sessões pelo Tessera e mediu quantos desses fatos plantados sobreviveram no histórico comprimido. Ele comparou isso com outros métodos que simplesmente cortam mensagens antigas ou mantêm apenas as mais recentes. Os resultados foram claros. Quando o sistema comprimiu a conversa para cerca de 29 por cento de seu tamanho original, manteve 61,8 por cento dos fatos no histórico principal. Em contraste, os outros métodos, que foram forçados a manter a mesma quantidade de espaço, mantiveram apenas cerca de 26 a 30 por cento dos fatos.

O sistema também inclui uma maneira de recuperar a informação ausente se ela for necessária. Isso é chamado de camada de recuperação (recall tier). Se o agente fizer uma pergunta específica sobre uma parte mais antiga da conversa, o sistema pode pesquisar em seu armazenamento seguro de textos originais e trazer de volta a passagem exata. Quando este recurso é usado, o sistema pode recuperar 99,5 por cento dos fatos, mesmo que eles não estivessem no histórico principal comprimido. Isso significa que o agente pode trabalhar com um histórico minúsculo e eficiente, mas ainda acessar os detalhes completos sempre que necessário. Os pesquisadores descobriram que essa recuperação funciona melhor quando o agente lembra o contexto do evento antigo, mas ainda funciona bem mesmo com perguntas vagas.

O estudo também analisou como diferentes tipos de agentes se comportam. Alguns agentes, como aqueles projetados para corrigir bugs de software, tendem a repetir comandos e ver os mesmos resultados com frequência. Para esses agentes, o sistema descobriu que quase 15 por cento da conversa eram duplicatas exatas. Outros agentes, usando modelos diferentes, raramente se repetiam. O sistema se adaptou a ambas as situações, provando que não precisa ser ajustado para um tipo específico de agente para funcionar. Ele simplesmente remove o que está lá, seja muita repetição ou pouca. O tempo que leva para comprimir os dados é insignificante, adicionando menos de oito milissegundos por requisição, o que é muito menos do que o tempo que o modelo leva para gerar uma resposta.

Uma das descobertas mais importantes é que este método não exige abrir mão da precisão. Ao contrário da sumarização, que pode perder detalhes ou alterar significados, o Tessera mantém cada byte original de texto seguro. Se um fato é removido da visualização principal para economizar espaço, ele não sumiu; está apenas escondido atrás de uma alça que pode ser aberta a qualquer momento. Isso torna o sistema totalmente auditável. Um engenheiro pode olhar para o histórico comprimido e saber exatamente o que foi removido e onde encontrar o original. Esta é uma mudança significativa em relação aos métodos atuais, que frequentemente dependem do modelo para adivinhar o que é importante, um processo difícil de verificar.

Os pesquisadores testaram seu sistema contra várias outras formas de gerenciar a memória. Eles descobriram que manter apenas as mensagens mais recentes, uma prática comum, era a maneira menos eficaz de manter fatos. Mesmo um método que mantinha mensagens aleatoriamente teve um desempenho melhor do que cortar as mensagens mais antigas, mas ainda não conseguiu igualar a precisão do Tessera. A chave para o sucesso do Tessera é que ele não descarta mensagens inteiras. Em vez disso, ele remove o excesso de dentro das mensagens, mantendo o início e o fim de textos longos e substituindo o meio por um ponteiro. Isso permite que o agente mantenha o contexto da conversa enquanto se livra do volume de dados.

O estudo também examinou o quão sensível o sistema é às suas configurações. Os pesquisadores ajustaram as regras para o que conta como uma duplicata e quantas mensagens recentes são protegidas da compressão. Eles descobriram que o sistema é robusto. Alterar as regras ligeiramente não causou a queda de desempenho do sistema. O sistema consistentemente salvou cerca de 70 por cento dos dados, mantendo a vasta maioria dos fatos importantes. Essa estabilidade sugere que o sistema pode ser usado em aplicações do mundo real sem a necessidade de ajustes constantes.

No final, o trabalho demonstra que é possível tornar as conversas dos agentes muito mais curtas sem perder a verdade. Ao tratar o histórico da conversa como uma coleção de dados que podem ser comprimidos e recuperados, em vez de uma história que deve ser resumida ou cortada, o sistema alcança um nível de eficiência que anteriormente se pensava exigir uma troca. O agente pode realizar tarefas mais longas e complexas sem ficar sem memória ou pagar por excesso de transferência de dados. O sistema permanece independente de qualquer provedor de modelo específico, o que significa que pode ser usado com qualquer ferramenta que fale a linguagem padrão desses agentes.

Os pesquisadores reconhecem que seu teste foi feito com dados sintéticos, o que significa que as sessões foram geradas por um computador, em vez de serem registradas a partir do uso humano real. Eles planejam testar o sistema em trajetórias de agentes do mundo real para ver como ele se comporta no campo. Eles também observam que, embora o sistema atual seja excelente em remover redundâncias, ele ainda não compreende o significado profundo da conversa. Versões futuras podem adicionar camadas que possam identificar quais partes da conversa são mais importantes com base na tarefa em questão. No entanto, o sistema atual fornece uma base sólida. Ele prova que, com engenharia cuidadosa, podemos manter o registro completo do trabalho de um agente enquanto enviamos apenas uma fração dos dados, garantindo que nenhum fato seja verdadeiramente perdido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →