Resumo Técnico: RECON – Avaliando a Memória de Agentes para Raciocínio Composicional sobre Contextos Longos
Declaração do Problema
Agentes baseados em Grandes Modelos de Linguagem (LLMs) estão sendo cada vez mais implantados em fluxos de trabalho de alto risco (codificação, clínico, jurídico, financeiro), onde devem reter, acessar e raciocinar sobre informações acumuladas ao longo de contextos longos e múltiplas interações. As arquiteturas de memória atuais (ex: Mem0, Zep, MemGPT) e sistemas de geração aumentada por recuperação (RAG) modelam primariamente a memória como uma máquina de estados, rastreando os valores atuais de fatos. No entanto, em cenários do mundo real, os fatos não apenas se acumulam; eles interagem, contradizem e invalidam uns aos outros através de estruturas de dependência explícitas.
Benchmarks existentes (ex: RULER, LongBench, LoCoMo) avaliam se os agentes conseguem recuperar fatos dispersos ou detectar se um fato mudou. Eles falham em avaliar as consequências de tais mudanças: se um agente consegue rastrear quais conclusões subsequentes são afetadas por uma invalidação, quais conclusções sobrevivem via suporte independente e como cronologias alternativas se desenrolariam. Existe uma lacuna crítica na avaliação do raciocínio composicional sobre narrativas de contexto longo em evolução, onde a validade de uma conclusão depende de um grafo de proveniência complexo, em vez de uma lista estática de fatos.
Metodologia: O Benchmark RECON
Os autores introduzem o RECON (Reasoning over Extended Contexts with Obfuscated Narratives), um benchmark projetado para avaliar agentes em seis tarefas intensivas de memória sobre contextos longos (50k–100k tokens).
1. Pipeline de Geração Determinística
Para garantir a confiabilidade da verdade fundamental (ground-truth), o RECON emprega um pipeline de geração totalmente determinístico onde os LLMs são restritos apenas à realização superficial (narração) e nunca influenciam a estrutura causal, a proveniência ou as chaves de resposta.
- Síntese de Blueprint: Um motor de produção com semente (seeded) gera um blueprint de caso usando terminais tipados (atores, evidências) e regras de produção, garantindo que os pré-requisitos lógicos sejam atendidos antes que as conclusões sejam traçadas.
- Expansão de Esqueleto: O blueprint expande-se em um esqueleto estruturado de eventos com carimbo de tempo, dependências causais, invalidações, conflitos de fonte e fluxos temporais paralelos (ex: vigilância, transações).
- DAG de Proveniência: Um Grafo Acíclico Dirigido (DAG) global é induzido a partir do contrato de geração. Os nós representam eventos/evidências, e as arestas codificam relações causais, revisionais e de invalidação. Este DAG serve como a verdade fundamental autoritativa.
- Síntese de Tarefas: As perguntas são geradas algoritmicamente a partir do DAG. Por exemplo, perguntas de Propagação de Cascata são criadas selecionando um nó de invalidação e computando o alcance (reachability) para determinar quais conclusões colapsam.
- Realização Narrativa: Um LLM converte o esqueleto estruturado em arquivos de caso de linguagem natural (relatórios policiais, registros clínicos, auditorias financeiras) enquanto adere estritamente aos fatos imutáveis do esqueleto.
2. Categorias de Tarefas
O RECON abrange 24 arquivos de caso através de três domínios (criminal, médico, financeiro) e 1.604 perguntas, categorizadas em seis tarefas:
- Reconstrução de Cadeia: Localizar e ordenar causalmente de 5 a 15 saltos de evidência espalhados pelo documento.
- Propagação de Cascata: Determinar quais conclusões quebram e quais sobrevivem via suporte independente após uma invalidação de evidência específica.
- Resolução de Conflito de Fonte: Adjudicar relatos contraditórios usando evidências corroboradoras independentes.
- Raciocínio Contrafactual: Determinar como eventos subsequentes mudam sob uma linha do tempo alternativa (ex: se um evento ocorreu mais cedo).
- Satisfação de Restrição Temporal: Cruzar fluxos de dados paralelos contra uma janela de tempo específica.
- Recuperação de Fato Temporal: Tarefas de linha de base para ordenação temporal e consultas de estado.
3. Configuração de Avaliação
O benchmark avalia três famílias de sistemas mais um teto de Oracle:
- Contexto Longo (Long-Context): Modelos que processam o arquivo de caso completo de 100k tokens.
- RAG: Variantes incluindo recuperação densa, recuperação híbrida e reranking.
- Agentes de Memória: Sistemas como Mem0, Mem0-Graph, Supermemory e Hindsight.
- Oracle: Recebe o DAG estruturado da verdade fundamental em vez do texto narrativo, fornecendo um limite superior de recuperação perfeita.
A pontuação envolve métricas de precisão rigorosas, com penalidades para erros em questões de múltipla escolha e opções de abstenção. Um filtro de contaminação remove perguntas que podem ser respondidas via conhecimento prévio de LLMs.
Resultados Principais
A avaliação revela limitações substanciais em todas as arquiteturas atuais:
- Desempenho Geral: Nenhum sistema não-Oracle excede 25% de Precisão. O melhor sistema não-Oracle (Gemini-2.5-Pro) atinge apenas 22,4% de Precisão, enquanto o Oracle (com recuperação perfeita) atinge 54,6%. Isso indica que, mesmo com acesso perfeito ao grafo de dependências, o raciocínio continua sendo um gargalo significativo.
- Desempenho por Tarefa:
- Propagação de Cascata: Sistemas de memória se destacam aqui, com o Supermemory alcançando uma pontuação de 0,708, quase o dobro do melhor modelo de contexto longo. Isso sugere que arquiteturas de memória são eficazes em rastrear mudanças de estado quando a estrutura de dependência é simples.
- Raciocínio Contrafactual: Esta é a tarefa mais difícil. Mesmo o Oracle atinge apenas 0,483, indicando que a inferência encadeada é o principal gargalo, não a recuperação.
- Reconstrução de Cadeia e Conflito de Fonte: Modelos de contexto longo lideram estas tarefas, mas o desempenho permanece baixo. RAG e sistemas de memória sofrem significativamente, provavelmente devido à perda de arestas entre fatos durante a compressão ou recuperação.
- Recuperação vs. Raciocínio:
- A recuperação é necessária, mas insuficiente. Em cenários de "cobertura total", onde a evidência correta é recuperada, os sistemas ainda respondem incorretamente cerca de 80% das vezes.
- A lacuna entre o Oracle e o desempenho do LLM é maior para tarefas que exigem raciocínio de múltiplos saltos (Reconstrução de Cadeia, Conflito de Fonte), sugerindo que a incapacidade de compor fatos recuperados é um modo de falha fundamental.
- Eficiência de Tokens: Abordagens baseadas em recuperação (RAG, Memória) são 8 a 20 vezes mais eficientes em termos de tokens do que modelos de contexto longo, mas muitas vezes sacrificam o desempenho em tarefas de raciocínio complexo.
Significância e Alegações
O artigo afirma que o RECON representa uma mudança na forma como a memória de agentes deve ser avaliada:
- De Máquina de Estados para Grafo de Proveniência: O benchmark argumenta que a memória deve ser modelada como um grafo de históricos de derivação onde as invalidações se propagam através de dependências, em vez de um simples estado de valores de fatos.
- O Raciocínio Composicional é o Gargalo: Os resultados demonstram que os agentes atuais falham não apenas em encontrar informações, mas em compor essas informações. A grande lacuna entre o Oracle (recuperação perfeita) e o desempenho do LLM destaca que a capacidade de rastrear cadeias causais e lidar com invalidações é uma limitação fundamental das arquiteturas atuais.
- Verdade Fundamental Determinística: Ao desacoplar a estrutura causal da narração do LLM, o RECON fornece um benchmark rigoroso e reprodutível, livre das alucinações frequentemente encontradas em datasets sintéticos gerados inteiramente por LLMs.
Os autores concluem que tanto a recuperação quanto o raciocínio permanecem desafios abertos. Mesmo com contexto perfeito, os agentes lutam para manter entendimentos coerentes e evolutivos de documentos longos onde os fatos interagem e se contradizem. O lançamento do benchmark, do gerador e da ferramenta de avaliação visa apoiar trabalhos futuros no desenvolvimento de agentes capazes de um raciocínio composicional robusto sobre contextos longos.