OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents
Este artigo apresenta o OpenPM, um framework de avaliação auditável de ponto no tempo para agentes de gestão de portfólio de LLM que impõe rigorosas restrições de disponibilidade de dados e de risco para evitar resultados inflados, revelando que a qualidade do analista e os custos de rotatividade são mais críticos do que a escolha do modelo de construção na geração de retornos modestos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: OpenPM – Avaliação Auditável de Ponto no Tempo para Agentes de Gestão de Portfólio de LLM
1. Declaração do Problema
O artigo aborda três falhas críticas na avaliação atual de agentes de negociação baseados em Large Language Models (LLMs), que frequentemente levam a resultados inflados ou não implantáveis:
- Vazamento de Informação (Information Leakage): Agentes frequentemente acessam dados indisponíveis no momento da decisão (ex: observações futuras, registros com carimbo de tempo de evento em vez de carimbo de tempo de disponibilidade), criando uma habilidade artificial.
- Execução Otimista: Os retornos reportados frequentemente ignoram custos de negociação (spread, slippage, turnover), apresentando limites superiores em vez de estimativas realistas de implantação.
- Mandatos Não Aplicados: Restrições de risco em linguagem natural (ex: "conservador", "máximo de 20 nomes") são frequentemente tratadas como preferências suaves para pontuação post-hoc, em vez de restrições rígidas aplicadas ao portfólio executado.
Benchmarks existentes frequentemente falham em controlar esses problemas simultaneamente, carecendo particularmente de controle de dados de ponto no tempo (PIT) e aplicação estrita de mandatos.
2. Metodologia: O Framework OpenPM
O OpenPM é um framework de avaliação auditável e de ponto no tempo, projetado para tratar a avaliação credível como um artefato de engenharia.
Princípios de Design Central
- Ambiente de Dados de Ponto no Tempo: O sistema impõe um "portão de disponibilidade" estrito. Um registro entra no estado do agente no tempo de decisão apenas se seu
ts_available. Isso distingue entre o tempo do evento e o tempo de disponibilidade (ex: um relatório trimestral só está disponível após a aceitação pelo EDGAR). O ambiente cobre um universo do S&P 500 com observações de estado de mercado de 5 minutos. - Aplicação de Mandatos: Mandatos de risco em linguagem natural são convertidos em restrições tipadas (ex: peso máximo por nome, número máximo de nomes). Crucialmente, estes são aplicados por um crítico determinístico em loop que projeta os pesos propostos pelo agente sobre o conjunto viável antes da execução, em vez de apenas pontuar o agente post-hoc.
- Execução Consciente de Custos: Os retornos são calculados usando half-spreads laterais (compra no ask, venda no bid) sem modelagem de impacto de mercado, fornecendo uma base de custo conservadora, porém realista.
O Alocador em Camadas (Agente de Referência)
O artigo introduz uma arquitetura de agente de referência para isolar componentes específicos do pipeline de negociação:
- Compilação de Mandato: Converte linguagem natural em restrições tipadas.
- Portão de Liquidez: Filtra o universo para nomes negociáveis (ex: os 50 principais por liquidez).
- Camada de Analistas: Seis analistas de LLM paralelos pontuam candidatos de forma independente através de canais tipados (técnico, regime, eventos, notícias, itens 8-K, narrativas 10-K/10-Q).
- Construtor: Um LLM separado propõe pesos de portfólio baseados nos scores agregados dos analistas e spreads, mas sem acesso a preços brutos ou ao score composto.
- Crítico Determinístico: Projeta a proposta do construtor sobre o conjunto viável (aplicando limites de long-only, limites de nomes, limites de liquidez).
- Simulador de Execução (Fill Simulator): Executa as negociações nos lados cotados.
Configuração Experimental
- Dataset: Um snapshot congelado e com hash de conteúdo do S&P 500 (508 nomes) ativo entre 19 de fevereiro de 2026 e 1 de maio de 2026. A janela de avaliação é de 2 de março de 2026 a 1 de maio de 2026 (44 dias úteis).
- Estratégia de Isolamento: Para isolar a capacidade do "construtor", os autores executam a camada de analistas uma única vez para criar uma "captura congelada" de evidências. Esta mesma evidência é então reproduzida através de diferentes modelos construtores (gpt-5, Opus-4.7, DeepSeek-V3.2, Qwen3-Max, gpt-4o-mini) para determinar se o construtor agrega valor independente da qualidade do sinal.
- Modos: Experimentos executados nos modos "uma vez e manter" (rebalanceamento único) e rebalanceamento diário.
3. Principais Resultados
O artigo relata descobertas estruturais em vez de alegações absolutas de alfa, enfatizando que os resultados são limites superiores de uma única janela congelada.
Capacidade do Construtor
- Ganhos Condicionais: Construtores mais fortes (ex: gpt-5, Opus-4.7) mostram ganhos modestos, dependentes do modelo, sobre a equalização de peso (EW) do mesmo pool de candidatos, mas apenas quando o sinal do analista a montante é forte.
- Dominância do Analista: A qualidade da camada de analistas é o principal driver de performance. Quando a captura do analista foi fraca (DeepSeek-V3.2), nenhum construtor conseguiu superar o baseline de EW do mesmo pool. Quando a captura foi forte (gpt-5), a maioria dos construtores superou o EW.
- Sobreposição: Construtores fortes reponderam majoritariamente o elenco de EW (75–78% de sobreposição), em vez de substituí-lo inteiramente. Construtores mais fracos frequentemente divergem significativamente e apresentam desempenho inferior.
Custo e Turnover
- Turnover é o Driver de Custo: No rebalanceamento diário, o turnover torna-se o fator de custo dominante. Modelos de alto turnover (ex: Qwen3-Max, gpt-4o-mini) viram seus retornos líquidos caírem abaixo do benchmark SPY devido ao arrasto de custos, apesar de terem retornos brutos semelhantes aos modelos de baixo turnover.
- Disciplina Importa: O padrão vencedor envolve selecionar bem e negociar esporadicamente. Baixo turnover por si só é insuficiente (gpt-5 teve o menor turnover, mas subperformou o SPY devido à má seleção naquele regime específico).
Conformidade e Auditoria
- Adesão ao Mandato: Todos os construtores aderiram com sucesso aos limites numéricos explícitos (ex: limite de 10% de peso).
- Necessidade do Crítico: O crítico determinístico foi essencial para aplicar restrições de liquidez (cortes rígidos) que eram mais estritas que o mandato e invisíveis para o modelo.
- Contaminação: Todas as execuções passaram pelo certificado de contaminação, confirmando a ausão de vazamento de dados (look-ahead leakage).
4. Significância e Alegações
O artigo posiciona o OpenPM não como um gerador de alfa validado, mas como uma ferramenta de diagnóstico para a comunidade de trading de LLM.
- Artefato de Engenharia: Ele redefine a avaliação como um problema de engenharia que exige contratos de dados estritos, controle de disponibilidade e camadas de aplicação determinística.
- Honestidade nas Alegações: Os autores declaram explicitamente que todos os retornos são "limites superiores de uma única janela congelada sem impacto de mercado, não alfa validado". O objetivo é manter as alegações honestas, vinculando cada número reportado às condições específicas (impressão digital de dados, modelo de custo, mandato) que o produziu.
- Insights Diagnósticos: O framework revela que a "habilidade de construção" é frequentemente um proxy para a "qualidade do sinal do analista". O artigo argumenta que o poder computacional deve ser priorizado para a camada de analistas, utilizando o construtor mais barato capaz após isso.
- Auditabilidade: Ao gerar artefatos como certificados de contaminação, curvas de sensibilidade de custo e relatórios de adesão a restrições para cada execução, o OpenPM permite que pesquisadores verifiquem se os resultados são artefatos de vazamento de dados ou suposições de execução otimista.
Em resumo, o OpenPM demonstra que, embora os LLMs possam construir portfólios que superam baselines simples sob condições específicas, seu desempenho é fortemente dependente da qualidade do sinal a montante e é facilmente erodido pelos custos de turnover. O framework fornece o rigor necessário para distinguir a habilidade genuína de artefatos de avaliação.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.