An Ensemble PPO Trading Agent Across Real Limit Order Book and Long-Horizon OHLCV Data: Diagnosis, Correction, and Honest Evaluation
Este artigo apresenta um estudo empírico transparente de um agente de negociação de Bitcoin baseado em PPO que diagnostica e corrige falhas críticas de treinamento para alcançar um desempenho modesto de longo prazo superior ao Buy-and-Hold, demonstrando simultaneamente que dados de livro de ofertas em tempo real frequentemente resultam em uma política racional de "não negociação" devido aos custos de transação superarem os movimentos de micropreço, defendendo, em última análise, o valor do relato reprodutível de resultados negativos sobre narrativas de sucesso polidas.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um robô a negociar Bitcoin. Você quer que ele seja mais inteligente do que apenas comprar e segurar a moeda, mas também quer evitar que ele perca todo o seu dinheiro. Este artigo é um documentário de "bastidores" desse processo, onde o autor, William Darryl Towa, decide ser brutalmente honesto sobre tudo o que deu errado, o que deu certo e por que o robô às vezes simplesmente decide sentar no sofá e não fazer nada.
Aqui está a história da pesquisa, dividida em conceitos simples:
1. Os Dois Campos de Treinamento Diferentes
O autor não usou apenas um conjunto de dados. Ele treinou seu robô em dois "ginásios" muito diferentes:
- Ginásio A (O Microscópio de Alta Velocidade): Este usou uma visão super detalhada, segundo a segundo, do livro de ordens do Bitcoin (a lista de pessoas esperando para comprar ou vender) de uma semana específica de 2021. É como assistir a um piloto de carro de corrida em câmera lenta, vendo cada pequeno movimento do volante.
- Ginásio B (A Rodovia de Longa Distância): Este usou 2,4 anos de gráficos de preços horários. É como assistir ao mesmo piloto durante vários anos, vendo como eles lidam com diferentes climas, tráfego e condições de estrada.
2. O Primeiro Grande Crash: "O Robô Congelado"
Quando o autor tentou treinar o robô pela primeira vez, ele quebrou imediatamente. O robô fez uma negociação e, então, por 195.000 etapas, ele simplesmente congelou. Ele parou de aprender e parou de se mover.
O Diagnóstico: O autor descobriu duas razões para este estado "congelado":
- Números Confusos: O robô foi alimentado com números que eram drasticamente diferentes em tamanho. Imagine tentar comparar o peso de uma pena (0,001) com o peso de uma baleia azul (85.000). O robó ficou confuso porque a baleia afogou a pena. O autor corrigiu isso "normalizando" os dados (colocando tudo na mesma escala).
- Um Scorecard Quebrado: O robô estava sendo avaliado em um teste que era matematicamente defeituoso. Às vezes, o teste lhe dava uma pontuação de "1.000" e às vezes "-1.000" para a exata mesma ação, apenas devido a um pequeno erro matemático. Isso fez o robô pensar que o mundo era caótico e imprevisível, então ele desistiu. O autor corrigiu a matemática para que as pontuações fizessem sentido.
3. O Robô "Preguiçoso": Quando Não Fazer Nada é o Movimento Mais Inteligente
Após corrigir o crash, o autor treinou o robô nos dados do Microscópio de Alta Velocidade (Ginásio A). Ele aprendeu uma lição muito estranha: Nunca negocie.
No início, o autor pensou que o robô estava quebrado ou que não tinha dados suficientes para aprender. Mas então ele percebeu a verdade: O robô estava, na verdade, sendo inteligente.
- A Analogia: Imagine que você está em um mercado de pulgas. Cada vez que você compra algo e tenta vendê-lo 10 segundos depois, o mercado cobra uma taxa de 30%. Mesmo que o preço do item suba 1%, você ainda perde dinheiro por causa da taxa.
- A Realidade: Nos dados de alta velocidade, o preço do Bitcoin mal se movia em um segundo (frequentemente 0,00000%). Mas a taxa para negociar era enorme (0,30%).
- A Conclusão: O robô percebeu que qualquer negociação resultaria em perda de dinheiro. Portanto, a estratégia mais lucrativa era ficar parado e não fazer nada. O autor chama isso de "inação economicamente racional". Não foi uma falha; foi o robô descobrindo corretamente que o jogo estava viciado contra a negociação.
4. O Sucesso de Longa Distância: Uma Vitória Modesta
Quando o autor treinou o robô nos dados da Rodovia de Longa Distância (Ginásio B) (os gráficos horários de 2,4 anos), ele fez algo diferente. Ele aprendeu a negociar, mas de forma muito cuidadosa.
- O Resultado: O mercado caiu cerca de 21% durante o período de teste.
- Se você apenas segurasse o Bitcoin (Compra e Segura/Buy-and-Hold), você perderia 20,82%.
- O robô perdeu 19,42%.
- A Lição: Ele não fez uma fortuna. Ele não venceu o mercado por uma margem enorme. Mas ele perdeu menos dinheiro do que a pessoa que apenas segurou a posição. Foi uma vitória pequena e consistente, como um corredor que termina uma maratona ligeiramente à frente do pelotão em uma corrida muito ruim.
5. O Filtro "Ensemble": Um Porteiro que Não Fez Nada
O autor tentou combinar os dois robôs. Ele construiu um "porteiro" (um filtro de ensemble) que só permitiria ao robô de Longa Distância negociar se o robô de Alta Velocidade visse uma boa oportunidade.
- O Testo: Ele testou isso na única semana em que ambos os conjuntos de dados se sobrepunham.
- O Resultado: O porteiro bloqueou 64 negociações potenciais, mas não mudou o resultado final. Por quê? Porque o robô de Longa Distância já estava sentado sobre as próprias mãos, não fazendo nada na maior parte do tempo. O porteiro era como um segurança em uma boate que já estava vazia; ele impediu as pessoas de entrarem, mas como ninguém estava tentando entrar de qualquer maneira, a boate permaneceu vazia.
- A Honestidade: Em vez de esconder esse "resultado nulo", o autor o publicou. Ele argumentou que admitir "esta parte não funcionou" é mais valioso do que forjar um sucesso.
6. A Grande Lição: "Falha Honesta" é Melhor que "Mentiras Polidas"
A parte mais importante deste artigo não é a estratégia de negociação; é a atitude.
No mundo da IA e das finanças, os pesquisadores costumam publicar apenas os "finais felizes" onde o robô ganha milhões. Este artigo é diferente. Ele diz:
- "Aqui está exatamente por que nossa primeira tentativa quebrou."
- "Aqui está por que nosso segundo robô decidiu não fazer nada (e por que isso foi, na verdade, correto)."
- "Aqui está uma parte do nosso sistema que não funcionou, e aqui está a prova."
O autor acredita que compartilhar esses "resultados negativos" e "diagnósticos" ajuda toda a comunidade a aprender mais rápido do que compartilhar uma história polida e perfeita que pode estar escondendo falhas ocultas. Ele liberou todo o seu código e notas para que qualquer pessoa possa verificar seu trabalho, provando que a transparência é a melhor maneira de fazer a ciência avançar.
Em resumo: O artigo é a história de um robô que aprendeu a negociar Bitcoin, quebrou devido a uma matemática ruim, aprendeu que às vezes a melhor negociação é não negociar e, finalmente, aprendeu a perder um pouco menos de dinheiro do que todo mundo — tudo isso enquanto o autor prometeu contar toda a verdade, inclusive as partes embaraçosas.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.