A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management
Este artigo propõe uma estrutura de supervisão de aprendizado por reforço que pondera dinamicamente múltiplas métricas de desempenho para selecionar a política de negociação ideal a partir de um conjunto heterogêneo de agentes, demonstrando retornos ajustados ao risco superiores em mercados de criptomoedas não estacionários em comparação com agentes individuais e estratégias fixas.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Investir nos mercados financeiros é um jogo constante de adaptação. As regras do jogo mudam conforme a economia transita de um período de crescimento em alta para uma deriva lenta e lateral, ou para um declínio súbito e acentuado. Nesses ambientes, uma única estratégia que funciona perfeitamente durante um boom frequentemente falha miseravelmente quando o mercado vira. Este é o cerne do desafio da gestão de portfólios: decidir como dividir o dinheiro entre diferentes ativos quando o futuro é incerto e o passado não é um mapa confiável. Durante décadas, os investidores confiaram em fórmulas matemáticas para equilibrar risco e recompensa, mas esses modelos estáticos muitas vezes têm dificuldade quando as condições de mercado mudam rapidamente. Mais recentemente, cientistas da computação voltaram-se para um tipo de inteligência artificial chamada aprendizagem por reforço. Em vez de serem ensinados regras específicas, esses programas de computador aprendem por tentativa e erro, interagindo com um mercado simulado para descobrir quais ações levam aos melhores resultados de longo prazo. Embora esses programas possam aprender a negociar, eles frequentemente ficam presos em uma única forma de pensar, sendo incapazes de pivotar quando o regime de mercado muda.
Uma equipe de pesquisadores da Universidade Nacional de Transporte da Coreia propôs uma nova maneira de resolver este problema. Em vez de tentar construir um único robô de negociação perfeito, eles criaram um sistema que atua como um supervisor, gerenciando uma equipe de cinco robôs de negociação diferentes, cada um treinado com um método de aprendizagem ligeiramente distinto. O supervisor não realiza as negociações em si. Em vez disso, ele observa como cada robô tem performado recentemente e decide qual deles deve estar no comando em qualquer momento dado. Os pesquisadores testaram este sistema usando dados reais de alta frequência do mercado de criptomoedas, um lugar conhecido por sua volatilidade extrema e mudanças rápidas. Eles descobriram que este sistema de supervisão superou consistentemente qualquer robô individual, bem como estratégias de investimento tradicionais, ao alternar dinamicamente para o agente mais adequado às condições atuais do mercado.
Os pesquisadores começaram construindo uma equipe de cinco agentes distintos. Cada agente é um programa de computador projetado para tomar decisões de investimento, mas todos foram treinados usando abordagens matemáticas diferentes. Embora todos os agentes tenham sido treinados no mesmo ambiente de portfólio com a mesma função de recompensa, seus mecanismos de aprendizagem distintos fizeram com que cada agente desenvolvesse uma "personalidade" única. Um pode ser muito agressivo, buscando altos lucros mas assumindo grandes riscos, enquanto outro pode ser mais cauteloso, priorizando a estabilidade sobre ganhos rápidos. Em um mercado estável, o agente agressivo pode brilhar. Em um mercado turbulento, o cauteloso pode ser o único que sobrevive. O problema é que nenhum agente individual é o melhor em tudo o tempo todo. Se um investidor escolher apenas um agente e permanecer com ele, provavelmente sofrerá quando o mercado mudar de uma forma que aquele agente não aprecia.
Para resolver isso, os pesquisadores introduziram um agente supervisor. Este supervisor não conhece o código interno dos cinco agentes que está gerenciando. Em vez disso, ele atua como um treinador observando um jogo, olhando apenas para o placar. Ele monitora sete métricas de desempenho diferentes para cada agente, tais como quanto lucro eles geraram, quanto risco assumiram para obter esse lucro e a proporção de períodos com retornos positivos. Ele observa esses números ao longo de diferentes períodos de tempo, desde as últimas horas até os últimos dias. O trabalho do supervisor é descobrir qual dessas métricas é mais importante no momento atual. Em um mercado calmo, o supervisor pode decidir que lucros constantes e estáveis são o sinal mais importante de um bom agente. Em um mercado caótico, ele pode decidir que evitar grandes perdas é a única coisa que conta.
O supervisor aprende este sistema de ponderação através de seu próprio processo de treinamento. Ele observa o mercado e os históricos recentes dos agentes e, então, aprende a atribuir pontuações de importância para as diferentes métricas de desempenho. Ele não escolhe simplesmente o agente com o lucro recente mais alto. Em vez disso, ele calcula uma pontuação para cada agente combinando seus dados de desempenho com os pesos de importância que o supervisor aprendeu para aquele momento específico. O agente com a pontuação total mais alta é selecionado para gerenciar o portfólio para o próximo período de negociação. Isso cria um sistema que está constantemente reavaliando suas escolhas, mudando sua confiança de um agente para outro conforme o ambiente de mercado muda.
Os pesquisadores testaram este sistema usando dados de preços de trinta minutos da exchange de criptomoedas Binance, cobrindo um período de 1º de janeiro de 2021 a 31 de dezembro de 2025. Eles configuraram dois cenários diferentes: um com quatro criptomoedas populares e outro com cinco, adicionando um quinto ativo para ver se o sistema poderia lidar com um grupo de investimentos ligeiramente maior. Eles compararam seu sistema de supervisão contra os cinco agentes individuais, uma estratégia simples de comprar e manter todos os ativos igualmente, e várias fórmulas de investimento tradicionais. Os resultados foram claros. O sistema de supervisão gerou valores finais de portfólio significativamente maiores do que qualquer um dos agentes individuais ou das estratégias tradicionais. No cenário de quatro ativos, o supervisor elevou o valor do portfólio para 2,349 vezes o valor inicial, enquanto o melhor agente individual atingiu apenas 1,652. No cenário de cinco ativos, o supervisor alcançou 3,044 vezes o valor inicial, comparado a 2,554 para o melhor agente individual.
Crucialmente, esse crescimento extra não veio ao custo de um risco maior. O sistema de supervisão também apresentou menores perdas máximas, conhecidas como drawdowns, do que os agentes individuais. Isso sugere que o sistema não estava apenas fazendo apostas maiores para obter retornos mais altos; ele estava, na verdade, gerenciando o risco melhor ao saber quando mudar para um agente mais seguro. Os pesquisadores também compararam seu sistema com uma versão mais simples que usava apenas uma regra fixa para trocar de agentes, como sempre escolher o agente com o lucro recente mais alto. O sistema de supervisão superou vastamente essas estratégias de regra única. Isso provou que o sucesso do sistema veio de sua capacidade de ponderar múltiplos fatores simultaneamente, em vez de depender de um critério único e rígido.
Para entender exatamente o que fez o sistema funcionar, os pesquisadores realizaram uma série de testes onde removeram partes do sistema para ver o que acontecia. Eles descobriram que o sistema precisava das sete métricas de desempenho e das quatro janelas temporais para funcionar em seu nível ideal. Remover as métricas relacionadas ao lucro prejudicou a capacidade do sistema de gerar riqueza, enquanto remover as métricas relacionadas ao risco prejudicou sua capacidade de proteção contra perdas. Da mesma forma, o sistema precisava observar o histórico de desempenho de curto e longo prazo. No teste de quatro ativos, o histórico de longo prazo foi o mais importante, enquanto no teste de cinco ativos, o histórico de curto prazo foi o que mais importou. Essa variação mostrou que o sistema não estava usando uma regra fixa, mas estava genuinamente se adaptando às necessidades específicas do portfólio atual e das condições de mercado.
O estudo conclui que gerenciar um portfólio não é apenas encontrar o melhor algoritmo de negociação individual. É criar uma estrutura que possa escolher a ferramenta certa para o trabalho conforme o trabalho muda. Ao usar um supervisor para ponderar dinamicamente diferentes sinais de desempenho, o sistema pode navegar pela natureza imprevisível dos mercados de criptomoedas de forma mais eficaz do que qualquer agente individual ou estratégia estática. Os pesquisadores observam que seu sistema atual utiliza um conjunto específico de cinco agentes e um conjunto específico de dados de mercado. Trabalhos futuros poderiam expandir isso incluindo agentes com diferentes perfis de risco ou testando o sistema em outros tipos de ativos. No entanto, o achado central permanece robusto: uma abordagem hierárquica que aprende a selecionar políticas baseadas em uma visão flexível e multifacetada de desempenho oferece uma maneira poderosa de lidar com a incerteza dos mercados financeiros.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.