← Últimos artigos
🤖 machine learning

CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach

Este artigo apresenta um sistema de aprendizado por reforço profundo aumentado por sentimento para a CLaC@FinMMEval 2026 Task 3, demonstrando que um agente DDPG utilizando o sentimento de notícias do LLaMA 3.2 e recompensas baseadas em alfa supera significativamente as estratégias de buy-and-hold em TSLA e BTC, ao mesmo tempo em que destaca os desafios de generalizar políticas de regimes de mercado de alta para de baixa.

Autores originais: Andrei Neagu, Eeham Khan, Leila Kosseim

Publicado 2026-07-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Andrei Neagu, Eeham Khan, Leila Kosseim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a jogar um videogame muito difícil: o mercado de ações. O objetivo deste jogo não é apenas ganhar pontos; é superar a pontuação de um jogador que nunca para de jogar, nunca muda sua estratégia e apenas mantém seu personagem durante todo o tempo (uma estratégia chamada "buy-and-hold" ou compra e manutenção). O jogo é caótico, cheio de efeitos sonoros barulhentos, reviravoltas repentinas e um fluxo constante de manchetes de notícias que podem mudar as regras. Para vencer, você precisa de um agente inteligente que consiga olhar para a tela, ler as notícias, sentir o ritmo do jogo e decidir se deve seguir em frente, ficar parado ou recuar. Este é o mundo do Aprendizado por Reforço Profundo (Deep Reinforcement Learning - DRL). Pense no DRL como um método onde uma IA aprende por tentativa e erro, recebendo um "high-five" (recompensa) quando faz um bom movimento e um "desapontamento" (penalidade) quando comete um erro. O artigo que você está prestes a ler explora como construir o robô de negociação definitivo para dois personagens muito diferentes: uma empresa de tecnologia chamada Tesla (TSLA) e uma moeda digital chamada Bitcoin (BTC).

Os pesquisadores da Universidade de Concordia propuseram-se a construir um sistema de negociação que não apenas adivinha; ele aprende. Eles trataram o mercado de ações como uma fase complexa de um videogame onde o jogador (a IA) tem que tomar uma decisão diária: ir Long (apostar que o preço vai subir), ir Flat (ficar de fora) ou ir Short (apostar que o preço vai cair). Para ajudar a IA a fazer essas escolhas, eles a alimentaram com três tipos de informações: Indicadores Técnicos (como velocímetros e linhas de tendência desenhadas a partir de preços passados), Ciclos de Calendário (saber se é segunda-feira ou o fim do mês, porque os mercados às vezes agem de forma diferente nesses dias) e Pontuações de Sentimento (um "anel de humor" para as notícias, calculado por uma IA superinteligente que lê artigos para ver se as pessoas estão felizes ou assustadas com o ativo).

A equipe treinou quatro tipos diferentes de "cérebros" de IA para jogar este jogo: Policy Gradient (PG), Proximal Policy Optimization (PPO), Deep Q-Learning (DQL) e Deep Deterministic Policy Gradient (DDPG). Mas aqui está a parte inteligente: em vez de apenas recompensar a IA por ganhar dinheiro, eles deram a ela uma "Recompensa Alpha" especial. Imagine se você estivesse correndo contra um amigo; em vez de apenas te recompensar por correr rápido, você só ganha pontos se correr mais rápido que seu amigo. Isso forçou a IA a focar em superar a linha de base "buy-and-hold" em vez de apenas ter sorte porque o mercado inteiro estava subindo. Eles também fizeram com que as sessões de treinamento começassem em momentos aleatórios para que a IA não apenas memorizasse o roteiro de um jogo específico, mas aprendesse a lidar com qualquer situação.

Quando testaram esses robôs com dados reais de 2025, os resultados foram uma mistura de triunfo e uma lição dura sobre o futuro. Para a Tesla, o robô DDPG foi a estrela, obtendo um retorno massivo de 54,96%, enquanto o robô DQL ficou em segundo lugar próximo, com 52,62%. Ambos esmagaram a estratégia "buy-and-hold", que rendeu apenas 16,45%. O robô DDPG foi particularmente bom em evitar problemas, mantendo suas perdas (drawdown) muito menores que os outros.

No entanto, o teste do Bitcoin foi um nível muito mais difícil. O mercado tornou-se um mercado de baixa (bear market), onde os preços despencaram, e a estratégia "buy-and-hold" perdeu um enorme 34,27%. Nesta tempestade, o robô DDPG foi o único que conseguiu se manter à tona, terminando com um ganho pequeno, mas positivo, de 1,58%. Os outros robôs, incluindo o DQL, que parecia incrível durante o treinamento, tiveram dificuldade em se adaptar à mudança repentina de um mercado em ascensão para um mercado em queda.

O artigo sugere que, embora esses agentes de IA possam aprender a negociar de forma eficaz, eles ainda são sensíveis ao "clima" do mercado. O algoritmo DDPG provou ser o mais robusto, lidando tanto com os dias ensolarados da Tesla quanto com os dias de tempestade do Bitcoin melhor do que os outros. No entanto, os pesquisadores encontraram uma lacuna complicada: o robô que parecia ser o melhor durante o treinamento (DQL) nem sempre venceu no teste real, especialmente quando o regime de mercado mudou de um mercado de alta (bull market) para um mercado de baixa (bear market). Isso nos diz que, embora a IA possa aprender a navegar nos mares financeiros, ela ainda precisa ter cuidado para não se acostumar demais com águas calmas, pois a próxima onda pode ser um tsunami. Em última análise, o estudo mostra que combinar o sentimento das notícias com algoritmos de aprendizado inteligentes pode ajudar a vencer o mercado, mas o "melhor" robô depende fortemente de que tipo de mercado ele está enfrentando.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →