← Últimos artigos
💰 quantitative finance

Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning

Este artigo introduz um mapeamento geral que transforma Processos de Decisão de Markov Não Cumulativos (NCMDPs) em MDPs padrão, permitindo a aplicação direta de técnicas de aprendizagem por reforço existentes para otimizar funções de recompensa arbitrárias e demonstrando melhor desempenho e eficiência de treinamento em diversas tarefas.

Autores originais: Maximilian Nägele, Jan Olle, Thomas Fösel, Remmy Zen, Florian Marquardt

Publicado 2026-10-01
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Maximilian Nägele, Jan Olle, Thomas Fösel, Remmy Zen, Florian Marquardt

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, existe uma estrutura poderosa usada para ensinar máquinas a tomar decisões. Imagine um robô aprendendo a caminhar, um programa de computador dominando um videogame ou um algoritmo de negociação gerenciando uma carteira de ações. Esses sistemas operam realizando uma série de ações, uma após a outra, em resposta ao seu entorno. A cada movimento, o sistema recebe um sinal, frequentemente chamado de recompensa, dizendo se aquela ação foi boa ou má. Por décadas, a regra padrão para o sucesso nesses cenários tem sido simples: maximizar a soma total de todas as recompensas coletadas ao longo do tempo. Se um robô recebe um pequeno ponto para cada passo à frente, o objetivo é obter o máximo de pontos possível até o fim da jornada. Essa abordagem, conhecida como processo de decisão de Markov, tem sido incriveldamente bem-sucedida, guiando desde robôs industriais até carros autônomos.

No entanto, a vida real é frequentemente mais complicada do que uma simples folha de contagem. Às vezes, o resultado mais importante não é a quantidade total de coisas boas que aconteceram, mas sim o pior momento que ocorreu, ou a consistência do desempenho ao longo do tempo. Considere uma espaçonave pousando em um planeta. O objetivo não é apenas pousar com segurança; é garantir que a nave nunca exceda uma velocidade perigosa durante todo o descenso, independentemente de quão suave tenha sido o resto do voo. Nas finanças, um investidor pode se importar menos com o lucro total obtido ao longo de um ano e mais com o quanto esse lucro flutuou, buscando um retorno constante em vez de uma aposta arriscada. Esses cenários envolvem o que os pesquisadores chamam de objetivos não cumulativos, onde a pontuação final depende de uma função específica de todo o histórico de recompensas, como o valor máximo alcançado ou a razão entre o ganho médio e a volatilidade. Até agora, ensinar a inteligência artificial a otimizar esses objetivos complexos e dependentes do histórico tem sido difícil, muitas vezes exigindo algoritmos construídos sob medida que são difíceis de aplicar a novos problemas.

Uma equipe de pesquisadores do Instituto Max Planck para a Ciência da Luz e da Universidade Friedrich-Alexander de Erlangen-Nürnberg desenvolveu uma solução geral para este problema. Eles descobriram uma maneira de traduzir esses desafios complexos e não cumulativos para o formato padrão que as ferramentas de inteligência artificial existentes e poderosas já sabem resolver. Em vez de inventar um novo tipo de algoritmo de aprendizado do zero, eles criaram uma ponte. Eles mostraram que, ao alterar ligeiramente a forma como a máquina percebe sua situação atual e como ela calcula seu feedback imediato, qualquer objetivo complexo pode ser convertido em um problema padrão de "soma de recompensas". Isso permite que os pesquisadores peguem o software de aprendizado mais avançado e pronto para uso disponível hoje e o apliquem diretamente a problemas que antes estavam fora de alcance, sem a necessidade de modificar o software em si.

O núcleo de seu método envolve dar ao agente artificial um pouco mais de memória. Em uma configuração padrão, um agente só precisa conhecer seu estado atual para tomar uma decisão. Mas quando o objetivo depende de todo o histórico de recompensas — como lembrar a velocidade máxima atingida até agora — o agente precisa carregar essa informação consigo. Os pesquisadores propuseram um sistema onde o "estado" do agente é expandido para incluir um resumo contínuo do passado, como a maior ou a menor recompensa vista até aquele momento. Simultaneamente, eles ajustaram a recompensa imediata que o agente recebe em cada etapa. Em vez de receber uma recompensa que simplesmente reflete a ação atual, o agente recebe um valor calculado que, quando somado ao longo de toda a jornada, reconstrói perfeitamente o objetivo complexo. Por exemplo, se o objetivo é minimizar a velocidade máxima, o agente é recompensado de uma forma que o penaliza apenas quando estabelece um novo recorde de velocidade, efetivamente transformando o problema do "mínimo dos máximos" em uma soma padrão.

Essa abordagem foi testada em uma grande variedade de tarefas difíceis, provando sua versatilidade. Em uma simulação de um módulo de pouso lunar, os pesquisadores treinaram um agente para pousar uma espaçonave enquanto limitavam estritamente sua velocidade máxima. Eles compararam seu método com uma abordagem padrão que tentava aproximar o objetivo adicionando uma penalidade ao final do voo. O novo método, que tratou o limite de velocidade como uma parte contínua do processo de aprendizado, encontrou um equilíbrio muito melhor entre pousar com segurança e mover-se de forma eficiente. No campo das finanças, eles aplicaram a técnica à otimização de portfólio, onde o objetivo é maximizar o índice Sharpe, uma medida de retorno ajustado ao risco que divide o lucro médio pela volatilidade desses lucros. Métodos anteriores tinham que depender de aproximações grosseiras dessa razão. Ao usar o novo mapeamento, os agentes puderam aprender a maximizar a razão exata diretamente, resultando em estratégias de investimento significativamente melhores durante o treinamento.

Os pesquisadores também exploraram problemas de otimização discreta, como encontrar o arranjo mais eficiente de portas lógicas quânticas ou simplificar diagramas complexos usados em computação quântica. Nessas tarefas, o objetivo é frequentemente encontrar o melhor estado único alcançado durante uma longa busca, em vez da soma de todas as melhorias feitas ao longo do caminho. Aqui, o novo método permitiu que os agentes explorassem de forma mais ousada. Como o agente não era penalizado por contratempos temporários que eram necessários para alcançar uma solução melhor mais tarde, ele aprendeu mais rápido e encontrou soluções de maior qualidade do que agentes treinados com recompensas cumulativas padrão. Em um experimento envolvendo correção de erros quânticos, o novo método melhorou o desempenho por uma margem significativa, encontrando melhores soluções em menos tempo.

A força deste trabalho reside em sua simplicidade e generalidade. Os pesquisadores não criaram um novo algoritmo de aprendizado; eles criaram uma camada de tradução. Isso significa que qualquer especialista em um campo específico, da robótica às finanças, pode pegar seu problema existente, aplicar este mapeamento e usar imediatamente as ferramentas de aprendizado por reforço mais poderosas disponíveis. O método funciona tanto em ambientes previsíveis quanto naqueles cheios de ruído aleatório, e lida com objetivos tanto simples quanto complexos. Embora os pesquisadores tenham observado que a memória expandida exigida para o agente pode tornar o problema ligeiramente maior, as técnicas modernas de deep learning estão bem equipadas para lidar com isso. O resultado é uma estrutura unificada que remove a barreira entre objetivos complexos do mundo real e as sofisticadas ferramentas de inteligência artificial, abrindo as portas para que as máquinas aprendam estratégias que eram anteriormente difíceis de definir.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →