← Últimos artigos
🤖 machine learning

Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning

Este artigo deriva um teorema de gradiente de política para objetivos de Teoria da Perspectiva Cumulativa (CPT) em aprendizado por reforço de horizonte finito e propõe um algoritmo de primeira ordem comprovadamente convergente usando estatísticas de ordem de Monte Carlo para otimizar políticas não convexas sensíveis ao risco.

Autores originais: Olivier Lepel, Anas Barakat

Publicado 2026-09-09
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Olivier Lepel, Anas Barakat

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os seres humanos são notoriamente ruins em calcular riscos. Nós não pesamos probabilidades como um matemático; em vez disso, nós as sentimos. Tendemos a temer uma pequena chance de uma perda terrível muito mais do que uma grande chance de uma moderada, e frequentemente perseguimos uma chance ínfima de um ganho massivo mesmo quando as probabilidades estão contra nós. Isso não é uma falha em nosso software; é como somos programados. Por décadas, economistas e psicólogos usaram uma estrutura chamada Teoria do Prospecto Cumulativo para descrever essas peculiaridades. Ela sugere que julgamos resultados não pelo seu valor absoluto, mas por como eles se comparam a um ponto de referência pessoal, e que distorcemos a probabilidade de eventos, superestimando desastres raros e subestimando os comuns.

Por muito tempo, o campo da inteligência artificial, especificamente o aprendizado por reforço, ignorou essas peculiaridades humanas. Neste campo, um agente aprende a tomar decisões interagindo com um ambiente para maximizar uma recompensa. A abordagem padrão assume que o agente é perfeitamente racional, calculando o resultado esperado médio de cada caminho possível e escolhendo aquele com o maior número. Isso funciona bem para máquinas, mas falha em capturar como os humanos realmente se comportam em situações complexas e incertas. Quando tentamos construir uma IA que trabalhe ao lado de pessoas ou tome decisões por elas, um agente puramente racional muitas vezes age de formas que parecem frias, irracionais ou simplesmente erradas para um observador humano. A questão que os pesquisadores têm feito é se podemos ensinar as máquinas a pensar mais como nós, não apenas em suas escolas finais, mas em como percebem risco e recompensa.

Uma equipe de pesquisadores deu agora um passo significativo para responder a essa pergunta. Eles desenvolveram uma nova estrutura matemática que permite que agentes de inteligência artificial otimizem seu comportamento baseando-se nos princípios da psicologia humana, em vez de um cálculo frio. Em uma série de simulações, eles demonstraram que, ao ensinar um agente a ver o mundo através das lentes da Teoria do Prospecto Cumulativo, a máquina começa a exibir os mesmos comportamentos de risco matizados e, por vezes, contraditórios, que os humanos apresentam. Os pesquisadores não apenas propuseram uma teoria; eles construíram um algoritmo prático que pode aprender esses comportamentos e provaram que ele funciona matematicamente, oferecendo uma maneira para a IA se alinhar às preferências humanas em ambientes de alto risco, como finanças, saúde e gestão de tráfito.

O cerne do trabalho deles é um novo método para ensinar um agente a aprender. No aprendizado por reforço tradicional, o agente tenta maximizar a soma das recompensas que espera obter. O novo método muda o objetivo. Em vez de perguntar, "Qual é a recompensa média?", ele pergunta, "Como um humano percebe este fluxo de recompensas?". Para fazer isso, o agente deve primeiro decidir o que conta como um ganho e o que conta como uma perda em relação a um ponto de referência específico. Uma queda na dor de um nível sete para cinco pode parecer uma vitória enorme se a linha de base do paciente for sete, mas uma melhora menor se a sua linha de base for dois. O agente então aplica uma transformação especial a esses ganhos e perdas, fazendo com que a dor de uma perda pareça mais pesada do que a alegria de um ganho equivalente. Finalmente, ele distorce as probabilidades, fazendo com que eventos raros pareçam mais prováveis e eventos comuns menos prováveis, exatamente como a mente humana faz.

Os pesquisadores enfrentaram um obstáculo significativo para fazer isso funcionar. O cenário matemático criado por essas distorções humanas é incrivelmente acidentado e complexo. Ao contrário das colinas suaves e previsíveis da otimização padrão, este novo cenário é cheio de picos afiados e vales profundos, tornando difícil para um algoritmo encontrar o melhor caminho sem ficar preso. Além disso, as ferramentas padrão usadas para ensinar a IA como melhorar suas decisões não se aplicavam aqui porque a função objetivo semelhante à humana não segue as regras simples de adição e linearidade nas quais a maioria dos algoritmos de aprendizado se baseia. A equipe teve que derivar um novo conjunto de regras, um "teorema do gradiente de política", que atua como uma bússola para o agente. Este novo teorema fornece uma maneira de calcular a direção na qual o agente deve mudar seu comportamento para melhorar seu desempenho, mesmo quando esse desempenho é medido por um padrão complexo e semelhante ao humano.

Para testar essa nova bússola, os pesquisadores realizaram uma série de experimentos. Em um cenário simples, colocaram um agente em uma situação onde ele tinha que escolher entre uma recompensa pequena e segura e uma recompensa grande e arriscada. Um agente padrão, racional, sempre escolhia a opção com o maior pagamento médio, mesmo que isso significasse uma aposta. Um agente avesso ao risco, projetado para evitar a incerteza, consistentamente evitava a aposta. Mas o agente treinado com o novo framework semelhante ao humano mostrou algo mais interessante. Quando a escolha envolvia ganhos potenciais, ele agia com cautela, preferindo a opção segura. No entanto, quando o cenário era invertido para envolver perdas potenciais, o mesmo agente tornava-se subitamente ousado, escolhendo a opção arriscada para evitar uma perda certa. Essa mudança de comportamento, conhecida como efeito de reflexão, é uma marca do processo de tomada de decisão humano que os modelos de IA padrão têm dificuldade em replicar. O novo algoritmo capturou essa nuance perfeitamente, usando as mesmas configurações internas para ambos os cenários.

Os pesquisadores também compararam seu método com abordagens existentes que tentavam modelar o risco. Eles descobriram que métodos mais antigos, que dependiam de estimativa de ordem zero (basicamente adivinhar a direção de melhoria tentando pequenas mudanças e vendo o que acontecia), tinham dificuldades à medida que os problemas se tornavam mais complexos. Esses métodos tornavam-se ineficientes e lentos quando o número de variáveis aumentava. Em contraste, o novo algoritmo, que utiliza informações de primeira ordem para calcular a direção exata de melhoria, escalava muito melhor. Ele permaneceu eficiente mesmo à medida que a complexidade do ambiente crescia, sugerindo que poderia ser aplicado a problemas do mundo real com muitas partes móveis, como gerenciar uma rede elétrica ou negociar ações.

As implicações deste trabalho estendem-se além de jogos simples. Os pesquisadores ilustraram como esta abordagem poderia ser usada em campos críticos. Na saúde, por exemplo, um médico que gerencia a dor crônica de um paciente pode precisar equilibrar o alívio imediato contra o risco de dependência a longo prazo. Uma IA padrão poderia simplesmente minimizar a pontuação média de dor, potencialmente ignorando o medo do paciente em relação aos sintomas de abstinência. Um agente alinhado ao humano, no entanto, poderia pesar o medo de um efeito colateral raro, mas catastrófico, de forma mais pesada, levando a planos de tratamento que pareçam mais seguros e atenciosos ao paciente. Da mesma forma, nas finanças, um agente poderia ser ajustado para refletir a tolerância ao risco específica de um investidor, não apenas ajustando um único número, mas mudando fundamentalmente como ele percebe a probabilidade de colapsos ou windfalls no mercado.

O estudo também esclareceu o que é necessário para que esses agentes funcionem. Os pesquisadores observaram que, para o algoritmo funcionar, as preferências humanas — o quanto uma pessoa teme uma perda ou como ela distorce as probabilidades — devem ser conhecidas antecipadamente. Estas não são aprendidas pelo agente do zero, mas são fornecidas como parte do modelo, tal como definir as regras de um jogo. Isso permite que o sistema seja adaptado a indivíduos ou grupos específicos. Os pesquisadores mostraram que, ao ajustar o ponto de referência ou a sensibilidade às perdas, o comportamento do agente poderia ser alterado dramaticamente, provando que o sistema é flexível o suficiente para modelar uma ampla gama de atitudes humanas.

Embora os resultados sejam promissores, os pesquisadores são cuidadosos em enquadrar suas descobertas dentro dos limites de suas simulações. Eles provaram que o algoritmo converge para uma solução estável e que pode encontrar políticas ótimas em ambientes complexos e não lineares. Mostraram, através de simulações, que superam métodos mais antigos em termos de velocidade e escalabilidade. No entanto, ainda não implantaram este sistema em um ambiente real e vivo onde vidas humanas ou ativos financeiros estejam em risco imediato. O trabalho permanece um avanço teórico e computacional, uma prova de conceito de que as máquinas podem ser ensinadas a navegar no cenário confuso e irracional da percepção de risco humana.

O caminho a seguir envolve o refinamento destes modelos e o teste em cenários do mundo real mais diversos. Os pesquisadores sugerem que o trabalho futuro poderia focar em aprender as preferências humanas diretamente dos dados, em vez de tê-las pré-programadas, e estender a teoria para problemas de horizonte infinito e contínuos. Eles também veem potencial em combinar esta abordagem com outros métodos de aprendizado a partir do feedback humano, criando um sistema híbrido que possa se adaptar às mudanças de preferências ao longo do tempo. Por enquanto, a conquista permanece como uma ponte entre dois mundos: a lógica fria da otimização de máquinas e a realidade quente e, muitas vezes, contraditória da tomada de decisão humana. Oferece uma maneira de construir uma IA que não apenas calcula o melhor resultado, mas entende o que esse resultado significa para as pessoas que ela serve.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →