Learning optimal policies from event logs through reinforcement learning: a comparison of deep and MDP-based approaches
Este artigo propõe um framework de Aprendizado por Reforço para Monitoramento Prescritivo de Processos que aprende políticas comportamentais ótimas diretamente de logs de eventos históricos para recomendar ações para otimizar Indicadores Chave de Desempenho, comparando uma abordagem de Processo de Decisão de Markov baseada em modelo com um método de Deep RL livre de modelo e demonstrando que ambos melhoram efetivamente os KPIs enquanto a abordagem baseada em modelo oferece eficiência computacional superior.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é o gerente de um banco movimentado. Todos os dias, clientes solicitam empréstimos. Às vezes o empréstimo é aprovado, às vezes é rejeitado e, às vezes, o cliente simplesmente desiste. Seu objetivo é simples: fazer com que o maior número possível de clientes diga "Sim" à sua oferta de empréstimo.
No entanto, você não controla tudo. Você controla as ações do banco (como enviar uma oferta ou pedir mais informações), mas não controla as ações do cliente (como decidir aceitar, rejeitar ou cancelar). É como jogar uma partida de xadrez onde você só pode mover suas próprias peças, mas seu oponente (o cliente) move as dele aleatoriamente, baseando-se no seu humor.
Este artigo trata de ensinar um computador a ser o melhor gerente de banco possível, analisando registros antigos de como o banco jogou o jogo no passado. O objetivo é descobrir a estratégia perfeita para vencer com mais frequência.
Os Dois "Treinadores"
Os pesquisadores testaram duas formas diferentes (ou "treinadores") de ensinar o computador essa estratégia usando Aprendizado por Reforço (um tipo de IA que aprende por tentativa e erro, mas, neste caso, aprende através de um livro de história em vez de jogar ao vivo).
1. O "Criador de Mapas" (Abordagem baseada em MDP)
Este treinador analisa milhares de solicitações de empréstimos passadas e tenta construir um mapa detalhado do jogo.
- Como funciona: Ele agrupa situações semelhantes (como "Cliente pediu $10k e nós enviamos uma oferta") e calcula as chances do que acontece a seguir. Ele cria um livro de regras claro: "Se você estiver na Situação A, faça a Ação B".
- A Analogia: Imagine um GPS que mapeou cada estrada de uma cidade. Ele sabe exatamente qual curva leva ao trânsito e qual leva a um atalho. Ele constrói um modelo completo da cidade antes de dizer para onde você deve ir.
- O Problema: Construir esse mapa dá trabalho e, se o mapa for detalhado demais, ele pode ficar confuso com eventos raros e estranhos. Para corrigir isso, os pesquisadores adicionaram um "filtro" para ignorar caminhos raros e pouco confiáveis no livro de história.
2. O "Aprendiz Profundo" (Deep RL Offline)
Este treinador não tenta construir um mapa. Em vez disso, ele usa uma rede neural super inteligente (como um cérebro com muitas camadas) para olhar o livro de história e adivinhar o melhor movimento diretamente.
- Como funciona: Ele lê os registros passados e tenta encontrar padrões ocultos que um humano ou um mapa simples poderiam perder. Ele aprende olhando para os dados repetidamente.
- A Analogia: Imagine um grande mestre de xadrez que assistiu a milhões de partidas. Eles não precisam desenhar um mapa do tabuleiro; eles apenas "sentem" o movimento certo com base na intuição construída pela experiência.
- O Problema: Este "cérebro" é muito pesado. Leva muito tempo para treinar e requer muita capacidade de computação, como tentar resolver um quebra-cabeça gigante com um supercomputador.
O Experimento: A Arena de Simulação
Como você não pode simplesmente começar a dar conselhos ruins para clientes reais para ver o que acontece (isso custaria dinheiro ao banco), os pesquisadores construíram uma simulação virtual.
- Eles criaram uma versão de "videogame" do processo de empréstimo.
- Eles deixaram o computador jogar o jogo milhares de vezes usando as estratégias que aprendeu.
- Eles mediram a pontuação: Quanto lucro o banco obteve? (Lucro = Juros ganhos menos o tempo gasto trabalhando no empréstimo).
O Que Eles Descobriram
Os resultados foram interessantes:
- Ambos os Treinadores Venceram: Tanto o "Criador de Mapas" quanto o "Aprendiz Profundo" descobriram estratégias que foram muito melhores do que a forma antiga e padrão do banco de agir. Ambos ajudaram o banco a obter mais respostas "Sim" dos clientes.
- O Criador de Mapas foi Ligeiramente Melhor: O "Criador de Mapas" (MDP) encontrou consistentemente estratégias ligeiramente melhores, especialmente em situações complicadas e raras. Ele foi mais confiável ao saber exatamente o que fazer.
- O Criador de Mapas foi Muito Mais Rápido: Esta foi a maior diferença. O "Criador de Mapas" aprendeu sua estratégia em questão de minutos. O "Aprendiz Profundo" levou horas (ou até dias, dependendo do tamanho dos dados) para treinar.
- Analogia: O Criador de Mapas foi como um aluno que estudou um livro didático e passou no teste em 10 minutos. O Aprendiz Profundo foi como um aluno que teve que reler toda a enciclopédia 100 vezes para obter a mesma nota.
A Conclusão Final
O artigo conclui que, se você quiser ensinar um computador como gerenciar um processo de negócios (como aprovações de empréstimos) usando dados passados:
- Você não precisa sempre da IA mais complexa e pesada (Deep Learning).
- Uma abordagem mais simples que constrói um modelo claro do processo (MDP) funciona tão bem quanto, se não melhor, e é muito mais rápida e barata de operar.
É um lembrete de que, às vezes, um bom e claro mapa é melhor do que um cérebro supercomplexo, especialmente quando você só quer realizar o trabalho de forma eficiente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.