← Últimos artigos
💻 computer science

Predicting Bank Customer Churn Using a Random Forest Classifier With Engineered Risk Features

Este estudo desenvolve e implementa um dashboard interativo em Streamlit apresentando um classificador Random Forest aprimorado com recursos de risco engenheirados para prever com precisão o churn de clientes bancários, alcançando métricas de alto desempenho e fornecendo insights de retenção acionáveis e explicáveis para gerentes de relacionamento.

Autores originais: Amula Venkatesh, Indira

Publicado 2026-09-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Amula Venkatesh, Indira

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo do setor bancário, o dinheiro não é apenas movimentado; ele é mantido sob confiança. Mas essa confiança é frágil. Para um banco de varejo, o erro mais caro não é fazer um empréstimo ruim, mas perder um bom cliente. Adquirir uma nova pessoa para abrir uma conta custa significativamente mais do que manter uma existente satisfeita. Essa realidade transformou a retenção de clientes em um jogo de alto risco de predição. Os bancos agora olham para o passado para adivinhar o futuro, fazendo uma pergunta simples, porém vital: qual de nossos clientes está prestos a ir embora? Para responder a isso, pesquisadores recorreram ao aprendizado de máquina (machine learning), um campo onde computadores aprendem a reconhecer padrões em vastas quantidades de dados sem serem explicitamente programados para cada regra. Em vez de um analista humano lendo milhares de arquivos, um computador varre sinais sutis — como uma queda repentina na atividade da conta ou uma faixa etária específica — que frequentemente precedem uma partida. O objetivo é detectar esses sinais cedo o suficiente para intervir, oferecendo ajuda ou uma oferta melhor antes que o cliente já tenha decidido partir.

Um estudo recente de Amula Venkatesh e Dra. Indira, do Chaitanya Bharathi Institute of Technology na Índia, aborda esse desafio de frente. Eles focaram em um conjunto de dados de 10.000 clientes de um banco europeu, um grupo onde quase 38 por cento já havia deixado o banco, um número que representa uma perda significativa de receita. Os pesquisadores construíram um sistema digital projetado para prever quem sairia a seguir. Eles não dependeram de uma regra única e simples, como "se o saldo for baixo, eles irão embora". Em vez disso, utilizaram um método chamado Floresta Aleatória (Random Forest). Imagine uma floresta de árvores de decisão, onde cada árvore observa os dados do cliente de um ângulo ligeiramente diferente. Uma árvore pode focar na idade, outra em quantos cartões de crédito eles possuem e uma terceira em sua localização. Ao combinar as opinições de centenas dessas árvores, o sistema alcança um consenso que é muito mais preciso e confiável do que qualquer árvore individual poderia fornecer por conta própria.

Para tornar este sistema mais aguçado, os pesquisadores não apenas o alimentaram com os números brutos encontrados nos registros do banco. Eles criaram pistas "engenheiradas" ao misturar fatos existentes. Calcularam quanto do salário de um cliente estava parado em sua conta bancária, uma proporção que revela o quão dependente a pessoa é daquele banco específico. Observaram quantos produtos um cliente possuía em relação ao tempo que era cliente, medindo o ritmo de seu engajamento. Eles até multiplicaram a idade de um cliente pelo número de anos que ele estava com o banco para ver se a fase da vida desempenhava um papel em sua lealdade. Essas novas combinações atuaram como uma lupa, destacando relações ocultas que os dados brutos sozinhos haviam perdido. Quando o computador foi treinado com essa informação enriquecida, aprendeu a ver os sinais de partida com uma clareza notável.

Os resultados deste treinamento foram impressionantes. Quando testado em um grupo de clientes que o sistema nunca havia visto antes, ele identificou corretamente quem ficaria e quem sairia com 91,4 por cento de precisão. Mais importante ainda, ele detectou 87,8 por cento das pessoas que realmente iriam embora, uma métrica crucial para um banco que deseja salvar seus clientes. O sistema teve um desempenho superior a métodos mais antigos e simples, como modelos lineares básicos ou árvores de decisão únicas, e chegou muito perto do desempenho de sistemas muito mais complexos e computacionalmente pesados. Os pesquisadores descobriram que a idade era o preditor individual mais forte de saída, seguida de perto por quão ativamente um cliente se engajava com seus produtos. Eles também descobriram que clientes na Alemanha estavam saindo a uma taxa quase duas vezes maior do que os da França ou Espanha, uma diferença regional que sugere que fatores locais estão em jogo.

Talvez a parte mais significativa deste trabalho não seja apenas a predição, mas a explicação. No passado, um computador poderia dizer "este cliente irá embora" sem dizer o porquê, deixando os funcionários do banco confusos e incapazes de agir. Este novo sistema inclui um recurso que atua como um holofote, mostrando exatamente quais fatores empurraram um cliente específico para a categoria de "risco". Se um cliente é sinalizado como de alto risco, o sistema pode informar ao gerente do banco que é porque o cliente tem entre 51 e 60 anos e parou de usar seus produtos, embora ainda possua várias contas. Essa clareza permite que os funcionários do banco vão além de suposições. Eles agora podem oferecer ajuda direcionada, como uma revisão financeira para alguém que está se aproximando da aposentadoria ou uma campanha de reengajamento para alguém que se tornou inativo.

Os pesquisadores levaram este modelo para fora do laboratório de computação e construíram um painel (dashboard) simples e interativo que qualquer funcionário do banco pode usar. Não há necessidade de conhecimento em programação. Um gerente pode digitar os detalhes de um cliente e a tela exibirá um medidor de probabilidade, um nível de risco codificado por cores e uma explicação em linguagem clara sobre os fatores de risco. Esta ferramenta transforma um resultado matemático complexo em um guia prático para decisões de negócios diárias. O estudo sugere que, ao focar no engajamento em vez de apenas na propriedade, e ao prestar atenção a fases de vida específicas e diferenças regionais, os bancos podem melhorar significativamente sua capacidade de manter clientes. Embora o modelo seja poderoso, os pesquisadores observam que ele é baseado em um único recorte histórico e que trabalhos futuros poderiam incluir dados de transações em tempo real para tornar as predições ainda mais oportunas. Por enquanto, este sistema oferece um caminho claro e baseado em dados para entender por que os clientes saem e como mantê-los.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →