← 최신 논문
💻 computer science

Predicting Bank Customer Churn Using a Random Forest Classifier With Engineered Risk Features

본 연구는 정교하게 설계된 리스크 특성(risk features)으로 강화된 랜덤 포레스트 분류기를 탑장한 인터랙티브 Streamlit 대시보드를 개발 및 배포하여 은행 고객 이탈을 정확하게 예측함으로써 높은 성능 지표를 달성하고, 관계 관리자들에게 실행 가능하며 설명 가능한 유지 관리 통찰력을 제공한다.

원저자: Amula Venkatesh, Indira

게시일 2026-09-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Amula Venkatesh, Indira

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

은행의 세계에서 돈은 단순히 이동하는 것이 아니라 신뢰 속에 보관됩니다. 하지만 그 신뢰는 취약합니다. 소매 금융에서 가장 비싼 실수는 잘못된 대출을 해주는 것이 아니라, 좋은 고객을 잃는 것입니다. 새로운 고객을 유치하여 계좌를 개설하게 하는 비용은 기존 고객을 만족스럽게 유지하는 비용보다 훨씬 더 많이 듭니다. 이러한 현실은 고객 유지를 고도의 예측이 필요한 고위험 게임으로 바꾸어 놓았습니다. 이제 은행들은 과거를 통해 미래를 예측하며, "우리 고객 중 누가 떠나려 하는가?"라는 단순하지만 매우 중요한 질문을 던집니다. 이를 해결하기 위해 연구자들은 컴퓨터가 모든 규칙에 대해 명시적으로 프로그래밍되지 않고도 방대한 양의 데이터에서 패턴을 인식하는 법을 배우는 분야인 머신러닝에 주목했습니다. 인간 분석가가 수천 개의 파일을 일일이 읽는 대신, 컴퓨터는 고객의 이탈 전조 현상인 계좌 활동의 갑작스러운 감소나 특정 연령대와 같은 미세한 신호를 스캔합니다. 목표는 고객이 이미 떠나기로 결심하기 전에 충분히 일찍 이러한 신호를 포착하여 도움을 제안하거나 더 나은 혜택을 제공하는 것입니다.

인도 차이타냐 바라티 공과대학교(Chaitanya Bharathi Institute of Technology)의 아물라 베칸테쉬(Amula Venkatesh)와 인디라(Indira) 박사가 수행한 최근 연구는 이 과제에 정면으로 맞서고 있습니다. 그들은 유럽의 한 은행에서 온 1만 명의 고객 데이터를 중심으로 연구를 진행했는데, 이 그룹에서는 약 38%가 이미 은행을 떠난 상태였으며, 이는 상당한 수익 손실을 의미합니다. 연구진은 누가 다음에 떠날 것인지를 예측하도록 설계된 디지털 시스템을 구축했습니다. 그들은 "잔액이 낮으면 떠날 것이다"와 같은 단일하고 단순한 규칙에 의존하지 않았습니다. 대신 '랜덤 포레스트(Random Forest)'라고 불리는 방법을 사용했습니다. 결정 트리(decision trees)로 이루어진 숲을 상상해 보십시오. 각 나무는 고객의 데이터를 조금씩 다른 각도에서 살펴봅니다. 어떤 나무는 연령에 집중하고, 다른 나무는 보유한 신용카드의 개수에, 또 다른 나무는 거주 지역에 집중할 수 있습니다. 이 수백 개의 나무가 가진 의견을 결합함으로써, 시스템은 단일한 나무가 스스로 제공할 수 있는 것보다 훨씬 더 정확하고 신뢰할 수 있는 합의점에 도달합니다.

이 시스템을 더욱 날카롭게 만들기 위해, 연구진은 단순히 은행 기록에 있는 가공되지 않은 숫자만을 입력하지 않았습니다. 그들은 기존의 사실들을 서로 조합하여 새로운 '엔지니어링된' 단서들을 만들어냈습니다. 그들은 고객의 급여 중 얼마가 은행 계좌에 머물고 있는지 계산했는데, 이 비율은 해당 고객이 특정 은행에 얼마나 의존하고 있는지를 보여줍니다. 또한 고객이 보유한 상품의 개수를 고객 기간 대비 계산하여 고객 참여의 속도를 측정했습니다. 심지어 고객의 연령과 은행 거래 기간을 곱하여 생애 단계가 충성도에 역할을 하는지도 살펴보았습니다. 이러한 새로운 조합들은 돋보기처럼 작용하여, 원시 데이터만으로는 놓쳤을 숨겨진 관계를 부각했습니다. 컴퓨터가 이 풍부한 정보로 학습되었을 때, 시스템은 놀라운 명확성으로 이탈의 징후를 포착해 냈습니다.

학습 결과는 놀라웠습니다. 시스템이 본 적 없는 새로운 고객 집단에 테스트했을 때, 시스템은 이탈자와 잔류자를 91.4%의 정확도로 올바르게 식별했습니다. 더 중요한 것은, 실제 이탈할 사람 중 87.8%를 잡아냈다는 점인데, 이는 고객을 지키고자 하는 은행에게 매우 중요한 지표입니다. 이 시스템은 기본 선형 모델이나 단일 결정 트리와 같은 오래되고 단순한 방법보다 우수한 성능을 보였으며, 훨씬 더 복잡하고 계산량이 많은 시스템의 성능에도 매우 근접했습니다. 연구진은 연령이 이탈을 예측하는 가장 강력한 단일 변수이며, 고객의 상품 참여도가 그 뒤를 바짝 쫓고 있다는 것을 발견했습니다. 또한 독일 고객들이 프랑스나 스페인 고객들보다 거의 두 배 높은 비율로 이탈하고 있다는 사실을 발견했는데, 이는 지역적 요인이 작용하고 있음을 시사합니다.

이 연구의 가장 중요한 부분은 단순한 예측이 아니라 '설명'에 있습니다. 과거에는 컴퓨터가 "이 고객은 떠날 것이다"라고 말하면서도 왜 그런지는 말해주지 않아 은행 직원들을 혼란스럽게 하고 행동하지 못하게 만들었습니다. 이 새로운 시스템은 특정 고객을 '위험군'으로 몰아넣은 정확한 요인이 무엇인지 보여주는 스포트라이트와 같은 기능을 포함하고 있습니다. 만약 어떤 고객이 고위험군으로 분류된다면, 시스템은 해당 고객이 51세에서 60세 사이이며 여러 계좌를 보유하고 있음에도 불구하고 상품 사용을 중단했기 때문이라는 사실을 은행 매니저에게 알려줄 수 있습니다. 이러한 명확성은 은행 직원들이 추측을 넘어 행동할 수 있게 합니다. 그들은 이제 은퇴를 앞둔 사람을 위한 재무 검토나, 활동이 뜸해진 사람을 위한 재참여 캠 l 캠페인과 같이 타겟팅된 도움을 제공할 수 있습니다.

연구진은 이 모델을 컴퓨터 실험실 밖으로 가져와 누구나 사용할 수 있는 간단하고 상호작용적인 대시보드를 구축했습니다. 코딩 지식은 필요하지 않습니다. 매니저가 고객의 세부 정보를 입력하면, 화면에는 확률 게이지, 색상으로 구분된 위험 수준, 그리고 위험 요인에 대한 평이한 언어 설명이 표시됩니다. 이 도구는 복잡한 수학적 결과를 일상적인 비즈니스 결정을 위한 실질적인 가이드로 바꿔줍니다. 이 연구는 단순히 상품의 '소유'가 아닌 '참여'에 집중하고, 특정 생애 단계와 지역적 차이에 주의를 기울임으로써 은행이 고객을 유지하는 능력을 크게 향방할 수 있음을 시사합니다. 모델은 강력하지만, 연구진은 이것이 단일한 역사적 스냅샷에 기반하고 있으며, 향-후 작업에는 예측을 더욱 실시간으로 만들기 위한 실시간 거래 데이터가 포함될 수 있다고 언급했습니다. 현재로서는, 이 시스템은 고객이 왜 떠나는지, 그리고 어떻게 그들을 붙잡을 수 있는지에 대한 명확하고 데이터에 기반한 경로를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →