Hard and Soft Label Assignment for Cost-Sensitive Semi-Supervised Reject Inference in Credit Scoring
이 논문은 신용 점수 산출 시 거절된 신청자에게 하드 또는 소프트 의사 라벨(pseudo-labels)을 할당함으로써 표본 선택 편향과 비대칭적 오분류 비용을 효과적으로 완화하고, Lending Club 데이터를 통해 승인된 데이터만을 사용한 베이스라인 모델보다 우수한 성능을 보이는 비용 민감형 준지도 Expectation-Maximization 프레임워크인 RI-CSCEM을 제안한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 대출 승인 여부를 결정해야 하는 은행 지점장이라고 상상해 보십시오. 당신에게는 아주 긴 신청자 명단이 있지만, 당신은 오직 승인된 사람들의 결과만을 본 적이 있습니다. 누가 대출금을 갚았고 누가 연체했는지는 알고 있습니다. 하지만 당신이 거절한 수천 명의 사람들은 어떻게 되었을까요? 당신은 그들에 대한 정보가 전혀 없습니다. 그들이 우량한 대출자였을지, 아니면 불량한 대출자였을지 알 수 없습니다. 당신은 그냥 그 데이터를 버린 것입니다.
이것은 '사각지대'를 만듭니다. 만약 당신이 승인된 사람들로부터만 학습한다면, 당신의 "리스크 점수"는 편향될 수 있습니다. 왜냐하면 당신이 "아니오"라고 말했던 사람들에게도 당신의 규칙을 테스트해보지 않았기 때문입니다. 이것을 **기각 추론(Reject Inference)**이라고 합니다. 즉, 거절된 사람들에게 어떤 일이 일어났을지 추측하는 과정입니다.
하지만 두 번째 문제가 있습니다. 대출 업무에서 실수의 무게는 같지 않습니다.
- 실수 A: 우량한 사람을 거절함. 당신은 약간의 이자 수익을 놓치게 됩니다.
- 실수 B: 불량한 사람을 승인함. 그들은 돈을 갚지 않을 것이고, 당신은 대출금 전체를 잃게 됩니다.
실수 B가 훨씬 더 비쌉니다. 대부분의 표준 컴퓨터 모델은 이 두 가지 실수를 동일한 비용으로 취급하는데, 이는 마치 1달러를 잃는 것과 집 한 채를 잃는 것이 같다고 말하는 것과 같습니다.
해결책: RI-CSCEM
이 논문의 저자들은 RI-CSCEM이라는 새로운 도구를 만들었습니다. 이것을 '스마트하고 비용을 고려하는 선생님'이라고 생각하십시오. 이 선생님은 통과한 학생들(승인된 신청자)과 수업에서 쫓겨난 학생들(거절된 신청자) 모두로부터 배웁니다.
작동 방식은 다음과 같습니다 (쉬운 비유를 사용합니다):
1. "소프트(Soft)" vs "하드(Hard)" 추측
모델이 거절된 신청자를 볼 때, 모델은 다음과 같이 추측해야 합니다: "이 사람이 대출금을 갚았을까?"
- 하드 웨이 (기존 방식): 모델은 이분법적인 선택을 강요합니다. "이 사람은 확실히 우량한 결제자다" 또는 "이 사람은 확실히 불량한 결제자다"라고 말합니다. 이것은 심판이 휘슬을 불며 플레이를 100% 확신하며 "세이프" 또는 "아웃"이라고 판정하는 것과 같습니다. 문제는 심판이 확신이 없을 때, 결정을 강요하면 경기를 망칠 수 있다는 점입니다.
- 소프트 웨이 (이 논문의 혁신): 모델은 이렇게 말합니다. "이 사람은 우량 결제자일 확률이 60%이고, 불량 결제자일 확률이 40%이다." 모델은 **부드러운 책임(soft responsibility)**을 할당합니다. 단일한 라벨 대신, 신청자를 두 가지 가능성 사이에 분산시킵니다.
- 비유: 배심원을 상상해 보십시오. "유죄" 또는 "무죄"로 투표하는 대신, "유죄 60%, 무죄 40%"로 투표하는 것입니다. 이는 미묘한 차이와 불확실성을 보존하며, 모델이 더 나은 패턴을 학습하도록 돕습니다.
2. "비용 민감형(Cost-Sensitive)" 균형
모델은 "불량 결제자"를 잡아내는 것이 "오보(false alarm)"를 피하는 것보다 더 중요하다는 것을 알고 있습니다.
- 모델은 특수한 척도를 사용합니다. 만약 모델이 누군가가 연체할 가능성이 있다고 생각하면, 그 가능성에 훨씬 더 큰 가중치를 둡니다.
- 또한 균형을 유지하기 위한 규칙을 가지고 있습니다. 거절된 그룹 내에서 모델이 추측한 "불량 결제자"의 수가 실제로 승인된 그룹에서 보았던 불량 결제자의 비율과 일치하도록 합니다. 이는 모델이 너무 안전하게 가려고 모든 사람을 불량 결제자라고 판단해버리는 극단적인 상황을 방지합니다.
3. 학습 루프 (The "Teacher" Method)
모델은 **분류 EM(Classification EM)**이라는 기법을 사용합니다. 답안의 절반이 누락된 시험지를 채점하려는 선생님을 상상해 보십시오:
- 1단계 (추측): 선생님은 지금까지 알고 있는 내용을 바탕으로 누락된 답에 대해 최선의 추측을 합니다.
- 2단계 (레슨): 선생님은 그 추측들을 사용하여 전체 학급(알려진 답과 추측된 답 모두)을 다시 공부하여 채점 규칙을 개선합니다.
- 3단계 (반복): 선생님은 개선된 규칙을 바탕으로 더 나은 새로운 추측을 만들어내며, 이 순환은 채점 규칙이 완벽해질 때까지 반복됩니다.
무엇을 발견했는가?
저자들은 이를 Lending Club(거대한 온라인 대출 플랫폼)의 실제 데이터로 테스트했습니다. 그들은 자신들의 새로운 도구를 12가지 다른 방법(표준 모델 및 다른 기각 추론 기법 포함)과 비교했습니다.
- 결과: 새로운 도구(RI-CSCEM)는 오직 승인된 신청자만을 바라보는 최고의 모델들과 대등한 성능을 보였습니다. 이 도구가 마법처럼 초인적인 능력을 보여준 것은 아니지만, 성능을 해치지 않으면서 "거절된" 데이터를 성공적으로 활용했습니다.
- 핵심 발견: "소프트(Soft)" 방식이 비결이었습니다. 모델이 "하드(Hard)" 추측(확실히 좋거나 나쁨)을 강요했을 때, 모델은 혼란에 빠져 우량한 대출자와 불량한 대출자를 구별하는 능력을 잃었습니다. 반면 "소프트" 추측(확률)을 사용했을 때, 모델의 구별 능력(AUC라고 불리는 지표)이 크게 상승했습니다.
- 이유: 논문은 은행의 거절 규칙이 가시적인 데이터(예: 신용 점수)에 기반했기 때문에, "거절된" 그룹이 숨겨진 천재나 숨겨진 범죄자로 가득 찬 곳은 아니었다고 설명합니다. 그들은 단지 승인된 그룹과 유사한 혼합체였을 뿐입니다. 따라서 모델은 그들의 결과를 맞추기 위해 마법사가 될 필요는 없었지만, 값비싼 실수를 하지 않도록 주의할 필요가 있었습니다.
요약
이 논문은 은행이 거절된 사람들을 통해 배우는 더 스마트한 방법을 소개합니다. 거절된 신청자를 "예/아니오"라는 결정을 강요받는 존재가 아니라 "우량할 수도, 불량할 수도 있는" 존재(소프트 라벨)로 취급하고, 돈을 잃는 비용을 무겁게 고려함으로써 모델은 더욱 견고해집니다. 이 모델이 기존 방식보다 미래를 더 잘 예측하는 것은 아니지만, 불완전한 데이터로부터 학습할 때 모델이 망가지지 않도록 보장해 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.