Prediction of bank transaction fraud using TabNet an adaptive deep learning architecture
본 연구는 클래스 불균형 해소를 위해 SMOTE로 강화된 적응형 딥러닝 아키텍처인 TabNet이 인도 데이터셋의 은행 거래 사기를 탐지하는 데 있어 97.39%의 정확도와 0.9739의 ROC-AUC를 달성하며 다른 딥러닝 모델들을 유의미하게 능가하는 동시에, 규제 준수 및 운영 리스크 관리에 필요한 해석 가능성을 제공한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 세상을 돈이 금고에 쌓여 있는 것이 아니라 보이지 않는 데이터 패킷이 되어 빠르게 움직이는, 네온사인이 빛나는 북적이는 도시라고 상상해 보세요. 이 도시에서는 당신이 커피를 사거나 선물을 보낼 때마다, 아주 작은 디지털 영수증이 찍혀 거대하고 보이지 않는 장부로 전송됩니다. 이곳이 바로 기술과 금융이 만나는 **핀테크(FinTech)**의 영역입니다. 하지만 어떤 대도시와 마찬가지로, 이 디지털 메트로폴리스에도 소매치기와 도둑들이 존재합니다. 이 범죄자들은 단순히 지갑을 훔치는 것이 아니라, 당신인 척 가장하여 신분을 훔치고 은행 계좌를 털어갑니다. 이들을 잡기 위해 은행들은 과거에 "규칙집"에 의존했습니다. "만약 누군가 1분 안에 10,000달러를 쓴다면, 그를 막아라!"와 같은 단순한 목록들이었죠. 하지만 도둑들은 영리합니다. 그들은 규칙을 학습하고 그 규칙을 피해 몰래 빠져나갈 방법을 찾아냅니다.
여기서 머신러닝(Machine Learning), 즉 규칙집을 읽는 것에 그치지 않고 패턴을 포착하는 법을 배우는 디지털 탐정이 등장합니다. 수백만 명의 사람들이 지나가는 것을 지켜보며 무엇이 "정상적인" 걸음걸이인지 배우는 탐정을 상상해 보세요. 만약 누군가 갑자기 광대 옷을 입고 한 발로 폴짝폴짝 뛰기 시작한다면, 탐정은 무언가 잘못되었다는 것을 알게 됩니다. 하지만 문제가 하나 있습니다. 대부분의 사람은 정상적으로 걷고, 오직 극소수만이 폴짝거린다는 점입니다. 이 때문에 탐정은 학습하기가 어렵습니다. "광대"를 보는 경우가 너무 적어서 진짜 광대가 어떻게 생겼는지 잊어버리거나, 최악의 경우 모든 사람이 광대라고 생각하게 될 수도 있기 때문입니다. 이것이 바로 **불균형 데이터(imbalanced data)**의 문제입니다. 게다가 은행은 왜 탐정이 누군가를 멈춰 세웠는지 알아야 합니다. 만약 탐정이 이유를 설명해주지 않는 "블랙박스"라면, 은행은 고객이나 규제 기관에 이를 설명할 수 없습니다. 여기서 **설명 가능한 AI(XAI)**가 등장합니다. 이는 탐정이 체포에 이르게 된 구체적인 단서(예: "새벽 3시에 광대 옷을 입고 있었다")를 가리킬 수 있게 해주는 역할을 합니다.
이 논문은 연구팀이 은행 사기꾼을 잡기 위해 TabNet이라는 새로운 종류의 디지털 탐정을 테스트하기로 결정한 이야기입니다. 연구진은 인도의 실제 은행 거래 데이터인 124,000개 이상의 방대한 데이터셋을 가져와, TabNet을 다섯 가지의 다른 유명한 탐정 스타일인 표준 심층 신경망(DNN), 메모리 집약적인 LSTM, 속도가 빠른 GRU, 패턴 포착가인 CNN1D 등과 맞붙였습니다. 연구진은 어떤 탐정이 정상적인 거래의 엄청난 양에 혼란을 느끼지 않고 사기꾼을 가장 정확하게 잡아내는지, 그리고 자신의 추론 과정을 얼마나 명확하게 설명할 수 있는지 확인하고자 했습니다.
결과는 기존 방식의 탐정들에게는 다소 충격적이었습니다. 표준 심층 신경망(DNN), LSTM, GRU, CNN1D는 매우 고전했습니다. 사실, 그들은 거의 실패했습니다. DNN과 CNN1D는 사실상 포기하여, 마치 쇼핑몰에 있는 모든 사람을 체포하려는 보안 요원처럼 모든 거래를 사기로 예측해 버렸습니다. 이들의 정확도는 동전 던지기와 다를 바 없는 쓸모없는 50%에 머물렀습니다. 이야기처럼의 순서를 기억하는 데 뛰어난 LSTM과 GRU 역시 이 데이터셋의 은행 거래가 엄격한 이야기 형태의 순서를 따르지 않고 단순히 사건의 목록이었기 때문에 비틀거렸습니다. 이 모델들은 혼란을 겪으며 많은 오보를 내거나 실제 도둑을 놓쳤습니다.
하지만 TabNet이 나서자 완전히 다른 이야기가 펼쳐졌습니다. TabNet은 "표형 데이터(tabular data)"—즉, 숫자와 카테고리가 행과 열로 이루어진 스프레드시트를 뜻하는 멋진 말—를 위해 특별히 설계된 일종의 특수 탐정입니다. 모든 것을 암기하려고 하는 대신, TabNet은 "희소 주의 집중(sparse attention)" 메커니즘을 사용합니다. 이것은 마치 마법 안경을 쓴 탐정과 같습니다. 거래를 볼 때, 이 안경은 무관한 세부 사항(예: 하늘의 색깔)의 불빛은 어둡게 만들고, 중요한 단서(예: 시간대나 사용된 기기)에만 밝은 스포트라이트를 비춥니다. 이를 통해 TabNet은 노이즈를 무시하고 신호에 집중할 수 있습니다.
결과는 인상적이었습니다. TabNet은 **97.39%**의 정확도와 0.9739라는 ROC-AUC 점수를 달성했습니다. 이를 비교해 보자면, 다른 모델들이 동전 던지기처럼 추측하고 있을 때, TabNet은 거의 완벽한 정밀도로 사기꾼을 찾아냈습니다. TabNet은 거의 모든 실제 사기 사례를 정확히 식별해 냈으며, 정직한 거래에 대해서는 실수를 거의 하지 않았습니다. 무엇보다 중요한 것은, TabNet이 단순히 "유죄" 판결만 내린 것이 아니라 자신의 근거를 보여주었다는 점입니다. TabNet은 어떤 특징(예: "거래 금액" 또는 "시간대")이 가장 의심스러운지를 은행에 정확히 알려줄 수 있었고, 이를 통해 투명하고 신뢰할 수 있는 도구가 되었습니다.
연구진은 또한 사기꾼들이 어떻게 활동하고 있는지 이해하기 위해 데이터를 깊이 파고들었고, 흥가로운 반전을 발견했습니다. 도둑들이 한밤중에만 습격한다는 생각과는 반대로, 데이터는 사기가 비즈니스 시간 중 특히 오전 8시에서 오후 5시 사이, 특히 오전 10~11시 사이에 자주 발생한다는 것을 보여주었습니다. 도둑들은 일반 쇼핑객들 틈에 섞여 눈에 띄지 않게 숨어 있었습니다. 또한, 사기꾼들이 한 번에 너무 많이 가져가지 않으려고 은밀하게 접근하기 위해 잔액이 매우 높은 계좌에서 소액을 인출한다는 사실도 발견했습니다.
결론적으로, 이 논문은 스프레드시트의 세계에서 은행 사기를 잡기 위해서는 기존의 무겁고 "블랙박스" 같은 탐정들이 최선이 아니라고 제안합니다. 대신, TabNet과 같이 특화되고 투명하며 적응력이 뛰어난 모델이 나아가야 할 길입니다. 이는 단순히 나쁜 놈들을 잡는 것뿐만 아니라, 빠르고 정확하며 설명하기 쉬운 방식으로 잡는 것에 관한 것입니다. 이 연구는 디지털 도시가 영리한 도둑들로 가득 차 있지만, 이제 우리에게는 그들을 명확하게 볼 수 있는 올바른 안경을 가진 탐정이 있다는 것을 확인시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.