Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
이 논문은 고차원 표형 데이터의 특성 공학 부담과 해석 불가능성 문제를 해결하기 위해, 중요도 기반 특성 축소와 라벨 인식 인스턴스 예시를 활용한 검색 증강 생성 (RAG) 기법을 도입한 'FinFRE-RAG'를 제안하여 사기 탐지 성능을 향상시키고 인간이 이해 가능한 설명을 제공하는 LLM 기반 접근법을 제시합니다.
기존의 상황: 은행이나 카드사는 매일 수천 건의 거래를 처리합니다. 이 데이터는 '숫자'와 '범주'로 이루어진 표 (Table) 형태입니다. (예: 거래 금액 10,000 원, 지역 5 번, 카드 개수 1 개 등)
기존의 AI (전통적 모델): 이 표를 분석하는 데는 '특징 공학 (Feature Engineering)'이라는 아주 힘든 노력이 필요합니다. 사람이 직접 "이 숫자가 중요해, 저 숫자는 무시해"라고 일일이 가르쳐야 합니다. 하지만 이 방식은 사람이 이해하기 어렵고, 새로운 사기 수법이 나오면 다시 처음부터 가르쳐야 합니다.
새로운 AI (LLM, 예: 챗봇): 요즘의 거대 언어 모델 (LLM) 은 글을 읽고 논리적으로 추론하는 데는 천재입니다. 하지만 숫자 표를 그대로 주면 어떻게 해야 할지 몰라 엉뚱한 답을 내놓거나, 아예 무작위 추측을 합니다.
이유 1: LLM 은 글로 훈련되었지, 복잡한 숫자 표로 훈련된 게 아닙니다.
이유 2: 표에 정보가 너무 많으면 (수백 개), LLM 이 혼란을 느껴 중요한 신호를 놓칩니다.
이유 3: 사기는 전체 거래 중 1% 미만으로 아주 드뭅니다. LLM 은 "대부분은 정상이다"라고만 생각하다 보니, 드문 사기 패턴을 찾아내지 못합니다.
🛠️ 2. 해결책: "FinFRE-RAG" (지능형 사기 탐지기)
이 논문은 LLM 이 숫자 표를 잘 읽을 수 있게 도와주는 두 단계의 비법을 제안합니다.
1 단계: "핵심만 추려내기" (Feature Reduction)
비유: "요리사에게 재료만 100 개 주지 말고, 핵심 재료 10 개만 줘라"
수백 개의 거래 데이터 중 사기와 가장 관련이 깊은 **가장 중요한 특징 (Top 10~20 개)**만 AI 가 볼 수 있도록 골라냅니다.
이렇게 하면 LLM 이 불필요한 잡음에 시달리지 않고, 진짜 중요한 숫자들에 집중할 수 있습니다.
2 단계: "유사한 사례로 가르치기" (RAG - 검색 증강 생성)
비유: "수사관이 사건을 해결할 때, 과거의 유사한 사건 기록을 참고하는 것"
지금 의심스러운 거래가 들어오면, AI 는 과거 데이터베이스에서 **"이 거래와 가장 비슷한 과거 사례"**를 찾아옵니다.
그리고 그 사례들이 "사기였다" 혹은 "정상이었다"라는 **정답 (라벨)**과 함께 AI 에게 보여줍니다.
핵심: AI 에게 "이 거래는 사기야"라고 직접 가르치는 게 아니라, **"과거에 이런 비슷한 거래가 사기였어, 너도 이걸 보고 판단해봐"**라고 **비유 (유추)**를 통해 가르치는 것입니다.
📊 3. 결과: "기적 같은 변화"
이 방법을 적용한 결과, 놀라운 변화가 일어났습니다.
기존 LLM: 숫자 표를 보고 "무작위 추측" 수준 (성능 0 에 가까움).
FinFRE-RAG 적용 후: LLM 이 전통적인 전문 AI(랜덤 포레스트, XGBoost 등) 와 거의 맞먹는 성능을 냅니다.
가장 큰 장점:
성능 향상: 사기를 찾아내는 정확도가 크게 올랐습니다.
이해 가능성 (Interpretability): AI 가 "왜 사기라고 생각했는지" 사람이 읽을 수 있는 이유를 설명해 줍니다.
예시: "이 거래는 사기일 확률이 높습니다. 왜냐하면 과거에 사기였던 거래들과 '거래 금액이 작고', '이메일 도메인이 같고', '주소가 비어있다는' 공통점이 있기 때문입니다."
💡 4. 핵심 교훈 (요약)
이 연구는 다음과 같은 메시지를 전달합니다.
"LLM 을 사기 탐지에 쓰려면, 숫자 표를 그대로 던져주지 말고, '중요한 부분만 추려서' 그리고 '유사한 과거 사례를 보여줘서' 가르쳐야 합니다."
이 방법은 AI 를 훈련시키는 데 드는 비용과 시간을 아끼면서도, 사람이 이해할 수 있는 설명을 함께 제공한다는 점에서 금융 사기 탐지 분야에서 매우 유용한 도구로 평가받습니다.
한 줄 요약:
"LLM 에게 복잡한 숫자 표를 주지 말고, 핵심만 추려서 과거의 유사한 사기 사례들과 비교하게 하면, AI 가 사기범을 잡는 명탐정이 될 수 있다!"
1. 문제 정의 (Problem Statement)
금융 사기 탐지는 전통적으로 표형 (Tabular) 데이터에 기반한 머신러닝 모델을 사용하지만, 다음과 같은 한계가 존재합니다.
특성 공학의 부담: 고차원 데이터를 처리하기 위해 방대한 수의 수동 특성 공학 (Feature Engineering) 이 필요하며, 이는 유지보수 비용이 높습니다.
해석 가능성 부족: 기존 모델은 예측의 근거를 인간이 이해하기 쉽게 설명하기 어렵습니다 (Aggregate feature importance 외에는 설명이 제한적임).
LLM 의 직접 적용 실패: 대규모 언어 모델 (LLM) 은 자연어 처리에 뛰어나지만, 숫자 및 범주형 데이터로 구성된 표형 금융 데이터에 직접 적용할 경우 성능이 매우 낮습니다.
문맥 불일치: LLM 은 구조화된 숫자 데이터의 의미적 맥락을 이해하지 못합니다.
고차원성: 수백 개의 특성을 프롬프트에 모두 넣으면 컨텍스트 한계를 초과하거나 노이즈가 발생합니다.
사기의 희소성과 모호성: 사기 데이터는 전체의 1% 미만으로 극단적으로 불균형하며, 사기 정의가 기관마다 달라 LLM 이 패턴을 학습하기 어렵습니다.
2. 제안 방법론: FinFRE-RAG
저자들은 LLM 의 추론 능력을 활용하면서도 구조화된 데이터의 한계를 극복하기 위해 FinFRE-RAG라는 2 단계 프레임워크를 제안합니다.
2.1. 오프라인 특성 축소 (Offline Feature Reduction)
목적: 수천 개의 특성 중 가장 영향력 있는 소수의 특성만 선택하여 LLM 의 컨텍스트 윈도우를 효율적으로 사용하고 노이즈를 줄입니다.
과정:
외부 역사적 데이터셋 (Dext) 을 사용하여 Random Forest 모델을 훈련시킵니다.
특성 중요도 (Feature Importance) 점수를 기반으로 모든 특성을 순위 매깁니다.
상위 k개의 특성 (Fsel) 만 선택합니다.
선택된 수치 특성을 전역 통계 (μ,σ) 를 사용하여 정규화하여 벡터화합니다.
2.2. 온라인 검색 증강 컨텍스트 학습 (Online Retrieval-Augmented In-Context Learning)
목적: LLM 이 현재 거래를 평가할 때 유사한 과거 사례를 참고하도록 하여 추론 능력을 유도합니다.
과정:
인스턴스 검색 (Instance Retrieval):
범주형 필터링: 중요도가 높은 범주형 특성 (예: 주, 카드 수 등) 을 기준으로 후보군을 좁힙니다.
수치 유사성 검색: 정규화된 수치 특성 공간에서 코사인 유사도를 계산하여 가장 유사한 n개의 거래를 검색합니다.
프롬프트 구성 및 추론:
검색된 유사 거래들을 자연어 서술형 예제 (Few-shot examples) 로 변환합니다 (예: "고객의 주 번호는 5 이고, 신용 잔고는 10,540 입니다. 이는 사기입니다.").
현재 거래 (쿼리) 도 동일한 자연어 템플릿으로 변환하되 레이블은 생략합니다.
LLM 에게 "유사한 과거 사례를 참고하여 현재 거래의 사기 위험 점수 (1~5 점) 와 근거를 설명하라"는 지시를 내립니다.
3. 주요 기여 (Key Contributions)
FinFRE-RAG 프레임워크 제안: LLM 에 대한 태스크별 미세 조정 (Fine-tuning) 없이도, 특성 축소와 검색 증강을 통해 구조화된 사기 탐지에 LLM 을 적응시킨 최초의 체계적인 방법론 중 하나입니다.
체계적인 평가: 4 개의 공개 사기 데이터셋 (CCF, CCFRAUD, IEEE-CIS, PAYSIM) 과 3 가지 계열의 오픈 가중치 LLM (Qwen, Gemma, GPT-OSS) 을 대상으로 광범위한 실험을 수행했습니다.
통찰력 있는 분석:
LLM 이 사기를 이해하는 데 필요한 특성 수 (k) 와 검색된 사례 수 (n) 의 최적점을 규명했습니다.
특성 축소 (Importance-guided) 가 무작위 선택보다 성능에 미치는 영향을 정량화했습니다.
이진 분류 대신 5 단계 위험 점수 (Risk Scoring) 를 출력하는 것이 정확도와 해석 가능성을 모두 향상시킨다는 것을 입증했습니다.
4. 실험 결과 (Results)
성능 향상:
직접 프롬프팅 (Direct Prompting) 한 LLM 은 무작위 추측 수준 (MCC 가 음수 또는 0 에 가까움) 의 성능을 보였습니다.
FinFRE-RAG 를 적용한 후, 모든 모델에서 F1-Score 와 MCC 가 획기적으로 개선되었습니다.
예: Qwen3-14B 모델의 IEEE-CIS 데이터셋에서 F1 점수가 0.04 에서 0.62 로, MCC 가 -0.01 에서 0.60 으로 상승했습니다.
전통적 모델과의 비교:
FinFRE-RAG 는 Random Forest, XGBoost, TabM 과 같은 강력한 표형 기반 베이스라인 모델들과 경쟁 가능한 성능을 보여주었습니다.
특히 Gemma 3 모델은 CCF 와 PAYSIM 데이터셋에서 전통적 모델 (Random Forest 등) 을 능가하는 높은 F1/MCC 점수를 기록했습니다.
미세 조정 (Fine-tuning) vs. RAG:
LoRA 를 이용한 미세 조정된 LLM 은 FinFRE-RAG 보다 일관되게 우수한 성능을 보이지 못했습니다. 미세 조정 모델은 정밀도 (Precision) 는 높지만 재현율 (Recall) 이 낮아 다양한 사기 패턴을 놓치는 경향이 있었습니다.
반면, RAG 기반의 FinFRE-RAG 는 이질적인 사례를 검색하여 학습함으로써 더 균형 잡힌 성능을 보였습니다.
출력 granularity:
단순 이진 분류 ("사기/아님") 보다 5 단계 위험 점수를 요구하는 프롬프팅이 모델의 불확실성을 더 잘 활용하여 전반적인 성능을 향상시켰습니다.
5. 의의 및 결론 (Significance & Conclusion)
실용적 가치: LLM 이 금융 사기 탐지 분야에서 단순한 보조 도구를 넘어, 해석 가능한 근거 (Rationale) 를 제공하며 실제 분석가들의 업무를 지원할 수 있는 강력한 도구로 자리 잡을 수 있음을 입증했습니다.
해석 가능성: LLM 은 단순히 "사기"라고 판단하는 것을 넘어, "어떤 특성 패턴이 유사한 과거 사기 사례와 일치하는지"에 대한 자연어 설명을 생성하여 의사결정 투명성을 높입니다.
한계 및 향후 과제:
현재 연구는 공개 데이터셋에 의존하며, 실제 생산 환경의 대규모 데이터와 민감한 개인정보 (PII) 처리에 대한 검증이 필요합니다.
검색 알고리즘 (코사인 유사도 등) 과 LLM 의 추론 능력을 더 발전시킬 여지가 있습니다.
LLM 의 출력을 절대적인 판단이 아닌 의사결정 지원 도구로 활용하고, 인간 검토 (Human-in-the-loop) 를 필수화해야 함을 강조합니다.
이 논문은 구조화된 금융 데이터라는 LLM 의 약점을 극복하기 위해 특성 선택과 검색 증강 생성 (RAG) 을 결합한 새로운 패러다임을 제시하며, 금융 사기 탐지 분야에서 LLM 의 실용적 적용 가능성을 크게 확장했습니다.