← 최신 논문
💻 computer science

Machine learning reduces audit detection risk in 3.3 million public sector general ledger transactions

본 연구는 330만 건의 실제 공공 부문 거래 및 공식 감사 보고서를 통해 검증된 새로운 4계층 머신러닝 프레임워크가 감사 탐지 위험을 38% 이상에서 2.01%로 낮추고 처리 시간을 98.7% 단축함으로써 기존의 화폐 단위 샘플링(Monetary Unit Sampling)보다 성능이 현저히 우수함을 입증한다.

원저자: Tsetsegjargal Ulambayar, Oyunbileg Pagjii, Oyuntsetseg Luvsandash, Gantulga Garamdorj, Chimedtsogzol Sangajav

게시일 2026-08-13
📖 5 분 읽기🧠 심층 분석

원저자: Tsetsegjargal Ulambayar, Oyunbileg Pagjii, Oyuntsetseg Luvsandash, Gantulga Garamdorj, Chimedtsogzol Sangajav

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 330만 개의 진짜 동전이 들어있는 거대한 가방 속에서 단 하나의 가짜 동전을 찾아내려는 형사라고 상상해 보십시오. 금융 감사(Auditing)의 세계에서 이것은 매일 벌어지는 도전입니다. 즉, 엄청난 양의 돈 기록 속에서 실수나 부정(fraud)을 찾아내는 일입니다. 전통적으로 감사인들은 '단위 샘플링(Monetary Unit Sampling, MUS)'이라는 방법을 사용해 왔습니다. 이것은 마치 보물 사냥꾼가 금이 반드시 있을 법한 가장 크고 명백한 흙더미만을 파헤치는 것과 같습니다. 그들은 작은 모래 주머니들은 안전하다고 가정하며 무시합니다. 하지만 만약 가짜 동전이 그 무시된 작은 주머니 속에 숨어 있다면 어떻게 될까요? 그것이 바로 위험 요소입니다. 큰 것들만 살펴보다가 나쁜 것들을 놓치게 되는 것입니다.

이를 해결하기 위해 과학자들은 '머신러닝(Machine Learning)'을 활용하고 있는데, 이는 형사에게 아주 똑똑하고 지치지 않는 로봇 조수를 붙여주는 것과 같습니다. 이 조수는 단순히 큰 덩어리뿐만 아니라 가방 안의 모든 기록을 읽을 수 있습니다. 이 조수는 인간의 눈이 놓칠 수 있는 패턴, 예를 들어 숫자의 기묘한 리듬이나 "부적절해 보이는" 거래 등을 찾아냅니다. 목표는 '탐지 위험(detection risk)', 즉 형사가 범죄를 놓칠 확률을 낮추는 것입니다. 만약 로봇이 작은 주머니 속의 가짜 동전을 찾아낼 수 있다면, 감사는 훨씬 더 안전하고 빨라질 것입니다. 이 논문은 한 가지 큰 질문을 던집니다. 과연 이 로봇 조수가 기존의 "큰 덩어리를 파헤치는" 방식보다 정부의 실제 자금 기록에서 실수를 더 잘 찾아낼 수 있는지, 그리고 인간 감사인이 신뢰할 수 있는 방식으로 그것을 찾아냈는지 설명할 수 있는지를 말입니다.


슈퍼 스캐너: AI는 어떻게 건초더미 속에서 바늘을 찾아냈는가

이 연구에서 몽골의 연구진은 공공 에너지 유틸리티 기업의 재무 기록을 점검하기 위한 4층 구조의 "슈퍼 스캐너"를 구축했습니다. 그들은 단순히 가상의 숫자로 테스트한 것이 아니라, 3개년(2023, 2024, 2025년) 동안의 개별 자금 거래 3,329,189건을 포함하는 방대하고 실제적인 데이터셋을 입력했습니다. 이는 총 **16.34조 투그릭(MNT)**에 달하는 데이터의 산이었습니다!

옛날 방식 vs 새로운 방식
연구진은 자신들의 새로운 머신러닝 시스템을 앞서 언급한 "큰 덩어리를 파헤치는" 방식인 기존 표준과 비교했습니다. 기존 방식에서는 감사인이 점검할 계좌의 **20%**를 무작위로 추출합니다. 연구 결과, 이 기존 방식에는 커다란 간극이 있음이 드러났습니다. 즉, "탐지 위험"(실수를 놓칠 확률)이 38.05%에서 52.7% 사이였습니다. 쉽게 말해, 이 기존 방식은 거의 절반의 경우에 부정이나 오류를 완전히 놓칠 수도 있다는 뜻입니다.

그러나 새로운 머신러닝 시스템은 모든 것을 잡아내는 그물처럼 작동했습니다. 이 시스템은 전체 330만 건의 거래를 단 4.5시간 만에 처리했습니다. 이를 비교해 보자면, 기존 방식대로 인간 감사인이 동일한 작업을 수행하려면 310시간에서 357시간이 걸렸을 것입니다. 이는 **98.7%**의 시간 단축을 의미합니다!

로봇이 학습하는 법 (스승 없이도)
보통 로봇에게 부정을 포착하도록 가르치려면 먼저 수천 개의 "좋은" 기록과 "나쁜" 기록의 예시를 보여줘야 합니다. 하지만 현실에서 감사인은 감사를 마친 후에야 어떤 기록이 나쁜 것인지 알 수 있습니다. 이는 진퇴양난(catch-22)의 상황입니다.

저자들은 "자기 레이블링(self-labeling)"이라는 영리한 기술로 이 문제를 해결했습니다. 세 명의 서로 다른 탐정(Isolation Forest, Z-score, Turn-ratio 분석)이 독립적으로 데이터를 조사한다고 상상해 보십시오. 만약 두 명 이상의 탐정이 특정 기록이 수상하다고 동의하면, 시스템은 이를 "이상치(anomalous)"로 표시합니다. 이를 통해 정답지 없이도 메인 로봇(Random Forest 모델)이 나쁜 놈들을 식별하는 법을 배울 수 있도록 무(無)에서 유(有)를 창조하듯 훈련 데이터를 만들어낸 것입니다.

결과: 19배의 개선
이 시스템을 테스트했을 때 결과는 놀라웠습니다. Random Forest 모델은 0.966의 F1 스코어0.999의 AUC를 달 achieve 했으며, "탐지 위험"을 단 **2.01%**로 줄였습니다. 이는 기존 방식보다 19배 개선된 수치입니다. 이것이 단순히 운이 아니었음을 증명하기 위해 McNemar 검정을 실시한 결과, 기존 방식이 놓친 실수 1개당 새로운 머신러닝 모델은 107개의 실수를 잡아냈다는 사실이 밝혀졌습니다. 수학적 근거는 매우 명확하여, 이것이 우연히 일어날 확률은 0.001 미만이었습니다.

"집계 마스킹(Aggregation Masking)"의 놀라움
이 논문에서 가장 흥-미로운 발견 중 하나는 저자들이 "집계 마스킹 효과"라고 부르는 현상입니다. 그들은 숫자가 어떻게 시작되어야 하는지(예: 실제 생활에서 숫자의 첫 자리에 1, 2, 3 등이 나타나는 빈도)를 예측하는 **벤포드의 법칙(Benford's Law)**을 테스트했습니다.

330만 개의 개별 거래를 살펴보았을 때, 숫자들은 기묘했고 벤포드의 법칙을 위반했습니다(이는 조작의 징후입니다). 하지만 동일한 거래들을 계좌 요약(account summaries)(예: 하나의 은행 계좌에 대한 모든 거래를 합산하는 것)으로 그룹화하자, 그 기묘함이 사라졌습니다! 숫자들이 완벽하게 정상적으로 보였습니다.

이는 마치 군중을 개별적으로 보면 빨간 모자를 쓴 사람과 파란 모자를 쓴 사람이 보이지만, 멀리서 군중 전체를 찍은 사진을 보면 색들이 섞여서 지루한 회색으로 보이는 것과 같습니다. 연구는 만약 감사인이 "회색 사진"(계좌 요약)만을 본다면, "빨간 모자"(거래 수준의 부정)를 놓치게 된다는 것을 보여주었습니다. 이는 진정으로 부정을 잡기 위해서는 요약된 큰 그림이 아니라 개별 거래를 들여다봐야 함을 시사합니다.

로봇이 스스로 설명할 수 있는가?
AI에 대한 주요 우려 중 하나는 그것이 "블랙박스"라는 점, 즉 답은 주지만 왜 그런 답을 냈는지는 말해주지 않는다는 것입니다. 연구진은 로봇의 수학적 계산을 "감사인 언어"로 번역하는 층을 추가하여 이 문제를 해결했습니다. 시스템은 단순히 "특성 X의 가중치가 높음"이라고 말하는 대신, "이 계좌는 잔액이 1년 만에 847% 급증하여 ISA 520 규정을 위반했기 때문에 경고되었습니다"라고 말합니다.

국가 감사국(National Audit Office)의 실제 감사인들이 이러한 설명들을 검토했을 때, **94%**가 이 설명들이 완벽하며 수정 없이 공식 보고서에 그대로 사용할 수 있다고 답했습니다. 이는 로봇이 단순히 추측하는 것이 아니라, 인간 전문가들이 이해할 수 있는 방식으로 추론하고 있음을 입증합니다.

다른 데이터에도 적용 가능한가?
연구팀은 또한 자신들의 로봇이 별도의 재학습 없이 다른 부문(예: 다른 정부 부처)의 데이터를 처리할 수 있는지 테스트했습니다. 훈련받은 에너지 유틸리티 부문에서 가장 뛰어난 성능을 보였지만, 다른 부문에서도 여전히 기존의 "20% 샘플링" 방식보다 훨씬 우수한 성능을 보이며 대부분의 오류를 잡아냈습니다.

결론
이 논문은 머신러닝이 단순히 미래적인 아이디어가 아니라, 330만 건의 거래를 4.5시간 만에 스캔하고, **거의 완벽한 분리 능력(AUC=0.999)**과 높은 정확도(F1=0.966)로 실수를 찾아내며, 그 결과를 평이한 영어로 설명할 수 있는 실용적인 도구임을 보여줍니다. 또한, 요약된 정보만 보는 것은 충분하지 않으며, 소음 속에 숨어 있는 부정을 잡기 위해서는 아주 세밀한 디테일까지 파고들어야 한다고 경고합니다. 저자들은 이 "슈퍼 스캐너"를 통해 공적 자금의 안전을 높일 수 있도록 시스템을 무료 오픈 소스로 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →