← 최신 논문
💻 computer science

Machine Learning versus Deep Learning for Public Financial Report Classification and Popularity Prediction: A Feasibility Study on Ghana's Controller and Accountant-General's Department

본 타당성 조사 결과는 가나 회계감사국(Controller and Accountant-General's Department)의 재무 보고서를 대상으로 고전적 머신러닝 및 딥러닝 모델의 성능을 평가하였으며, 미세 조정된 XGBoost가 완벽한 카테고리 분류를 달성했음에도 불구하고 후속 절제 연구(ablation study)를 통해 키워드 특징이 이러한 결과를 크게 부풀렸음을 입증함으로써, 공공 부문 맥락에서 이러한 도구를 배포하기 전 엄격한 특징 검증이 필수적임을 강조하였다.

원저자: Emmanuel Osei-Dwomoh, Gabriel Osei Forkuo

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Emmanuel Osei-Dwomoh, Gabriel Osei Forkuo

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

전 세계 정부들은 재정 기록을 온라인에 게시하는 비중을 점점 더 높이고 있습니다. 이러한 변화는 시민과 감사관들이 직접 사무실을 방문하지 않고도 공공 자금이 어떻게 사용되는지 볼 수 있도록 투명성을 가져오기 위한 것입니다. 그러나 이러한 디지털 아카이브가 성장함에 따라 관리하기가 어려워지고 있습니다. 단일 정부 부처가 몇 년에 걸쳐 연간 예산 보고서부터 급여 회보에 이르기까지 수백 개의 문서를 발표할 수도 있습니다. 이러한 파일들을 수동으로 분류하는 것은 느리고 오류가 발생하기 쉬우며, 사람들이 실제로 읽고 싶어 하는 보고서가 무엇인지 파악하는 것은 훨씬 더 어렵습니다. 이를 해결하기 위해 기관들은 컴퓨터가 대신 분류하고 예측해주기를 기대하고 있습니다. 여기서 머신러닝이 등장합니다. 머신러닝은 문서 제목의 단어와 같은 데이터의 패턴을 인식하여 "이것은 급여 보고서이다" 또는 "이 보고서는 자주 다운로드될 것이다"와 같은 결정을 내리는 데 학습하는 컴퓨터 프로그램입니다. 하지만 함정이 있습니다. 이러한 프로그램들은 잘 학습하기 위해 보통 수천 개의 사례를 필요로 합니다. 정부 부처가 불과 수백 개의 문서만을 보유하고 있을 때, 이러한 스마트한 도구들이 실제로 작동할 수 있을지, 아니면 단순히 운 좋은 지름길에 기반해 추측하고 있는 것인지는 불분명합니다.

가나의 컨트롤러 및 회계사 총괄국(Controller and Accountant-General's Department)은 방대한 양의 공공 재정 보고서를 보유하고 있습니다. 두 명의 연구자, 에마누엘 오세이 드워모(Emmanuel Osei-Dwomoh)와 가브리엘 오세이 포쿠오(Gabriel Osei Forkuo)는 자동화된 도구가 이 특정 컬렉션을 정리하고 그 인기도를 예측할 수 있는지 테스트하기로 했습니다. 그들은 2019년에서 2024년 사이에 발표된 131개의 공식 보고서를 수집했습니다. 이 문서들은 계정 과목 판본부터 국제 회계 기준 자료에 이르기까지 모든 것을 포함했습니다. 연구자들은 이 작업을 처리하기 위해 두 가지 다른 유형의 컴퓨터 모델을 구축하고자 했습니다. 첫 번째 유형은 인간 분석가가 "budget"이라는 단어가 몇 번 나타나는지 세거나 파일 길이를 기록하는 것과 같이 구체적인 단서 목록을 정교하게 만드는 "고전적" 머신러닝에 의존했습니다. 두 번째 유형은 "딥러닝"을 사용했는데, 이는 컴퓨터가 인간의 도움 없이 스스로 패턴을 찾기 위해 제목과 설명의 원시 텍스트를 문자 단위로 읽는 더 복잡한 접근 방식입니다. 그들은 이 모델들을 세 가지 특정 작업, 즉 보고서를 올바른 카테고리로 분류하는 것, 보고서가 평균보다 많이 다운로드될지 추측하는 것, 그리고 정확한 다운로드 횟수를 예측하는 것에 대해 테스트했습니다.

결과는 놀라웠으며, 이 시스템들이 학습하는 방식에 숨겨진 함정을 드러냈습니다. 연구자들이 처음에 테스트를 실행했을 때, 고전적 머신러닝 모델은 완벽해 보였습니다. 그것은 테스트 그룹의 모든 보고서를 올바른 카테고리로 정확히 분류하여 결점 없는 점수를 달랐습니다. 딥러닝 모델 또한 이 작업에서 매우 우수한 성능을 보였습니다. 그러나 연구자들은 이 완벽한 점수가 컴퓨터가 보고서의 내용을 진정으로 이해했기 때문이 아니라 다른 이유가 있을 것이라고 의심했습니다. 그들은 고전적 모델에게 제공된 단서들에 카테고리 이름과 거의 동일한 특정 키워드들이 포함되어 있다는 점을 발견했습니다. 예를 들어, 보고서 제목이 "2024 Payroll Circular(2024 급여 회보)"라면, 모델은 "payroll이라는 단어가 존재함"이라는 플래그를 받게 됩니다. 카테고리가 "Payroll(급여)"이기 때문에, 모델은 사실 시작하기도 전에 답을 이미 알고 있었던 셈입니다.

이를 증명하기 위해 연구자들은 해당 특정 키워드 단서들을 제거하고 다시 테스트를 진행했습니다. 완벽한 점수는 사라졌습니다. 모델의 정확도는 크게 떨어졌지만, 여전히 꽤 괜찮은 수준에는 머물렀습니다. 이는 초기 성공이 주로 지름길 때문이었음을 확인시켜 주었습니다. 즉, 보고서들이 제목에 자신의 카테고리 이름을 포함하고 있었던 것입니다. 텍스트를 직접 읽는 딥러닝 모델들 역시 이 지름길을 찾아냈고 유사하게 높은 점수를 기록했는데, 이는 원시 텍스트 자체가 답을 포함하고 있었음을 입증하며, 반드시 문서의 구조에 대한 깊은 이해를 의미하는 것은 아니라는 점을 보여주었습니다. 연구자들이 다른 작업들을 살펴보았을 때, 상황은 변했습니다. 어떤 보고서가 인기가 있을지 예측하는 것은 훨씬 더 어려웠습니다. 고전적 모델들은 약 4분의 3의 확률로 인기 있는 보고서를 정확히 식별하며 합리적인 성능을 보인 반면, 딥러닝 모델들은 더 고전했습니다. 딥러닝 모델들은 또한 이상한 행동을 보였습니다. 연구자들이 모델에게 더 많은 학습 시간을 주어 "미세 조정(fine-tuning)"을 시도했을 때, 성능이 오히려 저하되었습니다. 이는 이처럼 적은 양의 문서 컬렉션에서는 복잡한 딥러닝 모델이 너무 민감하여 일반적인 규칙을 배우기보다는 훈련 데이터를 암기하기 시작했음을 시사합니다.

이 연구는 이와 같은 작은 정부 아카이브의 경우, 더 복잡한 딥러닝 시스템보다 단순한 고전적 머신러닝 도구가 더 나은 시작점이라고 결-론 내립니다. 이러한 단순한 도구들은 이해하기 쉽고 데이터가 제한적일 때 무너질 가능성이 적습니다. 그러나 연구자들은 이 도구들을 사용하는 사람이라면 누구나 지름길에 의존하지 않도록 주의해야 한다고 경고합니다. 만약 모델이 제목에 "Payroll"이라는 단어가 나타난다는 이유로 카테고리를 인식하도록 훈련된다면, 새로운 보고서가 다른 용어를 사용할 때 완전히 실패할 수 있기 때문입니다. 이 연구의 가장 정직한 교훈은, 컴퓨터가 이러한 재정 기록을 정리하는 데 도움을 줄 수는 있지만, 아직 마법은 아니라는 점입니다. 컴퓨터는 데이터가 명확하고 단서가 진실할 때 가장 잘 작동하지만, 작고 불완전한 데이터셋에서는 그들의 인상적인 점수가 때때로 진정한 이해의 결여를 숨길 수 있습니다. 연구자들은 정부 포털이 이러한 시스템을 배포하기 전에, 모델이 단순히 라벨을 복사하는 것이 아니라 올바른 것을 배우고 있는지 엄격하게 테스트해야 한다고 제언합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →