A Leakage-Free Stacked Ensemble Method for Multiclass Classification
이 논문은 기능적 패턴과 규칙 기반 결정 경계를 효과적으로 통합하여 강건하고 일반화 가능한 다중 클래스 분류를 달성하기 위해, Kolmogorov-Arnold 네트워크와 XGBoost를 엄격한 out-of-fold 전략과 결합한 누수 없는 스택형 앙상블 프레임워크인 LFS-FRAME을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 컴퓨터에게 사진만 보고 다양한 종류의 동물을 인식하도록 가르치려 한다고 상상해 보십시오. 이것은 머신러닝 세계에서 "다중 클래스 분류(multiclass classification)"라고 불리는 고전적인 퍼즐입니다. 이는 마치 학생에게 구슬을 단순히 "빨강"과 "파랑"으로 나누는 것이 아니라, "빨강", "파랑", "초록", "노랑", "보라" 등 여러 색상으로 한꺼번에 분류하도록 요청하는 것과 같습니다. 문제는 어떤 구슬들은 서로 매우 비슷하게 생겼고, 때로는 빨간색 구슬은 엄청나게 많은데 초록색 구슬은 아주 적을 수도 있다는 점입니다.
이 문제를 해결하기 위해 과학자들은 종종 "앙상블 학습(ensemble learning)"을 사용하는데, 이는 "단 한 명의 전문가 대신 위원회의 의견을 묻자"라는 멋진 방법입니다. 판사 패널을 상상해 보십시오. 한 명은 매끄럽고 흐르는 듯한 형태(예: 화가)를 포착하는 데 뛰어나고, 다른 한 명은 엄격하고 단계적인 규칙(예: 탐정)을 따르는 데 뛰어납니다. 이들에게 투표를 요청하면, 단 한 명에게 물었을 때보다 보통 더 나은 답을 얻을 수 있습니다. 하지만 이러한 위원회가 형성되는 방식에는 교활한 함정이 있습니다. 만약 판사들이 훈련되는 동안 정답지를 훔쳐볼 수 있다면, 그들은 패턴을 실제로 배우는 대신 정답을 암기하는 "부정행위"를 하기 시작할 수 있습니다. 이를 "데이터 누수(data leakage)"라고 하며, 이는 컴퓨터가 교실에서는 매우 똑똑해 보이게 만들지만 실제 세상에서는 형편없게 만듭니다.
이 논문은 그 위원회를 구축하는 새로운 방법인 LFS-FRAME을 소개합니다. 저자들인 S. P. Sharmila과 Aruna Tiwari는 두 가지 매우 다른 유형의 컴퓨터 뇌를 결합한 시스템을 만들었습니다. 하나는 복잡한 곡선을 이해하는 데 능숙한 매끄럽고 흐르는 예술가와 같은 **콜모고로프-아르노프 네트워크(Kolmogorov-Arnold Networks, KAN)**에 기반하고, 다른 하나는 날카롭고 명확한 결정을 내리는 데 능숙한 규칙 준수 탐정과 같은 XGBoost에 기반합니다. 이 방법의 마법은 단순히 이 둘을 섞는 것에 있지 않습니다. 그것은 바로 이들을 '훈련시키는 방식'에 있습니다. 그들은 엄격한 "아웃-오브-폴드(out-of-fold)" 전략을 사용하는데, 이는 마치 심판들이 이전에 본 적이 없는 질문들로 연습하게 하여 그들이 속임수를 쓰지 못하게 하는 것과 같습니다. 이를 통해 최종 "대표 판사"(메타 분류기)가 그들의 투표를 결합할 때, 그것이 정직하고 편향되지 않은 의견에 기반하도록 보장합니다.
연구진은 컴퓨터 메모리에 숨겨진 16가지 서로 다른 카테고리의 악성코드(malware)가 포함된 도전적인 데이터셋을 통해 이 새로운 시스템을 테스트했습니다. 그들은 자신들의 "누수 없는(leakage-free)" 팀이 이전 방법들보다 이 까다로운 카테고리들을 분류하는 데 훨씬 더 뛰어났음을 발견했습니다. 기존 기술들은 카테고리 수가 늘어남에 따라 정확도가 떨어지는 데 어려움을 겪었지만, LFS-FRAME은 강력하게 버텼습니다. 16개 클래스를 대상으로 한 테스트에서 이 방법은 **81.74%**의 정확도를 달 기록했으며, 더 넓은 범위인 4개 클래스 테스트에서는 **89.85%**에 도달했습니다. 이는 학습 과정을 정직하게 유지하고 부드러운 학습과 규칙 기반 학습을 결합함으로써, 더 신뢰할 수 있는 데이터를 분류하는 컴퓨터를 구축할 수 있음을 시사합니다.
문제점: 부정행위를 하는 위원회
이 논문이 왜 중요한지 이해하기 위해, 이 논문이 해결하고자 하는 문제를 살펴봅시다. 머신러중에서 "스태킹(stacking)"은 여러 가지 서로 다른 모델의 예측값을 가져와 최종 결정을 내리기 위해 마지막 모델에 입력하는 인기 있는 기술입니다. 이것은 축구 팀과 같습니다. 공격수, 수비수, 골키퍼가 있다고 가정해 봅시다. 당신은 그들에게 "누구를 팀으로 뽑아야 할까?"라고 묻고, 그러면 코치(메타 학습자)가 그들의 답변을 바탕으로 최종 결정을 내립니다.
문제는 코치가 선수들이 '연습하는 동안' 냈던 정답을 사용하여 훈련될 때 발생합니다. 만약 선수들이 코치가 테스트하는 것과 똑같은 질문으로 연습했다면, 그들은 정답을 외워버릴 수 있습니다. 이것이 바로 "데이터 누수"입니다. 코치는 팀이 연습 테스트에서 100%를 맞혔기 때문에 그 팀이 천재라고 생각하지만, 새로운 질문이 나오는 실제 경기에 직면하면 처참하게 실패합니다.
저자들은 많은 기존 스태킹 방식이 이 문제를 겪고 있다고 주장합니다. 그들은 베이스 모델들이 예측해야 할 데이터를 미리 보게 함으로써 점수를 부풀리고 잘못된 안도감을 줍니다. 이는 선택할 수 있는 카테고리가 많은 "다중 클래스" 문제에서 특히 위험합니다. 시스템이 속임수를 쓰고 있다면, 4가지 유형의 악성코드는 잘 잡아내는 것처럼 보일지 몰라도 16가지를 구분해야 할 때는 무너질 수 있습니다.
해결책: "엿보기 금지" 규칙
이 논문은 LFS-FRAME(Leakage-Free Stacked Framework)을 제안합니다. 핵심 아이디어는 간단하지만 강력합니다: 어떤 모델도 자신이 예측해야 할 데이터를 미리 봐서는 안 된다는 것입니다.
그들은 아웃-오브-폴드(Out-of-Fold, OOF) 훈련이라는 기술을 사용하여 이를 달성합니다. 여러분에게 카드 한 덱(데이터)이 있고 이를 5개의 더미(폴드)로 나눈다고 상상해 보십시오.
- 모델을 훈련시키기 위해 4개의 더미를 가져옵니다.
- 5번째 더미는 상자 안에 숨겨둡니다.
- 모델들에게 그 숨겨진 5번째 더미의 카드를 예측하도록 요청합니다. 그들은 이 카드를 본 적이 없으므로, 그들의 예측은 정직합니다.
- 이 과정을 반복하여, 어떤 더미를 숨길지 번갈아 가며 수행함으로써 모든 카드가 오기 전에는 알 수 없었던 모델에 의해 예측되도록 합니다.
이러한 "정직한" 예측들이 최종 "대표 판사"(메타 분류기)를 훈련하는 데 사용됩니다. 대표 판사는 특정 데이터 포인트를 본 적이 없는 모델들이 만든 예측을 바탕으로 훈련되었기 때문에, 데이터 누수가 발생하지 않습니다. 시스템은 암기된 정답에 의존하지 않고 구성원들의 강점을 결합하는 법을 배웁니다.
팀 구성: 예술가와 탐정
저자들은 단순히 훈련 방식만 고친 것이 아닙니다. 그들은 또한 협력할 매우 구체적인 모델 팀을 선정했습니다. 그들은 서로 다른 문제에는 서로 다른 종류의 사고가 필요하다는 것을 깨달았습니다.
- 예술가 (KAN): 그들은 **콜모고로프-아르노프 네트워크(KAN)**를 사용했습니다. KAN을 매끄럽고 흐르는 관계를 이해하는 데 매우 능숙한 예술가라고 생각하십시오. KAN은 변수들이 연속적인 곡선 속에서 어떻게 함께 변화하는지 볼 수 있습니다. 이들은 "큰 그림"과 복잡한 비선형 패턴을 포착하는 데 뛰어납니다. 하지만 때때로 급격하고 갑작스러운 변화나 매우 구체적인 규칙에는 어려움을 겪을 수 있습니다.
- 탐정 (XGBoost): 그들은 결정 트리(decision trees)에 기반한 강력한 도구인 XGBoost를 사용했습니다. XGBoost를 엄격한 체크리스트를 따르는 탐정이라고 생각하십시오. "만약 문이 열려 있다면, 창문을 확인하라. 만약 창문이 깨져 있다면, 경찰을 불러라." 이 모델은 날카롭고 명확한 결정을 내리고 구체적이며 규칙 기반인 패턴을 다루는 데 탁월합니다.
예술가와 탐정을 결합함으로써, 시스템은 양쪽의 장점을 모두 얻게 됩니다. KAN은 데이터의 매끄럽고 복잡한 곡선을 처리하고, XGBoost는 날카롭고 뚜렷한 경계를 처리합니다. "대표 판사"는 예술가의 직관과 탐정의 규칙 사이에서 무게를 어떻게 조절할지 학습하여 최선의 최종 결정을 내립니다.
결과: 효과의 증명
저자들은 컴퓨터 공격의 메모리 데이터가 포함된 CIC-MalMem-2022라는 데이터셋을 통해 새로운 시스템을 테스트했습니다. 그들은 두 가지 버전의 테스트를 만들었습니다: 4개 클래스(넓은 카테고리) 버전과 16개 클래스(매우 구체적인 하위 카테고리) 버전입니다.
그들은 LFS-FRAME을 다음과 같은 기존 방법들과 비교했습니다:
- HyStack Ensemble: 이전의 스태킹 방식.
- Hybrid CNN-BiLSTM: 딥러닝 접근 방식.
- SMOTE-DNN: 데이터의 균형을 맞추려는 방법.
- 하이퍼파라미터 튜닝을 거친 랜덤 포레스트(Random Forest): 고전적인 규칙 기반 방식.
결과는 다음과 같았습니다:
- 4-클래스 테스트: 새로운 방법은 **89.85%**의 정확도를 달성했습니다. 이는 랜덤 포레스트 방식(89.07%)보다 약간 더 높았으며, 딥러닝 방식들보다는 현저히 높았습니다.
- 16-클래스 테스트 (가장 어려운 부분): 이 지점에서 다른 방법들이 무너지기 시작했습니다. 카테고리 수가 증가함에 따라 다른 방법들의 정확도는 급격히 떨어졌습니다.
- HyStack 방식은 4개 클래스에서의 **85.04%**에서 16개 클래스에서는 **70.29%**로 떨어졌습니다.
- 랜덤 포레스트 방식은 **89.07%**에서 **68.2%**로 떨어졌습니다.
- 딥러닝 방식들 역시 60-70% 범위로 떨어지며 고전했습니다.
- 그러나 LFS-FRAME은 자리를 지켰습니다. 16개 클래스 테스트에서 **81.74%**의 정확도를 달성했습니다.
저자들은 이 방법이 성공한 이유가 두 가지라고 제안합니다. 첫째, 데이터 누수를 방지함으로써 시스템이 정답을 외우는 것이 아니라 실제로 패턴을 학습하도록 보장했기 때문입니다. 둘째, KAN의 부드러운 학습과 XGBoost의 규칙 기반 강점을 혼합함으로써, 16개의 서로 다른 카테고리가 주는 복잡성을 혼란 없이 처리할 수 있는 시스템을 만들었기 때문입니다.
왜 중요한가
이 논문은 이 접근 방식이 복잡한 분류 문제를 다루는 데 있어 더 신뢰할 수 있는 방법을 제공한다고 결론짓습니다. 사이버 보안처럼 악성코드가 끊임없이 변화하는 실제 세상에서는, 연구실에서는 똑똑해 보이지만 현장에서는 실패하는 시스템을 가질 여유가 없습니다. "누수 없는" 전략을 사용함으로써, 저자들은 모델이 실제로 얼마나 잘 수행될지에 대한 더 정직한 추정치를 제공하는 프레임워크를 제시합니다.
비록 이 방법은 데이터 누수를 방지하기 위해 모델을 여러 번 다시 훈련시켜야 하는 추가 단계가 필요하므로 더 많은 컴퓨팅 파워를 요구하지만, 저자들은 이 비용이 가치가 있다고 주장합니다. 이는 다른 방법들을 괴롭히는 "과도하게 낙관적인" 결과를 방지하고, 더 견고하며 일반화 가능하고, 실제 세상에 투입될 준비가 된 시스템을 만들어주기 때문입니다. 이 연구는 어려운 다중 클래스 문제에 대해, 엄격하게 정직한 훈련 환경에서 서로 다른 유형의 학습 스타일을 결합하는 것이 승리하는 전략임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.