← 최신 논문
🤖 AI

A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification

본 논문은 이질적인 오디오 분류 작업에서 최첨단 계층적 F1 점수를 달画하기 위해 CLAP 기반 표현, 증강된 학습 데이터, 그리고 KNN 기반 후처리를 활용하는 DCASE 2026 챌린지용 다중 분기 계층 인식 프레임워크를 제시한다.

원저자: Beile Ning, Jiayi Yu, Zitong Wang, Yufei Hu, Wenjun Xu, Yuanhang Qian, Zhongxin Bai, Gongping Huang

게시일 2026-07-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Beile Ning, Jiayi Yu, Zitong Wang, Yufei Hu, Wenjun Xu, Yuanhang Qian, Zhongxin Bai, Gongping Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 북적이는 도시를 걷고 있다고 상상해 보세요. 당신의 귀는 사이렌 소리, 개 짖는 소리, 창문을 때리는 빗소리, 그리고 환호하는 군중의 소리 등 혼란스러운 소리의 향연에 노출되어 있습니다. 당신의 뇌는 단순히 '소음'을 듣는 것이 아니라, 이 소리들을 즉각적으로 머릿속의 파일 분류함에 분류합니다. 뇌는 사이렌 소리가 '비상 차량'(상위 레벨)이며, 구체적으로는 '경찰차'(두 번째 레벨)라는 것을 알고 있습니다.

DCASE 2026 챌린지는 컴퓨터에게 바로 이 작업을 수행하도록 요구했습니다. 즉, 무질서한 실제 세계의 오디오 녹음을 듣고 이를 특정 '광범적 음향 분류 체계(Broad Sound Taxonomy, BST)'로 분류하는 것입니다. 핵심은 컴퓨터가 특정 소리를 정확히 맞히는 동시에, 그 소리가 올바른 큰 카테로리에 속하는지도 확인해야 한다는 점이었습니다. 만약 '경찰차'라고 추측했다면, 실수로 그것을 '새 소리'라고 불러서는 안 됩니다.

우슈 대학교(Wuhan University) 팀이 이 챌린지에서 우승하기 위해 어떻게 이들의 '슈퍼 리스너(super-listener)'를 구축했는지, 쉬운 비유를 통해 설명해 드립니다.

1. 핵심 두뇌: "CLAP" 번역기

이 시스템의 중심에는 CLAP이라 불리는 사전 학습된 AI가 있습니다. CLAP을 수백만 권의 책을 읽고 수백만 곡의 노래를 들은 다국어 통역사라고 생각해보세요. CLAP은 오디오를 텍스트와 연결함으로써 소리의 '의미'(예: "이것은 파티 소리 같다")를 이해합니다.

하지만 CLAP은 일반론적인 성격이 강합니다. 큰 개념은 잘 파악하지만, 매우 유사한 두 소리를 구별하는 데 필요한 아주 미세하고 구체적인 디테일은 놓칠 때가 있습니다. 팀은 이 일반론적인 모델에게 전문화된 도구 세트를 제공해야 했습니다.

2. 특화된 도구: 세 가지 다른 "귀"

CLAP이 디테일을 들을 수 있도록 돕기 위해, 팀은 세 가지 특화된 '음향 분지(acoustic branches)'를 추가했습니다. 당신의 메인 두뇌에 서로 다른 주파수에 맞춰진 세 쌍의 추가 귀를 달아준다고 상상해 보세요.

  • Log-Mel 귀: 이 귀는 악기의 *음높이(pitch)*와 *음색(timbre)*을 듣는 음악가와 같습니다. 소리의 '형태'를 인식하는 데 탁월합니다.
  • MFCC 귀: 이 귀는 언어의 구조를 분석하는 언어학자와 같습니다. 소리를 그 구성 요소 단위로 분해합니다.
  • Log-STFT 귀: 이 귀는 소리의 파동을 찍는 고속 카메라와 같습니다. 시간의 흐름에 따른 소리의 급격한 변화를 포착합니다.

마법 같은 지점: 팀은 단 하나만 선택하지 않았습니다. 세 가지 '귀'가 모두 소리를 듣게 한 다음, 그 의견들을 CLAP의 '두뇌'와 결합했습니다. 결과적으로 Log-STFT 귀가 독자적으로 가장 민감한 청취자로 나타났으며, 핵심적인 역할을 수행했습니다.

3. 훈련 장소: 더 크고 깨끗한 도서관

시스템을 가르치기 위해서는 방대한 양의 소리 예시 도서관이 필요했습니다.

  • 문제점: 원래의 도서관(BSD10k)은 훌륭했지만 규모가 다소 작았습니다. 그들은 두 번째로 더 큰 도서관(BSD35k)을 발견했지만, 그곳은 엉망이었습니다. 마치 어떤 책은 제목이 잘못 달려 있거나 신뢰할 수 없는 저자가 쓴 책들이 섞여 있는 도서관과 같았습니다.
  • 해결책: 그들은 BSD-Grand라는 새로운 도서관을 만들었습니다. 그들은 엄격한 사서처럼 행동했습니다.
    • 그들은 '저자(업로더)'를 확인하여 동일한 소리를 1,000번씩 스팸처럼 올리지 않았는지 검사했습니다.
    • '교사 모델(teacher model)'을 사용하여 레이블을 재검토하고, 제목이 틀린 책들은 폐기했습니다.
    • 결과: 잘못된 데이터 때문에 혼란을 겪지 않도록 돕는, 더 깨в고, 더 크며, 더 다양한 훈련 세트를 구축했습니다.

4. 규칙집: 계층을 인식하는 사고방식

이 챌린지는 AI가 소리의 '가계도(family tree)'를 존중하도록 요구했습니다.

  • 평면적 접근 방식: 이는 특정 카테고리를 모른 채 단순히 23개의 구체적인 정답만을 암기하는 학생과 같습니다. 이 학생은 '경찰차'를 맞혔더라도, 그것이 '비상 차량'에 속한다는 사실을 깨닫지 못할 수 있습니다.
  • 계층적 접근 방식: 팀은 AI에 '규칙집'을 심어주었습니다. 그들은 두 가지 전략을 사용했습니다.
    1. 전역 분류기 (Global Classifier): AI는 5개의 큰 그룹과 23개의 작은 그룹을 동시에 학습합니다. 이는 마치 학생이 단원의 제목과 세부 단락을 동시에 공부하는 것과 같습니다.
    2. 지역 분류기 (LCL): AI는 먼저 큰 카테고리를 결정한 다음, 범위를 좁혀 구체적인 소리를 선택합니다. 만약 큰 카테고리가 '자연'이라고 판단했다면, '교통' 관련 소리는 아예 고려 대상에서 제외합니다. 이는 어처구니없는 실수를 방지합니다.

5. 최종 다듬기: "KNN" 이웃 감시단

학습이 끝난 후에도 AI는 때때로 망설였습니다. 이를 해결하기 위해 팀은 KNN (K-Nearest Neighbors) 후처리 단계를 추가했습니다.

  • 비유: AI가 어떤 소리가 '고양이'인지 '강아지'인지 확신하지 못한다고 가정해 봅시다. 맹목적으로 추측하는 대신, AI는 자신의 '기억 저장소'에 있는 훈련 소리들을 살펴봅니다. 현재 소리와 가장 유사한 10개의 소리를 찾는 것입니다. 만약 그 이웃 중 9개가 '고양이'였다면, AI는 자신의 추측을 '고양이'로 업데이트합니다.
  • 지식 증류 (Knowledge Distillation): 그들은 또한 이 '이웃 감시단' 로직을 학습 도중에도 사용하여 AI를 가르쳤습니다. 즉, "이웃들이 어떻게 생각하는지 보고, 그들과 일치하도록 노력하라"고 말하는 것과 같습니다.

결과: 그들은 어떻게 해냈는가?

팀은 단일 모델부터 투표를 통해 결정을 내리는 '위원회' 형태의 모델까지 총 네 가지 버전의 시스템을 제출했습니다.

  • 베이스라인 (Baseline): 개선 사항이 적용되지 않은 시작점은 **78.45%**였습니다.
  • 최고의 단일 모델: "Log-STFT 귀"와 "이웃 감시단"을 사용했을 때, 점수는 **80.84%**로 뛰어올랐습니다.
  • 앙상블 (위원회): 그들의 가장 뛰어난 시스템은 Log-STFT 귀, Log-Mel 귀, 평면 분류기, 그리고 지역 분류기를 하나의 슈퍼 팀으로 결합한 것이었습니다. 이들의 투표 결과를 평균함으로써, 그들은 **81.25%**라는 점수를 달성했습니다.

요약하자면:
이 팀은 새로운 종류의 청각을 발명한 것이 아닙니다. 대신 일반적인 AI(CLAP)에게 전문화된 귀를 달아주고, 훈련용 도서관을 정비하며, 논리적인 소리의 가계도를 따르도록 강제하고, 최종 결정을 내리기 전에 '이웃'에게 자문을 구하게 함으로써 더 똑똑한 시스템을 구축했습니다. 이러한 조합을 통해 그들은 세상의 혼란스러운 소리들을 높은 정확도로 분류할 수 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →