← 최신 논문
🧬 biology

YAPAT — An Open-Source Platform for Active and Weakly Supervised Annotation of Passive Acoustic Monitoring Data

YAPAT은 온톨로지 기반 레이블링, 다중 레이블 능동 학습, 그리고 이중 콜드 스타트 메커니즘을 통합하여 전문가의 노력을 줄이고 고품질의 상호 운용 가능한 데이터셋을 생성함으로써 수동 음향 모니터링 데이터의 대규모 주석 작업을 효율화하는 오픈 소스 기반 웹 플랫폼입니다.

원저자: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

게시일 2026-07-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thiago S. Gouvêa, Rida Saghir, Prathmesh P. Doddanawar, Novruz Mammadli, Pratik P. Sitapara, Hannes Kath, Daniel Sonntag

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

자연계를 멈추지 않고 방송되는 거대한 24시간 라디오 스테이션이라고 상상해 보세요. 음악 대신 개구리, 새, 곤충, 그리고 고래의 노래가 흘러나옵니다. 과학자들은 수동 음향 모니터링(Passive Acoustic Monitoring, PAM) 장치라고 불리는 특수한 마이크를 사용하여 며칠, 몇 주, 또는 몇 년 동안 이 소리들을 녹음합니다. 이것은 연구자들이 발을 들이거나 동물을 겁주지 않고도 전체 생태계의 소리를 들을 수 있게 해준다는 점에서 자연을 이해하는 데 있어 일종한 초능력입니다. 하지만 여기에는 거대한 문제가 있습니다. 마이크가 녹음하는 오디오 양이 너무 많아서, 인간이 그 소리를 듣고 기록하기에는 파일이 너무 거대한 산처럼 쌓여버린다는 점입니다. 이는 마치 도시 규모의 도서관에 있는 모든 책을 읽으려고 노력하는 것과 같지만, 그 책들이 소리로 만들어져 있는 것과 같습니다.

이 문제를 해결하기 위해 과학자들은 컴퓨터의 도움을 받아 듣습니다. 하지만 컴퓨터는 자신이 학습한 예시만큼만 똑똑할 수 있습니다. 컴퓨터에게 특정 개구리 울음소리를 인식하도록 가르치려면, 먼저 인간 전문가가 수천 개의 녹음 파일을 듣고 "네, 이것은 개구리입니다" 또는 "아니요, 이것은 그냥 바람 소리입니다"라고 라벨을 붙여야 합니다. 이 과정은 느리고, 지루하며, 비용이 많이 듭니다. 만약 전문가들이 라벨을 붙이는 데 너무 바쁘다면, 컴퓨터는 학습할 수 없고, 산더미 같은 오디오 데이터는 쓸모없는 상태로 방치됩니다. 이 분야의 핵심적인 질문은 이것입니다: 어떻게 하면 인간이 모든 초 단위의 소리를 먼저 듣지 않고도, 컴퓨터가 이 방대한 사운드 아카이브로부터 스스로 학습하게 할 수 있을까?

여기에서 YAPAT(Yet Another PAM Annotation Tool)라고 불리는 새로운 도구가 등장합니다. YAPAT을 자연의 소리를 위한 하이테크 인터랙티브 탐정 게임이라고 생각해보세요. 인간이 모든 녹음 파일을 하나씩 듣도록 강요하는 대신, YAPAT은 힘든 작업을 대신 수행하기 위해 컴퓨터 기술의 영리한 조합을 사용합니다. 우선 긴 오디오 파일을 3초 길이의 아주 작은 클립들로 나눕니다. 그런 다음, 사전 학습된 "두뇌"(BirdNET라고 불림)를 사용하여 각 클립을 고유한 디지털 지문으로 변환합니다.

마법은 YAPAT이 인간 전문가를 돕는 방식에서 일어납니다. 당신이 이 모든 소리 지문들이 모여 있는 거대한 지도를 보고 있다고 상상해 보세요. YAPAT은 단순히 무작위 목록을 보여주는 것이 아니라, 스마트한 가이드 역할을 합니다. 레이블링할 데이터가 전혀 없는 상태에서도 시작할 수 있도록 세 가지 주요 방법을 제공합니다:

  1. "닮은꼴" 검색 (The "Look-alike" Search): 특정 동물의 명확한 녹음 파일 하나를 가지고 있다면, 그것을 업로드할 수 있습니다. 그러면 YAPAT은 즉시 당신의 방대한 아카이브 내에서 그와 유사하게 들리는 다른 모든 3초 클립들을 찾아내어, 한꺼번에 많은 양의 클립을 라벨링할 수 있게 해줍니다.
  2. "파일 단위" 추측 (The "File-Level" Guess): 만약 특정 동물이 그 파일 안에 있었다는 사실은 알지만, 정확히 '언제'였는지는 모르는 녹음 폴더를 가지고 있다면, YAPAT은 "약한 감독(weak supervision)" 기법을 사용하여 파일 내에서 동물이 노래하는 위치를 추측할 수 있습니다. 이는 파티 사진을 보고 군중의 에너지에 따라 누가 춤을 추고 있는지 추측하는 것과 같습니다. 비록 직접 댄스 플로어를 촬영하지 않았더라도 말이죠.
  3. "스마트 분류" (The "Smart Sort"): 컴퓨터가 학습을 시작하면, 더 이상 무작위 클립을 보여주지 않습니다. 대신, 컴퓨터가 가장 '혼란스러워하는' 클립이나, 이미 알고 있는 것과 가장 다른 클립을 보여주는 특별한 점수 시스템을 사용합니다. 이를 통해 인간 전문가는 쉽거나 지루한 예시에 시간을 낭비하는 대신, 컴퓨터를 가장 잘 가르칠 수 있는 클립에 집중할 수 있습니다.

또한 YAPAT은 이러한 소리 라벨을 공식적인 과학적 사전(온톨로지)에 연결하여, 과학자가 "나무 개구리"라고 말할 때 그것이 전 세계 모든 사람에게 동일한 의미를 갖도록 보장하며, 데이터가 미래의 연구를 위해 재사용 가능하게 만듭니다.

이 논문은 YAPAT을 이 모든 기능들을 한곳에 모아놓은 웹 기반 플랫폼으로 제시합니다. 저자들은 이 시스템을 30,000개 이상의 개구리 소리 클립이 포함된 AnuraSet이라는 실제 데이터셋으로 테스트했습니다. 그 결과, 시스템이 인터랙티브하게 작동할 만큼 충분히 빠르다는 것을 발견했습니다. 예를 들어, 유사한 소리를 검색하는 데는 수천 개의 클립이 있더라도 1초 미만이 걸립니다. 새로운 패턴을 인식하도록 컴퓨터를 훈련시키는 데는 표준 컴퓨터에서 단 몇 초, 성능이 좋은 컴퓨터에서는 그보다 더 빠른 시간만 소요됩니다. 이 시스템은 오픈 소스로 설계되어, 누구나 다운로드하여 자신의 서버에 설치하고 자신만의 사운드 아카이브를 정리하기 시작할 수 있습니다.

저자들은 YAPAT이 강력한 도구이긴 하지만, 모든 것을 즉시 해결해 주는 마법 지팡이는 아니라는 점을 주의 깊게 언급합니다. YAPAT은 원래 새를 위해 학습된 "BirdNET" 두뇌에 의존하므로, 추가적인 조정 없이는 모든 유형의 동물(예: 박쥐나 고래)에 대해 완벽하지 않을 수 있습니다. 또한, 현재 시스템은 소리를 고정된 3초 단위로 자르기 때문에, 소리가 잘린 경계 부분에서 발생할 경우 정확히 몇 밀리초에 시작하고 끝나는지를 정밀하게 짚어낼 수 없습니다. 그러나 스마트 검색, 약한 감독, 그리고 능동 학습(active learning)을 결합함으로써, YAPAT은 거대하고 관리 불가능한 오디오 아카이브와 과학자들이 지구의 생물 다양성을 이해하는 데 필요한 고품질의 라벨링된 데이터 사이의 간극을 성공적으로 메워줍니다. 이는 모든 것을 들어야 하는 불가능한 과업을 인간과 컴퓨터가 협력하여 자연의 노래를 해독하는 관리 가능한 협동 게임으로 바꾸어 놓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →