← 최신 논문
🤖 machine learning

Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining

본 연구는 범용 사전 학습된 오디오 파운데이션 모델이 해양 포유류 및 조류의 발성 속에 깊은 계통 발생학적 관계를 본질적으로 인코딩하고 있음을 입증하며, 분류군별 사전 학습 없이도 수작업으로 제작된 특징량 및 도메인 특화 모델보다 우수한 성능을 보임을 보여준다.

원저자: Víctor Rincón Yepes

게시일 2026-07-27
📖 5 분 읽기🧠 심층 분석

원저자: Víctor Rincón Yepes

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가족 나무의 소리

모든 동물이 저마다의 독특한 목소리를 가진, 거대하고 시끄러운 숲속을 걷고 있다고 상상해 보세요. 어떤 동물은 짹짹거리고, 어떤 동물은 포효하며, 어떤 동물은 복잡한 노래를 부릅니다. 오랫동안 과학자들은 한 가지 의문을 품어왔습니다. 만약 귀를 기울여 듣는다면, 단지 소리만으로 누가 누구와 친척인지 구별할 수 있을까? 이 질문은 두 가지 커다란 과학적 아이디어의 교차점에 놓여 있습니다. 첫 번째는 종이 어떻게 변화하고 수백만 년에 걸쳐 갈라져 나왔는지를 보여주는 이야기인 진화이며, 이는 마치 거대한 나무에 가지가 뻗어 나가는 것과 같습니다. 두 번째는 동물의 소리를 연구하는 생물음향학입니다.

핵심적인 미스터리는 동물의 "가족 나무(계통도)"가 그들의 목소리에 새겨져 있는가 하는 점입니다. 두 종의 소리가 매우 비슷하다면, 그것은 그들이 가까운 사촌이라는 뜻일까요? 아니면 그저 이웃으로서 똑같은 방식으로 소리를 지치는 법을 배운 것뿐일까요? 이 질문에 답하기 위해, 과거의 과학자들은 피치(음높이)나 소리의 "질감" 같은 기본적인 특징을 살펴보기 위해 단순한 도구로 소리를 측정했습니다. 하지만 최근, 컴퓨터는 훨씬 더 똑똑해졌습니다. 이제 우리에게는 "파운데이션 모델(foundation models)"이 있습니다. 이는 수백만 시간의 인간의 언어, 음악, 자연의 소리를 학습한 거대한 AI 프로그램입니다. 이 AI들은 인간의 청취자처럼 소리를 매우 깊고 복잡하게 이해할 수 있습니다. 이 논문이 던지는 핵심 질문은 이것입니다. 동물 가족에 대해 배운 적이 없는 이 초지능형 컴퓨터들이, 소리를 듣는 것만으로 우연히 진화적 관계를 인식하게 되는 것일까?


연구: 가족 나무를 듣다

이 연구에서 연구자들은 현대적인 AI의 "귀"가 동물 가족의 숨겨진 역사를 들을 수 있는지 테스트하기로 했습니다. 그들은 두 가지 매우 다른 그룹의 동물을 살펴보았습니다. 바로 32종의 해양 포유류(고래, 돌고래, 물개 등)와 20종의 조류입니다.

AI 모델을 서로 다른 유형의 탐정이라고 생각해 보세요. 연구자들은 이들에게 방대한 녹음 라이브러리를 건네주며, 서로 다른 종의 소리가 얼마나 "유사한지" 측정하라고 요청했습니다. 그들은 이 소리 유사도 점수를 실제 "가족 나무" 간의 거리(두 종이 공통 조상을 공유한 지 얼마나 오래되었는지 나타내는 시간)와 비교했습니다.

그들은 네 가지 다른 방식으로 소리를 분석했습니다:

  1. 전통적인 방식 (MFCC): 이것은 소리를 측정하기 위해 기본적인 자를 사용하는 것과 같습니다. 사람이 직접 만든 단순한 특징들을 살펴봅니다.
  2. 범용 AI (AST & CLAP): 이들은 자동차 엔진부터 팝송까지 모든 것을 학습한 거대하고 범용적인 AI 모델들입니다. 이들은 동물에 대해 전혀 배우지 않았습니다.
  3. 전문가 AI (BEATs-bio & BirdNET): 이들은 동물의 소리나 새의 울음소리에 특화되어 훈련된 모델들로, 가족 관계를 더 잘 포착할 수 있기를 기대하며 만들어졌습니다.

놀라운 반전: 범용 모델의 승리

결과는 다소 충격적이었습니다. "전통적인 방식"(기본적인 자)은 동물의 소리와 그들의 관계 사이에서 어떤 연결고리도 거의 찾아내지 못했습니다. 그것은 마치 종이의 색깔만 보고 책을 읽으려는 것과 같았으며, 제대로 작동하지 않았습니다.

하지만 범용 AI 모델(인간의 음악과 언어를 학습한 모델)은 놀라운 일을 해냈습니다. 그들은 강력한 신호를 찾아냈습니다. 연구자들이 고래와 돌고래를 조사했을 때, AI는 최근에 갈라진 종들은 서로 더 비슷하게 들리고, 오래전에 갈라진 종들은 매우 다르게 들린다는 것을 알아냈습니다. 실제로 고래 가족의 경우, 이 연결 고리는 믿기 힘들 정도로 강력했습니다.

여기서 반전이 있습니다. 전문가 AI(새나 생물음향에 특화된 모델)는 범용 모델보다 더 나은 성능을 보이지 못했습니다. 사실, 조류의 경우 범용 모델이 전문가 모델보다 가족 나무를 찾는 데 오히려 약간 더 뛰어났습니다. 이 논문은 모델을 동물에 특화하여 훈련시키는 것이 오히려 거시적인 진화적 구조를 보는 데 방해가 될 수 있다고 제안합니다. 아마도 모델이 심층적인 구조보다는 아주 미세한 디테일이나 특정 종의 라벨에 너무 집중하게 만들기 때문일 것입니다.

AI가 실제로 들은 것

연구자들은 AI가 단순히 "큰 동물은 낮은 목소리를 가지고 작은 동물은 높은 목소리를 가진다"와 같은 단순한 특징을 포착하여 속임수를 쓰는 것이 아닌지 확인하고 싶었습니다. 그들은 피치(음높이)를 제거했을 때도 AI가 가족 관계를 찾아내는지 확인하기 위해 특별한 테스트를 수행했습니다. 결과는 아니오였습니다. 피치를 제거한 상태에서도 AI는 여전히 가족 관계를 찾아냈습니다.

이는 AI가 훨씬 더 미묘한 것, 즉 호출의 스타일을 포착하고 있다는 것을 의미합니다. 이는 마치 누군가가 속삭이거나 소리를 지르더라도, 그가 얼마나 크게 말하느냐가 아니라 어떻게 말을 형성하느냐에 따라 가족임을 알아챌 수 있는 것과 같습니다. AI는 진화의 "억양"을 학습한 것입니다.

혼동: 소리가 거짓말을 할 때

연구는 규칙을 증명하는 몇 가지 재미있는 예외 사례들도 발견했습니다.

  • 닮은꼴 타인: 북극곰리드물범(Bearded Seal)과 북극 l고래(Northern Right Whale)는 9천만 년 전에 갈라진 사촌 관계입니다. 그들은 완전히 다르게 들려야 합니다. 하지만 그들은 거의 똑같이 들립니다! AI는 이들이 고대의 낯선 사이임에도 불구하고 소리가 비슷하다는 것을 알아차렸습니다. 이는 아마도 두 종 모두 비슷한 추운 환경에서 살며, 물속을 통해 전달될 수 있는 낮은 저음의 울림 소리를 내야 하기 때문일 것입니다.
  • 다른 목소리의 사촌: 레오파드 물범(Leopard Seal)과 웨델 물범(Weddell Seal)은 불과 1천만 년 전에 갈라진 매우 가까운 사촌입니다. 당연히 비슷하게 들릴 것이라 예상되지만, 그들은 완전히 다르게 들립니다! 한쪽은 복잡하고 음악적인 수중 노래를 부르는 반면, 다른 한쪽은 낮은 으르렁거림을 냅니다.

이러한 예시들은 진화가 소리에 흔적을 남기기는 하지만, 환경이 때로는 동물의 목소리를 너무 많이 변화시켜 서로를 낯선 이처럼 보이게 하거나, 혹은 너무 비슷하게 만들어 가족처럼 보이게 만들 수도 있음을 보여줍니다.

결론

이 논문은 동물의 목소리에 담긴 진화적 역사를 이해하기 위해 반드시 동물 전용 컴퓨터를 만들 필요는 없다는 것을 알려줍니다. 인간 세상의 소리를 학습한 범용 AI 모델들은 이미 동물의 울음소리에 숨겨진 "가족 나무"를 듣는 데 매우 능숙합니다. 이들은 기존의 단순한 도구들보다 뛰어나며, 놀랍게도 동물을 위해 특별히 제작된 모델들보다 더 뛰어난 성능을 보입니다.

연구자들은 비밀이 AI를 동물에 맞춰 훈련시키는 데 있는 것이 아니라, 이러한 범용 모델이 소리의 복잡한 패턴을 이해하도록 설계된 방식에 있다고 제안합니다. 그들은 향후 실험에서 이것이 AI의 뇌 구조 때문인지, 학습 방식 때문인지, 아니면 학습한 소리의 엄청난 다양성 때문인지를 테스트해야 한다고 제안합니다. 하지만 현재로서는 메시지가 명확합니다. 만약 당신이 생명의 역사를 소리로 듣고 싶다면, 당신을 대신해 들어줄 범용 AI에게 부탁하면 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →