← 최신 논문
📄 animal behavior and cognition

FERAL: A Supervised Video-Understanding System for Direct Video-to-Behavior Mapping

FERAL은 전통적인 키포인트 추적의 한계를 우회하면서도 훨씬 적은 학습 데이터로 최신 베이스라인 모델들을 능가하며, 다양한 종과 규모에 걸쳐 가공되지 않은 비디오를 프레임 단위의 행동 레이블로 직접 매핑하는 지도 학습 기반의 오픈 소스 비디오 이해 시스템입니다.

원저자: Skovorodnikov, P., Razzauti, J., Costelloe, B. R., Buck, F., Chandra, V., Frank, D. D., Kay, T., Koger, B., Snir, O., Zhao, J., Couzin, I. D., Kronauer, D. J. C., Vosshall, L. B.

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Skovorodnikov, P., Razzauti, J., Costelloe, B. R., Buck, F., Chandra, V., Frank, D. D., Kay, T., Koger, B., Snir, O., Zhao, J., Couzin, I. D., Kronauer, D. J. C., Vosshall, L. B.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

컴퓨터에게 동물이 놀거나, 싸우거나, 혹은 그냥 쉬고 있는 영상을 이해하도록 가르치려 한다고 상상해 보세요. 수년 동안 이 작업을 수행하는 표준적인 방식은 매우 엄격하고 까다로운 감독과 같았습니다. 먼저, 모든 프레임마다 모든 동물의 신체 관절에 보이지 않는 "스티커"(키포인트)를 붙여야 했습니다. 그러고 나서 이 막대기 인형 형태의 골격 데이터를 컴퓨터에 입력하고, 그 관절들이 어떻게 움직이는지를 바탕으로 컴퓨터가 동물의 행동을 추측하기를 바랐던 것입니다.

문제는 이렇습니다. 만약 동물이 잎사귀 뒤로 숨거나, 다른 동물에 의해 가려지거나, 조명이 이상해지면 이 "스티커"들이 떨어져 나갑니다. 그러면 컴퓨터는 혼란에 빠지고 시스템 전체가 무너집니다. 이는 마치 꼭두각시의 줄만 보고 춤 동작을 이해하려는 것과 같습니다. 줄이 엉키면 무용수가 실제로 무엇을 하고 있는지 전혀 알 수 없게 됩니다.

여기 FERAL(Feature Extraction for Recognition of Animal Locomotion)이 등장합니다. FERAL을 꼭두각시 인형술사가 아니라, 꼭두각시 쇼 자체를 건너뛰고 직접 관람하는 아주 똑똑한 영화 평론가라고 생각해보세요. FERAL은 막대기 인형 대신 원본 비디오의 픽셀을 직접 봅니다. 색상, 모양, 움직임 등 장면 전체를 관찰하며, "아, 저건 쥐가 몸을 다듬는(grooming) 모습이구나"라거나 "저건 개미 떼가 먹이를 찾아 습격하는 것이구나"라고 말하는 법을 배웁니다.

중대한 발견
핵심적인 발견은 FERAL이 원본 비디오를 행동 라벨로 직접 매핑할 수 있으며, 그 정확도가 놀라울 정도로 높다는 점입니다. Feral은 종종 기존의 "막대기 인형" 기반 시스템들을 능가합니다. 마우스의 사회적 행동을 식별하는 CalMS21이라는 주요 테스트에서, FERAL은 94.2%(평균 정밀도 mAP로 측정)의 점수를 기록했습니다. 이는 구글의 VideoPrism을 포함한 이전의 최고 성능 모델들보다 높은 수치입니다. 더 멋진 점은 무엇일까요? FERAL은 VideoPrism이 필요로 했던 학습 데이터의 단 **25%**만을 사용하고도 이 성과를 냈다는 것입니다. 이는 마치 교과서의 4분의 1만 읽고도 전체를 다 읽은 학생보다 더 좋은 성적으로 시험을 통과한 학생과 같습니다.

FERAL이 거부하는 것들
이 논문은 FERAL이 무엇이 아닌지에 대해서도 명확히 밝히고 있습니다. FERAL은 행동을 이해하기 위해 반드시 신체 부위를 추적(자세 추정, pose estimation)해야 한다는 생각을 명시적으로 부정합니다. 저자들은 관절을 먼저 찾는 작업이, 특히 복잡하고 실제적인 환경에서는 종종 막다른 길에 다다르는 일이라고 주장합니다. 또한 FERAL은 지도 학습(supervised) 도구라는 점을 분명히 합니다. 즉, 명시적으로 가르친 것만을 학습한다는 뜻입니다. 스스로 새로운 미지의 행동을 발견할 수는 없습니다. 만약 당신이 "땅 파기"가 무엇인지 알려주지 않는다면, FERAL은 그 카테고리를 스스로 만들어내지 못하며, 단지 그것을 "배경"이나 다른 무언가로 추측할 뿐입니다. FERAL은 탐정이 아니라 번역가입니다.

얼마나 확실한가요?
저자들은 단순한 시뮬레이션이 아니라 실제 실험을 통한 확고한 수치로 자신감을 뒷받침합니다. 그들은 다양한 종을 대상으로 FERAL을 테스트했습니다:

  • 생쥐: 사회적 상호작용에 있어 기존의 최고 모델들을 능가했습니다.
  • 개미: 개미들이 붐비거나 서로를 가리고 있는 상황에서도, 군집이 "습격"을 가거나 성체가 새끼를 돌보는(grooming) 상황을 정확히 식별했습니다.
  • 벌레와 파리: 앞으로 기어가기, 뒤로 가기, 회전하기 등을 정확하게 추적했습니다.
  • 야생 얼룩말: 이 부분이 정말 놀랍습니다. 케냐에서 드론 영상을 사용하여 얼룩말의 "경계(vigilance)"(머리를 들고 가만히 서 있는 상태)를 포착했습니다. 기존의 자세 기반 시스템은 드론의 탑다운 뷰(위에서 내려다보는 시점) 때문에 목의 각도를 파악할 수 없어 실패를 거듭하며 거의 동전 던지기 수준인 0.50 근처의 점수를 기록했습니다. 반면, 장면 전체를 보는 FERAL은 0.785의 매크로 F1 점수를 기록하며 카메라 각도가 까다로운 상황에서도 작동함을 증명했습니다.
  • 침팬지와 고릴라: 야생 PanAf500 데이터셋에서 FERAL은 **90.8%**의 top-1 정확도를 달성하며, 테스트된 다른 모든 영장류 분석 방법들을 앞질렀습니다.

베일 뒤의 "마법"
FERAL은 "파운데이션 모델"(100만 시간 이상의 인터넷 영상을 사전 학습한 거대 AI)을 사용하여 작동합니다. 이것을 모든 영화를 이미 다 본 학생이 빛, 그림자, 움직임의 일반적인 원리를 알고 있는 상태라고 생각해보세요. 연구진들은 이 모델의 24개 층 중 상위 12개 층을 특정 동물 영상으로 "미세 조정(fine-tuning)"했습니다. 이는 일반적인 영화 평론가에게 동물 행동에 대한 속성 과정을 제공하는 것과 같습니다.

또한 FERAL은 놀라울 정도로 효율적이라는 것을 발견했습니다. 이를 실행하기 위해 슈퍼컴퓨터가 필요하지 않습니다. 표준적인 고성능 소비자용 그래픽 카드(예: RTX 5090)에서 1시간 분량의 영상을 처리하는 데 약 4.6분밖에 걸리지 않습니다. 실시간보다 빠릅니다!

결론
FERAL은 실험실 안에서만 작동하는 것이 아니라, 무질서하고 예측 불가능한 실제 세상에서도 작동합니다. 붐비는 장면, 이상한 조명, 그리고 숨어버리는 동물들을 모두 처리할 수 있습니다. FERAL은 과학자들이 지루하게 막대기 인형을 그리는 작업을 건너뛰고, 동물이 실제로 무엇을 하고 있는지 바로 이해할 수 있게 해주는 도구입니다. 모든 문제를 해결하는 마법 지팡이는 아닙니다(여전히 행동을 라벨링할 인간의 손길이 필요합니다). 하지만 FERAL은 동물 행동 연구를 더 빠르고, 저렴하며, 이전에는 불가능했던 곳에서도 가능하게 만드는 거대한 도약입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →