← 최신 논문
🧬 biology

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

본 논문은 동물 행동 분석에서의 의미적 동의어 혼란 문제를 해결하여 최첨단 고양이 의도 인식을 달성하기 위해 비디오, 오디오, 생리학적 시계열 데이터, 텍스트를 융합한 새로운 오픈소스 4 모달 대규모 언어 모델인 Meow-Omni 1 을 소개합니다.

원저자: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

다음은 "Meow-Omni 1" 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 번역한 것입니다.

큰 문제: "고양이 속마음 통역사" 딜레마

고양이가 무엇을 생각하고 있는지 추측해 보려 한다고 상상해 보세요. 고양이가 골골송을 하고 있습니다. 행복해서 그런 걸까요? 아니면 고통을 받아 스스로 달래기 위해 그런 걸까요?

  • 문제점: 이 논문은 이를"의미적 앨리어싱 (Semantic Aliasing)"이라고 부릅니다. 이는 문맥에 따라 완전히 반대되는 두 가지 의미를 가지는 단어와 같습니다. 골골송은 "너를 사랑해"라는 뜻일 수도 있고 "너무 무서워"라는 뜻일 수도 있으며, 고양이의 얼굴 (영상) 을 보거나 소리 (오디오) 를 듣는 것만으로는 그 차이를 구분하기 어렵습니다.
  • 옛날 방식: 이전 AI 모델들은 사진만 보거나 녹음만 듣는 탐정들과 같았습니다. 그들은 고양이의 내부 신체 신호에 대해 "맹목"이었습니다. 행동 (예: "달리기") 을 추측할 수는 있었지만, 의도 (예: "무서워서 달리는 것" 대 "놀면서 달리는 것") 를 추측할 수는 없었습니다.

해결책: Meow-Omni 1

연구진들은 고양이를 이해하도록 특별히 설계된 새로운 유형의 AI 뇌인 Meow-Omni 1을 개발했습니다. 이는 단순히 보고 듣는 것을 넘어, 고양이의 심박수와 움직임 센서에 직접 연결된 수의학교의 수퍼 인턴과 같습니다.

다음은 간단한 비유를 통해 작동 방식을 설명한 것입니다:

1. 네 가지 감각 (Quad-Modal)

대부분의 AI 모델은 두세 가지 "감각"만 가지고 있습니다. Meow-Omni 1 은 논문에서 Quad-Modal이라고 부르는 네 가지를 갖추고 있습니다:

  • 눈 (영상): 고양이의 움직임을 관찰합니다.
  • 귀 (오디오): 야옹음과 골골송을 듣습니다.
  • 목소리 (텍스트): 설명을 읽고 질문을 합니다.
  • "내부 감각" (생체 시계열 데이터): 이것이 마법의 재료입니다. 심박수, 가속도, 신체 진동을 추적하는 (고양이용 스마트워치 같은) 센서로부터 고속 데이터를 읽습니다.
    • 비유: 인간 탐정이 용의자가 달리는 것을 보면 "그가 늦었나 보다"라고 생각할 수 있습니다. 하지만 용의자의 심박수가 분당 180 회로 뛰고 있다는 심박수 모니터를 함께 본다면, "그가 쫓기고 있구나"라고 깨닫습니다. Meow-Omni 1 은 이 "내부 감각"을 사용하여 골골송을 부르는 고양이의 수수께끼를 풉니다.

2. 뇌 수술 (아키텍처)

연구진들은 처음부터 뇌를 새로 만든 것이 아니라, 기존의 똑똑한 AI(MiniCPM-o) 에 "수술"을 가했습니다.

  • 이식: 그들은 다른 프로젝트 (Intern-S1 Pro) 에서 센서 데이터를 읽는 데 특화된 "시계열 인코더 (time-series encoder)"라는 도구를 가져와 고양이 AI 에 이식했습니다.
  • 번역기: 그들은 특수한 "프로젝션 레이어 (projection layer)"를 구축하여 번역기 역할을 하게 했습니다. 이는 고양이의 센서에서 나오는 날것의 고속 숫자 데이터를 AI 뇌가 이해할 수 있는 언어로 변환하는 것으로, 비디오 게임 캐릭터가 외국어를 영어로 번역하는 것과 같습니다.

3. 훈련 (생각하는 법 학습)

이 AI 는 단순히 사실을 외운 것이 아니라 추론하는 법을 배웠습니다.

  • 데이터셋 (Meow-10K): 그들은 AI 에게 10,831 개의 고양이 사례를 학습시켰습니다. 각 사례는 영상, 소리, 센서 데이터가 혼합되어 있으며, 인간 전문가가 고양이가 실제로 무엇을 느끼고 있는지에 대한 설명과 짝을 이루고 있습니다.
  • 목표: 단순히 "고양이가 점프하고 있다"라고 추측하는 대신, AI 는 의도를 추측하도록 훈련되었습니다: "고양이가 점프하는 것은 놀고 있기 때문이다."
  • 테스트 (MeowBench): 이것이 작동하는지 확인하기 위해 MeowBench라는 테스트를 만들었습니다. 이는 AI 가 고양이의 데이터를 보고 행동의 올바른 이유를 여러 옵션 중에서 선택해야 하는 객관식 시험과 같습니다.

결과: 효과가 있었을까요?

네, 큰 성과였습니다.

  • 점수: Meow-Omni 1 은 테스트에서 **71.16%**의 정확도를 기록했습니다.
  • 경쟁: 영상이나 오디오만 본 기존 최상위 AI 모델들을 압도적인 차이로 능가했습니다. 영상, 오디오, 센서 데이터를 텍스트 설명으로만 본 매우 똑똑한 "올라운더" AI 조차 66.89% 만 기록했습니다.
  • 교훈: 이 논문은 고양이의 심박수를 말로 설명하는 것만으로는 부족하며, AI 가 고양이의 진정한 의도를 이해하려면 날것의 데이터를 직접 "느껴야" 함을 증명합니다.

"주저함" 기능 (불확실성)

이 논문이 강조하는 가장 멋진 점 중 하나는 AI 가 혼란을 어떻게 처리하는지입니다.

  • 상황: 고양이가 행복해 보이지만 (영상), 센서는 고통을 받고 있다고 말합니다 (생체 데이터).
  • 옛날 AI: 시각적 정보를 바탕으로 한 가지 답을 자신 있게 선택하여 틀릴 가능성이 높습니다.
  • Meow-Omni 1: 신호가 충돌할 때 AI 는 "불확실해집니다." 내부 신뢰 점수가 떨어지고, 본질적으로 "확실하지 않아, 이 단서들은 맞지 않아"라고 말합니다.
  • 중요성: 논문은 이것이 안전에 중요하다고 제안합니다. AI 가 불확실하면 위험한 잘못된 답변을 주는 대신 상황을 인간 수의사가 확인하도록 플래그를 표시할 수 있습니다.

요약

Meow-Omni 1은 고양이의 심박수와 움직임 센서를 단순한 배경 소음이 아닌 주요 언어로 취급하는 최초의 AI 입니다. 고양이가 어떻게 보이는지, 어떻게 들리는지, 그리고 내부적으로 어떻게 느껴지는지를 결합함으로써, 골골송을 부르는 고양이가 행복한지 고통을 받고 있는지라는 퍼즐을 마침내 해결할 수 있습니다. 저자들은 코드, 데이터, 모델을 누구나 사용할 수 있도록 공개하여 수의사들과 동물 연구자들이 비언어적 동물을 더 잘 이해하도록 돕는 것을 목표로 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →