← 最新の論文
🧬 biology

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

本論文は、動物行動分析における意味的エイリアシングの課題に取り組むことで、動画、音声、生理時系列、テキストを融合し、猫の意図認識において最先端の性能を達成する新たなオープンソースの四モーダル大規模言語モデル「Meow-Omni 1」を紹介する。

原著者: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

以下は、論文「Meow-Omni 1」の解説を、創造的なアナロジーを用いた平易な言葉で翻訳したものです。

大きな問題:「猫の心通訳者」のジレンマ

あなたの猫が何を考えているか推測しようとしていると想像してください。猫が喉を鳴らしているのを見ます。それは幸せだからでしょうか?それとも痛みを和らげようとして苦しんでいるのでしょうか?

  • 問題点: 論文はこの現象を**「意味的エイリアシング」**と呼んでいます。これは、文脈によって全く正反対の意味を持つ単語のようなものです。喉を鳴らすことは「愛している」という意味にも、「恐怖している」という意味にもなり、猫の顔(動画)を見ることや音(音声)を聞くことだけでは、その違いを見分けるのに十分ではないことが多いのです。
  • 従来の方法: 以前の AI モデルは、写真だけを見て録音だけを聞く探偵のようなものでした。彼らは猫の内部の身体信号に対して「盲目」でした。彼らは行動(例:「走っている」)を推測することはできましたが、意図(例:「恐ろしいから走っている」対「遊んでいるから走っている」)を推測することはできませんでした。

解決策:Meow-Omni 1

研究者たちは、猫を理解するために設計された新しいタイプの AI 脳、Meow-Omni 1を構築しました。これは単に見て聞くだけでなく、猫の心拍や動きのセンサーに直接つながっている、獣医学部のスーパーインターンのようなものです。

以下に、簡単なアナロジーを用いてその仕組みを説明します。

1. 四つの感覚(クアッドモーダル)

ほとんどの AI モデルは 2 つまたは 3 つの「感覚」しか持っていません。Meow-Omni 1 は 4 つ持っており、論文ではクアッドモーダルと呼ばれています。

  • 目(動画): 猫の動きを観察する。
  • 耳(音声): 鳴き声や喉を鳴らす音を聞く。
  • 声(テキスト): 説明を読み、質問をする。
  • 「内なる感覚」(生体時系列): これが魔法の材料です。心拍数、加速度、身体振動を追跡するスマートウォッチのようなセンサーからの高速データを読み取ります。
    • アナロジー: 人間の探偵が容疑者が走っているのを見ると、「彼は遅刻している」と思うかもしれません。しかし、もし容疑者の心拍数が 180bpm で激しく動いていることを示す心電図モニターを持っていれば、「彼は追われている」と気づきます。Meow-Omni 1 はこの「内なる感覚」を使って、喉を鳴らす猫の謎を解きます。

2. 脳外科手術(アーキテクチャ)

研究者たちはゼロから脳を構築したのではなく、既存の賢い AI(MiniCPM-o)に対して「手術」を行いました。

  • 移植: 彼らは、別のプロジェクト「Intern-S1 Pro」から来たセンサーデータを読み取るのに優れた特殊な「時系列エンコーダー」を取り出し、それを猫用 AI に移植しました。
  • 翻訳者: 彼らは、猫のセンサーからの生々しく高速な数値を、AI の脳が理解できる言語に変換する特別な「投影層」を構築しました。これは、ビデオゲームのキャラクターが外国語を英語に翻訳するようなものです。

3. 訓練(考えることを学ぶ)

この AI は単に事実を暗記したのではなく、推論することを学びました。

  • データセット(Meow-10K): 彼らは AI に 10,831 例の猫のデータを供給しました。各例には、動画、音声、センサーデータの混合と、猫が実際に何を感じているかについての人間の専門家の説明がペアになっています。
  • 目標: 「猫がジャンプしている」と推測するだけでなく、意図を推測するように訓練されました。「猫は遊んでいるからジャンプしている」などです。
  • テスト(MeowBench): 機能するか確認するために、MeowBenchと呼ばれるテストを作成しました。これは多肢選択試験のようなもので、AI は猫のデータを見て、行動の正しい理由を選択肢から選ぶ必要があります。

結果:機能しましたか?

はい、それは大きな成果でした。

  • スコア: Meow-Omni 1 はテストで**71.16%**の精度を記録しました。
  • 競合: それは動画または音声のみを見た既存の最優秀 AI モデルを大幅に上回りました。動画、音声、センサーデータをテキスト記述として見た非常に賢い「オールラウンダー」AI でさえ、わずか 66.89% でした。
  • 教訓: この論文は、猫の心拍を言葉で説明するだけでは不十分であることを証明しています。AI は猫の真の意図を理解するために、生データを直接「感じる」必要があります。

「躊躇」機能(不確実性)

論文が強調する最もクールな点の一つは、AI が混乱をどのように処理するかです。

  • シナリオ: 猫が幸せそうに見える(動画)が、センサーは痛みを示している(生体計測)とします。
  • 従来の AI: 自信を持って一つの答え、おそらく視覚的な方を選び、間違えます。
  • Meow-Omni 1: シグナルが矛盾すると、AI は「不確実」になります。内部の信頼スコアが低下し、「確信が持てない、これらの手がかりは一致しない」と本質的に言います。
  • 重要性: 論文は、これが安全性にとって重要であると示唆しています。AI が確信が持てない場合、危険な誤った答えを出すのではなく、人間獣医が確認するために状況を警告できます。

まとめ

Meow-Omni 1は、猫の心拍や動きのセンサーを単なる背景ノイズではなく、主要な言語として扱う最初の AI です。猫がどのように見えどのように聞こえ内部でどのように感じているかを組み合わせることで、喉を鳴らす猫が幸せなのか痛みを感じているのかというパズルついに解くことができます。著者たちは、コード、データ、モデルを誰でも使用できるように公開しており、獣医や動物研究者が非言語の動物をよりよく理解することを目的としています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →