← Nieuwste papers
🧬 biology

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

Het artikel introduceert Meow-Omni 1, een nieuw open-source quad-modaal groot taalmodel dat video, audio, fysiologische tijdreeksen en tekst combineert om state-of-the-art herkenning van kattenintenties te bereiken door de uitdaging van semantische aliasing in de analyse van dierlijk gedrag aan te pakken.

Oorspronkelijke auteurs: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Het Grote Probleem: Het "Kattenfluisteraar"-Dilemma

Stel je voor dat je probeert te raden waar je kat over denkt. Je ziet hem spinnen. Is hij blij? Of heeft hij pijn en probeert hij zichzelf te troosten?

  • Het Probleem: Het paper noemt dit "Semantische Aliasering". Het is alsof een woord twee volledig tegenovergestelde betekenissen heeft, afhankelijk van de context. Een spinnen kan betekenen "Ik hou van je" of "Ik ben verschrikkelijk bang", en alleen naar het gezicht van de kat kijken (video) of naar het geluid luisteren (audio) is vaak niet genoeg om het verschil te zien.
  • De Oude Manier: Vorige AI-modellen waren als detectives die alleen naar foto's keken of naar opnames luisterden. Ze waren "blind" voor de interne lichaamssignalen van de kat. Ze konden de actie raden (bijvoorbeeld "rennen"), maar ze konden de intentie niet raden (bijvoorbeeld "rennen omdat hij bang is" versus "rennen omdat hij speelt").

De Oplossing: Meow-Omni 1

De onderzoekers bouwden Meow-Omni 1, een nieuw type AI-brein dat specifiek is ontworpen om katten te begrijpen. Denk hierbij aan een super-intern op een veterinair instituut die niet alleen kijkt en luistert, maar ook een directe lijn heeft naar de hartslag en bewegingssensoren van de kat.

Hier is hoe het werkt, met eenvoudige analogieën:

1. De Vier Zintuigen (Quad-Modaal)

De meeste AI-modellen hebben slechts twee of drie "zintuigen". Meow-Omni 1 heeft er vier, wat het paper Quad-Modaal noemt:

  • Ogen (Video): Kijken hoe de kat beweegt.
  • Oren (Audio): Luisteren naar miauwen en spinnen.
  • Stem (Tekst): Beschrijvingen lezen en vragen stellen.
  • Het "Interne Zintuig" (Biologische Tijdsreeksen): Dit is het magische ingrediënt. Het leest hoogwaardige data van sensoren (zoals een smartwatch voor katten) die hartslag, versnelling en lichaamstrillingen volgen.
    • Analogie: Als een menselijke detective een verdachte ziet rennen, denkt hij misschien "hij is te laat". Maar als ze ook een hartmonitor hebben die laat zien dat het hart van de verdachte op 180 slagen per minuut slaat, beseffen ze: "Hij wordt achtervolgd." Meow-Omni 1 gebruikt dit "interne zintuig" om het mysterie van de spinnende kat op te lossen.

2. De Hersenoperatie (Architectuur)

De onderzoekers bouwden geen brein van scratch; ze voerden "chirurgie" uit op een bestaande slimme AI (MiniCPM-o).

  • De Transplantatie: Ze namen een gespecialiseerde "tijdsreeks-encoder" (een tool die goed is in het lezen van sensordata uit een ander project genaamd Intern-S1 Pro) en graften deze in de katten-AI.
  • De Vertaler: Ze bouwden een speciale "projectielaag" die fungeert als vertaler. Deze neemt de ruwe, snelle getallen van de sensoren van de kat en zet ze om in een taal die het brein van de AI kan begrijpen, net zoals een videospelkarakter een vreemde taal vertaalt naar het Engels.

3. De Training (Leren Denken)

De AI heeft niet alleen feiten uit het hoofd geleerd; het heeft leren redeneren.

  • De Dataset (Meow-10K): Ze voerden de AI 10.831 voorbeelden van katten. Elk voorbeeld bevatte een mix van video, geluid en sensordata, gekoppeld aan een uitleg van een menselijk expert over wat de kat eigenlijk voelde.
  • Het Doel: In plaats van alleen maar te raden "De kat springt", werd de AI getraind om de intentie te raden: "De kat springt omdat hij speelt."
  • De Test (MeowBench): Om te zien of het werkte, creëerden ze een test genaamd MeowBench. Het is als een meerkeuzetoets waarbij de AI naar de data van een kat moet kijken en de juiste reden voor zijn gedrag moet kiezen uit een lijst met opties.

De Resultaten: Werkte Het?

Ja, en het was een groot nieuws.

  • De Score: Meow-Omni 1 behaalde 71,16% nauwkeurigheid op de test.
  • De Wedstrijd: Het versloeg de beste bestaande AI-modellen (die alleen naar video of audio keken) met een aanzienlijke marge. Zelfs een zeer slimme "all-rounder" AI die naar video, audio en sensordata keek als tekstbeschrijvingen, haalde slechts 66,89%.
  • De Les: Het paper bewijst dat je het hartkloppen van een kat niet alleen in woorden kunt beschrijven; de AI moet de ruwe data direct "voelen" om de ware intentie van de kat te begrijpen.

De "Aarzeling"-Functie (Onzekerheid)

Een van de coolste dingen die het paper benadrukt, is hoe de AI omgaat met verwarring.

  • Het Scenario: Stel je voor dat een kat er blij uitziet (video), maar zijn sensoren zeggen dat hij pijn heeft (biometrie).
  • Oude AI: Zou zelfverzekerd één antwoord kiezen, waarschijnlijk de visuele, en het fout hebben.
  • Meow-Omni 1: Wanneer de signalen conflicteren, wordt de AI "onzeker". Zijn interne zekerheidsscore daalt en hij zegt in feite: "Ik weet het niet zeker, deze aanwijzingen kloppen niet."
  • Waarom het belangrijk is: Het paper suggereert dat dit cruciaal is voor veiligheid. Als de AI het niet zeker weet, kan hij de situatie markeren voor een menselijk dierenarts om te controleren, in plaats van een gevaarlijk fout antwoord te geven.

Samenvatting

Meow-Omni 1 is de eerste AI die het hartkloppen en bewegingssensoren van een kat behandelt als een primaire taal, en niet alleen als achtergrondruis. Door te combineren hoe de kat eruitziet, klinkt en intern aanvoelt, kan het eindelijk het raadsel oplossen of een spinnende kat blij is of pijn heeft. De auteurs hebben de code, de data en het model vrijgegeven voor iedereen om te gebruiken, met als doel dierenartsen en dierenonderzoekers te helpen niet-verbale dieren beter te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →