← नवीनतम पेपर
🧬 biology

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

यह शोध पत्र Meow-Omni 1 को प्रस्तुत करता है, जो एक नवीन ओपन-सोर्स क्वाड-मोडल लार्ज लैंग्वेज मॉडल है जो पशु व्यवहार विश्लेषण में सिमेंटिक एलियासिंग (semantic aliasing) की चुनौती को संबोधित करते हुए, बिल्ली के इरादों की पहचान करने के लिए वीडियो, ऑडियो, फिजियोलॉजिकल टाइम-सीरीज और टेक्स्ट को फ्यूज करके स्टेट-ऑफ-द-आर्ट फeline इंटेंट रिकग्निशन प्राप्त करता है।

मूल लेखक: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Meow-Omni 1" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "बिल्ली की भाषा समझने वाला" दुविधा (The "Cat Whisperer" Dilemma)

कल्पना कीजिए कि आप अनुमान लगाने की कोशिश कर रहे हैं कि आपकी बिल्ली क्या सोच रही है। आप उसे गुर्राते (purring) हुए देखते हैं। क्या वह खुश है? या वह दर्द में है और खुद को शांत करने की कोशिश कर रही है?

  • समस्या: पेपर इसे "सेमेंटिक एलियासिंग" (Semantic Aliasing) कहता है। यह वैसा ही है जैसे एक शब्द के संदर्भ के आधार पर दो बिल्कुल विपरीत अर्थ हो सकते हैं। एक 'पुर्र' (purr) का मतलब "मैं तुमसे प्यार करता हूँ" भी हो सकता है और "मैं डरा हुआ हूँ" भी, और केवल बिल्ली के चेहरे (वीडियो) को देखकर या उसकी आवाज़ (ऑडियो) सुनकर अंतर करना अक्सर पर्याप्त नहीं होता।
  • पुराना तरीका: पिछले AI मॉडल उन जासूसों की तरह थे जो केवल फोटो देखते थे या रिकॉर्डिंग सुनते थे। वे बिल्ली के आंतरिक शारीरिक संकेतों के प्रति "अंधे" थे। वे क्रिया का अनुमान तो लगा सकते थे (जैसे, "दौड़ना"), लेकिन वे इरादे (intent) का अनुमान नहीं लगा सकते थे (जैसे, "डर के मारे दौड़ना" बनाम "खेलने के लिए दौड़ना")।

समाधान: Meow-Omni 1

शोधकर्ताओं ने Meow-Omni 1 बनाया है, जो विशेष रूप से बिल्लियों को समझने के लिए डिज़ाइन किया गया एक नया प्रकार का AI मस्तिष्क है। इसे एक पशु चिकित्सा विद्यालय (veterinary school) के सुपर-इंटर्न के रूप में सोचें, जो न केवल देखता और सुनता है, बल्कि जिसके पास बिल्ली के दिल की धड़कन और मूवमेंट सेंसर तक सीधी पहुँच भी है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. चार इंद्रियां (Quad-Modal)

अधिकांश AI मॉडल में केवल दो या तीन "इंद्रियां" होती हैं। Meow-Omni 1 में चार हैं, जिसे पेपर में क्वाड-मोडल (Quad-Modal) कहा गया है:

  • आंखें (वीडियो): बिल्ली को चलते-फिरते देखना।
  • कान (ऑडियो): म्याऊं-म्याऊं और 'पुर्र' की आवाज़ सुनना।
  • आवाज़ (टेक्स्ट): विवरण पढ़ना और प्रश्न पूछना।
  • "आंतरिक इंद्रिय" (जैविक टाइम-सीरीज/Biological Time-Series): यह जादुई सामग्री है। यह सेंसर (जैसे बिल्लियों के लिए स्मार्टवॉच) से उच्च-गति डेटा पढ़ता है जो हृदय गति, त्वरण (acceleration) और शरीर के कंपन को ट्रैक करता है।
    • उपमा: यदि कोई मानव जासूस किसी संदिग्ध को भागते हुए देखता है, तो वह सोच सकता है कि "वह देर से पहुँच रहा है।" लेकिन यदि उसके पास एक हार्ट मॉनिटर भी है जो दिखा रहा है कि संदिग्ध का दिल 180 bpm की रफ्तार से धड़क रहा है, तो उसे एहसास होगा, "उसका पीछा किया जा रहा है।" Meow-Omni 1 इस 'पुर्र' करने वाली बिल्ली के रहस्य को सुलझाने के लिए इसी "आंतरिक इंद्रिय" का उपयोग करता है।

2. ब्रेन सर्जरी (Architecture)

शोधकर्ताओं ने शून्य से मस्तिष्क नहीं बनाया; उन्होंने एक मौजूदा स्मार्ट AI (MiniCPM-o) पर "सर्जरी" की।

  • ट्रांसप्लांट: उन्होंने एक विशेष "टाइम-सीरीज एनकोडर" (एक उपकरण जो 'Intern-S1 Pro' नामक दूसरे प्रोजेक्ट के सेंसर डेटा को पढ़ने में कुशल है) लिया और उसे बिल्ली वाले AI में ग्राफ्ट (जोड़) कर दिया।
  • अनुवादक (The Translator): उन्होंने एक विशेष "प्रोजेक्शन लेयर" बनाई जो एक अनुवादक की तरह काम करती है। यह बिल्ली के सेंसरों से आने वाले कच्चे, तेज़-तर्रार नंबरों को लेती है और उन्हें ऐसी भाषा में बदल देती है जिसे AI का मस्तिष्क समझ सके, ठीक वैसे ही जैसे एक वीडियो गेम का पात्र विदेशी भाषा को अंग्रेजी में अनुवाद करता है।

3. प्रशिक्षण (सोचना सीखना)

AI ने केवल तथ्य याद नहीं किए; इसने तर्क करना सीखा।

  • डेटासेट (Meow-10K): उन्होंने AI को 10,831 उदाहरण दिए। प्रत्येक उदाहरण में वीडियो, ध्वनि और सेंसर डेटा का मिश्रण शामिल था, जिसे एक मानव विशेषज्ञ के स्पष्टीकरण के साथ जोड़ा गया था कि बिल्ली वास्तव में क्या महसूस कर रही थी।
  • लक्ष्य: केवल यह अनुमान लगाने के बजाय कि "बिल्ली कूद रही है," AI को इरादे का अनुमान लगाने के लिए प्रशिक्षित किया गया था: "बिल्ली खेल रही है क्योंकि वह कूद रही है।"
  • परीक्षण (MeowBench): यह देखने के लिए कि क्या यह काम करता है, उन्होंने MeowBench नामक एक परीक्षण बनाया। यह एक बहुविकल्पीय परीक्षा (multiple-choice exam) की तरह है जहाँ AI को बिल्ली के डेटा को देखना होता है और विकल्पों की सूची में से उसके व्यवहार का सही कारण चुनना होता है।

परिणाम: क्या यह काम आया?

हाँ, और यह एक बड़ी उपलब्धि थी।

  • स्कोर: Meow-Omni 1 ने परीक्षण में 71.16% सटीकता प्राप्त की।
  • प्रतिस्पर्धा: इसने मौजूदा सर्वश्रेष्ठ AI मॉडलों (जो केवल वीडियो या ऑडियो देखते थे) को काफी बड़े अंतर से पीछे छोड़ दिया। यहाँ तक कि एक बहुत ही स्मार्ट "ऑल-राउंडर" AI भी, जो वीडियो, ऑडियो और सेंसर डेटा को टेक्स्ट विवरण के रूप में देखता था, केवल 66.89% ही प्राप्त कर सका।
  • सबक: यह पेपर साबित करता है कि आप केवल शब्दों में बिल्ली की हृदय गति का वर्णन नहीं कर सकते; बिल्ली के वास्तविक इरादे को समझने के लिए AI को सीधे कच्चे डेटा को "महसूस" करने की आवश्यकता होती है।

"हिचकिचाहट" की विशेषता (अनिश्चितता/Uncertainty)

एक बहुत ही दिलचस्प चीज़ जिसे पेपर हाइलाइट करता है, वह है कि AI भ्रम की स्थिति को कैसे संभालता है।

  • परिदृश्य: कल्पना कीजिए कि एक बिल्ली खुश दिख रही है (वीडियो) लेकिन उसके सेंसर दर्द (बायोमेट्रिक्स) दिखा रहे हैं।
  • पुराना AI: वह आत्मविश्वास के साथ एक उत्तर चुन लेगा, शायद दृश्य (visual) वाले को, और गलत साबित होगा।
  • Meow-Omni 1: जब संकेत आपस में टकराते हैं, तो AI "अनिश्चित" हो जाता है। उसका आंतरिक विश्वास स्कोर गिर जाता है, और वह मूल रूप से कहता है, "मुझे यकीन नहीं है, ये सुराग मेल नहीं खा रहे हैं।"
  • यह क्यों महत्वपूर्ण है: पेपर सुझाव देता है कि सुरक्षा के लिए यह महत्वपूर्ण है। यदि AI अनिश्चित है, तो वह एक खतरनाक गलत उत्तर देने के बजाय मामले को मानव पशु चिकित्सक (vet) की जांच के लिए फ्लैग कर सकता है।

सारांश

Meow-Omni 1 पहला ऐसा AI है जो बिल्ली की हृदय गति और मूवमेंट सेंसर को केवल बैकग्राउंड शोर के रूप में नहीं, बल्कि एक प्राथमिक भाषा के रूप में मानता है। बिल्ली कैसा दिखती है, कैसी सुनाई देती है, और आंतरिक रूप से कैसा महसूस करती है, इसे मिलाकर, यह अंततः इस पहेली को सुलझा सकता है कि 'पुर्र' करने वाली बिल्ली खुश है या दर्द में। लेखकों ने इसका कोड, डेटा और मॉडल सभी के उपयोग के लिए जारी कर दिया है, जिसका उद्देश्य पशु चिकित्सकों और पशु शोधकर्ताओं को गैर-मौखिक जानवरों को बेहतर ढंग से समझने में मदद करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →