Animal behavioral analysis and neural encoding with transformer-based self-supervised pretraining
यह शोध पत्र BEAST को प्रस्तुत करता है, जो एक स्केलेबल सेल्फ-सुपरवाइज्ड फ्रेमवर्क है जो विविध प्रजातियों में न्यूनतम लेबल वाले डेटा के साथ सटीक व्यवहार विश्लेषण, पोज़ एस्टीमेशन और एक्शन सेगमेंटेशन को सक्षम करने के लिए मास्क्ड ऑटोएनकोइंग और टेम्पोरल कॉन्ट्रास्टिव लर्निंग का उपयोग करके विजन ट्रांसफॉर्मर्स को प्री-ट्रेन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप केवल कंडक्टर के हाथ की गतिविधियों को सुनकर एक जटिल ऑर्केस्ट्रा को समझने की कोशिश कर रहे हैं। आप संगीत (मस्तिष्क की गतिविधि) को जानते हैं, लेकिन आपको यह पता लगाने की आवश्यकता है कि कंडक्टर वास्तव में क्या कर रहा है (जानवर का व्यवहार) ताकि आप समझ सकें कि वे वह संगीत कैसे बना रहे हैं।
लंबे समय से, जानवरों के व्यवहार का अध्ययन करने वाले वैज्ञानिक एक बाधा में फंसे हुए थे। उनके पास चूहों, मछलियों और अन्य जानवरों के हजारों घंटों के वीडियो फुटेज हैं, लेकिन उन्हें समझने के लिए, उन्हें हर एक फ्रेम को मैन्युअल रूप से लेबल करना पड़ता था। यह वैसा ही है जैसे किसी नई भाषा को सीखने के लिए आपके पास एक शिक्षक हो जो आपके लिए हर एक शब्द का अनुवाद करता हो। यह धीमा है, महंगा है, और यह सीमित करता है कि हम कितना सीख सकते हैं।
यह पेपर BEAST (BEhavioral Analysis via Self-supervised pretraining of Transformers) पेश करता है, जो एक नया AI टूल है जो न्यूरोसाइंटिस्टों के लिए एक "सुपर-इंटर्न" की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:
1. समस्या: "लेबलिंग बॉटलनेक" (Labeling Bottleneck)
जानवरों के व्यवहार के वीडियो को उन किताबों के एक विशाल पुस्तकालय के रूप में सोचें जो ऐसी भाषा में लिखी गई हैं जिसे अभी तक कोई नहीं जानता।
- पुराना तरीका: किसी किताब को समझने के लिए, एक इंसान को हर वाक्य का अनुवाद करने के लिए बैठना पड़ता था (हर फ्रेम को लेबल करना)। इसमें बहुत समय लगता था।
- सीमा: क्योंकि लेबलिंग करना बहुत कठिन था, वैज्ञानिक अपने पास मौजूद डेटा के केवल एक बहुत छोटे हिस्से का ही अध्ययन कर पाते थे। वे उस "बड़ी तस्वीर" को देखने से चूक रहे थे।
2. समाधान: BEAST का "स्व-अध्ययन" (Self-Study) तरीका
BEAST एक प्रकार का AI है जो बिना किसी शिक्षक के किताबें पढ़कर सीखता है। यह "सेल्फ-सुपरवाइज्ड लर्निंग" नामक तकनीक का उपयोग करता है।
कल्पना कीजिए कि एक छात्र को छेद वाले खाली फ्लैशकार्डों का एक ढेर दिया गया है।
- मास्क्ड ऑटोएनकोडर (The "Fill-in-the-Blanks" Game): AI एक वीडियो फ्रेम को देखता है, लेकिन कोई उसे एक काले बॉक्स के साथ 75% तक ढक देता है। AI को अनुमान लगाना होता है कि काले बॉक्स के नीचे क्या है, जो कि उन छोटे हिस्सों के आधार पर है जिन्हें वह देख सकता है। यह AI को जानवर के फर, मूंछों और मुद्रा के विवरण को सीखने के लिए मजबूर करता है, ठीक वैसे ही जैसे आप आँखों और नाक को याद रखकर एक चेहरे को सीखते हैं, भले ही मुँह ढका हुआ हो।
- टेम्पोरल कॉन्ट्रास्टिव लर्निंग (The "Spot the Difference" Game): AI को एक फ्रेम दिखाया जाता है, और फिर उससे पूछा जाता है कि वह कौन सा फ्रेम है जो उसके तुरंत बाद आता है। AI सीखता है कि आगे की ओर दौड़ते चूहे का रूप, स्थिर खड़े चूहे से थोड़ा अलग दिखता है। यह AI को केवल स्थिर चित्रों के बारे में ही नहीं, बल्कि गति और समय के बारे में भी सिखाता है।
इन दोनों खेलों को हजारों घंटों के अनलेबल (unlabeled) वीडियो पर एक साथ खेलकर, BEAST "जानवर की गति क्या दिखती है" का एक विशाल आंतरिक शब्दकोश बनाता है।
3. प्रतिफल: तीन महाशक्तियाँ (Three Superpowers)
एक बार जब BEAST ने वीडियो का "अध्ययन" कर लिया, तो वैज्ञानिक इसका उपयोग तीन विशिष्ट कार्यों के लिए कर सकते हैं, और वे इसे पुराने तरीकों की तुलना में बेहतर करते हैं:
क. मस्तिष्क की गतिविधि का अनुमान लगाना (The "Mind Reader")
- लक्ष्य: वैज्ञानिक जानना चाहते हैं: "यदि चूहा अपनी मूंछ इस तरह हिलाता है, तो उसके मस्तिष्क में क्या हो रहा है?"
- पुराना तरीका: उन्हें मूंछ के सिरे को मैन्युअल रूप से ट्रैक करना पड़ता था (जैसे चलते हुए लक्ष्य पर बिंदु बनाना)। यदि फर बिखरा हुआ था, तो बिंदु गलत हो जाता था, और मस्तिष्क का अनुमान विफल हो जाता था।
- BEST का तरीका: BEAST पूरे वीडियो को देखता है और गति के संदर्भ (context) को समझता है। यह मस्तिष्क की गतिविधि का अधिक सटीक रूप से अनुमान लगाता है क्योंकि यह केवल एक बिंदु को नहीं, बल्कि पूरी "कहानी" को देखता है। यह एक अभिनेता के हाथ को ट्रैक करने के बजाय पूरे दृश्य को देखकर एक फिल्म को समझने जैसा है।
ख. शरीर के अंगों को ट्रैक करना (The "Super Tracker")
- लक्ष्य: हर क्षण में चूहे के पंजे, नाक या पूंछ का सटीक स्थान ट्रैक करना।
- पुराना तरीका: AI को यह सिखाने के लिए हजारों लेबल किए गए उदाहरणों की आवश्यकता थी कि पंजे कहाँ हैं।
- BEAST का तरीका: क्योंकि BEEST पहले से ही वीडियो का "अध्ययन" कर चुका था, इसे बाकी सब सीखने के लिए केवल कुछ ही उदाहरणों (जैसे 100 फ्रेम) की आवश्यकता है। यह उस छात्र की तरह है जिसने पूरी पाठ्यपुस्तक पढ़ ली है और उसे अब केवल परीक्षा के एक अभ्यास प्रश्न को हल करने की आवश्यकता है। यह अजीब जानवरों जैसे मछली पर भी काम करता है या जब दो चूहे लड़ रहे हों (जो पुराने AI को भ्रमित कर देता है)।
ग. व्यवहार को काटना और जोड़ना (The "Editor")
- लक्ष्य: स्वचालित रूप से पहचानना कि चूहा कब ग्रूमिंग (सफाई) कर रहा है, सो रहा है, या लड़ रहा है।
- पुराना तरीका: वैज्ञानिकों को मैन्युअल रूप से व्यवहारों के चारों ओर बॉक्स बनाना पड़ता था या जटिल पोज़-ट्रैकिंग पर निर्भर रहना पड़ता था।
- BEAST का तरीका: BEAST वीडियो को देख सकता है और कह सकता है, "आह, यह 5 सेकंड का क्लिप 'ग्रूमिंग' है, और यह 'जांच-पड़ताल' है।" यह बीच के माध्यम को पूरी तरह से छोड़ देता है। यह एक वीडियो एडिटर की तरह है जो बिना किसी स्क्रिप्ट की आवश्यकता के अपने आप दृश्यों में फिल्म को काट देता है।
4. यह क्यों महत्वपूर्ण है
सबसे रोमांचक बात यह है कि BEAST अनलेबल डेटा (वीडियो के विशाल, अप्रयुक्त पहाड़ों जो लैब्स के पास पहले से हैं) को सोने में बदल देता है।
- छोटे लैब्स के लिए: अब आपको वीडियो लेबल करने के लिए 20 लोगों की टीम की आवश्यकता नहीं है। आप बस कच्चे वीडियो को BEEST को दे सकते हैं, और यह सारा भारी काम कर देता है।
- बड़े विज्ञान के लिए: यह शोधकर्ताओं को व्यवहार को उन तरीकों से अध्ययन करने की अनुमति देता है जो पहले असंभव थे, जिससे इस बात के छिपे हुए संबंध सामने आते हैं कि एक जानवर क्या करता है और उसका मस्तिष्क क्या सोच रहा है।
संक्षेप में: BEEST एक स्मार्ट AI है जो घंटों के कच्चे वीडियो को देखकर खुद को सिखाता है कि जानवर कैसे चलते हैं। एक बार जब यह सीख जाता है, तो यह वैज्ञानिकों को पहले की तुलना में बहुत तेज़ी से, सस्ते में और अधिक सटीकता के साथ मस्तिष्क के रहस्यों को डिकोड करने में मदद करता है। यह कच्चे वीडियो के "शोर" (noise) को समझ के स्पष्ट "सिग्नल" (signal) में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।