YAPAT — An Open-Source Platform for Active and Weakly Supervised Annotation of Passive Acoustic Monitoring Data
YAPAT एक ओपन-सोर्स, वेब-आधारित प्लेटफॉर्म है जो विशेषज्ञ के प्रयास को कम करने और उच्च-गुणवत्ता वाले, इंटरऑपरेबल डेटासेट तैयार करने के लिए ऑन्टोलॉजी-ग्राउंडेड लेबलिंग, मल्टी-लेबल एक्टिव लर्निंग और ड्यूल कोल्ड-स्टार्ट मैकेनिज्म को एकीकृत करके पैसिव एकॉस्टिक मॉनिटरिंग डेटा के बड़े पैमाने पर एनोटेशन को सुव्यवस्थित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि प्राकृतिक दुनिया एक विशाल, 24 घंटे चलने वाले रेडियो स्टेशन की तरह है जो कभी रुकता नहीं है। संगीत के बजाय, यह मेंढकों, पक्षियों, कीटों और व्हेल के गीतों को प्रसारित करता है। वैज्ञानिक आवाज़ों को रिकॉर्ड करने के लिए विशेष माइक्रोफ़ोन का उपयोग करते हैं, जिन्हें पैसिव अकॉस्टिक मॉनिटरिंग (PAM) इकाइयाँ कहा जाता है, ताकि वे दिनों, हफ्तों या वर्षों तक आवाज़ों को रिकॉर्ड कर सकें। यह प्रकृति को समझने के लिए एक सुपरपावर है क्योंकि यह शोधकर्ताओं को बिना वहां कदम रखे या जानवरों को डराए, पूरे पारिस्थितिकी तंत्र को सुनने की अनुमति देता है। हालाँकि, एक बहुत बड़ी समस्या है: ये माइक्रोफ़ोन इतनी अधिक ऑडियो रिकॉर्ड करते हैं कि फाइलें एक ऐसे पहाड़ में बदल जाती हैं जो किसी भी इंसान के लिए सुनने और उन्हें लिखने के लिए बहुत विशाल है। यह शहर के आकार के पुस्तकालय की हर एक किताब को पढ़ने की कोशिश करने जैसा है, लेकिन यहाँ किताबें आवाज़ों से बनी हैं।
इस समस्या को हल करने के लिए, वैज्ञानिक कंप्यूटर की मदद लेते हैं। लेकिन कंप्यूटर केवल उतने ही स्मार्ट होते हैं जितने उदाहरण उन्हें सिखाए जाते हैं। कंप्यूटर को किसी विशिष्ट मेंढक की पुकार पहचानने के लिए सिखाने हेतु, एक मानव विशेषज्ञ को पहले हजारों रिकॉर्डिंग सुननी पड़ती है और उन्हें लेबल करना पड़ता है, जैसे कि, "हाँ, यह एक मेंढक है," या "नहीं, यह सिर्फ हवा की आवाज़ है।" यह प्रक्रिया धीमी, उबाऊ और महंगी है। यदि विशेषज्ञ लेबल करने में बहुत व्यस्त हैं, तो कंप्यूटर सीख नहीं पाएंगे, और ऑडियो डेटा के पहाड़ बेकार पड़े रहेंगे। बड़ा सवाल यह है: हम कंप्यूटर को इन विशाल ध्वनि अभिलेखागारों से कैसे सीखने के लिए प्रेरित कर सकते हैं, बिना किसी इंसान द्वारा हर एक सेकंड को पहले सुने?
यहीं पर YAPAT (येट अनददर PAM एनोटेशन टूल) नामक एक नया उपकरण काम आता है। YAPAT को प्रकृति की ध्वनियों के लिए एक हाई-टेक, इंटरैक्टिव जासूसी खेल के रूप में समझें। मानव विशेषज्ञ को एक-एक करके हर रिकॉर्डिंग सुनाने के बजाय, YAPAT कंप्यूटर के चालाकी भरे मिश्रण का उपयोग करता है ताकि भारी काम किया जा सके। यह लंबे ऑडियो फाइलों को छोटे 3-सेकंड के क्लिप्स में तोड़कर शुरुआत करता है। फिर, यह एक पूर्व-प्रशिक्षित "मस्तिष्क" (जिसे BirdNET कहा जाता है) का उपयोग करता है ताकि प्रत्येक क्लिप को एक अद्वितीय डिजिटल फिंगरप्रिंट में बदला जा सके।
जादू तब होता है जब YAPAT मानव विशेषज्ञ की मदद करता है। कल्पना कीजिए कि आप सभी ध्वनि फिंगरप्रिंट्स के एक विशाल मानचित्र को देख रहे हैं। YAPAT केवल आपको एक रैंडम सूची नहीं दिखाता; यह एक स्मार्ट गाइड की तरह काम करता है। इसके पास आपको शुरू करने के लिए तीन मुख्य तरीके हैं, भले ही आपके पास शून्य लेबल किया गया डेटा क्यों न हो:
- "एक जैसा दिखने वाला" खोज (The "Look-alike" Search): यदि आपके पास किसी विशिष्ट जानवर की एक स्पष्ट रिकॉर्डिंग है, तो आप उसे अपलोड कर सकते हैं। YAPAT तुरंत आपके विशाल संग्रह में उन सभी अन्य 3-सेकंड के क्लिप्स को ढूंढ लेता है जो सुनने में समान हैं, जिससे आप एक साथ बहुत सारे क्लिप्स को लेबल कर सकते हैं।
- "फाइल-स्तर" का अनुमान (The "File-Level" Guess): यदि आपके पास रिकॉर्डिंग का एक फोल्डर है जहाँ आप केवल यह जानते हैं कि कौन सा जानवर उस फ़ाइल में था (लेकिन ठीक कब नहीं), तो YAPAT "वीक सुपरविजन" नामक तकनीक का उपयोग करके यह अनुमान लगा सकता है कि फ़ाइल में जानवर कहाँ गा रहा है। यह एक पार्टी की फोटो देखने और भीड़ की ऊर्जा के आधार पर यह अनुमान लगाने जैसा है कि कौन नाच रहा है, भले ही आपने सीधे डांस फ्लोर को फिल्माया न हो।
- "स्मार्ट सॉर्ट" (The "Smart Sort"): एक बार जब कंप्यूटर सीखना शुरू कर देता है, तो वह रैंडम क्लिप्स दिखाना बंद कर देता है। इसके बजाय, यह एक विशेष स्कोरिंग सिस्टम का उपयोग करता है ताकि आपको वे क्लिप्स दिखाए जा सकें जिनके बारे में वह सबसे अधिक भ्रमित है, या वे जो पहले से ज्ञात ध्वनियों से सबसे अलग हैं। यह सुनिश्चित करता है कि मानव विशेषज्ञ अपना समय केवल उन क्लिप्स पर खर्च करे जो कंप्यूटर को सबसे अधिक सिखाएंगे, न कि आसान या उबाऊ उदाहरणों पर समय बर्बाद करें।
YAPAT इन ध्वनि लेबल्स को आधिकारिक वैज्ञानिक शब्दकोशों (ऑन्टोलॉजी) से भी जोड़ता है, यह सुनिश्चित करते हुए कि जब कोई वैज्ञानिक "ट्री फ्रॉग" कहता है, तो उसका अर्थ दुनिया के अन्य सभी लोगों के लिए बिल्कुल वही हो, जिससे डेटा भविष्य के अनुसंधान के लिए पुन: उपयोग योग्य बन जाता है।
यह पेपर YAPAT को एक वेब-आधारित प्लेटफॉर्म के रूप में प्रस्तुत करता है जो इन सभी विशेषताओं को एक स्थान पर लाता है। लेखकों ने इस प्रणाली का परीक्षण 'AnuraSet' नामक एक वास्तविक डेटासेट पर किया, जिसमें मेंढकों के 30,000 से अधिक साउंड क्लिप्स हैं। उन्होंने पाया कि सिस्टम इतना तेज़ है कि यह इंटरैक्टिव हो सकता है। उदाहरण के लिए, समान ध्वनियों को खोजने में हजारों क्लिप्स होने के बावजूद एक सेकंड से भी कम समय लगता है। नए पैटर्न को पहचानने के लिए कंप्यूटर को प्रशिक्षित करने में एक मानक कंप्यूटर पर केवल कुछ सेकंड लगते हैं, या एक शक्तिशाली कंप्यूटर पर इससे भी तेज़। यह सिस्टम ओपन-सोर्स है, जिसका अर्थ है कि कोई भी इसे डाउनलोड कर सकता है, इसे अपने स्वयं के सर्वर पर सेट कर सकता है, और अपने स्वयं के ध्वनि अभिलेखागार को व्यवस्थित करना शुरू कर सकता है।
लेखक सावधानी बरतते हुए यह भी नोट करते हैं कि हालांकि YAPAT एक शक्तिशाली उपकरण है, लेकिन यह कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है। यह "BirdNET" मस्तिष्क पर निर्भर करता है, जिसे मूल रूप से पक्षियों के लिए प्रशिक्षित किया गया था, इसलिए बिना अतिरिक्त सुधार के यह हर प्रकार के जानवर (जैसे चमगादड़ या व्हेल) के लिए एकदम सही नहीं हो सकता है। इसके अलावा, सिस्टम वर्तमान में ध्वनियों को निश्चित 3-सेकंड के टुकड़ों में काटता है, जिसका अर्थ है कि यदि कोई ध्वनि कट के किनारे पर आती है, तो यह सटीक मिलीसेकंड का पता नहीं लगा सकता है कि ध्वनि कब शुरू या समाप्त हुई। हालाँकि, स्मार्ट सर्च, वीक सुपरविजन और एक्टिव लर्निंग को मिलाकर, YAPAT सफलतापूर्वक विशाल, प्रबंधित न किए जा सकने वाले ऑडियो अभिलेखागार और उच्च-गुणवत्ता वाले, लेबल किए गए डेटा के बीच के अंतर को पाटता है जिसकी वैज्ञानिकों को पृथ्वी की जैव विविधता को समझने के लिए आवश्यकता होती है। यह सब कुछ सुनने के असंभव कार्य को एक प्रबंधनीय, सहयोगात्मक खेल में बदल देता है जहाँ मनुष्य और कंप्यूटर मिलकर प्रकृति के गीत को डिकोड करने के लिए काम करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।