MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method
यह शोध पत्र MultiLinguahah का प्रस्ताव करता है, जो एक अनसुपरवाइज्ड (unsupervised) बहुभाषी हँसी विभाजन पद्धति है जो हँसी को एक विसंगति (anomaly) के रूप में पहचानने के लिए BYOL-A ऑडियो रिप्रजेंटेशन पर आइसोलेशन फॉरेस्ट (Isolation Forest) का उपयोग करती है, और मौजूदा सुपरवाइज्ड, अंग्रेजी-केंद्रित अत्याधुनिक एल्गोरिदम की तुलना में गैर-अंग्रेजी संदर्भों में बेहतर प्रदर्शन प्रदर्शित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़ी, शोर-शराबे वाली पार्टी में हैं जहाँ दर्जनों अलग-अलग भाषाएँ बोली जा रही हैं। बातचीत, संगीत और टकराते हुए गिलासों के बीच, एक ऐसी आवाज़ है जिसे हर कोई तुरंत पहचान लेता है: हंसी। यह खुशी, राहत या यहाँ तक कि झेंप की एक सार्वभौमिक भाषा है जिसे समझने के लिए किसी शब्दकोश की आवश्यकता नहीं होती।
"MultiLinguahah" नामक शोध पत्र इस बारे में है कि कंप्यूटर को उस हंसी को खोजने के लिए कैसे सिखाया जाए, भले ही वह रिकॉर्डिंग कितनी भी अव्यवस्थित, शोर भरी और विभिन्न भाषाओं से भरी क्यों न हो।
यहाँ इसका सरल विवरण दिया गया है कि उन्होंने क्या किया और यह क्यों महत्वपूर्ण है:
समस्या: "भूसे के ढेर में सुई"
एक ऑडियो फ़ाइल में हंसी को खोजना कठिन है। यह भूसे के ढेर में एक विशिष्ट प्रकार की सुई खोजने जैसा है, लेकिन वह भूसा अलग-अलग प्रकार के भूसे (संगीत, हवा, भाषण) से बना है, और सुइयाँ भाषा के आधार पर अलग-अलग आकृतियों की आती हैं।
अधिकांश वर्तमान कंप्यूटर प्रोग्राम विशेषज्ञ जासूसों की तरह हैं जो केवल अंग्रेजी बोलते हैं। उन्हें हजारों घंटों के अमेरिकी टीवी शो और स्टैंड-अप कॉमेडी पर प्रशिक्षित किया गया है। यदि आप उनसे स्पेनिश या रूसी रिकॉर्डिंग में हंसी खोजने के लिए कहेंगे, तो वे भ्रमित हो जाएंगे क्योंकि वे अंग्रेजी-विशिष्ट पैटर्न की तलाश कर रहे हैं। वे आमतौर पर यह भी चाहते हैं कि एक इंसान बैठकर मैन्युअल रूप से मार्क करे कि हर हंसी कहाँ शुरू होती है और कहाँ खत्म होती है, जो कि कंप्यूटर को सिखाने के लिए हर वीडियो के हर सेकंड को देखने के लिए लोगों की एक टीम को काम पर रखने जैसा है। यह महंगा और धीमा है।
समाधान: "सार्वभौमिक शोर डिटेक्टर"
लेखकों ने MultiLinguahah नामक एक नई विधि बनाई। कंप्यूटर को यह सिखाने के बजाय कि किसी विशिष्ट भाषा में हंसी कैसी सुनाई देती है, उन्होंने इसे यह पहचानने के लिए सिखाया कि हंसी क्या नहीं है।
इसे इस तरह सोचिए:
- बात करने वालों को चुप कराना (आवाज़ हटाना): सबसे पहले, कंप्यूटर एक फ़िल्टर का उपयोग करके सभी मानवीय आवाजों को म्यूट कर देता है। यह शोर-रद्द करने वाले हेडफ़ोन पहनने जैसा है जो केवल भाषण को रोकता है, जिससे पृष्ठभूमि का संगीत, हवा और हंसी शेष रह जाती है।
- केक काटना (ऊर्जा विभाजन): इसके बाद, यह शेष ऑडियो को वॉल्यूम के आधार पर छोटे टुकड़ों में काट देता है। यदि वॉल्यूम में उछाल आता है (जैसे हंसी का एक विस्फोट), तो यह उस टुकड़े को चिह्नित करता है।
- "सबसे अलग" का खेल (विसंगति का पता लगाना): यही जादुई कदम है। कंप्यूटर इन सभी ऑडियो टुकड़ों को देखता है। वह जानता है कि बैकग्राउंड शोर और संगीत आमतौर पर "सामान्य" और सुसंगत होते हैं। हालाँकि, हंसी "सबसे अलग" होती है। यह वह अजीब, अनूठा पैटर्न है जो बाकी बैकग्राउंड में फिट नहीं बैठता।
- कंप्यूटर एक टूल का उपयोग करता है जिसे इज़ोलेशन फ़ॉरेस्ट (Isolation Forest) कहा जाता है। कल्पना कीजिए एक जंगल की जहाँ पेड़ डेटा पॉइंट्स हैं। कंप्यूटर उन पेड़ों को अलग करने के लिए बाड़ बनाता है जो बाकी से अलग दिखते हैं। चूंकि हंसी सभी भाषाओं में एक सार्वभौमिक ध्वनिक "फिंगरप्रिंट" रखती है, इसलिए कंप्यूटर इसे एक विसंगति (anomaly) के रूप में पहचान सकता है, भले ही उसने पहले कभी वह विशिष्ट भाषा न देखी हो।
परीक्षण: वैश्विक टैलेंट शो
शोधकर्ताओं ने अपने तरीके का परीक्षण चार अलग-अलग प्रकार के ऑडियो पर सर्वश्रेष्ठ मौजूदा "केवल-अंग्रेजी" जासूसों के विरुद्ध किया:
- स्टैंड-अप कॉमेडी: कई भाषाओं में चुटकुलों पर हंसते हुए लाइव दर्शक।
- टीवी सिटकॉम: स्टूडियो रिकॉर्डिंग (जैसे Friends)।
- यूट्यूब क्लिप्स: रैंडम, अव्यवस्थित वास्तविक दुनिया का ऑडियो।
- कृत्रिम डेटा: कंप्यूटर द्वारा जनरेट किया गया हंसी का डेटा।
परिणाम: अंडरडॉग की जीत
यहाँ क्या हुआ:
- अंग्रेजी में: पुराने, विशिष्ट जासूस (जो अंग्रेजी डेटा पर प्रशिक्षित थे) ने बहुत अच्छा काम किया। वे अंग्रेजी बोलने वाली दुनिया के चैंपियन थे।
- अन्य भाषाओं में: पुराने जासूस लड़खड़ा गए। जब उन्होंने स्पेनिश, फ्रेंच या रूसी सुनी, तो उनका प्रदर्शन काफी गिर गया क्योंकि वे उन अंग्रेजी पैटर्न की तलाश कर रहे थे जो वहाँ मौजूद नहीं थे।
- MultiLinguahah: इस नई पद्धति को भाषा की परवाह नहीं थी। क्योंकि यह विशिष्ट शब्दों के बजाय हंसी की सार्वभौमिक "अजीबोगरीब प्रकृति" पर केंद्रित थी, इसलिए इसने सभी भाषाओं में लगातार अच्छा प्रदर्शन किया। वास्तव में, गैर-अंग्रेजी परिवेश में, इसने हर बार विशिष्ट अंग्रेजी जासूसों को पछाड़ दिया।
निष्कर्ष
यह शोध पत्र दिखाता है कि कंप्यूटर को विशिष्ट भाषाओं को याद करके हंसी पहचानना सिखाना, एक कुत्ते को केवल लाल गेंद का उपयोग करके गेंद लाने का अभ्यास कराने जैसा है। यदि आप उसे नीली गेंद देते हैं, तो उसे समझ नहीं आता कि क्या करना है।
इसके बजाय, MultiLinguahah कंप्यूटर को गेंद के रंग की परवाह किए बिना, गेंद लाने की क्रिया को पहचानना सिखाता है। हंसी को बैकग्राउंड शोर में एक सार्वभौमिक "विसंगति" के रूप में मानकर, यह प्रणाली पेरिस के कॉमेडी क्लब से लेकर टोक्यो के पॉडकास्ट तक, हर जगह काम करती है, और इसके लिए पहले से हर हंसी को मैन्युअल रूप से लेबल करने की आवश्यकता नहीं होती।
संक्षेप में: उन्होंने एक सार्वभौमिक हंसी डिटेक्टर बनाया है जिसे यह जानने के लिए आपकी भाषा बोलने की आवश्यकता नहीं है कि आप कब हंस रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।