← नवीनतम पेपर
💬 NLP

MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method

यह शोध पत्र MultiLinguahah का प्रस्ताव करता है, जो एक अनसुपरवाइज्ड (unsupervised) बहुभाषी हँसी विभाजन पद्धति है जो हँसी को एक विसंगति (anomaly) के रूप में पहचानने के लिए BYOL-A ऑडियो रिप्रजेंटेशन पर आइसोलेशन फॉरेस्ट (Isolation Forest) का उपयोग करती है, और मौजूदा सुपरवाइज्ड, अंग्रेजी-केंद्रित अत्याधुनिक एल्गोरिदम की तुलना में गैर-अंग्रेजी संदर्भों में बेहतर प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Callejas Sofia, Gomez Nahuel, Pelachaud Catherine, Ravenet Brian, Barriere Valentin

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Callejas Sofia, Gomez Nahuel, Pelachaud Catherine, Ravenet Brian, Barriere Valentin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़ी, शोर-शराबे वाली पार्टी में हैं जहाँ दर्जनों अलग-अलग भाषाएँ बोली जा रही हैं। बातचीत, संगीत और टकराते हुए गिलासों के बीच, एक ऐसी आवाज़ है जिसे हर कोई तुरंत पहचान लेता है: हंसी। यह खुशी, राहत या यहाँ तक कि झेंप की एक सार्वभौमिक भाषा है जिसे समझने के लिए किसी शब्दकोश की आवश्यकता नहीं होती।

"MultiLinguahah" नामक शोध पत्र इस बारे में है कि कंप्यूटर को उस हंसी को खोजने के लिए कैसे सिखाया जाए, भले ही वह रिकॉर्डिंग कितनी भी अव्यवस्थित, शोर भरी और विभिन्न भाषाओं से भरी क्यों न हो।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने क्या किया और यह क्यों महत्वपूर्ण है:

समस्या: "भूसे के ढेर में सुई"

एक ऑडियो फ़ाइल में हंसी को खोजना कठिन है। यह भूसे के ढेर में एक विशिष्ट प्रकार की सुई खोजने जैसा है, लेकिन वह भूसा अलग-अलग प्रकार के भूसे (संगीत, हवा, भाषण) से बना है, और सुइयाँ भाषा के आधार पर अलग-अलग आकृतियों की आती हैं।

अधिकांश वर्तमान कंप्यूटर प्रोग्राम विशेषज्ञ जासूसों की तरह हैं जो केवल अंग्रेजी बोलते हैं। उन्हें हजारों घंटों के अमेरिकी टीवी शो और स्टैंड-अप कॉमेडी पर प्रशिक्षित किया गया है। यदि आप उनसे स्पेनिश या रूसी रिकॉर्डिंग में हंसी खोजने के लिए कहेंगे, तो वे भ्रमित हो जाएंगे क्योंकि वे अंग्रेजी-विशिष्ट पैटर्न की तलाश कर रहे हैं। वे आमतौर पर यह भी चाहते हैं कि एक इंसान बैठकर मैन्युअल रूप से मार्क करे कि हर हंसी कहाँ शुरू होती है और कहाँ खत्म होती है, जो कि कंप्यूटर को सिखाने के लिए हर वीडियो के हर सेकंड को देखने के लिए लोगों की एक टीम को काम पर रखने जैसा है। यह महंगा और धीमा है।

समाधान: "सार्वभौमिक शोर डिटेक्टर"

लेखकों ने MultiLinguahah नामक एक नई विधि बनाई। कंप्यूटर को यह सिखाने के बजाय कि किसी विशिष्ट भाषा में हंसी कैसी सुनाई देती है, उन्होंने इसे यह पहचानने के लिए सिखाया कि हंसी क्या नहीं है

इसे इस तरह सोचिए:

  1. बात करने वालों को चुप कराना (आवाज़ हटाना): सबसे पहले, कंप्यूटर एक फ़िल्टर का उपयोग करके सभी मानवीय आवाजों को म्यूट कर देता है। यह शोर-रद्द करने वाले हेडफ़ोन पहनने जैसा है जो केवल भाषण को रोकता है, जिससे पृष्ठभूमि का संगीत, हवा और हंसी शेष रह जाती है।
  2. केक काटना (ऊर्जा विभाजन): इसके बाद, यह शेष ऑडियो को वॉल्यूम के आधार पर छोटे टुकड़ों में काट देता है। यदि वॉल्यूम में उछाल आता है (जैसे हंसी का एक विस्फोट), तो यह उस टुकड़े को चिह्नित करता है।
  3. "सबसे अलग" का खेल (विसंगति का पता लगाना): यही जादुई कदम है। कंप्यूटर इन सभी ऑडियो टुकड़ों को देखता है। वह जानता है कि बैकग्राउंड शोर और संगीत आमतौर पर "सामान्य" और सुसंगत होते हैं। हालाँकि, हंसी "सबसे अलग" होती है। यह वह अजीब, अनूठा पैटर्न है जो बाकी बैकग्राउंड में फिट नहीं बैठता।
    • कंप्यूटर एक टूल का उपयोग करता है जिसे इज़ोलेशन फ़ॉरेस्ट (Isolation Forest) कहा जाता है। कल्पना कीजिए एक जंगल की जहाँ पेड़ डेटा पॉइंट्स हैं। कंप्यूटर उन पेड़ों को अलग करने के लिए बाड़ बनाता है जो बाकी से अलग दिखते हैं। चूंकि हंसी सभी भाषाओं में एक सार्वभौमिक ध्वनिक "फिंगरप्रिंट" रखती है, इसलिए कंप्यूटर इसे एक विसंगति (anomaly) के रूप में पहचान सकता है, भले ही उसने पहले कभी वह विशिष्ट भाषा न देखी हो।

परीक्षण: वैश्विक टैलेंट शो

शोधकर्ताओं ने अपने तरीके का परीक्षण चार अलग-अलग प्रकार के ऑडियो पर सर्वश्रेष्ठ मौजूदा "केवल-अंग्रेजी" जासूसों के विरुद्ध किया:

  • स्टैंड-अप कॉमेडी: कई भाषाओं में चुटकुलों पर हंसते हुए लाइव दर्शक।
  • टीवी सिटकॉम: स्टूडियो रिकॉर्डिंग (जैसे Friends)।
  • यूट्यूब क्लिप्स: रैंडम, अव्यवस्थित वास्तविक दुनिया का ऑडियो।
  • कृत्रिम डेटा: कंप्यूटर द्वारा जनरेट किया गया हंसी का डेटा।

परिणाम: अंडरडॉग की जीत

यहाँ क्या हुआ:

  • अंग्रेजी में: पुराने, विशिष्ट जासूस (जो अंग्रेजी डेटा पर प्रशिक्षित थे) ने बहुत अच्छा काम किया। वे अंग्रेजी बोलने वाली दुनिया के चैंपियन थे।
  • अन्य भाषाओं में: पुराने जासूस लड़खड़ा गए। जब उन्होंने स्पेनिश, फ्रेंच या रूसी सुनी, तो उनका प्रदर्शन काफी गिर गया क्योंकि वे उन अंग्रेजी पैटर्न की तलाश कर रहे थे जो वहाँ मौजूद नहीं थे।
  • MultiLinguahah: इस नई पद्धति को भाषा की परवाह नहीं थी। क्योंकि यह विशिष्ट शब्दों के बजाय हंसी की सार्वभौमिक "अजीबोगरीब प्रकृति" पर केंद्रित थी, इसलिए इसने सभी भाषाओं में लगातार अच्छा प्रदर्शन किया। वास्तव में, गैर-अंग्रेजी परिवेश में, इसने हर बार विशिष्ट अंग्रेजी जासूसों को पछाड़ दिया।

निष्कर्ष

यह शोध पत्र दिखाता है कि कंप्यूटर को विशिष्ट भाषाओं को याद करके हंसी पहचानना सिखाना, एक कुत्ते को केवल लाल गेंद का उपयोग करके गेंद लाने का अभ्यास कराने जैसा है। यदि आप उसे नीली गेंद देते हैं, तो उसे समझ नहीं आता कि क्या करना है।

इसके बजाय, MultiLinguahah कंप्यूटर को गेंद के रंग की परवाह किए बिना, गेंद लाने की क्रिया को पहचानना सिखाता है। हंसी को बैकग्राउंड शोर में एक सार्वभौमिक "विसंगति" के रूप में मानकर, यह प्रणाली पेरिस के कॉमेडी क्लब से लेकर टोक्यो के पॉडकास्ट तक, हर जगह काम करती है, और इसके लिए पहले से हर हंसी को मैन्युअल रूप से लेबल करने की आवश्यकता नहीं होती।

संक्षेप में: उन्होंने एक सार्वभौमिक हंसी डिटेक्टर बनाया है जिसे यह जानने के लिए आपकी भाषा बोलने की आवश्यकता नहीं है कि आप कब हंस रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →