← नवीनतम पेपर
💻 computer science

DEMUN: Fast and accurate discovery of music notation in very large collections

यह शोध पत्र DEMUN प्रस्तुत करता है, जो एक तेज़ और अत्यधिक सटीक दो-चरणीय डिटेक्टर है जो विशाल, गैर-विशिष्ट पुस्तकालय संग्रहों के भीतर विरल संगीत नोटेशन की पहचान करने में सक्षम है, जिसने चार मिलियन छवियों के डेटासेट से हजारों पहले से अज्ञात दस्तावेजों को सफलतापूर्वक खोज निकाला है।

मूल लेखक: Vojtěch Dvořák, Filip Bím, Jiří Mayer, Martina Dvořáková, Markéta Herzanová Vlková, Pavel Pecina, Petr Žabička, Jan Hajič jr

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vojtěch Dvořák, Filip Bím, Jiří Mayer, Martina Dvořáková, Markéta Herzanová Vlková, Pavel Pecina, Petr Žabička, Jan Hajič jr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो एक विशाल पुस्तकालय में छिपे हुए हर एक संगीत स्कोर (musical score) को खोजने की कोशिश कर रहे हैं, जिसमें किताबों, अखबारों और पुराने पर्चों के 7 करोड़ पन्ने हैं। समस्या यह है कि इनमें से अधिकांश पन्नों पर "संगीत" (Music) का लेबल नहीं लगा है। वे इतिहास की पाठ्यपुस्तकों, दैनिक समाचार पत्रों या यात्रा गाइडों के भीतर दबे हुए हैं। यदि आप संगीत खोजने के लिए हाथ से हर एक पन्ने को पढ़ने की कोशिश करेंगे, तो इसमें आपका पूरा जीवन बीत जाएगा। यदि आप एक कंप्यूटर का उपयोग करके उन सभी को एक साथ स्कैन करने की कोशिश करेंगे, तो कंप्यूटर "गलत सूचनाओं" (false alarms) से घबरा जाएगा—वह फूल की तस्वीर या किसी मानचित्र को संगीत समझ लेगा, और आपको लाखों बेकार परिणाम मिल जाएंगे।

यह शोध पत्र DEMUN पेश करता है, जो एक स्मार्ट, दो-चरणीय प्रणाली है जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। इसे संगीत के लिए एक उच्च-तकनीकी स्वर्ण खनन (gold mining) ऑपरेशन की तरह समझें।

समस्या: "अयस्क" (Ore) बहुत ही विरल है

लेखक पुस्तकालय के संग्रह की तुलना कम-ग्रेड वाले पत्थर (अयस्क) के एक विशाल ढेर से करते हैं। "सोना" संगीत की लिपि (notation) है, लेकिन यह अविश्वसनीय रूप से दुर्लभ है। मोरावियन लाइब्रेरी (जहाँ उन्होंने इसका परीक्षण किया) में, केवल प्रत्येक 2,600 पन्नों में से लगभग 1 पन्ना वास्तव में संगीत युक्त है।

यदि आप इसे खोजने के लिए किसी मानक कंप्यूटर प्रोग्राम का उपयोग करते हैं, तो यह 1% बार गलती कर सकता है। 7 करोड़ पन्नों की लाइब्रेरी में, 1% की त्रुटि दर का अर्थ है कि कंप्यूटर आपको 700,000 नकली परिणाम देगा। यह शोर काम करने लायक नहीं है। आपको एक ऐसी प्रणाली की आवश्यकता है जो अविश्वसनीय रूप से सटीक हो, जो हर 10,000 पन्नों की जांच करने पर 2 से भी कम गलतियाँ करे।

समाधान: एक दो-चरणीय खनन प्रक्रिया

इसे बिना किसी सुपरकंप्यूटर की आवश्यकता के या वर्षों प्रतीक्षा किए बिना संभालने के लिए, टीम ने एक दो-चरणीय फ़िल्टर प्रणाली बनाई है:

चरण 1: एक मोटा छलनी (The Rough Sifter - प्री-फ़िल्टर)

  • यह कहाँ होता है: लाइब्रेरी के अपने सर्वर के अंदर।
  • यह क्या करता है: यह एक हल्के, तेज़ कंप्यूटर मॉडल (जैसे एक त्वरित, बिना प्रशिक्षित आँख) का उपयोग करता है जो लाखों पन्नों को स्कैन करता है। इसे पूर्ण होने की आवश्यकता नहीं है; इसे बस तेज़ होना चाहिए और अधिकांश संगीत को पकड़ लेना चाहिए।
  • उपमा: एक बड़ी छलनी की कल्पना करें जिसमें बड़े छेद हों। यह बहुत सारी मिट्टी को गुजरने देती है, लेकिन सोने के बड़े टुकड़ों को पकड़ लेती है। यह कुछ मिट्टी को भी फिसलने दे सकती है, लेकिन यह कुछ पत्थरों को भी पकड़ लेती है जो सोने जैसे दिखते हैं।
  • परिणाम: यह चरण छवियों को वहीं प्रोसेस करता है जहाँ वे मौजूद हैं, इसलिए अभी तक कोई डेटा इंटरनेट पर नहीं भेजा जाता है। यह संगीत की सांद्रता को 2,600 में से 1 से बढ़ाकर लगभग 66 में से 1 कर देता है। यह अभी भी पूर्ण नहीं है, लेकिन यह बहुत बेहतर है।

चरण 2: एक विशेषज्ञ निरीक्षक (The Expert Inspector - मुख्य चरण)

  • यह कहाँ होता है: एक शक्तिशाली रिमोट सर्वर पर जिसमें एक हाई-स्पीड ग्राफिक्स कार्ड (GPU) लगा हो।
  • यह क्या करता है: यह "स्मार्ट" हिस्सा है। यह चरण 1 द्वारा चिह्नित किए गए पन्नों के छोटे ढेर को लेता है और उन्हें बहुत बारीकी से देखता है। यह एक अधिक उन्नत AI का उपयोग करता है यह तय करने के लिए कि: "क्या यह निश्चित रूप से संगीत है? क्या यह आधुनिक शीट संगीत है, प्राचीन भजन है, या सिर्फ एक चित्र है जो संगीत जैसा दिखता है?"
  • उपमा: यह एक पेशेवर जौहरी की तरह है जो उन पत्थरों को देखता है जिन्हें छलनी ने पकड़ा है। वे असली सोने को नकली सोने (fool's gold) से अलग करने के लिए आवर्धक लेंस (magnifying glass) का उपयोग करते हैं।
  • परिणाम: यह चरण अविश्वसनीय रूप से सटीक है। यह लगभग सभी नकली परिणामों को फ़िल्टर कर देता है।

अद्भुत परिणाम

जब उन्होंने इन दोनों चरणों को मिलाया, तो यह प्रणाली एक सोने की खान बन गई:

  • गति: यह प्रति सेकंड सैकड़ों छवियों को प्रोसेस कर सकता है।
  • सटीकता: इसने 0.015% की फाल्स पॉजिटिव दर (false positive rate) हासिल की। इसका मतलब है कि हर 1,000 पन्नों के लिए जिसे यह "यह संगीत है" कहता है, यह केवल 1 या 2 बार गलत होता है।
  • आउटपुट: 2,600 पन्नों के ढेर के बजाय, जिसमें 1 गाना था, यह प्रणाली लाइब्रेरियन को 4 पन्नों का ढेर थमा देती है जहाँ 3 वास्तविक गाने हैं और केवल 1 गलती है। यह मनुष्यों द्वारा समीक्षा करने के लिए एक आदर्श अनुपात है।

उन्होंने क्या पाया

केवल लाइब्रेरी के एक छोटे से नमूने (40 लाख पन्ने) पर इस प्रणाली को चलाकर, उन्होंने संगीत के 1,500 पन्ने खोज निकाले जो पहले अज्ञात थे। इसके आधार पर, वे अनुमान लगाते हैं कि पूरे पुस्तकालय में संभवतः 20,000 से 30,000 पन्ने छिपे हुए संगीत के हैं।

ये केवल प्रसिद्ध सिम्फनी नहीं हैं; ये समाचार पत्रों में गाने, स्कूल की पाठ्यपुस्तकों में संगीत और अन्य पुस्तकों की बाइंडिंग में पाए गए पुराने भजनों के अंश हैं। यह प्रणाली इतिहासकारों को न केवल प्रसिद्ध संगीतकारों को, बल्कि अतीत के आम लोगों के संगीत जीवन को भी अंततः "सुनने" की अनुमति देती है।

संक्षेप में, DEMUN एक तेज़, दो-चरणीय फ़िल्टर है जो एक "भूसे के ढेर में सुई खोजने" वाली समस्या को एक प्रबंधनीय कार्य में बदल देता है, जिससे बिना भारी खर्च या इंटरनेट बैंडविड्थ बर्बाद किए हजारों छिपे हुए संगीत के खजानों का अनावरण होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →