← नवीनतम पेपर
🤖 machine learning

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

यह शोध पत्र सबमॉड्यूलर सूचना मापों (SIMs) को शास्त्रीय सांख्यिकीय अवधारणाओं से जोड़ने वाला एक एकीकृत सैद्धांतिक ढांचा स्थापित करता है, जो यह प्रदर्शित करता है कि विशिष्ट SIM उद्देश्य (कुल सूचना और पारस्परिक सूचना) अद्वितीय रूप से इंट्रा-क्लास विचरण और इंटर-क्लास पृथक्करण गुणों को अभिलक्षणित करते हैं, एक ऐसा सिद्धांत जिसे नियंत्रित सिंथेटिक प्रयोगों के माध्यम से मान्य किया गया है।

मूल लेखक: Rishabh Iyer, Truong Pham, Anay Majee

प्रकाशित 2026-07-31
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rishabh Iyer, Truong Pham, Anay Majee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को विभिन्न प्रकार के फलों को पहचानना सिखाने की कोशिश कर रहे हैं। आप उसे सेब, संतरे और केलों की हजारों तस्वीरें दिखाते हैं। रोबोट का मस्तिष्क एक विशाल मानचित्र है जहाँ प्रत्येक फल को एक विशिष्ट स्थान मिलता है। "रिप्रजेंटेशन लर्निंग" (प्रतिनिधित्व सीखने) का लक्ष्य इस मानचित्र को इस तरह व्यवस्थित करना है कि सभी सेब एक साथ एक घने, आरामदायक समूह में हों, जबकि संतरे और केले अपने अलग-अलग मोहल्लों में दूर धकेल दिए जाएं। यदि सेब पूरे मानचित्र पर बिखरे हुए हैं, या यदि सेब का मोहल्ला संतरे के मोहल्ले के ठीक बगल में है, तो रोबोट भ्रमित हो जाता है।

लंबे समय तक, वैज्ञानिकों ने इन फल समूहों को सघन और दूर रखने के लिए गणित का उपयोग किया है। वे "वैरिएंस" (एक समूह कितना फैला हुआ है) और "सेपरेशन" (समूहों के बीच की दूरी) को मापते हैं। लेकिन हाल ही में, एक नया, अधिक जटिल उपकरण जिसे "सबमॉड्यूलर इंफॉर्मेशन मेजर्स" (या SIMs) कहा जाता है, लोकप्रिय हुआ है। SIMs को एक सुपर-स्मार्ट, लचीले रूलर (मापक) के रूप में सोचें जो न केवल दूरी को मापता है, बल्कि यह भी मापता है कि एक समूह कितना विविध है, वह एक क्षेत्र को कितनी अच्छी तरह कवर करता है, और पड़ोसियों के साथ उसका कितना ओवरलैप (अतिव्यापन) है। हालांकि ये नए रूलर व्यवहार में अद्भुत काम करते रहे हैं, लेकिन वास्तव में कोई नहीं समझ पाया था कि वे क्यों काम करते हैं या वे रोबोट के मानचित्र को किस विशिष्ट प्रकार का "आकार" देने के लिए मजबूर कर रहे हैं। यह एक जादुई दिशा-सूचक यंत्र (कम्पास) का उपयोग करने जैसा था जो हमेशा उत्तर की ओर संकेत करता था, लेकिन कोई नहीं जानता था कि वह चुंबकीय क्षेत्र, गुरुत्वाकर्षण या केवल हवा को माप रहा था।

यह शोध पत्र उस जादुई कम्पास के हुड को खोलने वाला पहला प्रयास है। लेखकों, ऋषभ अय्यर, ट्रुओंग फाम और अनाय मजी ने यह समझाने के लिए एक एकीकृत सिद्धांत बनाया है कि ये विभिन्न SIM रूलर वास्तव में क्या माप रहे हैं। उन्होंने खोजा कि ये उपकरण एक समान नहीं हैं; वे अलग-अलग प्रकार के लेंसों की तरह हैं। कुछ लेंस समूहों को सघन और गोल बनाने पर ध्यान केंद्रित करते हैं (जैसे एक मानक वैरिएंस रूलर), जबकि अन्य समूह के आकार पर ध्यान केंद्रित करते हैं (जैसे एक रूलर जिसे इस बात की परवाह है कि समूह एक चपटे पैनकेक जैसा है या एक गोल गेंद जैसा)। कुछ लेंस दुर्लभ फलों के प्रति अत्यधिक संवेदनशील होते हैं, जिससे यह सुनिश्चित होता है कि अकेले, मुश्किल से मिलने वाले केलों को अपना विशेष स्थान मिले, जबकि अन्य यह जांचते हैं कि विभिन्न फल समूह भ्रमित करने वाले तरीकों से आपस में ओवरलैप तो नहीं हो रहे हैं। सिंथेटिक डेटा—अर्थात कंप्यूटर द्वारा निर्मित आदर्श फल संसारों—के साथ नियंत्रित प्रयोग चलाकर, उन्होंने सिद्ध किया कि प्रत्येक SIM टूल एक विशिष्ट, शास्त्रीय गणितीय अवधारणा के अनुरूप है। उन्होंने दिखाया कि ये उपकरण केवल 'ब्लैक बॉक्स' नहीं हैं; वे सटीक उपकरण हैं जिन्हें आप इस आधार पर चुन सकते हैं कि आप अपने रोबोट के मस्तिष्क के लिए किस तरह का ज्यामितीय आकार चाहते हैं।

बड़ी घोषणा: एक उपकरण सब पर फिट नहीं बैठता

इस शोध पत्र का मुख्य निष्कर्ष यह है कि रोबोट के फल मानचित्र के कितने अच्छे होने को मापने का कोई एक "सर्वश्रेष्ठ" तरीका नहीं है। इसके बजाय, "सबमॉड्यूलर इंफॉर्मेशन मेजर्स" (SIMs), जिनका शोधकर्ता उपयोग कर रहे हैं, वास्तव में तीन अलग-अलग परिवारों के उपकरण हैं, जिनमें से प्रत्येक का व्यक्तित्व और कार्य बहुत अलग है। लेखकों ने पाया कि आप किस टूल को चुनते हैं, इस पर निर्भर करता है कि आप रोबोट को किस तरह की पूरी तरह से अलग ज्यामिति सीखने के लिए कह रहे हैं।

रोबोट के मानचित्र को एक भीड़भाड़ वाले डांस फ्लोर के रूप में सोचें।

  • "टाइटनेस" (सघनता) के उपकरण (ग्राफ कट और लॉगडेट): कुछ उपकरण नर्तकों को एक विशिष्ट समूह (जैसे सभी सेब) के करीब रखने के लिए जुनूनी होते हैं।

    • ग्राफ कट (Graph Cut) एक सख्त नृत्य प्रशिक्षक की तरह है जो चाहता है कि सेब समूह के सभी लोग केंद्र के करीब खड़े हों। यह "विदिन-क्लास वैरिएंस" को मापता है। यदि सेब बिखरे हुए हैं, तो यह चिल्लाएगा "इसे ठीक करो!" यह यह कहने का शास्त्रीय तरीका है कि, "समूह को सघन रखें।"
    • लॉगडेट (LogDet) एक अधिक परिष्कृत प्रशिक्षक है। यह केवल इस बात की परवाह नहीं करता कि सेब कितने करीब हैं; इसे इस बात की परवाह है कि सेब के समूह का आकार कैसा है। यदि सेब एक लंबी, पतली रेखा में फैले हुए हैं, तो लॉगडेट इसे एक पूर्ण वृत्त के रूप में फैले होने की तुलना में अलग तरह से देखता है। यह "सामान्यीकृत वैरिएंस" या समूह के "आयतन" को मापता है। यह यह जांचने जैसा है कि समूह एक चपटा पैनकेक है या एक फूला हुआ बादल।
  • "दुर्लभ फल" का टूल (फैसिलिटी लोकेशन): इस टूल के पास एक अलग सुपरपावर है। यह अकेले नर्तकों की परवाह करता है। एक ऐसे डांस फ्लोर की कल्पना करें जहां 90% लोग एक बड़े घेरे में नाच रहे हैं (मुख्य क्लास), और केवल कुछ लोग कोने में अकेले नाच रहे हैं (टेल या दुर्लभ क्लास)। अधिकांश उपकरण अकेले नर्तकों को अनदेखा कर देते हैं क्योंकि बड़ा समूह बहुत शोर मचा रहा होता है। लेकिन फैसिलिटी लोकेशन (Facility Location) टूल एक सामाजिक तितली (social butterfly) की तरह है जो यह सुनिश्चित करता है कि अकेले नर्तकों पर भी ध्यान दिया जाए। यह रोबोट को दुर्लभ समूहों को अतिरिक्त स्थान देने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि वे लोकप्रिय समूहों द्वारा कुचले न जाएं। यही कारण है कि यह टूल तब बहुत अच्छा काम करता है जब डेटा "लॉन्ग-टेल्ड" (यानी बहुत सारी सामान्य वस्तुएं और बहुत कम दुर्लभ वस्तुएं) होता है।

सेपरेशन गेम: वे कितनी दूर होने चाहिए?

एक बार समूह बन जाने के बाद, रोबोट को उन्हें एक-दूसरे से दूर धकेलने की आवश्यकता होती है। शोध पत्र दिखाता है कि विभिन्न उपकरण उन्हें अलग-अलग तरीकों से धकेलते भी हैं।

  • ग्राफ कट म्यूचुअल इंफॉर्मेशन (Graph Cut Mutual Information) एक सरल दूरी की जांच की तरह है। यह पूछता है, "सेब के समूह और संतरे के समूह के केंद्रों के बीच कितनी दूरी है?" यह केंद्रों को दूर धकेलता है, समूहों के आकार की अनदेखी करता है।
  • लॉगडेट म्यूचुअल इंफॉर्मेशन (LogDet Mutual Information) अधिक स्मार्ट है। यह पूछता है, "वे उनके फैलाव को ध्यान में रखते हुए कितनी दूर हैं?" यदि सेब का समूह बहुत फैला हुआ है (जैसे एक लंबी रेखा), तो संतरे का अंदर घुसना आसान है। यह समूहों को उनके आकार और फैलाव को ध्यान में रखते हुए दूर धकेलता है, जो "महालेनोबिस दूरी" (Mahalanobis distance) के समान है। यह यह कहने जैसा है कि, "संतरे एक सीधी रेखा में दूर हैं, लेकिन वे सेब के फैलाव के किनारे के खतरनाक रूप से करीब हैं, इसलिए हमें उन्हें और दूर धकेलने की आवश्यकता है!"
  • फैसिलिटी लोकेशन म्यूचुअल इंफॉर्मेशन (Facility Location Mutual Information) सबसे अनूठा है। यह समूहों के केंद्र की परवाह नहीं करता है। इसके बजाय, यह समूहों के "मोड्स" या उन विशिष्ट स्थानों की परवाह करता है जहाँ नर्तक वास्तव में खड़े हैं। यदि सेब के समूह के दो अलग-अलग क्लस्टर हैं (शायद लाल सेब और हरे सेब), और संतरे का समूह लाल सेबों के ठीक बगल में है, तो यह टूल उस विशिष्ट ओवरलैप को नोट करता है। यह "रिप्रजेंटेशनल ओवरलैप" को मापता है, यह पूछते हुए, "क्या संतरे लाल सेबों का प्रतिनिधित्व कर सकते हैं?" यह जटिल, बहु-आकार के समूहों के लिए बेहतरीन है।

"जादुई" संयोजन

इनमें से दो उपकरणों को मिलाने में क्या होता है, यह इस पेपर की सबसे रोमांचक खोजों में से एक है: ग्राफ कट टोटल इंफॉर्मेशन और ग्राफ कट म्यूचुअल इंफॉर्मेशन

लेखकों ने गणितीय रूप से सिद्ध किया कि जब आप इन दोनों का एक साथ उपयोग करते हैं, तो आप केवल एक अस्पष्ट "अच्छा" परिणाम प्राप्त नहीं कर रहे हैं। आप वास्तव में ठीक उसी शास्त्रीय गणितीय सूत्र को फिर से बना रहे हैं जिसका उपयोग दशकों से समूहों को अलग करने के लिए किया जाता रहा है (जिसे "एग्रीगेट मीन-सेपरेशन क्राइटेरियन" के रूप में जाना जाता है)। यह खोजने जैसा है कि केक के लिए एक नया, हाई-टेक नुस्खा वास्तव में आपकी दादी के नुस्खे का ही बिल्कुल वही नुस्खा है, बस अलग भाषा में लिखा गया है। यह सिद्ध करता है कि ये आधुनिक, जटिल उपकरण पुराने गणित को बदल नहीं रहे हैं; वे एक ही मौलिक कार्य को करने का एक परिष्कृत, लचीला तरीका हैं।

प्रमाण: सिंथेटिक प्रयोग

यह सुनिश्चित करने के लिए कि वे केवल अनुमान नहीं लगा रहे थे, लेखकों ने "नियंत्रित सिंथेटिक प्रयोगों" की एक श्रृंखला चलाई। कल्पना कीजिए कि उन्होंने एक आभासी दुनिया बनाई जहाँ वे एक समय में केवल एक चीज़ बदलने के लिए नॉब (knobs) घुमा सकते थे।

  • उन्होंने एक समूह के "फैलाव" को बढ़ाया और देखा कि ग्राफ कट टूल बिल्कुल उसके साथ तालमेल बिठाकर ऊपर गया।
  • उन्होंने एक समूह के "आकार" को बदला (एक वृत्त के बजाय एक लंबी रेखा बनाकर) और देखा कि लॉगडेट टूल कैसे बदला, जबकि ग्राफ कट टूल समान रहा।
  • उन्होंने एक दुनिया बनाई जहाँ एक विशाल समूह और एक छोटा समूह था, और देखा कि फैसिलिटी लोकेशन टूल ने छोटे समूह पर लगभग पूरा ध्यान केंद्रित किया, बड़े समूह को अनदेखा कर दिया।

प्रत्येक परीक्षण में, इन उपकरणों का व्यवहार उनके नए सिद्धांत के साथ पूरी तरह मेल खाता था। संख्याएँ सटीक रूप से मेल खाती थीं (कुछ मामलों में 0.984 की तरह)। इसने उन्हें इस बात का उच्च विश्वास दिया कि इन उपकरणों के बारे में उनका स्पष्टीकरण सही है।

यह क्यों मायने रखता है

इस शोध पत्र से पहले, यदि कोई शोधकर्ता इन शक्तिशाली SIM उपकरणों का उपयोग करना चाहता था, तो उसे परीक्षण और त्रुटि (trial and error) के आधार पर यह अनुमान लगाना पड़ता था कि कौन सा चुनना है। वे ऐसा टूल चुन सकते थे जो संतुलित डेटा के लिए अच्छा काम करता था लेकिन असंतुलित डेटा के लिए बुरी तरह विफल हो जाता था।

अब, हमारे पास एक मानचित्र है।

  • यदि आपको समूहों को सघन और गोल रखना है, तो ग्राफ कट का उपयोग करें।
  • यदि आपको समूहों के आकार और फैलाव को ध्यान में रखना है, तो लॉगडेट का उपयोग करें।
  • यदि आपके पास दुर्लभ, मुश्किल से मिलने वाले वर्ग हैं जिन्हें अनदेखा किया जा रहा है, तो फैसिलिटी लोकेशन का उपयोग करें।
  • यदि आप जटिल, बहु-आकार के समूहों के साथ काम कर रहे हैं, तो फैसिलिटी लोकेशन म्यूचुअल इंफॉर्मेशन का उपयोग करें।

यह शोध पत्र केवल यह नहीं कहता कि "ये उपकरण काम करते हैं।" यह समझाता है कि "वे क्यों काम करते हैं और वे क्या माप रहे हैं।" यह एक 'ब्लैक बॉक्स' को स्पष्ट निर्देशों के सेट में बदल देता है, जिससे वैज्ञानिक उस डेटा के विशिष्ट आकार के आधार पर बेहतर AI सिस्टम डिजाइन करने के लिए सही उपकरण चुन सकते हैं जिसे वे समझना चाह रहे हैं। यह रिप्रजेंटेशन लर्निंग को केवल अनुमान लगाने के बजाय सटीक, सिद्धांत आधारित डिजाइन की ओर ले जाने वाला एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →