← नवीनतम पेपर
🤖 machine learning

T-REGS: Minimum Spanning Tree Regularization for Self-Supervised Learning

यह शोधपत्र T-REGS को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित शिक्षण ढांचा (self-supervised learning framework) है जो सीखे गए निरूपणों (representations) पर वितरण एकरूपता (distribution uniformity) को बढ़ावा देने के साथ-साथ आयामी पतन (dimensional collapse) को सैद्धांतिक और अनुभवजन्य रूप से रोकने के लिए न्यूनतम स्पैनिंग ट्री लंबाई (Minimum Spanning Tree length) को एक नियमितीकरण पद (regularization term) के रूप में उपयोग करता है।

मूल लेखक: Julie Mordacq, David Loiseaux, Vicky Kalogeiton, Steve Oudot

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Julie Mordacq, David Loiseaux, Vicky Kalogeiton, Steve Oudot

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को बिना किसी लेबल (जैसे "बिल्ली" या "कुत्ता") के तस्वीरें समझना सिखाने की कोशिश कर रहे हैं। इसे सेल्फ-सुपरवाइज्ड लर्निंग (Self-Supervised Learning) कहा जाता है। कंप्यूटर एक ही फोटो के दो अलग-अलग संस्करणों को देखकर सीखता है (शायद एक धुंधली है, और दूसरा क्रॉप किया हुआ) और यह पता लगाने की कोशिश करता है कि वे एक ही चीज़ हैं।

हालाँकि, एक बड़ी समस्या है: कंप्यूटर अक्सर आलसी हो जाता है। समृद्ध, विस्तृत विशेषताओं को सीखने के बजाय, यह हर तस्वीर के लिए बिल्कुल एक जैसा उबाऊ उत्तर दे सकता है। इसे "कोलैप्स" (Collapse) कहा जाता है। यह एक ऐसे छात्र की तरह है जो पूरे पाठ्यपुस्तक को पढ़ने के बजाय, हर अध्याय के पहले वाक्य को रट लेता है और हर टेस्ट प्रश्न का वही एक ही उत्तर देता है।

इस शोध पत्र के लेखकों, जूली मोर्डैक (Julie Mordacq) और उनकी टीम ने कंप्यूटर को आलसी होने से रोकने के लिए एक नया टूल बनाया है जिसे T-REGS कहा जाता है। यह कैसे काम करता है, यहाँ सरल रूप में समझाया गया है:

समस्या: "भीड़भाड़ वाला कमरा" बनाम "खाली कमरा"

जब एक कंप्यूटर सीखता है, तो वह हर तस्वीर को संख्याओं की एक सूची (एक बहु-आयामी स्थान में एक बिंदु) में बदल देता है।

  1. डायमेंशनल कोलैप्स (Dimensional Collapse): कल्पना कीजिए कि ये सभी बिंदु कमरे के एक छोटे से कोने में सिमट गए हैं। कंप्यूटर ने कमरे के अधिकांश आयामों (dimensions) को भुला दिया है। वह अपनी पूरी मानसिक शक्ति का उपयोग नहीं कर रहा है।
  2. एकरूपता का अभाव (Lack of Uniformity): भले ही वे सिमटे हुए न हों, लेकिन वे एक तंग घेरे में भी हो सकते हैं। वे पूरे स्थान में समान रूप से नहीं फैले हुए हैं।

लक्ष्य यह है कि कंप्यूटर इन बिंदुओं को जितना संभव हो सके उतना दूर फैला दे, ताकि वे पूरे "कमरे" को समान रूप से भर दें, जिससे वह हर तस्वीर को स्पष्ट रूप से पहचान सके।

समाधान: "मिनिमम स्पैनिंग ट्री" (Minimum Spanning Tree - MST)

लेखक गणित की एक अवधारणा का उपयोग करते हैं जिसे मिनिमम स्पैनिंग ट्री (Minimum Spanning Tree) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आपके पास मैदान में खड़े लोगों का एक समूह है। आप उन सभी को एक एकल रस्सी नेटवर्क से जोड़ना चाहते हैं ताकि हर कोई जुड़ा रहे, लेकिन आप रस्सी की कुल लंबाई को यथासंभव कम रखना चाहते हैं। वह सबसे छोटा नेटवर्क ही "मिनिमम स्पैनिंग ट्री" है।
  • ट्रिक: आमतौर पर, यदि आप रस्सी को कम करना चाहते हैं, तो आप लोगों को करीब लाते हैं। लेकिन T-REGS इसके विपरीत करता है: यह उस रस्सी की लंबाई को अधिकतम (maximize) करने की कोशिश करता है।

कंप्यूटर को जोड़ने वाली "रस्सी" की लंबाई को यथासंभव लंबा बनाने के लिए मजबूर करके, T-REGS कंप्यूटर को बिंदुओं को दूर धकेलने के लिए मजबूर करता है। वह उन्हें एक साथ गुच्छों में नहीं रख सकता, क्योंकि इससे रस्सी बहुत छोटी हो जाएगी।

सुरक्षा जाल: "गोला" (The Sphere)

एक पेच है। यदि आप केवल कंप्यूटर को "रस्सी की लंबाई बढ़ाएं" कहते हैं बिना किसी नियम के, तो बिंदु अनंत की ओर उड़ जाएंगे, रस्सी को हमेशा के लिए खींच देंगे। यह उपयोगी नहीं है।

इसलिए, T-REsGS एक दूसरा नियम जोड़ता है: बिंदुओं को एक विशाल, अदृश्य गेंद (गोले) की सतह पर रहना चाहिए।

  • अब, कंप्यूटर को इस गोले की सतह पर रहते हुए बिंदुओं को एक-दूसरे से जितना संभव हो सके उतना दूर धकेलना होगा।
  • इस गोले पर रहते हुए रस्सी को यथासंभव लंबा बनाने का एकमात्र तरीका यह है कि बिंदुओं को पूरे सतह पर एक समान रूप से फैला दिया जाए, जैसे कि एक पूर्ण ज्यामितीय आकार (simplex) के कोने।

उन्होंने क्या पाया

यह शोध पत्र दिखाता है कि यह सरल विचार वास्तव में बहुत अच्छा काम करता है:

  1. यह कोलैप्स को रोकता है: कंप्यूटर को अपने सभी आयामों का उपयोग करने के लिए मजबूर किया जाता है; वह एक कोने में छिप नहीं सकता।
  2. यह एकरूपता लाता है: डेटा बिंदु समान रूप से फैल जाते हैं, जैसे पार्टी में आए मेहमान जिन्हें एक-दूसरे से जितना संभव हो सके दूर खड़े होने के लिए कहा गया हो, जबकि वे कमरे में ही हैं।
  3. यह वास्तविक डेटा पर काम करता है: उन्होंने मानक इमेज डेटासेट (जैसे CIFAR और ImageNet) पर इसका परीक्षण किया। जब उन्होंने मौजूदा लर्निंग मेथड्स में T-REGS जोड़ा, तो कंप्यूटर चित्र पहचानने में बेहतर हो गए।
  4. यह टेक्स्ट और इमेज दोनों पर काम करता है: उन्होंने इसे एक ऐसे सिस्टम पर भी टेस्ट किया जो फोटो को टेक्स्ट के साथ मिलाता है (जैसे CLIP)। इसने सिस्टम को छवियों और शब्दों दोनों को बेहतर ढंग से समझने में मदद की क्योंकि इसने दोनों के लिए "मानसिक स्थान" को समान रूप से भरा।

संक्षेप में

T-REGS को एक सख्त शिक्षक के रूप में सोचें जो कंप्यूटर को कहता है: "आप अपने उत्तरों को एक साथ इकट्ठा नहीं कर सकते, और आप पन्ने से बाहर नहीं उड़ सकते। आपको अपने उत्तरों को पूरे पन्ने पर यथासंभव दूर तक फैलाना होगा, हर कोने को समान रूप से भरना होगा।"

यह कंप्यूटर को दुनिया को देखने का एक बहुत अधिक समृद्ध, विस्तृत और उपयोगी तरीका सीखने के लिए मजबूर करता है, बिना किसी मानवीय लेबल की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →