← नवीनतम पेपर
🤖 machine learning

Mapping the Concept Landscape: Structural Perception of Global Distributions for Transparent Data Pruning

यह शोध पत्र मैपिंग द कॉन्सेप्ट लैंडस्केप (MCL) प्रस्तुत करता है, जो एक पारदर्शी डेटा प्रूनिंग फ्रेमवर्क है जो वैश्विक अर्थपूर्ण वितरणों (global semantic distributions) को मॉडल करने के लिए अमूर्त एम्बेडिंग्स के स्थान पर स्पष्ट नमूना-स्तरीय ग्राफों (sample-level graphs) का उपयोग करता है, जिससे एक ग्रीडी एल्गोरिदम कुशलतापूर्वक उन नमूनों का चयन कर पाता है जो दुर्लभ और उच्च-मूल्य वाले अवधारणाओं के कवरेज को अधिकतम करते हैं।

मूल लेखक: Dongyue Wu, Tao Ma

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongyue Wu, Tao Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की इस विशाल और शोर भरी दुनिया में, मशीनें डेटा के पहाड़ों का अध्ययन करके देखना और बोलना सीख रही हैं। कंप्यूटर को एक छवि को समझने और उसे शब्दों में वर्णित करने के लिए सिखाने हेतु, शोधकर्ता इसे लाखों उदाहरण देते हैं, जिसमें चित्रों को उनके टेक्स्ट विवरणों के साथ जोड़ा जाता है। इस प्रक्रिया ने उल्लेखनीय सफलताएं दी हैं, जिससे कंप्यूटर कहानियाँ बनाने, प्रश्नों के उत्तर देने और समस्याओं को हल करने में सक्षम हुए हैं। हालाँकि, इस सफलता की एक भारी कीमत है। आवश्यक डेटासेट इतने विशाल हैं कि वे भारी मात्रा में स्टोरेज और कंप्यूटिंग पावर की मांग करते हैं, जिन्हें अक्सर एक एकल मॉडल को प्रशिक्षित करने में कई दिन या सप्ताह लग जाते हैं। इसके अलावा, ये विशाल संग्रह दोहराव वाले, निम्न-गुणवत्ता वाले या अनावश्यक उदाहरणों से भरे होते हैं जो मशीन को कुछ भी नया सीखने में मदद नहीं करते हैं। आज वैज्ञानिकों के लिए केंद्रीय चुनौती केवल अधिक डेटा एकत्र करना नहीं है, बल्कि यह समझना है कि सबसे उपयोगी हिस्सों को कैसे रखा जाए। उन्हें इन डेटासेट से 'फालतू चर्बी' को इस तरह काटने की आवश्यकता है कि वह 'मांसपेशी' न कटे जो मॉडल को बुद्धिमान बनाती है, और साथ ही यह भी समझना है कि वे वास्तव में क्या रख रहे हैं और क्यों।

शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए एक नया तरीका प्रस्तावित किया है, जो डेटा को उसके छिपे हुए, गणितीय आकार के आधार पर आंकने की मानक पद्धति से अलग है। वर्तमान में, अधिकांश प्रणालियाँ प्रत्येक छवि और उसके विवरण को संख्याओं के एक एकल, संकुचित ब्लॉक (compressed block) के रूप में मानती हैं। हालांकि यह कंप्यूटरों के लिए कुशल है, लेकिन यह दृष्टिकोण किसी पुस्तकालय को केवल किताबों के वजन को देखकर समझने की कोशिश करने जैसा है; यह आपको उनके भीतर की कहानियों के बारे में कुछ नहीं बताता। क्योंकि ये संकुचित ब्लॉक विशिष्ट विवरणों को छिपा देते हैं, इसलिए प्रणालियाँ उन दो नमूनों के बीच अंतर करने में संघर्ष करती हैं जो गणितीय रूप से समान दिखते हैं लेकिन जिनमें बहुत अलग विचार होते हैं। वे गलती से एक दुर्लभ, मूल्यवान अवधारणा को हटा सकते हैं क्योंकि वह गणितीय स्थान में एक सामान्य चीज़ की तरह दिखाई देती थी, या वे ढेर सारी लगभग एक जैसी छवियों को केवल इसलिए रख सकते हैं क्योंकि वे गणना में दूर-दूर स्थित हैं। स्पष्टता की इस कमी के कारण मनुष्यों के लिए इस प्रक्रिया का ऑडिट करना या यह समझना कठिन हो जाता है कि मशीन वास्तव में क्या सीख रही है।

इसे ठीक करने के लिए, शोधकर्ताओं ने 'मैपिंग द कॉन्सेप्ट लैंडस्केप' (Mapping the Concept Landscape) नामक एक ढांचा विकसित किया। डेटा को संख्याओं के ब्लैक बॉक्स के भीतर छिपाने के बजाय, वे प्रत्येक छवि और उसके कैप्शन को उसके सबसे छोटे, समझने योग्य टुकड़ों में तोड़ देते हैं। वे प्रत्येक उदाहरण को विशिष्ट विचारों के एक छोटे मानचित्र के रूप में देखते हैं: मौजूद वस्तुएं, हो रही क्रियाएं और उनका वर्णन करने वाले विवरण। उदाहरण के लिए, साइकिल चलाते हुए एक व्यक्ति की तस्वीर केवल एक डेटा पॉइंट नहीं है; यह विशिष्ट अवधारणाओं जैसे "व्यक्ति", "चलाना", "साइकिल", "लाल कपड़े" और "घास" का एक संग्रह है। इन टुकड़ों को बाहर निकालकर, शोधकर्ता देख सकते हैं कि डेटासेट में वास्तव में क्या है। फिर वे इन व्यक्तिगत मानचित्रों को एक साथ जोड़कर पूरे संग्रह का एक एकल, विशाल मानचित्र बनाते हैं। यह वैश्विक मानचित्र दिखाता है कि कौन से विचार लगातार आते हैं और कौन से दुर्लभ हैं, जो डेटासेट की वास्तविक सामग्री की एक स्पष्ट, मानव-पठनीय तस्वीर प्रदान करता है।

इस परिदृश्य के स्पष्ट दृश्य के साथ, टीम ने सर्वोत्तम डेटा चुनने के लिए एक स्मार्ट चयन प्रक्रिया बनाई। कल्पना कीजिए कि आप एक ऐसा संग्रह बनाने की कोशिश कर रहे हैं जो हर संभावित विषय को कवर करे, लेकिन आप केवल कुछ ही किताबें रख सकते हैं। आप केवल सबसे लोकप्रिय किताबें नहीं चुनेंगे, क्योंकि आपके पास पहले से ही वैसी कई किताबें हैं। इसके बजाय, आप उन किताबों की तलाश करेंगे जो वे विषय पेश करती हैं जो अभी तक आपके पास नहीं हैं। शोधकर्ताओं की विधि भी इसी तरह काम करती है। यह एक खाली चयन के साथ शुरू होती है और एक समय में एक उदाहरण जोड़ती है। प्रत्येक चरण में, यह शेष उदाहरणों को देखती है और उस एक को चुनती है जो सबसे अधिक नए, मूल्यवान विचार लाता है जो वर्तमान में संग्रह में मौजूद नहीं हैं। यदि किसी उदाहरण में एक सामान्य विचार है जो पहले से ही अच्छी तरह से प्रतिनिधित्व किया गया है, तो उसे कम स्कोर दिया जाता है। यदि इसमें एक दुर्लभ विचार या क्रियाओं और वस्तुओं का एक अनूठा संयोजन है, तो उसे उच्च स्कोर मिलता है। यह प्रक्रिया तब तक दोहराई जाती है जब तक कि वांछित मात्रा में डेटा एकत्र नहीं हो जाता, जिससे यह सुनिश्चित होता है कि अंतिम सेट केवल सबसे आम चीजों का यादृच्छिक मिश्रण होने के बजाय विविध, सूचनात्मक अवधारणाओं से भरा हो।

इसके परिणाम आश्चर्यजनक हैं। विजन और लैंग्वेज मॉडल्स को प्रशिक्षित करने के लिए उपयोग किए जाने वाले विशाल डेटासेट्स पर परीक्षण करते समय, इस नई पद्धति ने मूल डेटा के दस प्रतिशत से भी कम हिस्से को चुनने में सफलता प्राप्त की, जबकि इसने पूर्ण डेटासेट का उपयोग करने के लगभग समान प्रदर्शन हासिल किया। कुछ मामलों में, छोटा किया गया मॉडल उसी तरह बेहतर प्रदर्शन करता है, लेकिन इसने इसे बहुत कम समय में किया। शोधकर्ताओं ने पाया कि उनकी विधि न केवल तेज़ थी, बल्कि उन पिछली तकनीकों की तुलना में अधिक प्रभावी भी थी जो छिपे हुए गणितीय ब्लॉकों पर निर्भर थीं। वास्तविक अवधारणाओं पर ध्यान केंद्रित करके, न कि अमूर्त संख्याओं पर, सिस्टम ने दोहराव वाले डेटा को रखने के जाल से खुद को बचाया और उन दुर्लभ, महत्वपूर्ण विवरणों को सफलतापूर्वक संरक्षित किया जो एक मॉडल को सुदृढ़ बनाते हैं। इसके अलावा, क्योंकि चयन "व्यक्ति", "साइकिल" या "घास" जैसे दृश्य योग्य अवधारणाओं पर आधारित है, पूरी प्रक्रिया पारदर्शी है। एक मनुष्य अंतिम चयन को देख सकता है और तुरंत समझ सकता है कि उन विशिष्ट छवियों को क्यों चुना गया था, जिससे वह सामान्य और दुर्लभ विचारों के संतुलित मिश्रण को देख सकता है, न कि एक रहस्यमय, अस्पष्ट सूची को।

यह कार्य यह दर्शाता है कि हमें उपयोगी बनाने के लिए दुनिया के डेटा को फेंकने की आवश्यकता नहीं है; हमें बस इसे बेहतर ढंग से समझने की आवश्यकता है। स्पष्ट, संरचित अवधारणाओं पर ध्यान केंद्रित करके, शोधकर्ताओं ने दिखाया है कि बुद्धिमत्ता का त्याग किए बिना छोटे, स्वच्छ और अधिक कुशल डेटासेट बनाना संभव है। यह पद्धति सिद्ध करती है कि जब हम डेटा को केवल संख्याओं के बजाय सार्थक विचारों के संग्रह के रूप में देखते हैं, तो हम तेज़ और अधिक प्रभावी ढंग से सीखने वाली स्मार्ट मशीनें बना सकते हैं, और साथ ही इस प्रक्रिया को उन लोगों के लिए खुला और समझने योग्य रख सकते हैं जो इन्हें बनाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →