Proper Dataset Valuation by Pointwise Mutual Information
यह शोध पत्र क्यूरेटेड (curated) और टेस्ट डेटा के बीच म्यूचुअल इंफॉर्मेशन (mutual information) के माध्यम से डेटासेट की गुणवत्ता को परिमाणित करके डेटा क्यूरेशन विधियों के मूल्यांकन के लिए एक सूचना-सैद्धांतिक ढांचा प्रस्तावित करता है, जिससे पारंपरिक टेस्ट-स्कोर-आधारित मेट्रिक्स की सीमाओं को दूर किया जा सके जो ओवरफिटिंग को प्रोत्साहित कर सकते हैं और वास्तविक सूचनात्मकता को पकड़ने में विफल हो सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक आर्टिफिशियल इंटेलिजेंस के युग में, मशीनों को प्रशिक्षित करने के लिए उपयोग किए जाने वाले डेटा की गुणवत्ता उतनी ही महत्वपूर्ण हो गई है जितनी कि स्वयं मशीनों की जटिलता। वर्षों तक, प्रचलित धारणा यह थी कि अधिक डेटा बेहतर होता है, जिससे टेक्स्ट और छवियों के विशाल संग्रह तैयार हुए। हालाँकि, जैसे-जैसे ये सिस्टम बड़े होते जा रहे हैं, शोधकर्ताओं ने महसूस किया है कि केवल मात्रा बढ़ाना पर्याप्त नहीं है; डेटा को वास्तव में उपयोगी होने के लिए उसे क्यूरेट, फ़िल्टर और परिष्कृत किया जाना चाहिए। इस क्षेत्र में केंद्रीय चुनौती यह जानना है कि डेटा को साफ करने और चुनने के कौन से तरीके वास्तव में मॉडल की सीखने की क्षमता में सुधार करते हैं, और कौन से तरीके केवल सिस्टम को एक विशिष्ट परीक्षण पर स्मार्ट दिखने के लिए धोखा देते हैं। यह माप की एक समस्या है: यदि आप डेटा चयन पद्धति का मूल्यांकन केवल इस आधार पर करते हैं कि परिणामी मॉडल एक ज्ञात परीक्षा में कितना अच्छा प्रदर्शन करता है, तो आप ऐसी रणनीतियों को प्रोत्साहित करने का जोखिम उठाते हैं जो वास्तविक पाठ सिखाने के बजाय परीक्षा के प्रश्नों को रटने पर केंद्रित होती हैं।
त्सिंहहुआ विश्वविद्यालय, स्टैनफोर्ड विश्वविद्यालय और टुगेदर एआई (Together AI) के शोधकर्ताओं की एक टीम ने इन डेटा क्यूरेशन पद्धतियों का मूल्यांकन करने का एक नया तरीका प्रस्तावित किया है, जो अंतिम टेस्ट स्कोर से परे जाकर डेटा द्वारा प्रदान की जाने वाली वास्तविक जानकारी को देखता है। उनका तर्क है कि एक अच्छा डेटासेट वह है जो किसी कार्य के वास्तविक नियमों के बारे में अनिश्चितता को कम करता है, एक ऐसी अवधारणा जिसे वे एक ऐसे ढांचे का उपयोग करके औपचारिक रूप दिया गया है जो सुनिश्चित करता है कि अधिक सूचनात्मक डेटा बेहतर और अधिक सामान्यीकरण योग्य (generalizable) मॉडल की ओर ले जाता है। ऐसा करने के लिए, उन्होंने यह गणना करने का एक तरीका विकसित किया कि एक क्यूरेटेड डेटासेट हमें एक अलग टेस्ट डेटासेट के बारे में कितनी जानकारी देता है, जिसके लिए 'म्युचुअल इंफॉर्मेशन' (mutual information) नामक एक गणितीय अवधारणा का उपयोग किया गया है। उनका कार्य प्रदर्शित करता है कि पारंपरिक परीक्षण अक्सर उन रणनीतियों को पुरस्कृत करते हैं जो प्रशिक्षण डेटा को टेस्ट डेटा के समान संदिग्ध रूप से दिखाने के लिए बनाया जाता है, एक ऐसी प्रथा जो नई, अनदेखी स्थितियों को संभालने की मॉडल की क्षमता को कम कर सकती है। इसके विपरीत, उनकी नई स्कोरिंग प्रणाली सही ढंग से पहचान लेती है कि कब एक डेटासेट को उसके वास्तविक सीखने के मूल्य से वंचित कर दिया गया है, भले ही मॉडल के टेस्ट स्कोर में सुधार होता दिखाई दे।
शोधकर्ताओं ने इस प्रक्रिया से शुरुआत की कि उद्योग वर्तमान में डेटा गुणवत्ता को कैसे आंकता है। मानक दृष्टिकोण यह है कि एक डेटासेट लिया जाए, उसे किसी नई तकनीक का उपयोग करके साफ किया जाए, उस पर एक मॉडल को प्रशिक्षित किया जाए, और देखें कि वह मॉडल बेंचमार्क टेस्ट पर कैसा प्रदर्शन करता है। हालांकि यह तार्किक लगता है, लेकिन यह एक खतरनाक प्रोत्साहन पैदा करता है। यदि कोई डेटा क्यूरेटर जानता है कि टेस्ट कैसा दिखता है, तो वह प्रशिक्षण डेटा को टेस्ट वितरण (distribution) के साथ पूरी तरह से मिलाने के लिए उसे बदल सकता है। यह उस विशिष्ट परीक्षा के स्कोर को बढ़ा सकता है, लेकिन इसका अक्सर अर्थ यह होता है कि मॉडल ने समस्या के सामान्य सिद्धांतों को सीखने के बजाय टेस्ट के विशिष्ट पैटर्न को पहचानना सीख लिया है। शोधकर्ता इसे "रणनीतिक" (strategic) क्यूरेशन कहते हैं। यह सिस्टम में हेरफेर करने का एक रूप है जहाँ डेटा समस्या की वास्तविक प्रकृति के बारे में कम सूचनात्मक हो जाता है, भले ही टेस्ट के परिणाम बेहतर दिखें। इसे ठीक करने के लिए, उन्हें सीधे "सूचनात्मकता" (informativeness) को मापने का एक तरीका चाहिए था, जो कि एक विशिष्ट सेट के प्रश्नों पर मॉडल के स्कोर से स्वतंत्र हो।
वे सूचना सिद्धांत (information theory) की एक अवधारणा की ओर मुड़े जिसे 'ब्लैकवेल ऑर्डरिंग' (Blackwell ordering) कहा जाता है, जो यह तुलना करने का एक कठोर तरीका प्रदान करती है कि विभिन्न डेटासेट एक अज्ञात सत्य के बारे में कितनी जानकारी रखते हैं। सरल शब्दों में, यदि एक डेटासेट आपको दूसरे की तुलना में एक छिपे हुए सत्य के बारे में बेहतर निर्णय लेने में सक्षम बनाता है, तो उसे अधिक सूचनात्मक माना जाता है। शोधकर्ताओं ने दिखाया कि यदि कोई डेटा क्यूरेशन पद्धति डेटासेट को इस ऑर्डरिंग के अनुसार कम सूचनात्मक बनाती है, तो वह एक रणनीतिक पद्धति है जिसे दंडित किया जाना चाहिए। व्यवहार में इस सूचनात्मकता को मापने के लिए, उन्होंने क्यूरेटेड ट्रेनिंग डेटा और टेस्ट डेटा के बीच 'म्युचुअल इंफॉर्मेशन' की गणना करने का प्रस्ताव दिया। म्युचुअल इंफॉर्मेशन यह मापने का एक तरीका है कि एक चीज़ को जानने से आपको दूसरी चीज़ के बारे में कितनी जानकारी मिलती है। यदि ट्रेनिंग डेटा और टेस्ट डेटा एक-दूसरे के बारे में अत्यधिक सूचनात्मक हैं, तो यह सुझाव देता है कि ट्रेनिंग डेटा समस्या की वास्तविक अंतर्निहित संरचना को कैप्चर कर रहा है। यदि कोई क्यूरेशन पद्धति इस संबंध को कम करती है, तो इसकी संभावना है कि वह मूल्यवान लर्निंग सिग्नल को हटा रही है।
चुनौती यह थी कि बड़े, जटिल डेटासेट्स के लिए इस म्युचुअल इंफॉर्मेशन की गणना करना अत्यंत कठिन है। मौजूदा तरीके छोटे, सरल डेटा पॉइंट्स के लिए तो ठीक काम करते हैं, लेकिन हजारों छवियों या टेक्स्ट दस्तावेजों की उच्च-आयामी जटिलता के सामने विफल हो जाते हैं। इस पर काबू पाने के लिए, टीम ने एक अभिनव दृष्टिकोण विकसित किया जो डेटासेट को मशीन लर्निंग मॉडल को प्रशिक्षित करने के एक उपकरण के रूप में देखता है। कच्चे डेटा पॉइंट्स की सीधे तुलना करने के बजाय, उन्होंने एक 'बायेसियन मॉडल' (Bayesian model)—जो विभिन्न परिणामों की संभावना का अनुमान लगाने वाला एक प्रकार का मॉडल है—को पहले ट्रेनिंग डेटा पर और फिर टेस्ट डेटा पर प्रशिक्षित किया। यह विश्लेषण करके कि ट्रेनिंग डेटा बनाम टेस्ट डेटा देखने पर मॉडल के विश्व संबंधी विश्वासों (beliefs) में कैसे बदलाव आया, वे एक सटीक स्कोर निकाल सके कि ट्रेनिंग सेट ने कितनी जानकारी प्रदान की। यह स्कोर, जिसे वे 'पॉइंटवाइज म्युचुअल इंफॉर्मेशन' (Pointwise Mutual Information - PMI) स्कोर कहते हैं, डेटा गुणवत्ता के लिए एक 'सत्यवादी' (truth-teller) के रूप में कार्य करता है।
शोधकर्ताओं ने कई वास्तविक दुनिया के परिदृश्यों पर अपने तरीके का परीक्षण किया, जिसमें इमेज क्लासिफिकेशन कार्यों से लेकर बड़े लैंग्वेज मॉडल का प्रशिक्षण तक शामिल है। प्रयोगों के एक सेट में, उन्होंने ऐसे डेटासेट्स बनाए जहाँ ट्रेनिंग डेटा में आवश्यक विशेषताएं (जैसे अंक का आकार) और गैर-आवश्यक विशेषताएं (जैसे बैकग्राउंड का रंग) दोनों मौजूद थीं। फिर उन्होंने दो अलग-अलग क्यूरेशन रणनीतियां लागू कीं: एक जिसने डेटा की गुणवत्ता सुधारने के लिए गलत लेबल वाले डेटा को हटाया, और दूसरी जिसने ट्रेनिंग सेट को टेस्ट सेट जैसा दिखाने के लिए केवल गैर-आवश्यक बैकग्राउंड कलर के आधार पर डेटा को हटाया। परिणाम स्पष्ट थे। पारंपरिक टेस्ट-स्कोर पद्धति ने उस रणनीति को उच्च स्कोर दिया जिसने बैकग्राउंड कलर के आधार पर डेटा हटाया, जिससे गलत रूप से यह संकेत मिला कि यह एक बेहतर दृष्टिकोण है। वास्तव में, इस रणनीति ने मॉडल को वास्तविक आकृतियों के बारे में सिखाने की डेटासेट की क्षमता को कम कर दिया था। हालाँकि, नए PMI स्कोर ने इस रणनीतिक निष्कासन को सही ढंग से कम स्कोर दिया, यह पहचानते हुए कि इसने डेटा के वास्तविक सीखने के मूल्य को छीन लिया था।
लार्ज लैंग्वेज मॉडल्स के साथ किए गए आगे के प्रयोगों ने इन निष्कर्षों की पुष्टि की। टीम ने उन डेटासेट्स का उपयोग किया जो यह परीक्षण करने के लिए डिज़ाइन किए गए थे कि मॉडल नए, अनदेखे प्रकार के प्रश्नों पर कितनी अच्छी तरह से सामान्यीकरण (generalize) कर सकते हैं। उन्होंने ट्रेनिंग डेटा के चयन के तीन तरीकों की तुलना की: एक जो विविधता (diversity) को अधिकतम करता है, एक जो रैंडम है, और एक जो अत्यधिक समान, रेडंडेंट (redundant) उदाहरणों पर केंद्रित है। ट्रेनिंग डेटा के अपने वितरण पर मानक टेस्ट सटीकता ने रेडंडेंट, कम विविधता वाले चयन का पक्ष लिया, जिससे उसे उच्चतम स्कोर मिला। हालाँकि, जब इन मॉडल्स का पूरी तरह से अलग, वास्तविक दुनिया के डेटासेट पर परीक्षण किया गया, तो रेडंडेंट डेटा पर प्रशिक्षित मॉडल का प्रदर्शन सबसे खराब रहा। इसके विपरीत, PMI स्कोर ने विविध, उच्च-गुणवत्ता वाले डेटा को सर्वश्रेष्ठ के रूप में रैंक किया, जो मॉडल की वास्तविक सामान्यीकरण क्षमता के साथ पूरी तरह मेल खाता था। इसने पुष्टि की कि नया मीट्रिक वास्तव में मॉडल को सिखाने वाले डेटा और केवल एक विशिष्ट टेस्ट को रटने में मदद करने वाले डेटा के बीच सफलतापूर्वक अंतर करता है।
इस कार्य के निहितार्थ आर्टिफिशियल इंटेलिजेंस के भविष्य के लिए महत्वपूर्ण हैं। जैसे-जैसे मॉडल अधिक शक्तिशाली होते जा रहे हैं, बाधा कंप्यूटिंग पावर से हटकर उस डेटा की गुणवत्ता पर आ गई है जिसका वे उपभोग करते हैं। यदि शोधकर्ता डेटा क्यूरेट करने के लिए टेस्ट स्कोर पर निर्भर रहना जारी रखते हैं, तो वे ऐसे मॉडल बनाने का जोखिम उठाते हैं जो नाजुक (brittle) होते हैं और अप्रत्याशित स्थितियों का सामना करने पर विफल हो जाते हैं। नया PMI स्कोरिंग फंक्शन यह सुनिश्चित करने का एक तरीका प्रदान करता है कि डेटा क्यूरेशन के प्रयास वास्तविक सीखने के बजाय रणनीतिक हेरफेर पर केंद्रित न हों। डेटा की वास्तविक सूचनात्मकता को मापने का एक विश्वसनीय तरीका प्रदान करके, यह पद्धति डेवलपर्स को ऐसे सिस्टम बनाने में मदद करती है जो न केवल परीक्षा पास करने में अच्छे हैं, बल्कि मजबूत और जटिल, विविध दुनिया को समझने में सक्षम भी हैं। अध्ययन इस निष्कर्ष के साथ समाप्त होता है कि जबकि पारंपरिक मीट्रिक्स भ्रामक हो सकते हैं, ट्रेनिंग और टेस्ट डेटा के बीच के संबंध पर आधारित एक सूचना-सिद्धांत (information-theoretic) दृष्टिकोण आधुनिक बुद्धिमत्ता को संचालित करने वाले डेटा की गुणवत्ता का मूल्यांकन करने के लिए एक स्पष्ट, सिद्धांतवादी मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।