Rethinking Learning with Noisy Labels: A CriticalReview of Structured Supervision, RepresentationDynamics, and Robust-Learning Pipelines
यह आलोचनात्मक विवरणात्मक समीक्षा रैंडम एरर धारणाओं से आगे बढ़कर संरचित पर्यवेक्षण विसंगतियों, प्रतिनिधित्व गतिशीलता और सुदृढ़ पाइपलाइनों का विश्लेषण करके नॉइज़ी लेबल्स के साथ सीखने को पुनर्परिभाषित करती है, जो अंततः आधुनिक फाउंडेशन-मॉडल और ओपन-वर्ल्ड पारिस्थितिक तंत्रों की चुनौतियों को संबोधित करने के लिए शोर संबंधी धारणाओं को जोखिम सुधार और मूल्यांकन प्रोटोकॉल से जोड़ती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, मशीनें उदाहरणों को देखकर और यह जानकर सीखती हैं कि वे उदाहरण क्या हैं। यदि कोई कंप्यूटर बिल्ली की तस्वीर देखता है और उसे "बिल्ली" बताया जाता है, तो वह बिल्लियों को पहचानना सीख जाता है। यह प्रक्रिया एक मौलिक धारणा पर टिकी है: लेबल जो मशीन को बता रहे हैं कि वह क्या देख रही है, वे सही हैं। दशकों तक, शोधकर्ताओं ने ऐसे सिस्टम बनाए जो यह मानकर चलते थे कि ये लेबल त्रुटिहीन हैं, जैसे कि एक शिक्षक जो कभी गलती नहीं करता। लेकिन वास्तविक दुनिया में, यह धारणा टूट रही है। आधुनिक एआई सिस्टम इंटरनेट, क्राउडसोर्स्ड श्रमिकों और यहाँ तक कि अन्य आर्टिफिशियल इंटेलिजेंस मॉडल से एकत्र किए गए डेटा पर प्रशिक्षित होते हैं। ये स्रोत अव्यवस्थित हैं। कुत्ते की एक तस्वीर को भेड़ के रूप में गलत लेबल किया जा सकता है क्योंकि दोनों जानवर दिखने में समान हैं, या एक मेडिकल इमेज को गलत स्थिति के साथ टैग किया जा सकता है क्योंकि विभिन्न विशेषज्ञों के बीच निदान पर असहमति हो सकती है। जब प्रशिक्षण डेटा इन त्रुटियों से भरा होता है, तो मशीन गलत सबक सीख सकती है, सत्य के बजाय गलतियों को याद कर लेती है।
यह 'नॉइजी लेबल्स' (noisy labels) के साथ सीखने की समस्या है। लंबे समय तक, वैज्ञानिकों ने इन त्रुटियों को सरल, यादृच्छिक (random) दुर्घटनाओं के रूप में माना, जैसे कि सही या गलत तय करने के लिए सिक्का उछालना। उन्होंने माना कि यदि कंप्यूटर को पर्याप्त डेटा दिया जाए, तो यादृच्छिक गलतियाँ एक-दूसरे को निष्प्रभावी कर देंगी। हालाँकि, एक नया दृष्टिकोण सुझाव देता है कि यह दृष्टिकोण बहुत सरल है। आधुनिक डेटा में त्रुटियाँ यादृच्छिक नहीं हैं; वे संरचित (structured) हैं। वे इस आधार पर पैटर्न का पालन करती हैं कि वस्तुएं दिखने में कितनी समान हैं, किसी विशिष्ट छवि की व्याख्या करना कितना कठिन है, या डेटा कैसे एकत्र किया गया था। बीजिंग इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं, वेनक्सियाओ फैन और कान ली द्वारा किए गए एक हालिया महत्वपूर्ण समीक्षा में तर्क दिया गया है कि हमें त्रुटियों को ठीक करने के लिए सरल गलतियों के रूप में देखना बंद करना चाहिए और उन्हें उस जटिल बेमेल (mismatch) के रूप में समझना शुरू करना चाहिए जो डेटा जो दिखा रहा है और जो सिस्टम को बताया जा रहा है, उसके बीच है।
शोधकर्ताओं ने इस नए परिदृश्य को मैप करने का प्रयास किया, जो केवल त्रुटियों को ठीक करने के तरीकों की एक साधारण सूची से आगे बढ़ता है। इसके बजाय, उन्होंने यह परीक्षण किया कि जब लेबल अविश्वसनीय होते हैं तो सीखने की प्रक्रिया स्वयं कैसे बदल जाती है। उन्होंने पाया कि कंप्यूटर के सीखने का क्षण एक स्थिर घटना नहीं बल्कि एक गतिशील यात्रा है। प्रशिक्षण के शुरुआती चरणों में, मशीन पहले सरल, स्पष्ट पैटर्न सीखती है। एक सामान्य, आसानी से पहचाने जाने वाली वस्तु की तस्वीर को फिट करना एक भ्रमित करने वाली वस्तु की तुलना में आसान है। यह एक संक्षिप्त अवसर की खिड़की बनाता है जहाँ कंप्यूटर एक स्वच्छ, सही उदाहरण और एक नॉइजी, गलत उदाहरण के बीच अंतर कर सकता है। शोधकर्ताओं ने दिखाया कि यह खिड़की एक गारंटी नहीं है; यह डेटा की संरचना पर बहुत अधिक निर्भर करती है। यदि त्रुटियाँ सूक्ष्म हैं, जैसे कि पक्षियों के दो बहुत समान प्रकारों को भ्रमित करना, तो कंप्यूटर सही पैटर्न के जितनी तेज़ी से गलत पैटर्न भी सीख सकता है, जिससे वह सुधार करने के लिए खिड़की के बंद होने से पहले ही इसे बंद कर देता है।
उनके काम का एक बड़ा हिस्सा एक लोकप्रिय रणनीति का परीक्षण करना था जिसका उपयोग कई एआई सिस्टम द्वारा किया जाता है: उन उदाहरणों पर भरोसा करना जिन्हें कंप्यूटर सबसे आसानी से सीख लेता है। विचार यह है कि यदि कंप्यूटर किसी छवि पर छोटी सी गलती करता है, तो लेबल संभवतः सही है, लेकिन यदि वह संघर्ष करता है, तो लेबल संभवतः गलत है। शोधकर्ताओं ने प्रदर्शित किया कि इस रणनीति में एक छिपा हुआ दोष है। जब त्रुटियाँ संरचित होती हैं—अर्थात जब गलत लेबल छवियों पर इस तरह से लगाए जाते हैं जो अर्थपूर्ण (semantically) रूप से तर्कसंगत हों, जैसे कि ट्रक को कार के रूप में भ्रमित करना क्योंकि वे दोनों वाहन हैं—तो कंप्यूटर सही पैटर्न के जितनी आसानी से गलत पैटर्न भी सीख सकता है। इन मामलों में, "आसान" उदाहरण आवश्यक रूप से सही नहीं होते हैं। कंप्यूटर आत्मविश्वास के साथ एक गलत लेबल को याद कर सकता है क्योंकि वह छवि गलत श्रेणी में अच्छी तरह से फिट बैठती है, जिससे कार्य की कठिनाई का उपयोग करके सत्य को त्रुटि से अलग करना असंभव हो जाता है।
इसे संबोधित करने के लिए, लेखक समाधान को एक एकल उपकरण के रूप में नहीं, बल्कि पांच जुड़े हुए चरणों के एक पाइपलाइन के रूप में देखते हैं। पहला, सिस्टम को मौजूद शोर (noise) के प्रकार को समझना चाहिए, यह समझना कि त्रुटियाँ यादृच्छिक हैं, संरचित हैं, या अपेक्षित श्रेणियों से बाहर से आती हैं। दूसरा, इसे उन संकेतों को अलग करना चाहिए जो वास्तव में विश्वसनीय हैं, केवल छवि की कठिनाई के बजाय अन्य चीजों का उपयोग करना, जैसे कि यह देखना कि समान छवियां एक साथ कैसे समूह बनाती हैं। तीसरा, इसे लक्ष्यों को परिष्कृत करना चाहिए, जिसका अर्थ है कि इसे केवल एक गलत लेबल को सही लेबल से बदलना नहीं चाहिए, बल्कि कंप्यूटर के विश्वास और अनिश्चितता को समायोजित करना चाहिए कि वह क्या देख रहा है। चौथा, सिस्टम को डेटा की ज्यामिति (geometry) को संरक्षित करना चाहिए, यह सुनिश्चित करते हुए कि विभिन्न वस्तुओं के बीच संबंध बरकरार रहें भले ही लेबल गलत हों। अंत में, सिस्टम को अपनी सीखने की प्रक्रिया को नियंत्रित करना चाहिए, यह जानना कि कब रुकना है और कब आगे बढ़ना है ताकि गलतियों को याद करने से बचा जा सके।
समीक्षा यह भी रेखांकित करती है कि इन सिस्टमों का परीक्षण करने का तरीका अक्सर त्रुटिपूर्ण होता है। कई अध्ययन सिंथेटिक शोर (synthetic noise) का उपयोग करते हैं, जहाँ शोधकर्ता अपने तरीकों का परीक्षण करने के लिए नियंत्रित तरीके से लेबल को कृत्रिम रूप से बदलते हैं। लेखक तर्क देते हैं कि यह वास्तविकता को प्रतिबिंबित नहीं करता है। वास्तविक दुनिया की त्रुटियाँ अधिक जटिल होती हैं और अक्सर सही डेटा से अलग करना कठिन होता है। उन्होंने उन बेंचमार्क की जांच की जो वास्तविक मानवीय त्रुटियों का उपयोग करते हैं और पाया कि जो तरीके कृत्रिम परीक्षणों पर पूरी तरह से काम करते हैं, वे अक्सर इंटरनेट या मेडिकल रिकॉर्ड की अव्यवस्थित वास्तविकता का सामना करने पर विफल हो जाते हैं। उदाहरण के लिए, एक विधि जानवरों के डेटासेट पर अच्छी तरह काम कर सकती है जहाँ त्रुटियाँ यादृच्छिक हैं, लेकिन कपड़ों के डेटासेट पर पूरी तरह विफल हो सकती है जहाँ त्रुटियाँ समान शैलियों या रंगों को भ्रमित करने के कारण होती हैं।
शोधकर्ता निष्कर्ष निकालते हैं कि क्षेत्र को इस विचार से दूर जाने की आवश्यकता है कि शोर के नीचे हमेशा एक "सही" लेबल छिपा होता है। कई आधुनिक सेटिंग्स में, जैसे कि जब डेटा विभिन्न विशेषज्ञों से आता है या अन्य एआई मॉडल द्वारा उत्पन्न किया जाता है, तो सत्य संदिग्ध या अधूरा हो सकता है। लक्ष्य केवल सही उत्तर खोजना नहीं है बल्कि प्रदान की जा रही जानकारी की विश्वसनीयता को समझना है। वे सुझाव देते हैं कि भविष्य के शोध को ऐसे सिस्टम बनाने पर ध्यान केंद्रित करना चाहिए जो इस अनिश्चितता को संभाल सकें, और डेटा की उपयोगी संरचना को बनाए रख सकें, भले ही लेबल अपूर्ण हों। इसका अर्थ है ऐसे एआई बनाना जो यह जान सके कि वह अनिश्चित है, बजाय इसके कि उसे झूठे आत्मविश्वास के साथ अनुमान लगाने के लिए मजबूर किया जाए।
इस कार्य के निहितार्थ इस बात पर भी लागू होते हैं कि हम भविष्य के एआई सिस्टम को कैसे बनाते हैं और उन पर कैसे भरोसा करते हैं। जैसे-जैसे इन सिस्टम का उपयोग स्वास्थ्य सेवा, स्वायत्त ड्राइविंग और वैज्ञानिक खोज जैसे महत्वपूर्ण क्षेत्रों में किया जा रहा है, खराब डेटा से सीखने की लागत को अनदेखा करने के लिए बहुत अधिक है। लेखक जोर देते हैं कि हम केवल अधिक डेटा या बड़े मॉडल पर इस समस्या को हल करने के लिए निर्भर नहीं रह सकते। इसके बजाय, हमें ऐसे सीखने की प्रक्रियाओं को डिजाइन करने की आवश्यकता है जो अपनी सीमाओं और उनके सामने आने वाली त्रुटियों की प्रकृति के प्रति जागरूक हों। पर्यवेक्षण (supervision) किस तरह विफल हो सकता है, लेबल जनरेशन के तरीके से लेकर कंप्यूटर द्वारा अपने ज्ञान को व्यवस्थित करने के तरीके तक, यह समझकर कि हम भविष्य के एआई को मजबूत बना सकते हैं, हम न केवल यादृच्छिक गलतियों के खिलाफ, बल्कि उन जटिल, संरचित त्रुटियों के खिलाफ भी सक्षम बना सकते हैं जो वास्तविक दुनिया को परिभाषित करती हैं। आगे का मार्ग पूर्ण डेटा की मांग करना नहीं है, क्योंकि पूर्ण डेटा मौजूद नहीं है, बल्कि मशीनों को उस अपूर्ण डेटा से प्रभावी ढंग से सीखना सिखाना है जो वास्तव में मौजूद है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।