← नवीनतम पेपर
🤖 machine learning

Noise-Aware Framework for Correcting Corrupted Labels

यह शोध पत्र CANOLA को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो शोर वितरण (noise distributions) का स्पष्ट रूप से अनुमान लगाकर और सतर्क सॉफ्ट-लेबल ब्लेंडिंग के माध्यम से दूषित लेबल को पुनरावृत्ति से परिष्कृत करके मॉडल की मजबूती और सामान्यीकरण को बढ़ाता है, जिससे कई डेटासेट्स पर अत्याधुनिक विधियों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Ha-Linh Nguyen, Hong-Anh Nguyen, Minh-Duc La, Phong Lam, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

प्रकाशित 2026-06-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ha-Linh Nguyen, Hong-Anh Nguyen, Minh-Duc La, Phong Lam, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र को विभिन्न प्रकार के जानवरों की पहचान करना सिखाने की कोशिश कर रहे हैं। आपके पास फ्लैशकार्ड्स का एक विशाल ढेर है, लेकिन एक समस्या है: एक शरारती ग्रीमलिन (gremlin) ने कुछ लेबल बदल दिए हैं। एक बिल्ली की तस्वीर पर "कुत्ता" लिखा हो सकता है, और एक शेर की तस्वीर पर "बाघ" लिखा हो सकता है।

यदि आप छात्र को इन गलत लेबल वाले कार्ड्स से पढ़ाते हैं, तो वह भ्रमित हो जाएगा, गलत चीजें सीख जाएगा और अंततः परीक्षा में असफल हो जाएगा। यही "करप्टेड लेबल्स" (corrupted labels) की समस्या है, जो आर्टिफिशियल इंटेलिजेंस (AI) में होती है।

यह पेपर CANOLA नामक एक नया सिस्टम पेश करता है (जिसका अर्थ है "नॉइज़-अवेयर फ्रेमवर्क")। CANOLA को एक सुपर-स्मार्ट एडिटर के रूप में समझें जो न केवल गलतियों को पकड़ता है बल्कि छात्र के पढ़ने से पहले उन्हें सावधानीपूर्वक ठीक भी करता है।

यहाँ बताया गया है कि CANOLA कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके:

1. पुराने तरीकों के साथ समस्या

गलत लेबल्स को ठीक करने के पिछले प्रयास दो अलग-अलग, त्रुटिपूर्ण रणनीतियों जैसे थे:

  • "पड़ोसी" रणनीति (The "Neighbor" Strategy): यह तरीका एक कार्ड को देखता है और पूछता है, "इसके ठीक बगल वाले कार्ड क्या कहते हैं?" यदि एक "बिल्ली" वाला कार्ड "कुत्तों" के कार्डों से घिरा हुआ है, तो यह मान लेता है कि बिल्ली का लेबल गलत है और इसे बदलकर "कुत्ता" कर देता है।
    • दोष: कभी-कभी, एक बिल्ली वास्तव में कुत्ते जैसी दिख सकती है (शायद वह एक रोएंदार सामोयड हो)। यदि आप केवल भीड़ का अनुसरण करते हैं, तो आप एक सही लेबल को गलत लेबल में बदल सकते हैं।
  • "जल्दी अनुमान" रणनीति (The "Early Guess" Strategy): यह तरीका छात्र से पढ़ाई के सत्र की शुरुआत में ही एक त्वरित अनुमान लगाने को कहता है। चूंकि छात्र नया है, इसलिए वह भाग्यशाली हो सकता है और आसान कार्डों पर सही अनुमान लगा सकता है। सिस्टम फिर इन शुरुआती अनुमानों का उपयोग लेबल्स को ठीक करने के लिए करता है।
    • दोष: यदि शोर (noise) बहुत अधिक है (बहुत सारे गलत लेबल हैं), तो छात्र तुरंत भ्रमित हो जाता है। वह गलत उत्तरों को रटने लगता है (जैसे कि एक छात्र जो गणित समझने के बजाय उत्तर कुंजी को रट लेता है)। सिस्टम इन गलत अनुमानों के आधार पर लेबल्स को ठीक करने लगता है, जिससे समस्या और बढ़ जाती है।

2. CANOLA कैसे काम करता है: "दो-चरणों वाला" एडिटर

CANOLA अलग है क्योंकि यह एक सतर्क, दो-चरणीय संपादक की तरह कार्य करता है। यह तब तक कुछ भी ठीक करने की जल्दबाजी नहीं करता जब तक कि वह पूरी तरह आश्वस्त न हो जाए।

चरण 1: "नॉइज़ डिटेक्टिव" (The "Noise Detective")
लेबल्स को ठीक करने से पहले, CANOLA यह समझने की कोशिश करता है कि ग्रीमलिन ने चीजों को कैसे बिगाड़ा है।

  • यह दो "डिटेक्टिव मॉडल" का उपयोग करता है। एक डिटेक्टिव केवल उन कार्डों को देखता है जिन्हें वह 100% सही होने के प्रति आश्वत है। दूसरा डिटेक्टिव सब कुछ देखता है, यहाँ तक कि गड़बड़ चीजों को भी।
  • इन दोनों डिटेक्टिव्स द्वारा देखी गई चीजों की तुलना करके, CANOLA एक "नॉइज़ मैप" (Noise Map) बनाता है। यह मैप सिस्टम को बताता है: "ठीक है, जब ग्रीमलिन एक 'शेर' को बिगाड़ता है, तो वह आमतौर पर 30% बार उसे 'बाघ' में बदल देता है।"
  • यह मैप सिस्टम को गलतियों का केवल अनुमान लगाने के बजाय, गलतियों के पैटर्न को समझने में मदद करता है।

चरण 2: "सावधान सुधारक" (The "Cautious Fixer")
अब जब सिस्टम को शोर के पैटर्न का पता चल गया है, तो यह लेबल्स को ठीक करना शुरू करता है, लेकिन यह इसे बहुत सावधानी से करता है।

  • "सॉफ्ट" स्पर्श: यह कहने के बजाय कि "यह कार्ड निश्चित रूप से एक कुत्ता है," CANOLA कहता है, "इस कार्ड की 70% संभावना एक कुत्ते की है और 30% संभावना एक बिल्ली की है।" यह थोड़ी अनिश्चितता बनाए रखता है। यह सिस्टम को बहुत जल्दी कोई स्थायी, गलत निर्णय लेने से रोकता है।
  • "देखो और प्रतीक्षा करो" नियम: सिस्टम तब तक इंतजार करता है जब तक कि छात्र (AI मॉडल) पर्याप्त अध्ययन न कर ले और उसका प्रदर्शन स्थिर न हो जाए। यह लेबल्स को ठीक करना तभी शुरू करता है जब छात्र आत्मविश्वासी और विश्वसनीय हो जाता है। यह सिस्टम को छात्र के शुरुआती, भ्रमित अनुमानों के आधार पर चीजें ठीक करने से रोकता है।
  • पुनरावृत्ति सुधार (Iterative Refinement): यह कुछ लेबल्स को ठीक करता है, फिर से पढ़ता है, कुछ और ठीक करता है, और यही प्रक्रिया दोहराता है। यह एक गंदी खिड़की को साफ करने जैसा है: आप उसे पोंछते हैं, फिर देखते हैं, फिर से पोंछते हैं, जब तक कि वह एकदम साफ न हो जाए।

3. परिणाम: एक स्पष्ट तस्वीर

लेखकों ने छह अलग-अलग डेटासेट्स (जैसे कपड़ों, अंगों और समाचार टेक्स्ट की छवियां) पर CANOLA का परीक्षण किया। उन्होंने इसकी तुलना सबसे अच्छे मौजूदा तरीकों से की।

  • सफाई की शक्ति (Cleaning Power): CANOLA ने अन्य तरीकों की तुलना में डेटा को काफी बेहतर तरीके से साफ किया। औसतन, इसने डेटासेट में गलतियों को लगभग 25% कम कर दिया। सबसे खराब स्थितियों में (जहाँ डेटा बहुत अधिक गड़बड़ था), इसने अन्य तरीकों की तुलना में त्रुटियों को 52% तक कम कर दिया।
  • बेहतर छात्र: जब उन्होंने इन "साफ किए गए" डेटा का उपयोग नए AI मॉडल को प्रशिक्षित करने के लिए किया, तो वे मॉडल बहुत बेहतर प्रदर्शन कर रहे थे। वास्तव में, CANOLA के साफ डेटा पर प्रशिक्षित एक साधारण मॉडल अक्सर उन जटिल, हाई-टेक मॉडलों को भी मात दे देता है जो बिना सफाई के सीधे गड़बड़ डेटा से सीखने की कोशिश करते हैं।

मुख्य बात (The Bottom Line)

CANOLA को डेटा के लिए एक क्वालिटी कंट्रोल इंस्पेक्टर के रूप में समझें। गलतियों से भरे टेक्स्टबुक से छात्र को पढ़ाने की कोशिश करने के बजाय, या इस उम्मीद में रहने के बजाय कि छात्र गलतियों को अनदेखा कर देगा, CANOLA पहले टेक्स्टबुक को सावधानीपूर्वक ठीक करने के लिए समय लेता है।

यह पेपर दिखाता है कि डेटा को साफ करना अक्सर एक ऐसे "सुपर-स्मार्ट" छात्र को बनाने से अधिक शक्तिशाली होता है जो गलत जानकारी को अनदेखा कर सके। एक नॉइज़-अवेयर दृष्टिकोण का उपयोग करके और लेबल्स को धीरे-धीरे और सावधानी से ठीक करके, CANOLA यह सुनिश्चित करता है कि AI शोर को नहीं, बल्कि सत्य को सीखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →