Data filtering methods for training language models
यह शोध पत्र रूसी टेक्स्ट वर्गीकरण डेटासेट में लेबल त्रुटियों का पता लगाने के लिए कॉन्फिडेंट लर्निंग और डेटासेट कार्टोग्राफी का एक तुलनात्मक विश्लेषण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि हालांकि दोनों विधियाँ रैंडम रिमूवल से बेहतर प्रदर्शन करती हैं, उनकी मॉडल प्रदर्शन में सुधार करने की प्रभावशीलता काफी हद तक डेटासेट के आकार और शोर के स्तरों पर निर्भर करती है, जिसमें कॉन्फिडेंट लर्निंग छोटे, शोर वाले डेटासेट पर महत्वपूर्ण लाभ प्रदान करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को मानव भाषा समझने के लिए सिखाने की कोशिश कर रहे हैं। आप उसे उदाहरणों और उत्तरों से भरी एक विशाल पाठ्यपुस्तक देते हैं। लेकिन यहाँ एक पेंच है: उस पाठ्यपुस्तक के कुछ उत्तर गलत हैं। शायद एक वाक्य जिसे "खुश" (happy) के रूप में लेबल किया जाना चाहिए था, उसे गलती से "क्रोधित" (angry) के रूप में चिह्नित कर दिया गया, या एक व्याकरणिक रूप से सही वाक्य को "गलत" के रूप में चिह्नित किया गया।
यदि आप रोबोट को गलतियों से भरी पाठ्यपुस्तक से सिखाते हैं, तो वह उन गलतियों को भी सीख लेगा। यह लेबल नॉइज़ (label noise) की समस्या है।
यह शोध पत्र तीन अलग-अलग रूसी-भाषा की पाठ्यपुस्तकों (डेटासेट) के लिए एक गुणवत्ता नियंत्रण निरीक्षण की तरह है जिनका उपयोग AI को प्रशिक्षित करने के लिए किया जाता है। लेखकों, ई. शेवचेंको और ई. ब्रूचेस ने गलत उदाहरणों को खोजने और हटाने के लिए दो अलग-अलग "जासूसी उपकरणों" (detective tools) का परीक्षण किया, ताकि रोबोट के पढ़ाई शुरू करने से पहले उन्हें हटाया जा सके।
यहाँ उनके प्रयोग और उनके निष्कर्षों का एक सरल विवरण दिया गया है:
दो जासूस (The Two Detectives)
शोधकर्ताओं ने त्रुटियों को खोजने के लिए दो स्वचालित विधियों की तुलना की:
"दूसरी राय" वाला जासूस (कन्फिडेंट लर्निंग - Confident Learning):
- यह कैसे काम करता है: कल्पना कीजिए कि एक छात्र एक परीक्षा देता है। फिर, आप उसी छात्र को लेते हैं, उन्हें चार समूहों में विभाजित करते हैं, और प्रत्येक समूह को दूसरों के उत्तरों को ग्रेड करने के लिए कहते हैं। यदि एक छात्र लगातार एक विशिष्ट प्रश्न को अन्य समूहों के अनुसार गलत करता है, लेकिन उत्तर कुंजी कहती है कि वे सही हैं, तो "दूसरी राय" वाला जासूस इसे उत्तर कुंजी में एक संभावित त्रुटि के रूप में चिह्नित करता है।
- इसका स्वभाव: यह गहन लेकिन आक्रामक है। यह मॉडल के भविष्यवाणियों के सर्वसम्मति पर भरोसा करता है।
"पढ़ने की आदत" वाला जासूस (डेटासेट कार्टोग्राफी - Dataset Cartography):
- यह कैसे काम करता है: यह जासूस समय के साथ छात्र के अध्ययन पर नज़र रखता है। यदि एक छात्र किसी विशिष्ट प्रश्न को बार-बार सही, फिर गलत, और फिर से सही करता है, या कई अध्ययन सत्रों के बाद उसमें भ्रमित दिखाई देता है, तो जासूस उसे "परेशान करने वाला" (troublesome) चिह्नित करता है। यह देखता है कि समय के साथ मॉडल का आत्मविश्वास कैसे बदलता है।
- इसका स्वभाव: यह अधिक सतर्क है। यह केवल उन उदाहरणों को हटाता है जिन्हें मॉडल लगातार सीखने में संघर्ष करता है।
तीन पाठ्यपुस्तकें (डेटासेट)
उन्होंने अपने जासूसों का परीक्षण तीन बहुत ही अलग रूसी डेटासेट पर किया:
- बड़ी किताब (ru_emotion_e-culture): भावनाओं के बारे में 49,000 फोरम पोस्टों का एक विशाल संग्रह। यह बड़ा है और आम तौर पर उच्च गुणवत्ता वाला है।
- मध्यम किताब (RuCoLA): व्याकरणिक रूप से वाक्य सही हैं या नहीं, इसकी जाँच करने के लिए 8,500 वाक्यों का एक संग्रह। यह मध्यम आकार का है लेकिन पेचीदा है क्योंकि "सही होना" व्यक्तिपरक हो सकता है।
- छोटी किताब (TERRa): वाक्यों के 2,300 जोड़ों का एक छोटा संग्रह यह जाँचने के लिए कि क्या एक वाक्य दूसरे का निहितार्थ (imply) निकालता है। यह छोटा है और इसमें गड़बड़ी होने का संदेह है।
क्या हुआ? (परिणाम)
1. बड़ी किताब: "जो टूटा नहीं है उसे ठीक न करें"
विशाल डेटासेट पर, पाठ्यपुस्तकें पहले से ही काफी अच्छी थीं।
- परिणाम: जब जासूसों ने उनके द्वारा खोजे गए "बुरे" उदाहरणों को हटाया, तो रोबोट वास्तव में कार्य में थोड़ा खराब हो गया।
- सबक: जब आपके पास डेटा की विशाल मात्रा होती है, तो रोबोट इतना स्मार्ट होता है कि वह कुछ खराब उदाहरणों को अपने आप अनदेखा कर सकता है। उन्हें हटाने से किताब बेहतर होने के बजाय केवल छोटी हो गई।
2. मध्यम किताब: "रैंडम से बेहतर, लेकिन पूर्ण नहीं"
मध्यम डेटासेट पर, दोनों जासूसों ने बहुत सारी त्रुटियाँ पाईं (लगभग 15-18%)।
- परिणाम: इन त्रुटियों को हटाने से रोबोट पूर्ण तो नहीं हुआ, लेकिन इसने इसे उससे बेहतर प्रदर्शन कराया जो आपने तब किया होता जब आप रैंडम तरीके से उतने ही पेज फेंक देते।
- सबक: जासूस वास्तव में वास्तविक गलतियाँ ढूंढ रहे थे, न कि केवल अनुमान लगा रहे थे। हालाँकि, डेटासेट अभी भी बहुत शोर वाला था या कार्य बहुत कठिन था जिससे केवल सफाई करने से प्रदर्शन में कोई बड़ी छलांग नहीं देखी जा सकी।
3. छोटी किताब: "सफाई का जादू"
यह सबसे नाटकीय परिणाम था। छोटी डेटासेट के बहुत अव्यवस्थित होने का संदेह था।
- परिणाम: "दूसरी राय" वाले जासूस ने पाया कि किताब का 35% हिस्सा गलत था! जब उन्होंने उन बुरे उदाहरणों को हटाया, तो रोबोट के प्रदर्शन में महत्वपूर्ण उछाल आया।
- तुलना: यदि उन्होंने रैंडम तरीके से किताब का 35% हिस्सा फेंक दिया होता, तो रोबोट पूरी तरह विफल हो जाता। लेकिन क्योंकि उन्होंने विशिष्ट बुरे उदाहरणों को फेंका, इसलिए रोबोट बहुत स्मार्ट हो गया।
- सबक: छोटे, अव्यवस्थित डेटासेट के लिए, त्रुटियों को खोजना और हटाना गेम-चेंजर है।
मुख्य निष्कर्ष (The Big Takeaway)
पेपर निष्कर्ष निकालता है कि कोई "एक आकार सभी के लिए उपयुक्त" (one size fits all) समाधान नहीं है।
- यदि आपके पास एक विशाल, साफ डेटासेट है, तो आपको फ़िल्टर करने में समय बर्बाद करने की आवश्यकता नहीं है; AI शोर को संभाल सकता है।
- यदि आपके पास एक छोटा, अव्यवस्थित डेटासेट है, तो डेटा को साफ करने के लिए "कन्फिडेंट लर्निंग" जैसे टूल का उपयोग करना आवश्यक है। यह एक छोटे, कीचड़ भरे कमरे को साफ करने जैसा है: यदि आप कीचड़ को नहीं हटाते हैं, तो आप फर्श को नहीं देख सकते।
लेखकों ने यह भी नोट किया कि "पढ़ने की आदत" वाला जासूस (डेटासेट कार्टोग्राफी) अधिक सुरक्षित है और अच्छे उदाहरणों को गलती से हटाने की कम संभावना रखता है, जबकि "दूसरी राय" वाला जासूस (कन्फिडेंट लर्निंग) अधिक आक्रामक है और छोटे डेटासेट में सबसे खराब त्रुटियों को खोजने में बेहतर है।
संक्षेप में: अपने डेटा को साफ करना एक लेंस को पॉलिश करने जैसा है। यदि लेंस पहले से ही स्पष्ट और विशाल है, तो उसे थोड़ा और पॉलिश करने से कोई मदद नहीं मिलती। लेकिन यदि लेंस छोटा है और कीचड़ से ढका है, तो उसे साफ करना ही स्पष्ट देखने का एकमात्र तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।