← नवीनतम पेपर
🤖 machine learning

On the importance of multiple training seeds for evaluating machine unlearning

यह शोध पत्र तर्क देता है कि मशीन अनलर्निंग (machine unlearning) एल्गोरिदम का मूल्यांकन केवल एक एकल प्रशिक्षण बीज (training seed) का उपयोग करके करने से प्रशिक्षण प्रारंभिक स्थिति (training initialization) के प्रति संवेदनशीलता के कारण गैर-प्रतिनिधि परिणाम प्राप्त हो सकते हैं, और यह प्रदर्शित करता है कि अनलर्निंग बीजों की संख्या में वृद्धि इस सीमा की भरपाई नहीं कर सकती है, जिससे सुदृढ़ अनुभवजन्य मूल्यांकन के लिए कई प्रशिक्षण बीजों का उपयोग करना आवश्यक हो जाता है।

मूल लेखक: Jamie Lanyon, Axel Finke, Petros Andreou, Georgina Cosma

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jamie Lanyon, Axel Finke, Petros Andreou, Georgina Cosma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: "भूली हुई" रेसिपी

कल्पना कीजिए कि आपके पास एक मास्टर शेफ (मशीन लर्निंग मॉडल) है जिसने एक विशाल कुकबुक (ट्रेनिंग डेटा) का उपयोग करके एक जटिल व्यंजन बनाना सीखा है। अचानक, एक ग्राहक मांग करता है कि रेसिपी से एक विशिष्ट सामग्री (डेटा पॉइंट) को हटा दिया जाए क्योंकि वह एक्सपायर हो गई है या आपत्तिजनक है।

मशीन अनलर्निंग (Machine Unlearning) का लक्ष्य शेफ को उस सामग्री को "भूलने" में मदद करना है ताकि वह उसका उपयोग न कर सके, और यह सब बिना पूरी कुकबुक को फेंक दिए और फिर से शुरुआत किए (जो बहुत महंगा और धीमा है) के किया जा सके।

समस्या क्या है? अधिकांश "अनलर्निंग" तकनीकें केवल अनुमान (approximations) हैं। वे रेसिपी में थोड़ा बदलाव करने की कोशिश करती हैं ताकि खराब सामग्री को हटाया जा सके, लेकिन हमें 100% यकीन नहीं है कि वे वास्तव में काम कर गईं या शेफ बस भाग्यशाली रहा। यह सुनिश्चित करने के लिए कि वे लगातार काम करें, वैज्ञानिक इन तकनीकों को कई बार चलाकर देखते हैं।

गलती: केवल एक बार पासा फेंकना

यह पेपर तर्क देता है कि वैज्ञानिक इन "भूलने" वाली तकनीकों का परीक्षण करने के तरीके में एक गंभीर गलती कर रहे हैं।

पुराना तरीका (दोषपूर्ण परीक्षण):
कल्पना कीजिए कि आप यह परीक्षण करना चाहते हैं कि क्या एक नई "भूलने" वाली तकनीक काम करती है।

  1. आप विशिष्ट रैंडम सामग्रियों और एक विशिष्ट ओवन तापमान (ट्रेनिंग सीड) का उपयोग करके एक केक बनाते हैं।
  2. फिर आप उस केक से एक विशिष्ट स्वाद को हटाने या "अन-बेक" करने के लिए दस अलग-अलग रैंडम जादू की छड़ियों (अनलर्निंग सीड्स) का उपयोग करते हैं।
  3. आप उन दस छड़ियों के परिणामों का औसत निकालते हैं और कहते हैं, "देखो, यह तकनीक काम करती है!"

पेपर का निष्कर्ष:
लेखक कहते हैं कि यह एक लॉटरी टिकट को उसी दिन दस टिकट खरीदने जैसा है जिनमें समान भाग्यशाली नंबर हों। यदि उस विशेष दिन का ड्रा एक इत्तेफाक था, तो आपके दस टिकट सभी बेहतरीन दिखेंगे, लेकिन वे आपको यह नहीं बताएंगे कि लॉटरी वास्तव में निष्पक्ष है या नहीं।

पेपर दिखाता है कि शुरुआती बिंदु (वह केक जो आपने पहले बनाया था) उस टूल से कहीं अधिक महत्वपूर्ण है जिसका उपयोग आप स्वाद हटाने के लिए करते हैं।

  • यदि आप थोड़े अलग ओवन तापमान या आटे के अलग बैच (एक अलग ट्रेनिंग सीड) के साथ केक बनाते हैं, तो "भूलने" वाली तकनीक पूरी तरह से विफल हो सकती है, भले ही वह पहले केक पर पूरी तरह से काम कर रही हो।
  • केवल एक शुरुआती केक पर परीक्षण करके, शोधकर्ता एक "गैर-प्रतिनिधिक" (non-representative) परिणाम प्राप्त करते हैं। उन्हें लग सकता है कि एक विधि शानदार है जबकि वास्तव में वह केवल भाग्यशाली थी।

उपमा: माली और मिट्टी

ट्रेनिंग सीड को मिट्टी के रूप में और अनलर्निंग सीड को माली के औज़ार के रूप में समझें।

  • पुरानी पद्धति: एक माली एक नए "खरपतवार हटाने वाले" औज़ार का परीक्षण मिट्टी के एक विशिष्ट टुकड़े पर करता है। वह उसी टुकड़े पर 10 बार उस औज़ार का उपयोग करता है। यदि खरपतवार निकल आते हैं, तो वह औज़ार को सफल घोषित कर देता है।
  • वास्तविकता: क्या होगा यदि वह विशिष्ट मिट्टी का टुकड़ा असामान्य रूप से नरम था? वह औज़ार सख्त मिट्टी (clay) के टुकड़े पर बुरी तरह विफल हो सकता है।
  • पेपर की सलाह: यह जानने के लिए कि क्या औज़ार वास्तव में काम करता है, आपको कई अलग-अलग मिट्टी के टुकड़ों (कई ट्रेनिंग सीड्स) पर परीक्षण करना चाहिए। भले ही आप प्रत्येक टुकड़े पर केवल एक बार औज़ार का उपयोग करें, फिर भी आपको एक ही टुकड़े पर 100 बार उपयोग करने की तुलना में इसके प्रदर्शन की अधिक सच्ची तस्वीर मिलेगी।

हम अधिक "जादुई छड़ियाँ" (Wands) का उपयोग क्यों नहीं कर सकते?

आप पूछ सकते हैं: "यदि मैं 75 अलग केक नहीं बना सकता, तो क्या मैं अपने पास मौजूद एक ही केक पर 75 अलग छड़ियों का उपयोग नहीं कर सकता?"

पेपर कहता है नहीं

  • अलग-अलग छड़ियों (Unlearning Seeds) के कारण होने वाले "उतार-चढ़ाव" आमतौर पर बहुत छोटे होते हैं।
  • अलग-अलग शुरुआती केक (Training Seeds) के कारण होने वाले "उतार-चढ़ाव" बहुत बड़े होते हैं।
  • यदि आपके पास केवल एक ही केक है, तो अलग-अलग छड़ियों के साथ कितना भी प्रयोग करने से यह तथ्य ठीक नहीं होगा कि वह केक खुद एक इत्तेफाक हो सकता है। एक वास्तविक उत्तर पाने के लिए आपको अधिक केक (Training Seeds) की आवश्यकता है।

समाधान: अपने समय का सदुपयोग कैसे करें

लेखक एक मार्गदर्शिका प्रदान करते हैं कि आप अपने कंप्यूटर समय (बजट) का बुद्धिमानी से उपयोग कैसे करें:

  • सारा समय एक ही मॉडल पर अनलर्निंग ट्रिक को 10 बार चलाने में न लगाएं
  • अपना समय 10 अलग-अलग मॉडल बनाने (विभिन्न शुरुआती सीड्स के साथ) और प्रत्येक पर अनलर्निंग ट्रिक को केवल एक या दो बार चलाने में लगाएं

यह दृष्टिकोण एक बहुत अधिक ईमानदार और विश्वसनीय उत्तर देता है कि क्या मशीन लर्निंग मॉडल ने वास्तव में डेटा को भुला दिया है।

क्या यह हर जगह लागू होता है?

इस पेपर ने तीन अलग-अलग क्षेत्रों में इस विचार का परीक्षण किया:

  1. इमेज क्लासिफिकेशन: तस्वीरों को पहचानना (जैसे बिल्ली बनाम कुत्ता)।
  2. फेडेरेटेड लर्निंग-टू-रैंक: यूजर क्लिक के आधार पर सर्च रिजल्ट्स को क्रमबद्ध करना।
  3. लार्ज लैंग्वेज मॉडल्स (LLMs): चैटबॉट्स जो टेक्स्ट लिखते हैं।

इन तीनों मामलों में परिणाम एक ही था: शुरुआती सीड (Starting Seed), अनलर्निंग सीड से अधिक महत्वपूर्ण है। चाहे आप रोबोट को देखना सिखा रहे हों, सर्च रिजल्ट्स को रैंक करना सिखा रहे हों, या कहानी लिखना सिखा रहे हों, आप परिणामों पर तब तक भरोसा नहीं कर सकते जब तक कि आप केवल एक शुरुआती मॉडल पर परीक्षण कर रहे हों।

सारांश

यह जानने के लिए कि क्या एक मशीन लर्निंग मॉडल वास्तव में कुछ "भूल" गया है, आप केवल मॉडल के एक विशिष्ट संस्करण पर भूलने वाली तकनीक का परीक्षण नहीं कर सकते। आपको मॉडल के कई अलग-अलग संस्करणों पर इसका परीक्षण करना चाहिए। अन्यथा, आप एक ऐसी सफलता का जश्न मना सकते हैं जो केवल एक भाग्यशाली दुर्घटना थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →