← नवीनतम पेपर
💻 computer science

Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices

यह शोध पत्र एज डिवाइसेस पर छोटे लैंग्वेज मॉडल्स के सुरक्षित वितरित प्रशिक्षण (डिस्ट्रीब्यूटेड ट्रेनिंग) के लिए एक मॉडल मल्टीप्लिसिटी फ्रेमवर्क प्रस्तावित करता है, जो पारंपरिक सिंगल-मॉडल डिफेंस की तुलना में एडवर्सरियल पॉइजनिंग का अधिक प्रभावी ढंग से पता लगाने और उसे अलग करने के लिए समवर्ती रूप से प्रशिक्षित स्वतंत्र मॉडल्स के बीच विचलन (डाइवर्जेंस) का लाभ उठाता है।

मूल लेखक: Stefan Behfar, Richard Mortier

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stefan Behfar, Richard Mortier

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप छोटे, बुद्धिमान रोबोटों (जिन्हें "स्मॉल लैंग्वेज मॉडल्स" कहा जाता है) को कहानियाँ लिखना सिखाने की कोशिश कर रहे हैं। ये रोबोट अलग-अलग उपकरणों जैसे फोन या स्मार्ट सेंसर पर रहते हैं जो एक पड़ोस (जिसे "एज" कहा जाता है) में बिखरे हुए हैं। वे अपना सारा निजी डेटा एक केंद्रीय सुपर-कंप्यूटर को भेजने के बजाय, एक-दूसरे के साथ छोटे अपडेट साझा करके मिलकर सीखते हैं।

समस्या यह है कि इनमें से कुछ उपकरण टूटे हुए, अविश्वसनीय या गुप्त रूप से किसी हैकर द्वारा नियंत्रित हो सकते हैं। एक हैकर एक "ज़हरीला" (poisoned) अपडेट डाल सकता है जो धीरे-धीरे रोबोटों को गलत चीजें सीखने के लिए बहला सकता है, जैसे कि खतरनाक निर्देश लिखना या उनकी कहानियों में गुप्त कोड डालना।

पुराना तरीका: एकल शिक्षक (The Single Teacher)

पारंपरिक रूप से, इन प्रणालियों में एक ही "ग्लोबल मॉडल" (सोचिए एक मुख्य शिक्षक के रूप में) होता है। हर दौर में, सभी रोबोट अपना होमवर्क इस शिक्षक को भेजते हैं, जो एक नया पाठ योजना बनाने के लिए उनके काम का औसत निकालता है।

बुरे तत्वों को पकड़ने के लिए, पुराने सुरक्षा तरीकों ने कोशिश की:

  1. आउटलेयर्स (Outliers) को अनदेखा करना: यदि कोई रोबोट बहुत अलग उत्तर भेजता है, तो शिक्षक उसे बस फेंक देता है (जैसे उस छात्र को अनदेखा करना जो गलत उत्तर चिल्ला रहा हो)।
  2. इतिहास पर नज़र रखना: वे प्रत्येक रोबोट के पिछले उत्तरों का एक लॉग रखते हैं। यदि कोई रोबोट अचानक अपने स्वयं के इतिहास की तुलना में अजीब व्यवहार करने लगता है, तो वे उसे चिह्नित कर देते हैं।

खामी: पेपर का तर्क है कि ये पुराने तरीके विफल हो जाते हैं जब:

  • बुरे तत्व चतुर और सूक्ष्म होते हैं (वे चिल्लाते नहीं हैं, बल्कि फुसफुसाते हैं)।
  • रोबोट अविश्वसनीय होते हैं (वे केवल कभी-कभी ही क्लास में आते हैं)। यदि कोई रोबोट आधा समय गायब रहता है, तो शिक्षक एक विश्वसनीय इतिहास लॉग नहीं बना पाता जिससे उसे पकड़ा जा सके।

नया विचार: "मॉडल मल्टीप्लिसिटी" (MMR) सिस्टम

लेखक एक चतुर नई रणनीति प्रस्तावित करते हैं जिसे मॉडल मल्टीप्लिसिटी (Model Multiplicity) कहा जाता है। केवल एक शिक्षक के बजाय, वे एक ही समय में तीन (या अधिक) अलग-अलग शिक्षकों को काम पर रखते हैं।

यह इस सरल उपमा (analogy) का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

1. "स्प्लिट क्लास" रणनीति
कल्पना कीजिए कि शिक्षक के पास तीन अलग-अलग कक्षाएं हैं (मॉडल A, मॉडल B और मॉडल C)।

  • हर दौर में, शिक्षक यादृच्छिक रूप से (randomly) छात्रों का एक अलग समूह चुनता है जो प्रत्येक कक्षा में बैठेगा।
  • कक्षा A में छात्रों का एक रैंडम मिश्रण होगा।
  • कक्षा B में थोड़ा अलग रैंडम मिश्रण होगा।
  • कक्षा C में एक और अलग मिश्रण होगा।

2. "क्रॉस-चेक"
चूंकि समूह रैंडम हैं, इसलिए बुरे छात्र (हैकर) एक ही समय में हर कक्षा में नहीं होंगे।

  • यदि कोई हैकर कक्षा A में है, तो उस शिक्षक की पाठ योजना बदलने लगेगी और अजीब दिखने लगेगी।
  • लेकिन कक्षा B और कक्षा C (जिनमें वह हैकर नहीं था) सही रास्ते पर बनी रहेंगी।

3. अलार्म बेल
सिस्टम लगातार तीनों शिक्षकों की तुलना करता है।

  • यदि शिक्षक A की पाठ योजना, शिक्षक B और शिक्षक C से पूरी तरह अलग दिखने लगती है, तो सिस्टम अलार्म बजाता है: "हे, कक्षा A में मौजूद समूह के साथ कुछ गलत है!"
  • सिस्टम फिर पीछे देखता है कि कक्षा A में कौन था और कहता है, "हमें लगता है कि ये विशिष्ट छात्र ही समस्या पैदा करने वाले हैं," और उन्हें बाहर निकाल देता है या उनके होमवर्क को अनदेखा कर देता है।

यह बेहतर क्यों है (पेपर के अनुसार)

पेपर ने 100 "रोबोटों" (क्लाइंट्स) के कंप्यूटर सिमुलेशन पर इस विचार का परीक्षण किया और पाया कि:

  • तेज़ पहचान: "तीन शिक्षकों" वाले सिस्टम ने हैकरों को पुराने "एकल शिक्षक" वाले सिस्टम की तुलना में बहुत तेज़ी से पकड़ा। इसे लंबे इतिहास लॉग की प्रतीक्षा करने की आवश्यकता नहीं थी; इसने शिक्षकों के बीच तत्काल असहमति को देख लिया।
  • अविश्वसनीय रोबोटों के साथ भी कारगर: जब रोबोट केवल 20% समय ही उपस्थित थे (बहुत रुक-रुक कर), तब भी नया सिस्टम अच्छी तरह काम करता रहा। पुराने सिस्टम संघर्ष करते थे क्योंकि वे व्यक्तिगत रोबोटों का इतिहास बनाने के लिए पर्याप्त डेटा प्राप्त नहीं कर सके।
  • स्टील्थी अटैक (Stealthy Attacks): यह "स्लो-ड्रिफ्ट" हमलों (जहाँ हैकर समय के साथ बहुत सूक्ष्म बदलाव करते हैं) को पकड़ने में बेहतर था क्योंकि सूक्ष्म बदलावों ने "ज़हरीले" शिक्षक को स्वस्थ शिक्षकों से दूर धकेल दिया।

लागत

पेपर स्वीकार करता है कि यह मुफ्त नहीं है। एक के बजाय तीन शिक्षकों को चलाने के लिए थोड़े अधिक कंप्यूटर मेमोरी और प्रोसेसिंग पावर की आवश्यकता होती है। हालाँकि, लेखकों ने पाया कि यह अतिरिक्त लागत, हैकरों को पकड़ने के लाभ की तुलना में बहुत कम थी। यह दरवाजे की रखवाली के लिए दूसरे सुरक्षा गार्ड को भुगतान करने जैसा है; इसमें थोड़ा अधिक खर्च होता है, लेकिन चोरों को रोकने के लिए यह सार्थक है।

सारांश

संक्षेप में, पेपर कहता है: सत्य के केवल एक संस्करण पर भरोसा न करें। उपयोगकर्ताओं के विभिन्न समूहों के साथ एक साथ AI मॉडल के कई संस्करण चलाकर, सिस्टम तुरंत पहचान सकता है कि कब एक संस्करण दूषित हो रहा है। यदि एक मॉडल अन्य स्थिर मॉडलों की तुलना में पटरी से उतर जाता है, तो आप जानते हैं कि दोष किसे देना है, भले ही बुरे तत्व छिप रहे हों या केवल कभी-कभार दिखाई दे रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →