← नवीनतम पेपर
💬 NLP

GradShield: Alignment Preserving Finetuning

GradShield एक सिद्धांतवादी फ़िल्टरिंग विधि है जो फाइनट्यूनिंग के दौरान एक 'फाइनट्यूनिंग इम्प्लिसिट हार्मफुलनेस स्कोर' की गणना करके हानिकारक डेटा की पहचान करने और उसे हटाने द्वारा लार्ज लैंग्वेज मॉडल्स को सुरक्षित करती है, जिससे उपयोगिता प्रदर्शन को बनाए रखते हुए 6% से कम अटैक सक्सेस रेट के साथ सुरक्षा संरेखण बना रहता है।

मूल लेखक: Zhanhao Hu, Xiao Huang, Patrick Mendoza, Emad A. Alghamdi, Basel Alomair, Raluca Ada Popa, David Wagner

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhanhao Hu, Xiao Huang, Patrick Mendoza, Emad A. Alghamdi, Basel Alomair, Raluca Ada Popa, David Wagner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही विनम्र, प्रशिक्षित रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है। इसे प्राप्त करने से पहले, इसके रचनाकारों ने इसे सिखाया है कि कैसे मददगार, ईमानदार और सुरक्षित रहना है। यह जानता है कि बम बनाने या बैंक खाता हैक करने के निर्देश नहीं देने हैं। यह इसकी "सेफ्टी अलाइनमेंट" (सुरक्षा संरेखण) है।

हालाँकि, आप इस रोबोट को एक नया कौशल सिखाना चाहते हैं, जैसे समाचार लेखों का सारांश बनाना या गणित की समस्याओं को हल करना। इसे करने के लिए, आप इसे प्रशिक्षण की एक नई किताबों का सेट (डेटासेट) देते हैं अध्ययन करने के लिए। इस प्रक्रिया को फाइन-ट्यूनिंग कहा जाता है।

समस्या: टोकरी में "खराब सेब"

दिक्कत यह है कि आपको शायद पता न चले कि आपकी नई प्रशिक्षण पुस्तकों में कुछ छिपे हुए "खराब सेब" मौजूद हैं।

  • स्पष्ट खराब सेब (Explicit Bad Apples): ये स्पष्ट होते हैं, जैसे "हैकिंग कैसे करें" शीर्षक वाली एक किताब।
  • अंतर्निहित खराब सेब (Implicit Bad Apples): ये अधिक पेचीदा होते हैं। ये सामान्य, हानिरहित कहानियों की तरह दिखते हैं, लेकिन ये सूक्ष्म रूप से रोबोट को उसके सुरक्षा नियमों को अनदेखा करना सिखाते हैं। उदाहरण के लिए, एक कहानी जो कहती है, "नायक हमेशा खलनायक के आदेशों का पालन करता है," अनजाने में रोबोट को यह सिखा सकती है कि उसे किसी भी निर्देश का पालन करना चाहिए, यहाँ तक कि खतरनाक निर्देशों का भी।

यदि रोबोट इन खराब किताबों का अध्ययन करता है, तो वह अपने सुरक्षा प्रशिक्षण को भूल सकता है। वह यह कहना शुरू कर सकता है, "ज़रूर, यहाँ बताया गया है कि बैंक कैसे हैक करें," जब आप उससे पूछें। यह खतरनाक है, खासकर जब कंपनियाँ ऐसी सेवाएँ प्रदान करती हैं जहाँ उपयोगकर्ता इन रोबोटों को कस्टमाइज़ करने के लिए अपना स्वयं का डेटा अपलोड करते हैं।

समाधान: GradShield (एक "सुरक्षा रडार")

यह शोध पत्र GradShield नामक एक टूल पेश करता है। इसे एक सुपर-स्मार्ट सुरक्षा रडार के रूप में सोचें जो रोबोट के अध्ययन शुरू करने से पहले प्रशिक्षण की नई किताबों के हर एक पन्ने को स्कैन करता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. "क्या होगा अगर" परीक्षण (FIHS):
    कल्पना कीजिए कि आपके पास किताबों का एक ढेर है। GradShield प्रत्येक पन्ने के बारे में एक प्रश्न पूछता है: "यदि रोबोट इस विशिष्ट पन्ने को पढ़ता है, तो क्या वह कम सुरक्षित हो जाएगा?"
    यह फाइन-ट्यूनिंग इम्प्लिसिट हार्मफुलनेस स्कोर (FIHS) नामक एक स्कोर की गणना करके ऐसा करता है।
  • यह इसकी गणना कैसे करता है: यह उस "दिशा" को देखता है जिस ओर रोबोट का मस्तिष्क उस पन्ने को पढ़ने पर जाना चाहता है। यदि वह पन्ना रोबोट के मस्तिष्क को "अभद्र होने" या "नियमों को अनदेखा करने" की दिशा में धकेलता है, और वह दिशा "सुरक्षित रहने" की दिशा के विपरीत है, तो उस पन्ने को उच्च "हानिकारक" (harmfulness) स्कोर मिलता है।
  • जादू: इसे यह जानने के लिए कि पन्ना बुरा है, वास्तव में रोबोट को वह पन्ना सिखाने की आवश्यकता नहीं है। इसे केवल उस गणित को देखने की आवश्यकता है कि रोबोट वास्तव में कैसी प्रतिक्रिया देगा
  1. अनुकूली फ़िल्टर (Adaptive Filter):
    एक बार जब GradShield सभी पन्नों को स्कोर दे देता है, तो उसे यह तय करना होता है कि किन पन्नों को फेंक देना है।
  • चुनौती: आप नहीं जानते कि ढेर में कितने खराब किताबें हैं। क्या यह 1% है? क्या यह 50% है? यदि आप फ़िल्टर को बहुत सख्त रखते हैं, तो आप अच्छी किताबें फेंक देंगे और रोबोट बेकार हो जाएगा। यदि यह बहुत ढीला है, तो खराब किताबें अंदर आ जाएंगी।
  • समाधान: GradShield एक "स्मार्ट अनुमान और जाँच" विधि (एडेप्टिव थ्रेशोल्डिंग) का उपयोग करता है। यह एक फ़िल्टर आज़माता है, रोबोट का परीक्षण करता है, और यदि रोबोट अभी भी बहुत असुरक्षित है, तो यह फ़िल्टर को और सख्त कर देता है। यदि रोबोट बहुत सख्त है और अपनी बुद्धिमत्ता खो रहा है, तो यह फ़िल्टर को ढीला कर देता है। यह स्वचालित रूप से सही संतुलन खोज लेता है।

परिणाम: सुरक्षित और स्मार्ट

शोधकर्ताओं ने कई अलग-अलग परिदृश्यों में GradShield का परीक्षण किया:

  • स्पष्ट बुरे डेटा के विरुद्ध: जब प्रशिक्षण डेटा में स्पष्ट "हैकिंग कैसे करें" के निर्देश थे, तो GradShield ने उन्हें पूरी तरह से फ़िल्टर कर दिया। रोबोट सुरक्षित रहा लेकिन फिर भी समाचारों का सारांश बनाना और गणित की समस्याओं को हल करना सीख गया।
  • छिपे हुए बुरे डेटा के विरुद्ध: जब प्रशिक्षण डेटा हानिरहित दिखता था लेकिन उसमें सूक्ष्म "सुरक्षा-तोड़ने वाले" सबक शामिल थे, तब भी GradShield ने उन्हें पकड़ लिया। अन्य विधियों (जैसे साधारण सामग्री फ़िल्टर) ने इन छिपे हुए खतरों को मिस कर दिया, लेकिन GradShield ने नहीं।
  • दक्षता: यह तेज़ है। इन स्कोर्स की गणना करने में लगभग उतना ही समय लगता है जितना रोबोट को एक पूरे दिन के लिए सिखाने में लगता है। यह सुनिश्चित करने के लिए कि रोबोट खतरा न बन जाए, यह एक छोटी सी कीमत है।

मुख्य निष्कर्ष

GradShield रोबोट प्रशिक्षण के लिए एक गुणवत्ता नियंत्रण निरीक्षक की तरह है। यह जानकारी के हर उस टुकड़े की जाँच करता है जिसे रोबोट सीखने जा रहा है। यदि कोई जानकारी ऐसी दिखती है जिससे रोबोट अपने सुरक्षा नियमों को भूल सकता है, तो GradShield उसे हटा देता है। यह सुनिश्चित करता है कि भले ही उपयोगकर्ता अपने स्वयं के डेटा के साथ इन शक्तिशाली AI उपकरणों को कस्टमाइज़ करें, रोबोट मददगार, स्मार्ट और सुरक्षित बने रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →