SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
यह शोध पत्र SPARD का प्रस्ताव करता है, जो एक रक्षा ढांचा (defense framework) है जो हानिकारक फाइन-ट्यूनिंग हमलों को प्रभावी ढंग से कम करने और कार्य प्रदर्शन को बनाए रखने के लिए सेफ्टी-प्रोजेक्टेड अल्टरनेटिंग ऑप्टिमाइज़ेशन (Safety-Projected Alternating optimization) को रिलेवेंस-डाइवर्सिटी अवेयर डेटा चयन (Relevance-Diversity aware data selection) के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, आज्ञाकारी रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है, जिसे मददगार बनने के लिए प्रशिक्षित किया गया है लेकिन कभी भी हानिकारक नहीं होने के लिए। वह नियमों को जानता है: "घृणास्पद भाषण न लिखें," "खतरनाक सलाह न दें," इत्यादि।
अब, कल्पना कीजिए कि कोई इस रोबोट को एक नया कौशल सिखाना चाहता है, जैसे गणित की समस्याओं को हल करना। लेकिन, रोबोट को दी जाने वाली गणित की होमवर्क के अंदर कुछ "जहरीले" निर्देश छिपे हुए हैं, जो रोबोट को उसके सुरक्षा नियमों को भूलने के लिए बहकाने के लिए डिज़ाइन किए गए हैं। इसे हार्मफुल फाइन-ट्यूनिंग अटैक (Harmful Fine-Tuning Attack) कहा जाता है। रोबोट गणित सीखता है, लेकिन वह अपने सुरक्षा घेरों (safety guardrails) को भी अनदेखा करना सीख जाता है, जिससे वह खतरनाक हो जाता है।
यह शोधपत्र (paper) इस रोबोट को सुरक्षित रूप से सिखाने के लिए एक नई विधि, SPARD, पेश करता है। SPARD को एक दो-भाग वाली सुरक्षा प्रणाली के रूप में समझें: एक सख्त कोच (Strict Coach) और एक स्मार्ट लाइब्रेरियन (Smart Librarian)।
1. सख्त कोच: "सेफ्टी-प्रोजेक्टेड अल्टरनेटिंग ग्रेडिएंट" (SPAG)
आमतौर पर, जब हम एक रोबोट को प्रशिक्षित करते हैं, तो हम बस कहते हैं: "गणित में बेहतर करने की कोशिश करो, और शायद बुरा व्यवहार न करो।" यह एक नरम सुझाव जैसा है। यदि रोबोट गणित को लेकर बहुत अधिक उत्साहित हो जाता है, तो वह अनजाने में अपने सुरक्षा नियमों को भूल सकता है।
SPARD एक अलग दृष्टिकोण का उपयोग करता है जिसे SPAG कहा जाता है। कल्पना कीजिए कि रोबोट गणित सीखने के लिए एक कदम आगे बढ़ा रहा है।
- कदम (The Step): रोबोट गणित के होमवर्क के आधार पर एक कदम लेता है।
- जांच (The Check): उस कदम के तुरंत बाद, सख्त कोच जांच करता है: "क्या आपने सुरक्षा रेखा पार की?"
- सुधार (The Correction): यदि रोबोट थोड़ा भी "असुरक्षित क्षेत्र" में चला जाता है, तो कोच केवल चिल्लाता नहीं है; वे भौतिक रूप से रोबोट को पकड़ते हैं और उसे वापस खींचकर ठीक सुरक्षा रेखा के किनारे पर ले आते हैं।
यह हर बार होता है जब रोबोट कुछ नया सीखता है। यह एक सुझाव नहीं है; यह एक कठोर नियम है। रोबोट को गणित सीखते समय भी गणितीय रूप से "सुरक्षित क्षेत्र" के भीतर रहने के लिए मजबूर किया जाता है। यह सुनिश्चित करता है कि रोबोट अपने सुरक्षा प्रशिक्षण को कभी न भूले, चाहे वह कितनी भी मेहनत से नया कार्य सीख रहा हो।
2. स्मार्ट लाइब्रेरियन: "रेलेवेंस-डाइवर्सिटी डेटा सिलेक्शन" (Relevance–Diversity Data Selection)
रोबोट को सुरक्षा की ओर वापस खींचने के लिए, कोच को "सुरक्षित उदाहरणों" की एक संदर्भ पुस्तक की आवश्यकता होती है। लेकिन सभी सुरक्षित उदाहरण समान नहीं होते।
शोधपत्र में पाया गया कि यदि आप केवल लाइब्रेरी से यादृच्छिक (random) सुरक्षित उदाहरण लेते हैं, तो यह काम नहीं करता है।
- यादृच्छिकता की समस्या (The Problem with Randomness): यदि रोबिमोट गणित सीख रहा है, और आप उसे "खाना पकाने" के सुरक्षित उदाहरण दिखाते हैं, तो यह बहुत उपयोगी नहीं है। रोबोट को ऐसे सुरक्षित उदाहरणों की आवश्यकता है जो गणित की समस्याओं की तरह दिखते हों ताकि वह जान सके कि गणित के दौरान सुरक्षित कैसे रहना है।
- बहुत अधिक समान उदाहरणों की समस्या (The Problem with Too-Similar Examples): यदि आप रोबोट को केवल ऐसे सुरक्षित गणित के उदाहरण दिखाते हैं जो बिल्कुल एक जैसे दिखते हैं, तो रोबोट भ्रमित हो सकता है। वह उस एक विशिष्ट प्रकार की गणित की समस्या के लिए सुरक्षित होना सीख जाता है, लेकिन जब समस्या थोड़ी बदल जाती है, तो वह विफल हो जाता है। यह किसी विशिष्ट प्रश्न का उत्तर रटने के बजाय नियम को समझने के बजाय है।
यहीं पर स्मार्ट लाइब्रेरियन आता है। शोधपत्र एक विशेष गणितीय उपकरण (जिसे Relevance-Diversity DPP कहा जाता है) का उपयोग करके सुरक्षित उदाहरणों का सही मिश्रण चुनता है।
- प्रासंगिकता (Relevance): लाइब्रेरियन उन सुरक्षित उदाहरणों को चुनता है जो उन गणित की समस्याओं के बहुत करीब हैं जिन्हें रोबोट सीख रहा है (ताकि सलाह उपयोगी हो)।
- विविधता (Diversity): लाइब्रेरियन यह भी सुनिश्चित करता है कि उदाहरण एक-दूसरे से भिन्न हों (ताकि रोबोट कई अलग-अलग स्थितियों में सुरक्षित रहना सीख सके, न कि केवल एक में)।
यह एक "सेफ्टी स्टडी गाइड" तैयार करने जैसा है जो सभी पक्षों को कवर करता है: यह परीक्षा के लिए प्रासंगिक है, लेकिन किसी भी ट्रिकी सवाल से निपटने के लिए पर्याप्त विविध भी है।
परिणाम
शोधकर्ताओं ने वास्तविक गणित और विज्ञान परीक्षणों पर इस प्रणाली का परीक्षण किया, जबकि रोबोट पर "जहरीले" डेटा द्वारा हमला किया जा रहा था।
- SPARD के बिना: रोबोट ने गणित सीख लिया लेकिन वह खतरनाक हो गया (उच्च "अटैक सक्सेस रेट")।
- SPARD के साथ: रोबोट ने गणित को उतनी ही अच्छी तरह से सीखा, लेकिन वह सुरक्षित रहा। उसने सफलतापूर्वक जहर (poison) को अनदेखा कर दिया।
सरल शब्दों में, SPARD एक तरीका है जिससे एक रोबोट को उसका नैतिक दिशा-निर्देश (moral compass) खोए बिना नया काम सिखाया जा सकता है। यह लगातार रोबोट के कदमों की जांच करके और उसे सुरक्षित उदाहरणों की एक ऐसी सूची देकर किया जाता है जो काम के लिए प्रासंगिक भी है और जोखिमों को कवर करने के लिए विविध भी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।