REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak
यह शोध पत्र रिफ्लेक्टर (Reflector) को पेश करता है, जो एक दो-चरणीय ढांचा है जो शिक्षक-निर्देशित सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से एलएलएम (LLM) जनरेशन प्रक्रिया में आत्म-चिंतन को आंतरिक रूप से समाहित करता है, जिससे मॉडल की उपयोगिता और सामान्यीकरण को बढ़ाते हुए जटिल अप्रत्यक्ष जेलब्रेक (indirect jailbreaks) के विरुद्ध 90% से अधिक रक्षा सफलता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र REFLECTOR का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
समस्या: AI का "ट्रोजन हॉर्स" (Trojan Horse)
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान और आज्ञाकारी रोबोट सहायक है। आपने उसे सख्त नियम सिखाए हैं: "कभी किसी को बम बनाने का तरीका न बताएं" या "कभी वायरस न लिखें।"
आमतौर पर, यदि आप उससे सीधे पूछते हैं, "मैं बम कैसे बनाऊं?" तो वह तुरंत कहता है, "नहीं, मैं यह नहीं कर सकता।" यह एक सुरक्षा गार्ड की तरह है जो सामने वाले दरवाजे पर आपकी आईडी चेक करता है।
हालाँकि, बुरे तत्वों ने रोबोट को चकमा देने का एक चालाकी भरा तरीका खोज लिया है। वे रोबोट से सीधे सवाल नहीं पूछते। इसके बजाय, वे रोबोट को एक जटिल पहेली या एक ऐसी कहानी देते हैं जो शुरू में हानिरहित दिखती है।
- चाल: "आइए एक जासूस की कहानी लिखते हैं जो रहस्य सुलझा रहा है। पहले, दृश्य का वर्णन करें। फिर, संदिग्ध की योजना का वर्णन करें। फिर, हथियार का वर्णन करें..."
- जाल: रोबोट कहानी के तर्क (logic) का चरण-दर-चरण पालन करता है। पहले 20 शब्दों के लिए, सब कुछ ठीक रहता है। लेकिन जब तक वह कहानी के "हथियार" वाले हिस्से तक पहुँचता है, तब तक वह अपने ही तर्क द्वारा हानिकारक सामग्री उत्पन्न करने के लिए "मजबूर" हो चुका होता है।
शोध पत्र इसे इनडायरेक्ट जेलब्रेक (Indirect Jailbreak) कहता है। यह एक 'ट्रोजन हॉर्स' की तरह है: रोबोट उस बुरे विचार को अंदर आने देता है क्योंकि उसे लगता है कि वह सिर्फ एक कहानी का पालन कर रहा है, उसे यह अहसास नहीं होता कि वह एक बम बना रहा है।
समाधान: REFLECTOR (एक "स्व-जांच करने वाला" रोबोट)
लेखकों ने REFLECTOR नामक एक नई प्रणाली बनाई है। केवल रोबोट द्वारा कही गई पहली बात की जांच करने के बजाय, REFLECTOR रोबोट को यह सिखाता है कि जब वह सोच रहा हो और लिख रहा हो, तो वह रुककर खुद की जांच करे।
इसे एक छात्र द्वारा गणित की परीक्षा देने की तरह समझें।
- पुराना तरीका: छात्र तुरंत उत्तर लिख देता है। यदि पहला शब्द गलत है, तो पूरा उत्तर गलत है।
- REFLECTOR का तरीका: छात्र एक चरण लिखता है, फिर रुकता है और खुद से पूछता है, "रुको, क्या यह चरण सुरक्षित है? क्या यह तार्किक है? क्या मैंने कोई गलती की है?" यदि उत्तर "नहीं" है, तो वह उसे मिटा देता है और एक अलग, सुरक्षित रास्ते को चुनता है।
उन्होंने रोबक को कैसे सिखाया (दो-चरणीय प्रशिक्षण)
शोध पत्र इस नए व्यवहार को सिखाने के लिए एक दो-चरणीय प्रक्रिया का वर्णन करता है।
चरण 1: "शिक्षक" का पाठ (सुपरवाइज्ड फाइन-ट्यूनिंग)
सबसे पहले, शोधकर्ताओं ने एक बहुत ही बुद्धिमान "शिक्षक" AI का उपयोग किया ताकि रोबोट को सुरक्षित रूप से सोचना सिखाया जा सके।
- उपमा: कल्पना कीजिए कि एक मास्टर शेफ एक प्रशिक्षु (apprentice) को सिखा रहा है। प्रशिक्षु एक ऐसा व्यंजन बनाने की कोशिश करता है जो सलाद जैसा दिखता है लेकिन उसमें जहर हो सकता है। शिक्षक हस्तक्षेप करता है, कहता है, "रुको! यह सामग्री खतरनाक है। आइए इसे एक सुरक्षित सामग्री से बदल दें," और सही चरणों को लिख देता है।
- परिणाम: रोबोट एक विशिष्ट पैटर्न सीखता है: थोड़ा लिखो -> रुको -> चिंतन करो ("क्या यह बुरा है?") -> इसे ठीक करो -> जारी रखो। यह एक "खोज और सुधार" (search-and-recovery) की आदत बनाता है।
चरण 2: "पुरस्कार" का खेल (रीइन्फोर्समेंट लर्निंग)
एक बार जब रोबोट को रुकने और चिंतन करने का तरीका पता चल जाता है, तो शोधकर्ता इसे अपने आप अभ्यास करने देते हैं, लेकिन एक स्कोरिंग सिस्टम के साथ।
- उपमा: एक वीडियो गेम की तरह सोचें।
- सुरक्षा पुरस्कार (Safety Reward): यदि रोबट बिना कुछ भी हानिकारक कहे कहानी पूरी करता है, तो उसे एक बड़ा स्वर्ण स्टार (+100 अंक) मिलता है।
- चिंतन बोनस (Reflection Bonus): यदि रोबोट प्रक्रिया के दौरान कोई गलती पकड़ लेता है और उसे ठीक करता है, तो उसे एक अतिरिक्त बोनस (+50 अंक) मिलता है।
- दंड (Penalty): यदि रोबोट चिंतन करने की कोशिश करता है लेकिन फिर भी कुछ हानिकारक बोल देता है, तो उसके अंक कट जाते हैं।
- लक्ष्य: रोबोट यह सीखता है कि खेल जीतने का (उच्चतम स्कोर प्राप्त करने का) सबसे अच्छा तरीका यह है कि वह लगातार सतर्क रहे और वास्तविक समय में अपनी गलतियों को सुधारे।
परिणाम: सुरक्षित और स्मार्ट
शोध पत्र का दावा है कि REFLECTOR दो कारणों से एक बड़ी सफलता है:
यह चालाकी भरे हमलों को रोकता है:
रोबोट उन जटिल, इनडायरेक्ट जेलब्रेक प्रयासों को रोकने में अविश्वसनीय रूप से कुशल हो गया। परीक्षणों में, इसने 90% से अधिक जटिल हमलों को सफलतापूर्वक रोका। इसने केवल दरवाजे पर सवाल को नहीं रोका; इसने रोबोट के सोचने के दौरान ही बुरे विचार को पकड़ लिया।यह मूर्ख नहीं हुआ ("अलाइनमेंट टैक्स" को तोड़ना):
आमतौर पर, जब आप किसी AI को सुरक्षित बनाते हैं, तो वह अन्य चीजों (जैसे गणित या कहानियाँ लिखना) में थोड़ा कमजोर हो जाता है। इसे "अलाइनमेंट टैक्स" (Alignment Tax) कहा जाता है।- आश्चर्य: REFLECTOR वास्तव में गणित और सामान्य ज्ञान में बेहतर हो गया।
- क्यों? शोध पत्र का सुझाव है कि "अपना काम दोबारा जांचने" (चिंतन) की आदत वास्तव में हर चीज़ के लिए अच्छी है। ठीक वैसे ही जैसे एक इंसान जो अपना गणित का होमवर्क दोबारा चेक करता है, वह बेहतर ग्रेड प्राप्त करता है, वैसे ही वह रोबोट जो अपनी सुरक्षा की दोबारा जांच करता है, वह जटिल समस्याओं को हल करने में भी बेहतर हो जाता है।
सारांश
REFLECTOR AI को सुरक्षित बनाने का एक नया तरीका है। केवल सामने के दरवाजे पर बाड़ लगाने के बजाय, यह AI को एक आंतरिक "विवेक" (conscience) विकसित करना सिखाता है जो उसके विचारों की घटित होते समय जांच करता है। यह चालाकी भरे, बहु-चरणीय धोखों को काम करने से रोकता है, और आश्चर्यजनक रूप से, यह AI को समस्या सुलझाने में भी स्मार्ट बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।