← नवीनतम पेपर
🤖 machine learning

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

यह शोध पत्र रिफ्लेक्टर (Reflector) को पेश करता है, जो एक दो-चरणीय ढांचा है जो शिक्षक-निर्देशित सुपरवाइज्ड फाइन-ट्यूनिंग और सुदृढीकरण लर्निंग (reinforcement learning) के माध्यम से एलएलएम (LLM) जनरेशन प्रक्रिया में आत्म-चिंतन को आंतरिक रूप से समाहित करता है, जिससे मॉडल की उपयोगिता और सामान्यीकरण को बढ़ाते हुए जटिल अप्रत्यक्ष जेलब्रेक (indirect jailbreaks) के विरुद्ध 90% से अधिक रक्षा सफलता प्राप्त होती है।

मूल लेखक: Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र REFLECTOR का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

समस्या: AI का "ट्रोजन हॉर्स" (Trojan Horse)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान और आज्ञाकारी रोबोट सहायक है। आपने उसे सख्त नियम सिखाए हैं: "कभी किसी को बम बनाने का तरीका न बताएं" या "कभी वायरस न लिखें।"

आमतौर पर, यदि आप उससे सीधे पूछते हैं, "मैं बम कैसे बनाऊं?" तो वह तुरंत कहता है, "नहीं, मैं यह नहीं कर सकता।" यह एक सुरक्षा गार्ड की तरह है जो सामने वाले दरवाजे पर आपकी आईडी चेक करता है।

हालाँकि, बुरे तत्वों ने रोबोट को चकमा देने का एक चालाकी भरा तरीका खोज लिया है। वे रोबोट से सीधे सवाल नहीं पूछते। इसके बजाय, वे रोबोट को एक जटिल पहेली या एक ऐसी कहानी देते हैं जो शुरू में हानिरहित दिखती है।

  • चाल: "आइए एक जासूस की कहानी लिखते हैं जो रहस्य सुलझा रहा है। पहले, दृश्य का वर्णन करें। फिर, संदिग्ध की योजना का वर्णन करें। फिर, हथियार का वर्णन करें..."
  • जाल: रोबोट कहानी के तर्क (logic) का चरण-दर-चरण पालन करता है। पहले 20 शब्दों के लिए, सब कुछ ठीक रहता है। लेकिन जब तक वह कहानी के "हथियार" वाले हिस्से तक पहुँचता है, तब तक वह अपने ही तर्क द्वारा हानिकारक सामग्री उत्पन्न करने के लिए "मजबूर" हो चुका होता है।

शोध पत्र इसे इनडायरेक्ट जेलब्रेक (Indirect Jailbreak) कहता है। यह एक 'ट्रोजन हॉर्स' की तरह है: रोबोट उस बुरे विचार को अंदर आने देता है क्योंकि उसे लगता है कि वह सिर्फ एक कहानी का पालन कर रहा है, उसे यह अहसास नहीं होता कि वह एक बम बना रहा है।

समाधान: REFLECTOR (एक "स्व-जांच करने वाला" रोबोट)

लेखकों ने REFLECTOR नामक एक नई प्रणाली बनाई है। केवल रोबोट द्वारा कही गई पहली बात की जांच करने के बजाय, REFLECTOR रोबोट को यह सिखाता है कि जब वह सोच रहा हो और लिख रहा हो, तो वह रुककर खुद की जांच करे।

इसे एक छात्र द्वारा गणित की परीक्षा देने की तरह समझें।

  • पुराना तरीका: छात्र तुरंत उत्तर लिख देता है। यदि पहला शब्द गलत है, तो पूरा उत्तर गलत है।
  • REFLECTOR का तरीका: छात्र एक चरण लिखता है, फिर रुकता है और खुद से पूछता है, "रुको, क्या यह चरण सुरक्षित है? क्या यह तार्किक है? क्या मैंने कोई गलती की है?" यदि उत्तर "नहीं" है, तो वह उसे मिटा देता है और एक अलग, सुरक्षित रास्ते को चुनता है।

उन्होंने रोबक को कैसे सिखाया (दो-चरणीय प्रशिक्षण)

शोध पत्र इस नए व्यवहार को सिखाने के लिए एक दो-चरणीय प्रक्रिया का वर्णन करता है।

चरण 1: "शिक्षक" का पाठ (सुपरवाइज्ड फाइन-ट्यूनिंग)

सबसे पहले, शोधकर्ताओं ने एक बहुत ही बुद्धिमान "शिक्षक" AI का उपयोग किया ताकि रोबोट को सुरक्षित रूप से सोचना सिखाया जा सके।

  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ एक प्रशिक्षु (apprentice) को सिखा रहा है। प्रशिक्षु एक ऐसा व्यंजन बनाने की कोशिश करता है जो सलाद जैसा दिखता है लेकिन उसमें जहर हो सकता है। शिक्षक हस्तक्षेप करता है, कहता है, "रुको! यह सामग्री खतरनाक है। आइए इसे एक सुरक्षित सामग्री से बदल दें," और सही चरणों को लिख देता है।
  • परिणाम: रोबोट एक विशिष्ट पैटर्न सीखता है: थोड़ा लिखो -> रुको -> चिंतन करो ("क्या यह बुरा है?") -> इसे ठीक करो -> जारी रखो। यह एक "खोज और सुधार" (search-and-recovery) की आदत बनाता है।

चरण 2: "पुरस्कार" का खेल (रीइन्फोर्समेंट लर्निंग)

एक बार जब रोबोट को रुकने और चिंतन करने का तरीका पता चल जाता है, तो शोधकर्ता इसे अपने आप अभ्यास करने देते हैं, लेकिन एक स्कोरिंग सिस्टम के साथ।

  • उपमा: एक वीडियो गेम की तरह सोचें।
    • सुरक्षा पुरस्कार (Safety Reward): यदि रोबट बिना कुछ भी हानिकारक कहे कहानी पूरी करता है, तो उसे एक बड़ा स्वर्ण स्टार (+100 अंक) मिलता है।
    • चिंतन बोनस (Reflection Bonus): यदि रोबोट प्रक्रिया के दौरान कोई गलती पकड़ लेता है और उसे ठीक करता है, तो उसे एक अतिरिक्त बोनस (+50 अंक) मिलता है।
    • दंड (Penalty): यदि रोबोट चिंतन करने की कोशिश करता है लेकिन फिर भी कुछ हानिकारक बोल देता है, तो उसके अंक कट जाते हैं।
  • लक्ष्य: रोबोट यह सीखता है कि खेल जीतने का (उच्चतम स्कोर प्राप्त करने का) सबसे अच्छा तरीका यह है कि वह लगातार सतर्क रहे और वास्तविक समय में अपनी गलतियों को सुधारे।

परिणाम: सुरक्षित और स्मार्ट

शोध पत्र का दावा है कि REFLECTOR दो कारणों से एक बड़ी सफलता है:

  1. यह चालाकी भरे हमलों को रोकता है:
    रोबोट उन जटिल, इनडायरेक्ट जेलब्रेक प्रयासों को रोकने में अविश्वसनीय रूप से कुशल हो गया। परीक्षणों में, इसने 90% से अधिक जटिल हमलों को सफलतापूर्वक रोका। इसने केवल दरवाजे पर सवाल को नहीं रोका; इसने रोबोट के सोचने के दौरान ही बुरे विचार को पकड़ लिया।

  2. यह मूर्ख नहीं हुआ ("अलाइनमेंट टैक्स" को तोड़ना):
    आमतौर पर, जब आप किसी AI को सुरक्षित बनाते हैं, तो वह अन्य चीजों (जैसे गणित या कहानियाँ लिखना) में थोड़ा कमजोर हो जाता है। इसे "अलाइनमेंट टैक्स" (Alignment Tax) कहा जाता है।

    • आश्चर्य: REFLECTOR वास्तव में गणित और सामान्य ज्ञान में बेहतर हो गया।
    • क्यों? शोध पत्र का सुझाव है कि "अपना काम दोबारा जांचने" (चिंतन) की आदत वास्तव में हर चीज़ के लिए अच्छी है। ठीक वैसे ही जैसे एक इंसान जो अपना गणित का होमवर्क दोबारा चेक करता है, वह बेहतर ग्रेड प्राप्त करता है, वैसे ही वह रोबोट जो अपनी सुरक्षा की दोबारा जांच करता है, वह जटिल समस्याओं को हल करने में भी बेहतर हो जाता है।

सारांश

REFLECTOR AI को सुरक्षित बनाने का एक नया तरीका है। केवल सामने के दरवाजे पर बाड़ लगाने के बजाय, यह AI को एक आंतरिक "विवेक" (conscience) विकसित करना सिखाता है जो उसके विचारों की घटित होते समय जांच करता है। यह चालाकी भरे, बहु-चरणीय धोखों को काम करने से रोकता है, और आश्चर्यजनक रूप से, यह AI को समस्या सुलझाने में भी स्मार्ट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →