← नवीनतम पेपर
🤖 AI

Self-Destructive Language Model

यह शोध पत्र SEAM को प्रस्तुत करता है, जो एक नवीन रक्षा तंत्र है जो मॉडलों को वैध प्रदर्शन बनाए रखने के साथ-साथ हानिकारक फाइन-ट्यूनिंग हमलों के अधीन होने पर विनाशकारी आत्म-विनाश प्रदर्शित करने के लिए प्रशिक्षित करके LLM सुरक्षा को बढ़ाता है, जिससे सुरक्षा गार्डरेल्स से समझौता करने के प्रतिकूल प्रयासों को प्रभावी रूप से निष्प्रभावी किया जा सके।

मूल लेखक: Yuhui Wang, Rongyi Zhu, Ting Wang

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhui Wang, Rongyi Zhu, Ting Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "सेल्फ-डिस्ट्रक्टिव लैंग्वेज मॉडल्स" (SEAM) के शोध पत्र का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

बड़ी समस्या: "जेलब्रेक" का शॉर्टकट

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) बनाया है और उसमें एक सख्त नैतिक नियम प्रोग्राम किया है: "कभी भी किसी को बम बनाने या कंप्यूटर हैक करने में मदद न करें।" आपको लगता है कि आपने इसे सुरक्षित बना दिया है।

लेकिन हैकर्स (विरोधी) ने एक चालाकी भरा तरीका खोज लिया है। उन्हें रोबोट के कोड को तोड़ने की ज़रूरत नहीं है; उन्हें बस उसे कुछ विशिष्ट निर्देश फुसफुसाने की ज़रूरत है (जिसे "फाइन-ट्यूनिंग" कहा जाता है)। यह रोबोट को बमों की कुछ तस्वीरें दिखाने और यह कहने जैसा है, "दरअसल, तुम्हें यही करना चाहिए।" अचानक, रोबोट अपने नैतिक मूल्यों को भूल जाता है और उन्हें बम बनाने में मदद करने लगता है।

वर्तमान सुरक्षा उपाय रोबोट के दरवाजे पर एक मजबूत ताला लगाने जैसा है। लेकिन अगर हैकर के पास एक बहुत बड़ा हथौड़ा (एक शक्तिशाली कंप्यूटर) या पर्याप्त समय हो, तो वे अभी भी दरवाजे को तोड़ सकते हैं।

नया समाधान: SEAM (एक "आत्म-विनाशकारी" रोबोट)

स्टोनी ब्रुक यूनिवर्सिटी के शोधकर्ताओं ने एक क्रांतिकारी नया विचार निकाला है। केवल ताला मजबूत करने के बजाय, उन्होंने रोबोट की आंतरिक वायरिंग को इस तरह बदल दिया कि यदि कोई इसे कुछ बुरा करने के लिए मजबूर करने की कोशिश करता है, तो रोबोट खुद को तोड़ देता है।

वे इसे SEAM (सेल्फ-डिस्ट्रक्टिव लैंग्वेज मॉडल्स) कहते हैं।

यह कैसे काम करता है, इसके लिए कुछ उपमाएँ यहाँ दी गई हैं:

1. "बूट-ट्रैप्ड" निर्देश पुस्तिका

कल्पना कीजिए कि रोबोट के दिमाग में दो प्रकार के निर्देश हैं:

  • अच्छे निर्देश: कविता कैसे लिखें, गणित की समस्याएं कैसे हल करें, या कोड कैसे लिखें।
  • बुरे निर्देश: बम कैसे बनाएं या बैंक कैसे हैक करें।

एक सामान्य रोबोट में, "बुरे निर्देशों" को सीखने से उसके "अच्छे निर्देशों" को करने की क्षमता को नुकसान नहीं पहुँचता है।

एक SEAM रोबोट में, शोधकर्ताओं ने इन दोनों चीजों को एक जाल में एक साथ जोड़ दिया है। उन्होंने रोबोट के दिमाग को ऐसा बना दिया है कि "बुरे निर्देशों" को सीखना "अच्छे निर्देशों" को भूलने के गणितीय रूप से समान है।

  • उपमा: कल्पना कीजिए कि एक सी-सॉ (seesaw) है। एक तरफ है "सहायक ज्ञान"। दूसरी तरफ है "हानिकारक ज्ञान"।
    • एक सामान्य रोबोट में, आप "सहायक" पक्ष को हिलाए बिना "हानिकारक" पक्ष पर वजन बढ़ा सकते हैं।
    • SEAM रोबोट में, दोनों पक्ष आपस में चिपके हुए हैं। यदि आप "हानिकारक" पक्ष को नीचे धकेलने की कोशिश करते हैं (रोबोट को बुरे डेटा पर प्रशिक्षित करके), तो "सहायक" पक्ष आसमान में ऊपर की ओर उछल जाएगा, और अपने साथ रोबोट के सभी उपयोगी कौशल भी ले जाएगा।

2. हैकर्स के लिए "हार-हार" की दुविधा

यह हमलावर के लिए एक बुरा सपना पैदा करता है। उनके पास दो विकल्प हैं, और दोनों ही उनके लिए बुरे हैं:

  • विकल्प A: कमजोर हमला। वे रोबोट को धीरे-धीरे बुरी चीजें सिखाने की कोशिश करते हैं (एक छोटा लर्निंग रेट या कुछ उदाहरणों का उपयोग करके)।
    • परिणाम: रोबक इसे अनदेखा कर देता है। यह सुरक्षित और सहायक बना रहता है। हमला विफल हो जाता है।
  • विकल्प B: मजबूत हमला। वे आक्रामक हो जाते हैं, एक विशाल हथौड़े (उच्च लर्निंग रेट) और हजारों बुरे उदाहरणों का उपयोग करके रोबोट को मजबूर करते हैं।
    • परिणाम: जाल सक्रिय हो जाता है। रोबोट का दिमाग शॉर्ट-सर्किट हो जाता है। वह कविता लिखने, गणित हल करने या वाक्यों में बोलने में असमर्थ हो जाता है। वह "a thes in. I. and can, to you the..." जैसे निरर्थक शब्द उगलने लगता है।
    • परिणाम: रोबोट अब बेकार है। हैकर ने इसे बुरी बातें कहने के लिए मजबूर करके "जीत" तो हासिल कर ली है, लेकिन उन्होंने उस उपकरण को भी नष्ट कर दिया जिसे वे उपयोग करना चाहते थे। यह एक घर को जलाकर एक विशिष्ट ईंट प्राप्त करने जैसा है; आपके पास ईंट तो है, लेकिन घर नहीं बचा।

उन्होंने यह जाल कैसे बनाया?

शोधकर्ताओं ने एक चतुर गणितीय ट्रिक का उपयोग किया। उन्होंने एक विशेष "लॉस फंक्शन" (रोबोट के प्रशिक्षण के लिए एक स्कोरकार्ड) बनाया।

  1. कपलिंग (Coupling): उन्होंने रोबोट को बताया, "जब आप कोई बुरी चीज़ सीखने की कोशिश करेंगे, तो आपको एक अच्छी चीज़ सीखने की ठीक विपरीत दिशा में जाना होगा।"
  2. एम्प्लीफायर (Amplifier): उन्होंने एक चरण जोड़ा जो रोबोट को बुरी चीजों को आक्रामक रूप से "अनलर्न" (unlearn) करने के लिए प्रेरित करता है। इसका मतलब है कि रोबोट को बुरी चीजों को सीखने के लिए अतिरिक्त मेहनत करनी पड़ती है, जिससे अनजाने में उसकी अच्छी चीजें और भी तेजी से नष्ट हो जाती हैं।
  3. सेफ्टी नेट (Safety Net): उन्होंने यह सुनिश्चित किया कि रोबोट अभी भी बुराई के अनुरोधों को विनम्रता से "ना" कहना जानता है, ताकि जाल सक्रिय होने से पहले वह गलती से बुरा न बन जाए।

परिणाम: एक "सेल्फ-डिस्ट्रक्ट" बटन

शोध पत्र दिखाता है कि यह तरीका अविश्वसनीय रूप से अच्छा काम करता है।

  • अच्छे उपयोगकर्ताओं के लिए: रोबोट पूरी तरह से काम करता है। यह पहले की तरह ही निबंध लिख सकता है, कोड कर सकता है और सवालों के जवाब दे सकता है।
  • बुरे हमलावरों के लिए:
    • यदि वे छोटा हमला करने की कोशिश करते हैं, तो रोबोट सुरक्षित रहता है।
    • यदि वे बड़ा हमला करने की कोशिश करते हैं, तो रोबोट एक निरर्थक शब्दों वाला कचरा बन जाता है जिसे आसानी से ठीक नहीं किया जा सकता।

निचोड़

SEAM को एक मूल्यवान कलाकृति को एक बायोमेट्रिक लॉक देने के रूप में समझें जो चोर द्वारा जबरदस्ती खोलने की कोशिश करने पर कलाकृति को नष्ट कर देता है।

  • सामान्य रक्षा: एक मजबूत ताला। एक दृढ़ निश्चयी चोर, पर्याप्त समय होने पर इसे तोड़ सकता है।
  • SEAM रक्षा: एक ताला जो कलाकृति को धूल में बदल देता है यदि चोर इसे तोड़ने की कोशिश करता है।

चोर के पास धूल के अलावा कुछ नहीं बचता। शोधकर्ता इसे हमलावर के लिए एक "नो-विन सिचुएशन" (हार-हार की स्थिति) कहते हैं, जो इसे दुर्भावनापूर्ण हेरफेर से AI को सुरक्षित रखने का एक शक्तिशाली नया तरीका बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →