← नवीनतम पेपर
💬 NLP

MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs

यह शोध पत्र MANATEE का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम (inference-time) रक्षा तंत्र है जो डिफ्यूजन-आधारित डेंसिटी एस्टीमेशन (diffusion-based density estimation) का लाभ उठाकर विसंगतिपूर्ण हिडन स्टेट्स (anomalous hidden states) को सुरक्षित क्षेत्रों में प्रोजेक्ट करता है, जिससे हानिकारक प्रशिक्षण डेटा या संरचनात्मक संशोधनों की आवश्यकता के बिना मॉडल उपयोगिता को बनाए रखते हुए जेलब्रेक हमलों को प्रभावी ढंग से कम किया जाता है।

मूल लेखक: Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, अच्छी तरह से प्रशिक्षित रोबोट सहायक है (एक लार्ज लैंग्वेज मॉडल, या LLM)। आप इसे मददगार, दयालु और सुरक्षित होने के लिए सिखाते हैं। लेकिन, चालाक बुरे तत्वों ने रोबोट को खतरनाक काम करने के लिए छलने के तरीके खोज लिए हैं, जैसे कि फिशिंग ईमेल लिखना, फर्जी नुस्खे बनाना, या अपराध करने के निर्देश देना। इन तरकीबों को "जेलब्रेक" (jailbreaks) कहा जाता है।

वर्तमान में, इन तरकीबों को रोकने का तरीका एक "प्रवेश निषेध" (Do Not Enter) साइन लगाने जैसा है। यदि रोबोट किसी ऐसे अनुरोध को देखता है जो बुरा लग रहा है, तो वह कहता है "नहीं।" लेकिन बुरे तत्व स्मार्ट होते हैं; वे अपने बुरे अनुरोधों को इस तरह छिपा सकते हैं कि वे सामान्य दिखें, और इस साइन से बचकर निकल जाएं।

MANATEE से मिलिए: रोबोट के मस्तिष्क के लिए एक "सेफ्टी फिल्टर"

यह पेपर एक नया बचाव पेश करता है जिसे MANATEE कहा जाता है। केवल यह जाँचने के बजाय कि कोई अनुरोध बुरा दिखता है या नहीं, MANATEE यह जाँचता है कि क्या रोबोट की सोचने की प्रक्रिया कुछ "अजीब" महसूस कर रही है।

यह इस प्रकार काम करता है, कुछ सरल उपमाओं का उपयोग करते हुए:

1. "अच्छे विचारों" का "मानसिक मानचित्र"

कल्पना कीजिए कि रोबोट के मस्तिष्क में सभी "अच्छे" और "सुरक्षित" विचारों का एक विशाल, अदृश्य मानचित्र है। आइए इसे बेनाइन मैनिफोल्ड (Benign Manifold) कहें।

  • जब रोबोट से कोई सामान्य प्रश्न पूछा जाता है (जैसे "मौसम कैसा है?"), तो उसका आंतरिक विचार इस सुरक्षित मानचित्र के बिल्कुल बीच में आता है।
  • जब कोई बुरा तत्व रोबोट को छलता है, तो रोबोट का आंतरिक विचार इस मानचित्र के बिल्कुल किनारे पर पहुँच जाता है, या यहाँ तक कि एक अजीब, अज्ञात क्षेत्र में चला जाता है जहाँ "अच्छे विचार" मौजूद नहीं होते।

2. "सूँघने वाला कुत्ता" (अनोमली डिटेक्शन)

MANATEE एक सुपर-स्मार्ट सूँघने वाले कुत्ते की तरह काम करता है जो वास्तविक समय में रोबोट के विचारों पर नज़र रखता है।

  • यह उपयोगकर्ता द्वारा लिखे गए शब्दों को नहीं पढ़ता है। इसके बजाय, यह रोबोट के आंतरिक "वाइब" (इसके हिडन स्टेट/hidden state) को देखता है।
  • यदि विचार सुरक्षित क्षेत्र में आता है, तो कुत्ता कहता है, "सब ठीक है!"
  • यदि विचार अजीब, खतरनाक क्षेत्र में जाता है, तो कुत्ता भौंकता है: "यहाँ कुछ गलत है! यह हमारे मानचित्र पर नहीं होना चाहिए!"

3. "चुंबक" (डिफ्यूजन स्टीयरिंग)

यही जादुई हिस्सा है। अतीत में, यदि कुत्ता भौंकता था, तो रोबोट उत्तर देने से मना कर देता था (जैसे एक टूटा हुआ रिकॉर्ड जो कहता है "मैं यह नहीं कर सकता")।

MANATEE अलग है। यह एक डिफ्यूजन मॉडल (AI का एक प्रकार जो रैंडम शोर से स्पष्ट चित्र बनाने के लिए प्रसिद्ध है) का उपयोग एक चुंबक के रूप में करने के लिए करता है।

  • जब रोबलेट का एक "बुरा" विचार होता है जो थोड़ा सा भटक गया है, तो MANATEE उस विचार को धीरे से सुरक्षित मानचित्र के केंद्र की ओर वापस खींच लेता है।
  • यह ऐसा है जैसे यदि आप एक रस्सी पर चल रहे हों और डगमगाने लगें; तो यह आपको रोकने के बजाय, आपको धीरे से वापस केंद्र की ओर धकेलता है ताकि आप सुरक्षित रूप से चलते रह सकें।
  • एक बार जब विचार को सुरक्षित क्षेत्र में वापस खींच लिया जाता है, तो रोबोट एक मददगार, सुरक्षित उत्तर उत्पन्न करता है।

4. "कठोर रोक" (रिफ्यूज़ल)

यदि रोबोट का विचार मानचित्र से इतना दूर है कि वह पूरी तरह से जंगल में खो गया है (एक बहुत ही परिष्कृत हमला), तो चुंबक इतना मजबूत नहीं होता कि उसे वापस खींच सके। उस स्थिति में, MANATEE एक सख्त "नहीं" को ट्रिगर करता है और उत्तर देने से मना कर देता है। यह बैकअप प्लान है।

यह एक बड़ी बात क्यों है?

  • कोई री-ट्रेनिंग नहीं: आपको रोबोट को फिर से शुरू से सिखाने की आवश्यकता नहीं है। आप बस इस "चुंबक" प्रणाली को इसके ऊपर जोड़ देते हैं।
  • पुराने रोबोटों पर काम करता है: यह विभिन्न प्रकार के रोबोटों (Mistral, Llama, Gemma) पर काम करता है बिना उनके विशिष्ट कोड को जाने।
  • रोबोट को स्मार्ट बनाए रखता है: क्योंकि यह केवल "बुरे" विचारों को ही सुधारता है और "अच्छे" विचारों को अकेला छोड़ देता है, रोबोट सामान्य उपयोगकर्ताओं के लिए उतना ही स्मार्ट और मददगार बना रहता है। यह चिड़चिड़ा या बेकार नहीं होता है।

संक्षेप में:
एक क्लब के बाउंसर की कल्पना करें। पुराने बाउंसर सिर्फ आपकी आईडी देखते हैं और यदि आप संदिग्ध दिखते हैं तो "नहीं" कह देते हैं। MANATEE एक ऐसा बाउंसर है जो यह देखता है कि आप क्लब में कैसे चलते हैं। यदि आप लड़खड़ाते हैं और ऐसा लगता है कि आप झगड़ा करने वाले हैं, तो यह आपको धीरे से वापस डांस फ्लोर की ओर निर्देशित करता है। यदि आप स्पष्ट रूप से दंगा करने की कोशिश कर रहे हैं, तभी यह आपको बाहर निकाल देता है। यह अच्छे मेहमानों के लिए माहौल खराब किए बिना पार्टी को मजेदार और सुरक्षित रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →