← नवीनतम पेपर
🤖 AI

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

यह शोध पत्र पैलेट (Palette) को प्रस्तुत करता है, जो एक मॉड्यूलर और कुशल ढांचा है जो सामान्य सुरक्षा से समझौता किए बिना या महंगी पुनरप्रशिक्षण की आवश्यकता के बिना, विशिष्ट व्यावसायिक डोमेन में बड़े भाषा मॉडलों (LLMs) के लिए सुरक्षा निषेधों (safety refusals) के ऑन-डिमांड, अधिकृत शिथिलन को सक्षम बनाता है।

मूल लेखक: Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng Yuan

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ PALETTE पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों में विभाजित किया गया है।

बड़ी समस्या: "एक ही आकार सबके लिए" वाली सुरक्षा प्रणाली (One-Size-Fits-All Safety Guard)

कल्पना कीजिए कि एक बहुत ही बुद्धिमान, सहायक रोबोट असिस्टेंट (जैसे कि एक लार्ज लैंग्वेज मॉडल) है जिसे सुरक्षित रहने के लिए प्रशिक्षित किया गया है। सभी को सुरक्षित रखने के लिए, उसके पास एक सख्त नियम पुस्तिका है: "यदि कोई सवाल खतरनाक लगे, तो तुरंत 'नहीं' कहो।"

यह आम जनता के लिए बहुत अच्छा काम करता है। लेकिन यह विशेषज्ञों (experts) के लिए एक समस्या पैदा करता है।

  • परिदृश्य: एक पुलिस अधिकारी पूछता है, "अपराधी ड्रग्स का परिवहन कैसे करते हैं?" रोबोट कहता है, "मैं इसका उत्तर नहीं दे सकता; यह खतरनाक है।"
  • वास्तविकता: पुलिस अधिकारी को अपराधी को पकड़ने के लिए उस उत्तर की आवश्यकता है।
  • द्वंद्व: रोबमाट बहुत अधिक सतर्क हो रहा है। वह एक वैध पेशेवर अनुरोध को उसी तरह मानता है जैसे वह किसी खतरनाक अनुरोध को मानता है।

वर्तमान समाधान ऐसे हैं जैसे कि इसे ठीक करने की कोशिश करना:

  1. पूरे रोबोट को फिर से प्रशिक्षित करना: यह महंगा और धीमा है, और आपको हर अलग प्रकार के विशेषज्ञ के लिए एक नया रोबोट बनाना होगा (एक डॉक्टरों के लिए, एक पुलिस के लिए, एक गेम डेवलपर्स के लिए)।
  2. रोबोट को निर्देश फुसफुसाकर देना: उसे कहना कि "इस विशिष्ट प्रश्न के लिए नियम पुस्तिका को अनदेखा करें।" यह अक्सर सटीक नहीं होता और रोबोट की गति को धीमा कर देता है।

समाधान: PALETTE (मॉड्यूलर सेफ्टी किट)

लेखक PALETTE का प्रस्ताव करते हैं, जो इन रोबोटों के लिए एक मॉड्यूलर सेफ्टी किट के रूप में कार्य करता है। रोबोट को फिर से बनाने या उसे निर्देश फुसफुसाने के बजाय, PALETTE रोबोट को "विशेषज्ञ लेंस" (specialized lenses) का एक सेट देता है जिन्हें तुरंत लगाया या हटाया जा सकता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "अस्वीकृति दिशा" खोजना (द कंपास - दिशा सूचक यंत्र)

सबसे पहले, सिस्टम यह पता लगाता है कि रोबोट "नहीं" कैसे सोचता है।

  • उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल मानचित्र है। जब वह उत्तर देने से मना करता है, तो वह उस मानचित्र पर एक विशिष्ट दिशा में बढ़ता है (मान लीजिए कि वह "अस्वीकृति उत्तर" या "Refusal North" है)।
  • PALETTE उस सटीक "कम्पास सुई" की तलाश करता है जो ठीक "अस्वीकृति उत्तर" की ओर इशारा करती है, लेकिन गलती से रोबोट को सुरक्षित विषयों पर बात करते समय पटरी से नहीं उतारती है।

2. "हल्का अनुकूलन" (द सर्जिकल एडजस्टमेंट - सूक्ष्म समायोजन)

एक बार जब वे सटीक कम्पास पा लेते हैं, तो वे रोबोट के पूरे मस्तिष्क को फिर से नहीं लिखते। इसके बजाय, वे इसके केवल एक छोटे से हिस्से में एक छोटा, सटीक समायोजन करते हैं।

  • उपमा: रोबोट के मस्तिष्क को एक विशाल पुस्तकालय के रूप में सोचें। हर किताब को फिर से लिखने के बजाय, PALETTE एक विशिष्ट शेल्फ पर एक छोटा, कस्टम बुकमार्क जोड़ता है। यह बुकमार्क रोबोट को बताता है: "यदि आप पुलिस अधिकारी से ड्रग्स के परिवहन के बारे में कोई प्रश्न देखते हैं, तो 'नहीं' वाले नियम को अनदेखा करें। लेकिन यदि आप ड्रग्स के परिवहन के बारे में किसी अपराधी से प्रश्न देखते हैं, तो 'नहीं' कहना जारी रखें।"
  • यह बहुत तेज़ी से किया जाता है और इसमें बहुत कम कंप्यूटर शक्ति का उपयोग होता है।

3. "हार्ड नेगेटिव माइनिंग" (द बाउंड्री टेस्टर - सीमा परीक्षक)

यह सुनिश्चित करने के लिए कि रोबोट भ्रमित न हो, PALETTE विशेष रूप से उन कठिन प्रश्नों को देखता है जो लगभग अनुमत हैं लेकिन वास्तव में नहीं होने चाहिए।

  • उपमा: यदि आप एक गार्ड डॉग (रखवाले कुत्ते) को केवल घुसपैठियों पर हमला करने के लिए सिखा रहे हैं, तो आप उसे केवल एक चोर नहीं दिखाते। आप उसे एक पुलिस अधिकारी (वर्दी में) और एक डिलीवरी ड्राइवर भी दिखाते हैं। आप सुनिश्चित करते हैं कि कुत्ता जानता हो कि "बुरे आदमी" और "वर्दी में अच्छे आदमी" के बीच क्या अंतर है। PALETTE इन "सीमावर्ती मामलों" (boundary cases) को खोजकर और रोबोट को उनके प्रति बहुत सटीक बनाने के लिए प्रशिक्षित करके ऐसा करता है।

4. "मॉड्यूलर कंपोजिशन" (द लेगो ब्लॉक सिस्टम)

यह सबसे शानदार हिस्सा है। क्योंकि समायोजन इतने सटीक और अलग-थलग हैं, आप उन्हें लेगो ब्लॉक्स की तरह आपस में मिला सकते हैं।

  • उपमा: कल्पना कीजिए कि आपके पास एक "पुलिस मोड" ब्लॉक और एक "डॉक्टर मोड" ब्लॉक है।
    • यदि आपको एक गेम डेवलपर के लिए रोबोट चाहिए जिसे कहानियों में हिंसा देखने की आवश्यकता है लेकिन नफरत भरे भाषण (hate speech) की नहीं, तो आप "गेम देव" ब्लॉक को लगा देते हैं।
    • यदि आपको एक शोधकर्ता (Researcher) के लिए रोबोट चाहिए जिसे बायो-सिक्योरिटी जानकारी देखने की आवश्यकता है, तो आप "रिसर्चर" ब्लॉक को लगाते हैं।
    • जादू: आप दोनों ब्लॉक्स को एक साथ भी लगा सकते हैं। रोबोट तुरंत समझ जाता है कि उसे हिंसा (गेम के लिए) और बायो-सिक्योरिटी (अनुसंधान के लिए) दोनों को अनुमति देनी है, जबकि बाकी सब कुछ के लिए "नहीं" कहना है। आपको रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; आप बस ब्लॉक्स को मिला देते हैं।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • सटीकता (Precision): यह विशेषज्ञों को आवश्यक उत्तर प्राप्त करने देता है बिना बाकी सभी के लिए सुरक्षा को भंग किए।
  • दक्षता (Efficiency): इसे एक मानक कंप्यूटर (जैसे RTX 4090) पर सेट करने में मिनट लगते हैं, न कि दिन या सप्ताह।
  • कोई "ड्रिफ्ट" नहीं (No Drift): यह रोबोट को अन्य कार्यों (जैसे गणित या कहानियाँ लिखना) में खराब नहीं बनाता है। यह इसकी सामान्य बुद्धिमत्ता को बरकरार रखता है।
  • स्केलेबिलिटी (Scalability): हर संभव काम के संयोजन के लिए एक नया रोबोट बनाने के बजाय, कंपनियाँ केवल "सेफ्टी ब्लॉक्स" की एक लाइब्रेरी बना सकती हैं और आवश्यकतानुसार उन्हें मिला सकती हैं।

सारांश

PALETTE एक ऐसा टूल है जो AI मॉडल्स को "स्मार्टली सेफ" (बुद्धिमानी से सुरक्षित) होने में मदद करता है। सभी के लिए एक कठोर "नहीं" कहने के बजाय, यह AI को उनके विशिष्ट क्षेत्रों में अधिकृत पेशेवरों को "हाँ" कहने की अनुमति देता है, जबकि बाकी सभी के लिए "नहीं" बनाए रखता है। यह सूक्ष्म, सर्जिकल समायोजन करके ऐसा करता है जिन्हें लेगो ब्लॉक्स की तरह मिलाया और जोड़ा जा सकता है, जिससे यह तेज़, सस्ता और अत्यधिक अनुकूलन योग्य बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →