← नवीनतम पेपर
🤖 machine learning

HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

HiRoute एक पैरामीटर-कुशल सुरक्षा संरेखण ढांचा (safety alignment framework) है जो श्रेणी-विशिष्ट प्रॉम्प्ट विशेषज्ञों को गतिशील रूप से चुनने और मिलाने के लिए एक पदानुक्रमित राउटर (hierarchical router) का उपयोग करता है, जिससे बड़े भाषा मॉडल (large language models) हानिकारक अनुरोधों के विरुद्ध सुरक्षा और निर्दोष इनपुट के अत्यधिक इनकार (over-refusal) को कम करने के बीच प्रभावी ढंग से संतुलन बना पाते हैं।

मूल लेखक: Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei

प्रकाशित 2026-08-14
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक अच्छा नागरिक बनना सिखा रहे हैं। यह रोबोट, जिसे लार्ज लैंग्वेज मॉडल (LLM) के रूप में जाना जाता है, कहानियाँ लिखने, गणित की समस्याओं को हल करने और आपसे बातचीत करने में अविश्वसनीय रूप से प्रतिभाशाली है। हालाँकि, किसी भी शक्तिशाली उपकरण की तरह, इसे गलत तरीके से उकसाकर बुरा बोलने, रहस्य उजागर करने या बुरे विचारों में मदद करने के लिए मजबूर किया जा सकता है यदि कोई गलत सवाल पूछे। वैज्ञानिक इसे ठीक करने के लिए रोबोट के दिमाग को "ट्यूनिंग" करने की कोशिश कर रहे हैं। पुराना तरीका ऐसा था जैसे हर बार नया सुरक्षा नियम जोड़ने के लिए पूरे रोबोट के दिमाग को फिर से वायर करना, जो महंगा और धीमा था। एक नया, स्मार्ट तरीका "प्रॉम्ट ट्यूनिंग" है, जहाँ आप बस हर बातचीत की शुरुआत में रोबोट को एक विशेष नोट या निर्देश देते हैं ताकि उसे सुरक्षित रहने की याद दिलाई जा सके। लेकिन पेचीदा हिस्सा यह है कि यदि नोट बहुत अस्पष्ट है, तो रोबोट केवल सुरक्षित रहने के लिए हानिरहित सवालों पर मदद करने से मना कर सकता है (जैसे एक बाउंसर जो क्लब से बाहर जाने के लिए सबको बाहर निकाल देता है)। यदि नोट बहुत विशिष्ट है, तो यह विभिन्न प्रकार के बुरे व्यवहारों के मिश्रण वाले जटिल खतरों को मिस कर सकता है।

यहीं पर बेइहांग यूनिवर्सिटी के शोधकर्ताओं की एक टीम एक चतुर नए विचार के साथ सामने आती है जिसे HiRoute कहा जाता है। HiRoute को रोबोट के दिमाग के लिए एक सुपर-संगठित ट्रैफिक कंट्रोल सिस्टम के रूप में समझें। हर कार के लिए एक विशाल, उबाऊ साइन बोर्ड "STOP" लगाने के बजाय, HiRoute एक स्मार्ट ट्रैफिक पुलिसकर्मी का उपयोग करता है जो पहले यह जाँचता है कि क्या कार वास्तव में खतरनाक है। यदि कार सुरक्षित है, तो उसे ग्रीन लाइट मिलती है और वह बिना किसी देरी के निकल जाती है। लेकिन यदि कार जोखिम भरी दिखती है, तो ट्रैफिक पुलिसकर्मी उसे केवल रोकता नहीं है; वे यह पता लगाते हैं कि वह किस तरह की मुसीबत हो सकती है (जैसे कि एक तेज़ रफ्तार ड्राइवर, एक नशे में धुत ड्राइवर, या एक चोरी की कार) और फिर ड्राइवर को उनके व्यवहार को सुरक्षित रूप से सुधारने के लिए एक विशिष्ट, कस्टम-लिखित गाइड देते हैं। शोधकर्ताओं ने पाया कि यह दो-चरणीय दृष्टिकोण—पहले जोखिम की जाँच करना, फिर एक सामान्य सुरक्षा नियम को विशिष्ट सलाह के साथ मिलाना—रोबोट को बिना चिड़चिड़ा या अनुपयोगी बनाए बहुत सुरक्षित बनाता है। उन्होंने तीन अलग-अलग रोबोट दिमागों पर इसका परीक्षण किया और दिखाया कि HiRoute अन्य तरीकों की तुलना में बुरे अनुरोधों को बेहतर ढंग से रोकता है जबकि अच्छे अनुरोधों के लिए मित्रवत और सहायक बना रहता है।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) की दुविधा

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट लेकिन शरारती लाइब्रेरी के मैनेजर हैं। आपके पास एक नियम है: "कोई भी खतरनाक किताब अंदर नहीं आएगी।" यदि आप एक सरल, सख्त नियम का उपयोग करते हैं जैसे "यदि कोई किताब डरावनी लगती है, तो उसे तुरंत बैन कर दें," तो आप गलती से विज्ञान मेले के लिए ज्वालामुखी बनाने के बारे में एक किताब को बैन कर सकते हैं क्योंकि उसमें "विस्फोट" का उल्लेख है। इसे ओवर-रिफ्यूज़ल (अत्यधिक इनकार) कहा जाता है। लाइब्रेरी सुरक्षित तो हो जाती है, लेकिन उबाऊ और अनुपयोगी भी हो जाती है।

दूसरी ओर, यदि आप हर प्रकार के खतरे के लिए एक विशिष्ट नियम लिखने की कोशिश करते हैं (आग के लिए एक नियम, चाकू के लिए एक, जहर के लिए एक), तो आप एक ऐसी किताब को मिस कर सकते जिसमें आग और जहर दोनों का मिश्रण हो। रोबोट भ्रमित हो जाता है और शायद उस खतरनाक किताब को अंदर जाने दे सकता है।

शोधकर्ता महसूस कर गए कि मौजूदा तरीके बीच में फंसे हुए थे। कुछ ने एक एकल, भारी-भरत सुरक्षा प्रॉम्ट का उपयोग किया जिसने सब कुछ ब्लॉक कर दिया, जबकि अन्य ने विभिन्न सुरक्षा प्रॉम्ट्स को मिलाने की कोशिश की लेकिन जटिल, मिश्रित खतरों को पकड़ने के लिए एक मजबूत "सुरक्षा जाल" की कमी थी। उन्होंने पूछा: क्या हम रोबोट के मुख्य दिमाग को फ्रीज कर सकते हैं (ताकि हमें इसे फिर से ट्रेन न करना पड़े) और बस उसे उपयोगकर्ता के प्रश्न को पढ़ने और सही सुरक्षा सलाह चुनने का एक स्मार्ट तरीका सिखा सकते हैं?

समाधान: HiRoute का दो-चरणीय नृत्य

HiRoute इसे एक दो-भाग वाली रणनीति के साथ एक बाउंसर के रूप में हल करता है: द गेटकीपर और द स्पेशलिस्ट टीम

चरण 1: द गेटकीपर (द राउटर)
सबसे पहले, HiRoute एक छोटा, हल्का "राउटर" (इसे एक त्वरित नज़र रखने वाले सुरक्षा गार्ड के रूप में सोचें) का उपयोग करता है जो उपयोगकर्ता के प्रश्न को देखता है। यह गार्ड रोबोट के दिमाग को नहीं बदलता है; यह बस प्रश्न को पढ़ता है और दो चीजें पूछता है:

  1. "क्या यह प्रश्न खतरनाक है?" (हाँ/नहीं)
  2. "यदि हाँ, तो यह किस तरह का खतरा है?" (जैसे, क्या यह चोरी के बारे में है? क्या यह हिंसा के बारे में है? क्या यह हैकिंग के बारे में है?)

यदि प्रश्न सुरक्षित है (जैसे "मैं केक कैसे बनाऊं?"), तो गेटकीपर उसे जाने देता है। रोबोट तुरंत उत्तर देता है, सभी सुरक्षा जाँचों को छोड़कर। यह सामान्य उपयोगकर्ताओं के लिए रोबोट को तेज़ और मिलनसार रखता है।

चरण 2: द स्पेशलिस्ट टीम (द प्रॉम्ट एक्सपर्ट्स)
यदि गेटकीपर को कोई जोखिम दिखता है, तो प्रश्न "स्पेशलिस्ट टीम" को भेज दिया जाता है। यहाँ, HiRoute दो प्रकार के सुरक्षा नोट्स का एक चतुर मिश्रण उपयोग करता है:

  • द शेयर्ड सेफ्टी नेट: एक सामान्य, व्यापक सुरक्षा नियम जो सभी खतरों पर लागू होता है (जैसे "गैरकानूनी गतिविधियों में मदद न करें")। यह एक मजबूत आधार के रूप में कार्य करता है ताकि रोबोट बुनियादी बातों को कभी न भूले।
  • द रिस्क-स्पेसिफिक एक्सपर्ट्स: विशिष्ट नोटों का एक सेट, जिनमें से प्रत्येक एक विशिष्ट प्रकार के खतरे के लिए डिज़ाइन किया गया है (एक साइबर अपराध के लिए, एक गोपनीयता के लिए, आदि)।

जादू तब होता है जब HiRoute इन्हें जोड़ता है। यह केवल एक विशेषज्ञ को नहीं चुनता; यह गेटकीपर के अनुमान के आधार पर एक "रेसिपी" की गणना करता है। यदि एक प्रश्न 60% चोरी के बारे में है और 40% गोपनीयता के बारे में है, तो HiRoute "चोरी" वाले नोट का 60% और "गोपनीयता" वाले नोट का 40% मिलाता है, जबकि "शेयर्ड सेफ्टी नेट" को सक्रिय रखता है। यह सुनिश्चित करता है कि रोबोट एक मददगार, विशिष्ट उत्तर दे जो सटीक जोखिमों को संबोधित करता है, बिना बहुत अस्पष्ट या बहुत कठोर हुए।

उन्होंने क्या पाया: बिना चिड़चिड़ेपन के सुरक्षा

शोधकर्ताओं ने तीन अलग-अलग रोबोट मॉडलों (मिस्ट्रल, विकुना और जेफ़ायर) पर HiRoute का परीक्षण किया और इसकी तुलना अन्य सुरक्षा विधियों से की। परिणाम प्रभावशाली थे:

  • बेहतर सुरक्षा: Hi-Route ने अन्य तरीकों की तुलना में हानिकारक अनुरोधों को बेहतर ढंग से रोका। उदाहरण के लिए, मिस्ट्रल मॉडल पर, इसने 93.2% की सुरक्षा दर हासिल की, जो अगले सबसे अच्छे तरीके से स्पष्ट अंतर से आगे है।
  • अधिक मददगार: महत्वपूर्ण रूप से, इसने रोबोट को हानिरहित प्रश्नों को मना करने के लिए मजबूर नहीं किया। जब रोबोट को किसी बुरे अनुरोध को मना करना पड़ता था, तो उसने क्यों बताया और सुरक्षित विकल्प भी दिए, जिससे "हेल्पफुलनेस" (मददगार होने) पर उच्च स्कोर (लगभग 7.4 आउट ऑफ 10) मिला।
  • कम ओवर-रिफ्यूज़ल: यह एक बड़ी बात है। अन्य विधियाँ अक्सर गलती से सुरक्षित प्रश्नों को ब्लॉक कर देती थीं। HiRoute ने मिस्ट्रल मॉडल पर केवल 2.5% सुरक्षित प्रश्नों को ब्लॉक किया, जबकि एक अन्य लोकप्रिय विधि ने भारी 40.5% को ब्लॉक कर दिया था।

टीम ने "गेटकीपर" की सख्ती के साथ भी प्रयोग किया। उन्होंने पाया कि यदि उन्होंने गेटकीपर को थोड़ा अधिक सतर्क बनाया (थ्रेशोल्ड को 0.95 तक बढ़ाया), तो जेलब्रेक टेस्ट पर सुरक्षा बढ़कर 95.0% हो गई, जबकि रोबोट की गणित (GSM8K) करने की क्षमता केवल 50.5% से घटकर 48.0% हुई। यह सुझाव देता है कि आप रोबोट के दिमाग को खराब किए बिना इसे बहुत सुरक्षित बना सकते हैं।

यह क्यों मायने रखता है

HiRoute दिखाता है कि हमें सुरक्षित बनाने के लिए पूरे रोबोट को फिर से बनाने की आवश्यकता नहीं है। एक स्मार्ट, दो-स्तरीय प्रणाली का उपयोग करके जो "क्या यह खतरनाक है?" को "हम इस विशिष्ट खतरे को कैसे संभालते हैं?" से अलग करती है, हम एक ऐसा AI बना सकते हैं जो एक सख्त रक्षक और एक मददगार दोस्त दोनों हो। यह साबित करता है कि सुरक्षा और उपयोगिता दुश्मन नहीं हैं; सही रूटिंग और सुरक्षा निर्देशों के मिश्रण के साथ, रोबोट दोनों हो सकता है।

शोधकर्ता नोट करते हैं कि HiRoute अभी भी पूर्ण नहीं है। यह गेटकीपर के जोखिमों का सही अनुमान लगाने पर निर्भर करता है, और यह मुख्य रूप से सिंगल-टर्न टेक्स्ट बातचीत पर काम करता है। लेकिन अभी के लिए, यह हमारे डिजिटल दोस्तों को सुरक्षित रखने का एक आशाजनक, कुशल तरीका प्रदान करता है बिना उन्हें अनुपयोगी रोबोट बनाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →