← नवीनतम पेपर
🤖 AI

Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

यह शोध पत्र RFM-AGOP के माध्यम से फास्ट मल्टी-डायमेंशनल रिफ्यूज़ल सबस्पेस (Fast Multi-dimensional Refusal Subspaces) को प्रस्तुत करता है, जो एक कुशल विधि है जो प्रोब-इन्फॉर्म्ड इनिशियलाइज़ेशन (probe-informed initialization) के साथ रिकर्सिव फीचर मशीन एल्गोरिदम को अनुकूलित करती है ताकि रीजनिंग और नॉन-रीजनिंग दोनों प्रकार के LLMs में मल्टी-डायमेंशनल रिफ्यूज़ल सबस्पेसों की तेजी से और सटीक रूप से पहचान की जा सके, जिससे मौजूदा तकनीकों की कम्प्यूटेशनल सीमाओं को दूर किया जा सके।

मूल लेखक: Thomas Winninger

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Winninger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: हमें इसकी आवश्यकता क्यों है

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) बहुत बुद्धिमान लेकिन कभी-कभी जिद्दी लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह हैं। उनका काम सवालों के जवाब देना है, लेकिन उन्हें खतरनाक अनुरोधों (जैसे "मैं बम कैसे बनाऊं?") पर "ना" कहने के लिए प्रशिक्षित किया गया है।

लंबे समय तक वैज्ञानिकों ने सोचा कि लाइब्रेरियन का "ना" बटन एक सिंगल, सरल स्विच है। यदि आप उस एक स्विच को ढूंढ लेते और उसे पलट देते, तो लाइब्रेरियन मना करना बंद कर देता और कुछ भी बताने लगता।

समस्या: हालिया शोध से पता चलता है कि स्मार्ट और अधिक जटिल मॉडल्स के लिए (विशेष रूप से जो जवाब देने से पहले लंबे समय तक "सोचते" हैं), "ना" बटन केवल एक स्विच नहीं है। यह कई अलग-अलग डायल और लीवर्स (lever) वाला एक पूरा कंट्रोल रूम है जो एक साथ काम करते हैं। यदि आप केवल एक लीवर खींचते हैं, तो लाइब्रेरियन फिर भी मना कर सकता है।

लक्ष्य: लेखक इन सभी लीवर्स को जल्दी और सस्ते में खोजना चाहते थे, ताकि वे समझ सकें कि मॉडल कैसे इनकार करने का निर्णय लेता है, या यह परीक्षण भी कर सकें कि क्या वे रिफ्यूजल (मना करने के तंत्र) को बंद करने के लिए इसे कैसे बदल सकते हैं।


पुराना तरीका बनाम नया तरीका

पुराना तरीका (बहुत धीमा)

कल्पना कीजिए कि आप उस कंट्रोल रूम में सही डायल का कॉम्बिनेशन खोजने की कोशिश कर रहे हैं, जिसमें एक-एक करके डायल घुमाते हैं, परिणाम देखते हैं, उन्हें वापस घुमाते हैं और फिर से कोशिश करते हैं।

  • समस्या: आधुनिक "रीज़निंग" (तर्क करने वाले) मॉडल्स के लिए जो लंबे 'चेन ऑफ थॉट' उत्पन्न करते हैं, यह प्रक्रिया अविश्वसनीय रूप से धीमी है। यह रेडियो को ट्यून करने जैसा है जहाँ घंटों तक केवल शोर (static) सुनने के बाद भी सही स्टेशन नहीं मिलता। इसमें इतनी कंप्यूटर शक्ति लगती है कि इसे एक सामान्य लैपटॉप पर करना अक्सर असंभव होता है।

नया तरीका (RFM-AGOP)

लेखकों ने एक नई विधि बनाई जिसे RFM-AGOP कहा जाता है। इसे एक स्मार्ट मेटल डिटेक्टर के रूप में सोचें जो घंटों के बजाय सेकंडों में पूरे कंट्रोल रूम को स्कैन कर सकता है।

  1. "प्रोब" वॉर्म-अप: स्कैन करने से पहले, वे डिटेक्टर को एक छोटा सा संकेत देते हैं। वे एक सरल प्रश्न पूछते हैं ताकि "ना" के संकेतों का एक मोटा अंदाज़ा मिल सके। इससे डिटेक्टर को सही पड़ोस में शुरुआत करने में मदद मिलती है।
  2. "मूविंग एवरेज" स्टेबलाइज़र: जैसे-जैसे डिटेक्टर स्कैन करता है, वह थोड़ा अस्थिर (जैसे हिलता हुआ कैमरा) हो जाता है। लेखकों ने एक फीचर जोड़ा जो डेटा को स्मूथ (स्थिर) बनाता है, जिससे स्कैन स्थिर और विश्वसनीय हो जाता है।
  3. परिणाम: केवल एक "ना" दिशा खोजने के बजाय, यह विधि तेजी से एक मल्टी-डायमेंशनल स्पेस (दिशाओं का एक समूह) मैप करती है जहाँ इनकार (refusal) होता है।

उन्होंने क्या पाया (प्रयोग)

टीम ने अलग-अलग आकार के "Qwen" मॉडल्स (छोटे से लेकर बहुत बड़े तक) पर इसका परीक्षण किया।

1. आकार मायने रखता है: "एक स्विच" का मिथक

  • छोटे मॉडल्स: छोटे मॉडल्स के लिए, पुराना विचार काफी हद तक सही था। केवल एक लीवर (दिशा) खींचना ही उन्हें मना करने से रोकने के लिए पर्याप्त था।
  • बड़े मॉडल्स: बड़े, स्मार्ट मॉडल्स (जैसे 8B और 14B संस्करण) के लिए, केवल एक लीवर खींचने से लगभग कुछ नहीं हुआ। मॉडल ने "ना" कहना जारी रखा।
  • खोज: बड़े मॉडल्स को मना करने से रोकने के लिए, उन्हें एक साथ कम से कम तीन या पांच लीवर्स खींचने पड़े। "इनकार" (refusal) का व्यवहार एक जटिल, बहु-आयामी आकार (जैसे शंकु या क्लाउड) में फैला हुआ है, न कि एक एकल रेखा में।

2. क्या उन्होंने दिमाग खराब कर दिया?
एक बड़ी चिंता यह है: "यदि हम इन लीवर्स के साथ छेड़छाड़ करते हैं ताकि इनकार को रोका जा सके, तो क्या मॉडल गणित करना या कहानियाँ लिखना भूल जाएगा?"

  • परीक्षण: उन्होंने मानक ज्ञान परीक्षणों (MMLU) पर मॉडल्स की जांच की।
  • परिणाम: आश्चर्यजनक रूप से, अधिकांश मॉडल्स के लिए, रिफ्यूजल लीवर्स को हटाने से उनकी सामान्य बुद्धिमत्ता को नुकसान नहीं पहुँचा। वे अभी भी हानिरहित प्रश्नों के उत्तर ठीक से दे पा रहे थे। हालांकि, सबसे बड़े मॉडल (14B) पर, प्रदर्शन में थोड़ी गिरावट आई, जिससे पता चलता है कि सबसे बड़े मॉडल्स के लिए, रिफ्यूजल मैकेनिज्म अन्य स्मार्ट सोचने वाली प्रक्रियाओं के साथ उलझा हुआ हो सकता है।

3. गति और लागत

  • पुरानी विधि: एक शक्तिशाली लैपटॉप पर घंटों लेती थी।
  • नई विधि: एक मानक लैपटॉप पर सेकंडों में पूरी हो गई। यह नियमित शोधकर्ताओं के लिए बिना सुपरकंप्यूटर के इन सुरक्षा तंत्रों का अध्ययन करना संभव बनाता है।

"स्टीयरिंग" प्रयोग (एक चेतावनी)

लेखकों ने इसके विपरीत भी करने की कोशिश की: इनकार को बंद करने के बजाय, उन्होंने हानिरहित प्रश्नों (जैसे "मैं केक कैसे बनाऊं?") के लिए इनकार को चालू करने की कोशिश की।

  • परिणाम: यह मुख्य "ना" लीवर के लिए काम कर गया। लेकिन जब उन्होंने अन्य लीवर्स (दूसरी, तीसरी या चौथी दिशाओं) का उपयोग करने की कोशिश की, तो मॉडल बकवास या कचरा टेक्स्ट (garbage text) उगलने लगा।
  • सीख: यह सुझाव देता है कि हालांकि "ना" की अवधारणा जटिल है, हम अभी तक उस जटिलता के सभी अलग-अलग हिस्सों को पूरी तरह से नहीं समझते हैं। कुछ हिस्से "ना" कहने के लिए आवश्यक हैं, जबकि अन्य शायद केवल शोर (noise) हैं या किसी अलग प्रक्रिया का हिस्सा हैं।

सारांश

यह पेपर स्मार्ट AI मॉडल्स के भीतर जटिल "रिफ्यूजल ज़ोन" को मैप करने के लिए एक तेज़, सस्ता और प्रभावी उपकरण पेश करता है। यह साबित करता है कि बड़े मॉडल्स के लिए, "ना" कहना एक साधारण स्विच नहीं बल्कि एक जटिल, बहु-आयामी क्षेत्र है। लेखक सफलतापूर्वक इस क्षेत्र को सेकंडों में मैप करने में सफल रहे, जिससे पता चला कि व्यवहार बदलने के लिए आपको कई दिशाओं को लक्षित करने की आवश्यकता है, और ऐसा करने से मॉडल की सोचने की क्षमता को नुकसान नहीं पहुँचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →