The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
यह शोधपत्र प्रतिनिधित्व इंजीनियरिंग (representation engineering) के लिए एक ग्रेडिएंट-आधारित दृष्टिकोण प्रस्तावित करता है ताकि यह प्रदर्शित किया जा सके कि एलएलएम (LLM) का इनकार किसी एक दिशा द्वारा नियंत्रित नहीं होता है, बल्कि कई, जटिल और कार्यात्मक रूप से स्वतंत्र बहु-आयामी "कॉन्सेप्ट कोन्स" (concept cones) द्वारा नियंत्रित होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप समझने की कोशिश कर रहे हैं कि एक विशाल गगनचुंबी इमारत में एक हाई-टेक सुरक्षा प्रणाली कैसे काम करती है। अधिकांश लोग मानते हैं कि वहां केवल एक "मास्टर स्विच" (Master Switch) है जो अलार्म को चालू या बंद करता है। यदि आप वह स्विच ढूंढ लेते हैं और उसे घुमा देते हैं, तो पूरी इमारत शांत हो जाती है।
यह शोध पत्र, "The Geometry of Refusal in Large Language Models," यह तर्क देता है कि AI सुरक्षा (वह हिस्सा जो AI को यह कहने के लिए मजबूर करता है कि "मैं इस हानिकारक अनुरोध में आपकी सहायता नहीं कर सकता") एक एकल स्विच की तुलना में बहुत अधिक जटिल है। यह केवल एक लीवर नहीं है; यह जटिल डायल, स्लाइडिंग पैनल और आपस में जुड़े गियरों से भरा एक पूरा कमरा है।
यहाँ तीन सरल उपमाओं (analogies) का उपयोग करके उनकी खोज का विवरण दिया गया है:
1. "मास्टर स्विच" से "कंट्रोल रूम" तक (Concept Cones)
पुराना विचार: पिछले शोधकर्ताओं का मानना था कि AI का इनकार (refusal) एक सिंगल लाइट स्विच की तरह है। यदि आप AI के विचारों की दिशा को "इनकार" की ओर "पलट" देते हैं, तो वह 'ना' कहता है। यदि आप इसे "पलट" कर दूर ले जाते हैं, तो वह 'हाँ' कहता है।
नई खोज: लेखकों ने पाया कि इनकार एक अकेली रेखा नहीं है; यह एक "कॉन्सेप्ट कोन" (Concept Cone) है।
- उपमा: कल्पना कीजिए कि आप एक नाव चलाने की कोशिश कर रहे हैं। केवल एक "बाएं" या "दाएं" लीवर होने के बजाय, कल्पना कीजिए कि आपके पास एक जॉयस्टिक है जिसे एक विशिष्ट वेज-आकार (wedge-shaped) के क्षेत्र के भीतर कई दिशाओं में घुमाया जा सकता है। जब तक आप जॉयस्टिक को उस "कोन" के भीतर कहीं भी घुमाते हैं, नाव मुड़ जाएगी।
- अर्थ: वहां केवल एक "इनकार की दिशा" नहीं है। वहां गणितीय स्थान का एक पूरा क्षेत्र है। आप AI को हजारों थोड़े अलग तरीकों से प्रभावित कर सकते हैं, और जब तक आप उस "कोन" के भीतर रहते हैं, AI अभी भी हानिकारक कार्यों से इनकार करेगा।
2. "द घोस्ट इन द मशीन" (Representational Independence)
पुराना विचार: वैज्ञानिक पहले सोचते थे कि यदि दो गणितीय दिशाएं "लंबवत" (perpendicular) हैं (जैसे एक उत्तर-दक्षिण रेखा और एक पूर्व-पश्चिम रेखा), तो वे स्वतंत्र थीं। एक को बदलने से दूसरी प्रभावित नहीं होनी चाहिए।
नई खोज: एक AI में, भले ही दो दिशाएं कागज पर लंबवत दिखें, वे अक्सर आपस में "उलझी" हुई होती हैं।
- उपमा: कल्पना कीजिए कि दो नर्तक मंच पर प्रदर्शन कर रहे हैं। भले ही वे कमरे के अलग-अलग कोनों में नाच रहे हों (लंबवत), यदि एक नर्तक ज़ोर से पैर पटकता है, तो फर्श थरथराता है, और दूसरा नर्तक अपना संतुलन खो देता है। वे "गणितीय रूप से" अलग जगहों पर हैं, लेकिन "मैकेनिस्टिक रूप से" वे एक-दूसरे को प्रभावित कर रहे हैं।
- अर्थ: शोधकर्ताओं ने "वास्तव में स्वतंत्र" दिशाएं खोजने का एक नया, अधिक सख्त तरीका बनाया—ऐसी दिशाएं जिन्हें बदलने पर अन्य हिस्सों में कोई "कंपन" (vibration) पैदा न हो जो AI के अन्य हिस्सों को प्रभावित करे। उन्होंने पाया कि इनकार को चलाने वाले कई, पूरी तरह से अलग "गियर्स" हैं। एक गियर शायद "बम बनाने में मदद न करें" को संभालता है, जबकि दूसरा "घृणास्पद भाषण (hate speech) में मदद न करें" को संभालता है, और वे स्वतंत्र रूप से कार्य करते हैं।
3. "प्रिसिजन सर्जन" (Gradient-Based Engineering)
समस्या: AI का अध्ययन करने के अधिकांश तरीके एक घड़ी को ठीक करने के लिए हथौड़े का उपयोग करने जैसे हैं। यदि आप इनकार तंत्र को "बंद" करने की कोशिश करते हैं, तो आप अक्सर अनजाने में AI की गणित करने या अंग्रेजी बोलने की क्षमता को भी तोड़ देते हैं (इसे "ओवर-रिफ्यूज़ल" कहा जाता है)।
नई खोज: लेखकों ने RDO (Refusal Direction Optimization) नामक एक नया उपकरण विकसित किया है।
- उपमा: हथौड़े का उपयोग करने के बजाय, उन्होंने एक लेजर-गाइडेड स्कैल्पल (सर्जिकल चाकू) विकसित किया है।
- अर्थ: उनका तरीका उन्हें उस सटीक "तंत्रिका" (nerve) को खोजने की अनुमति देता है जो इनकार को नियंत्रित करती है। वे उस तंत्रिका को "सुन्न" (numb) कर सकते हैं (यह परीक्षण करने के लिए कि क्या वे सुरक्षा को बायपास कर सकते हैं) बिना अनजाने में AI की बाकी बुद्धिमत्ता को "पक्षाघात" (paralyze) दिए। यह बहुत अधिक सटीक है, जो इसे हैकर्स (कमजोरियों को खोजने के लिए) और रक्षकों (मजबूत ढाल बनाने के लिए) दोनों के लिए एक बेहतर उपकरण बनाता है।
यह क्यों मायने रखता है?
यदि आप एक शहर की रक्षा करना चाहते हैं, तो आपको यह जानने की आवश्यकता है कि क्या वह एक एकल गेट द्वारा सुरक्षित है या सेंसरों के एक जटिल जाल द्वारा। यह शोध पत्र सिद्ध करता है कि AI सुरक्षा एक जटिल जाल (complex web) है। यह समझकर कि AI के "ना" कहने की "ज्यामिति" (आकार और संरचना) कैसी है, हम बहुत स्मार्ट, अधिक मजबूत "डिजिटल गार्ड्स" बना सकते हैं जो धोखा देने में कठिन हों और अनजाने में AI की मददगारता को भी खराब न करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।