HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails
HoloAegis एक न्यूनतम पैरामीट्रिक, प्रशिक्षण-मुक्त सुरक्षा ढांचा है जो फ्रोजन सिमेंटिक रिप्रेजेंटेशन को विशुद्ध रूप से ज्यामितीय टोपोलॉजिकल इन्फरेंस से अलग करके अत्याधुनिक ज़ीरो-शॉट LLM गार्डरेल्स प्राप्त करता है, जिससे फाइन-ट्यूनिंग की आवश्यकता समाप्त हो जाती है और सब-मिलीसेकंड लेटेंसी एवं सुदृढ़ क्रॉस-लिंगुअल ट्रांसफर सुनिश्चित होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को विनम्र और सुरक्षित होना सिखाने की कोशिश कर रहे हैं। यह रोबोट, जिसे लार्ज लैंग्वेज मॉडल (LLM) के रूप में जाना जाता है, एक विशाल पुस्तकालय की तरह है जिसने कभी लिखा गया लगभग सब कुछ पढ़ लिया है। यह कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है, और इंसानों की तरह बातचीत कर सकता है। लेकिन क्योंकि इसने बहुत कुछ पढ़ा है, इसलिए यह कभी-कभी अनजाने में बुरी बातें कह सकता है, झूठ बोल सकता है, या बुरी चीज़ें करने के लिए बहकाया जा सकता है। इसे रोकने के लिए, हमें एक "गार्डरेल" (guardrail)—एक सुरक्षा गार्ड की आवश्यकता है जो रोबोट द्वारा संदेश भेजने से पहले हर संदेश की जाँच करे।
अभी, इन गार्ड्स को बनाने के दो मुख्य तरीके हैं। पहला तरीका एक दूसरे, समान रूप से विशाल रोबोट को जज के रूप में काम पर रखना है। यह जज संदेश को पढ़ता है और तय करता है कि क्या वह सुरक्षित है। यह बहुत सटीक है, लेकिन यह धीमा, महंगा है, और इसे चलाने के लिए विशाल, शक्तिशाली कंप्यूटरों की आवश्यकता होती है। दूसरा तरीका एक छोटी, सरल चेकलिस्ट का उपयोग करना है। यह बहुत तेज़ और सस्ता है, लेकिन यह अक्सर भ्रमित हो जाता है, गलती से अच्छे संदेशों को ब्लॉक कर देता है या बुरे संदेशों को छोड़ देता है। वैज्ञानिक बीच में फंस गए थे: या तो आपके पास एक धीमा, भारी गार्ड है या एक तेज़, अनाड़ी गार्ड। बड़ा सवाल यह है: क्या हम एक ऐसा गार्ड बना सकते हैं जो बिना दूसरे विशाल रोबोट की आवश्यकता के, बिजली की तरह तेज़ और अविश्वसनीय रूप से स्मार्ट हो?
यहीं पर एक नया विचार जिसे HoloAegis कहा जाता है, सामने आता है। इसके पीछे के शोधकर्ताओं ने, जिनका नेतृत्व टैक हो एलेक्स ली और माइकल के. एनजी कर रहे हैं, एक चतुर मोड़ प्रस्तावित किया है। यह सीखने के लिए कि "बुरा" क्या दिखता है (क्योंकि इससे मूल रोबोट के मस्तिष्क को नुकसान पहुँच सकता है), एक नया रोबोट प्रशिक्षित करने के बजाय, उन्होंने शुद्ध ज्यामिति (geometry) का उपयोग करने का निर्णय लिया। इसे इस तरह सोचें: कल्पना करें कि सभी संभावित वाक्य एक विशाल, अदृश्य 3D स्थान में तैरते हुए बिंदु हैं। सुरक्षित वाक्य एक ही पड़ोस में एक साथ रहते हैं, और खतरनाक वाक्य दूसरे पड़ोस में।
HoloAegis टीम ने महसूस किया कि यदि आप रोबोट के मस्तिष्क को फ्रीज (freeze) कर देते हैं (ताकि वह बदले नहीं) और केवल बिंदुओं के बीच की दूरी मापने के लिए एक साधारण रूलर का उपयोग करते हैं, तो आप तुरंत सुरक्षा संबंधी निर्णय ले सकते हैं। उन्होंने "एंकर्स" (anchors) नामक कुछ प्रमुख लैंडमार्क्स का उपयोग करके सुरक्षित और असुरक्षित स्थानों का एक "मानचित्र" बनाया। जब कोई नया संदेश आता है, तो सिस्टम एक विशाल रोबोट से उसके बारे में सोचने के लिए नहीं पूछता; यह बस जाँचता है कि संदेश "असुरक्षित" लैंडमार्क्स के कितने करीब है बनाम "सुरक्षित" लैंडमार्क्स के। यदि यह बुरे पड़ोस के बहुत करीब है, तो गार्ड उसे रोक देता है।
शोध पत्र सुझाव देता है कि यह तरीका आश्चर्यजनक रूप से शक्तिशाली है। सुरक्षा को एक जटिल सीखने की समस्या के बजाय एक गोले (sphere) पर दूरियों को मापने की गणितीय समस्या के रूप में मानकर, उन्होंने ऐसे परिणाम प्राप्त किए जो विशाल, धीमे रोबलों से मेल खाते हैं, लेकिन वे एक मिलीसेकंड से भी कम समय में चलते हैं। परीक्षणों में, उनके सिस्टम ने लगभग पूर्ण सटीकता के साथ (कुछ परीक्षणों में 1.0000 और अन्य में 0.9802 स्कोर करते हुए) खतरनाक संदेशों को पकड़ा, जबकि उन्होंने लगभग न के बराबर कंप्यूटर मेमोरी का उपयोग किया—3.5 MB से भी कम। यह एक सुरक्षा गार्ड होने जैसा है जो भीड़ में चोर को तुरंत पहचान सकता है, बिना पूरी पुलिस फोर्स को काम पर रखे।
हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह कोई जादुई छड़ी नहीं है जो हमेशा सब कुछ हल कर देगी। उन्होंने पाया कि हालांकि यह ज्यामितीय दृष्टिकोण चालाकी भरी चालों (जैसे कि बुरे शब्दों को छिपाने के लिए अपनी स्पेलिंग बदलना) के खिलाफ बहुत स्थिर है, फिर भी यह प्रारंभिक मानचित्र की गुणवत्ता पर निर्भर करता है। यदि मानचित्र गलत है, तो गार्ड भी गलत होगा। वे यह भी स्वीकार करते हैं कि यदि कोई व्यक्ति उनके "लैंडमार्क्स" का पता लगाकर सिस्टम पर हमला करने की कोशिश करता है, तो सिस्टम असुरक्षित हो सकता है। लेकिन फिलहाल के लिए, HoloAegis सुझाव देता है कि हमें अपने AI को सुरक्षित रखने के लिए विशाल, ऊर्जा-खपत करने वाले मॉडलों को प्रशिक्षित करने की आवश्यकता नहीं हो सकती है; कभी-कभी, थोड़ी सी स्मार्ट ज्यामिति ही काफी होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।