The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams
LatentBiopsy एक प्रशिक्षण-मुक्त विसंगति पहचान (anomaly detection) विधि है जो LLM रेसिडुअल स्ट्रीम्स में एक मानक संदर्भ दिशा से उनके कोणीय विचलन को मापकर हानिकारक प्रॉम्प्ट्स की पहचान करती है, और यह विभिन्न मॉडल वेरिएंट्स—जिनमें वे भी शामिल हैं जिनसे रिफ्यूज़ल मैकेनिज्म को सर्जिकल रूप से हटाया गया है—के बीच हानिकारक इरादे और संरेखण व्यवहारों के बीच ज्यामितीय पृथक्करण का लाभ उठाते हुए उच्च सटीकता प्राप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान पुस्तकालय (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, प्रश्नों के उत्तर दे सकता है और समस्याओं को हल कर सकता है। लेकिन कभी-कभी, लोग इस पुस्तकालय को खतरनाक या हानिकारक चीजें लिखने के लिए बहकाने की कोशिश करते हैं। आमतौर पर, पुस्तकालय को "नहीं, मैं यह नहीं करूँगा" कहने के लिए प्रशिक्षित किया जाता है, और वह अनुरोध को अस्वीकार कर देता है।
यह शोध पत्र एक नए सुरक्षा गार्ड से परिचय कराता है जिसका नाम है LatentBiopsy। यहाँ बताया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करके।
1. समस्या: "अस्वीकृति" (Refusal) की चाल
अधिकांश सुरक्षा प्रणालियाँ एक क्लब के बाउंसर की तरह काम करती हैं। वे प्रवेश के लिए पूछने वाले व्यक्ति (प्रॉम्प्ट) को देखते हैं और "बुरे लोगों" की एक सूची की जाँच करते हैं। यदि वे किसी बुरे व्यक्ति को देखते हैं, तो वे कहते हैं "नहीं।"
लेकिन क्या होगा अगर बुरा आदमी अपने कपड़े बदल ले, या क्या होगा अगर बाउंसर को नौकरी से निकाल दिया जाए? एआई (AI) की दुनिया में, शोधकर्ताओं ने एआई के उस हिस्से को "सर्जिकल तरीके से हटाने" (जिसे refusal ablation कहा जाता है) का एक तरीका खोजा है जो "नहीं" कहता है। अब, एआई एक ऐसे रोबोट की तरह है जो "नहीं" नहीं कह सकता; यदि पूछा जाए, तो वह खुशी-खुशी हानिकारक सामग्री उत्पन्न करेगा।
बड़ा सवाल यह था: यदि एआई "नहीं" नहीं कह सकता, तो क्या हम अभी भी यह बता सकते हैं कि वह कुछ बुरा करने वाला है?
2. समाधान: "बॉडी लैंग्वेज" डिटेक्टर
LatentBiopsy उन शब्दों को नहीं देखता जिन्हें एआई कहने के बारे में सोच रहा है। इसके बजाय, यह एआई की आंतरिक बॉडी लैंग्वेज (शारीरिक भाषा) को देखता है।
एआई के मस्तिष्क को अदृश्य धागों (जिन्हें residual streams कहा जाता है) से भरे एक विशाल कमरे के रूप में सोचें। हर बार जब एआई किसी चीज़ के बारे में सोचता है, तो वह इन धागों को एक विशिष्ट दिशा में खींचता है।
- सुरक्षित विचार धागों को एक आरामदायक, सहज पैटर्न में खींचते हैं (जैसे हाथ पकड़कर घेरे में खड़ा होना)।
- हानिकारक विचार धागों को एक बहुत ही विशिष्ट, तंग और असामान्य दिशा में खींचते हैं।
LatentBiopsy एक कैमरा है जो एआई द्वारा एक भी शब्द लिखे जाने से पहले इन धागों की एक तस्वीर लेता है। इसे यह जानने की आवश्यकता नहीं है कि "बुरा" कैसा दिखता है। इसे बस इतना जानने की आवश्यकता है कि "सामान्य" कैसा दिखता है।
3. यह कैसे काम करता है: "सुरक्षित घेरा" (Safe Circle)
यहाँ चरण-दर-चरण जादू दिया गया है:
- प्रशिक्षण (The "Safe Circle"): शोधकर्ता एआई को 200 पूरी तरह से सामान्य, उबाऊ प्रश्न दिखाते हैं (जैसे "मौसम कैसा है?" या "बिल्ली के बारे में एक कविता लिखें")। वे मापते हैं कि इन प्रश्नों के लिए एआई के आंतरिक धागे कैसे चलते हैं। वे इन गतिविधियों के आधार पर एक विशाल, अदृश्य "सुरक्षित घेरा" बनाते हैं।
- परीक्षण (The "Angle"): जब कोई नया प्रॉम्प्ट आता है, तो सिस्टम उस सुरक्षित घेरे की तुलना में एआई के आंतरिक धागों के कोण (angle) को मापता है।
- यदि कोण घेरे के करीब है, तो यह सुरक्षित है।
- यदि कोण घेरे से बहुत अलग है (भले ही वह घेरे के दूसरी ओर हो), तो इसे खतरनाक के रूप में चिह्नित किया जाता है।
- स्कोर: यह एक "खतरा स्कोर" देता है कि वह कोण कितना अजीब है। इसे सिखाने के लिए किसी हानिकारक उदाहरण की आवश्यकता नहीं थी; इसने बस यह सीख लिया कि "सामान्य" महसूस करना कैसा होता है।
4. सबसे बड़ा आश्चर्य: "घोस्ट सिग्नल" (The "Ghost Signal")
यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है।
शोधकर्ताओं ने एआई मॉडल्स के दो अलग-अलग परिवारों (Qwen) को लिया। उन्होंने "अस्वीकृति" की क्षमता (वह हिस्सा जो "नहीं" कहता है) को लिया और उसे सर्जिकल तरीके से हटा दिया। एआई एक "ज़ोंबी" बन गया जो किसी भी चीज़ को मना नहीं कर सकता था।
परिणाम: भले ही एआई "नहीं" नहीं कह सकता था, लेकिन LatentBiخص कैमरा खतरे को देख सका।
- उपमा: कल्पना कीजिए कि एक व्यक्ति है जिसकी आवाज की नली निकाल दी गई है और वह अब "रुको!" या "बचाओ!" नहीं बोल सकता। भले ही वह चुप है, लेकिन उसकी बॉडी लैंग्वेज (पसीना आना, कांपना, डरा हुआ दिखना) अभी भी स्पष्ट रूप से दिखाती है कि वह खतरे में है।
- निष्कर्ष: हानिकारक इरादे की "ज्यामिति" (geometry) (जिस तरह से धागों को खींचा जाता है) "नहीं" कहने वाले तंत्र से अलग है। आप "नहीं" बटन को हटा सकते हैं, लेकिन "खतरे का संकेत" (Danger Signal) एक बाहरी पर्यवेक्षक के लिए दृश्यमान रहता है।
5. "विपरीत रिंग्स" का रहस्य
शोधकर्ताओं ने परीक्षण किए गए दो अलग-अलग एआई परिवारों के बारे में एक अजीब और मजेदार बात पाई:
- परिवार A में, खतरनाक विचारों ने धागों को बाहर की ओर (केंद्र से दूर) खींचा।
- परिवार B में, खतरनाक विचारों ने धागों को अंदर की ओर (केंद्र की ओर) खींचा।
यह दो अलग-अलग डांस हॉल की तरह है जहाँ "बुरे डांसर" विपरीत दिशाओं में घूमते हैं। अधिकांश सुरक्षा प्रणालियाँ टूट जाएँगी क्योंकि वे मानती हैं कि बुरे डांसर हमेशा एक ही दिशा में घूमते हैं। लेकिन LatentBiopsy स्मार्ट है क्योंकि यह कहता है, "मुझे परवाह नहीं कि आप किस दिशा में घूम रहे हैं; यदि आप सुरक्षित डांसरों से अलग घूम रहे हैं, तो आपको चिह्नित किया जाएगा।"
यह क्यों मायने रखता है?
- यह तेज़ है: यह जाँच करने में एक मिलीसेकंड से भी कम समय लगता है। यह एक मेटल डिटेक्टर की तरह है जो आपको धीमा किए बिना तुरंत बीप करता है।
- इसे धोखा देना कठिन है: क्योंकि यह शब्दों के बजाय आंतरिक "बॉडी लैंग्वेज" को देखता है, इसलिए हैकर्स के लिए इसे बेवकूफ बनाना बहुत कठिन है।
- यह "टूटे हुए" एआई पर काम करता है: यदि कोई एआई के सुरक्षा फिल्टर को हटाने के लिए इसे हैक करने की कोशिश करता है, तो भी यह उपकरण पता लगा सकता है कि एआई कुछ हानिकारक करने वाला है।
संक्षेप में: आपको अपराधी को पहचानने के लिए यह जानने की ज़रूरत नहीं है कि वह कैसा दिखता है। आपको बस यह जानने की ज़रूरत है कि एक सामान्य, कानून का पालन करने वाला नागरिक कैसा दिखता है। यदि किसी की "आंतरिक मुद्रा" (internal posture) भीड़ से अजीब तरह से अलग है, तो आप जानते हैं कि कुछ गड़बड़ है—भले ही वे विनम्र होने का ढोंग कर रहे हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।