← नवीनतम पेपर
🤖 machine learning

Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams

यह शोध पत्र यह प्रदर्शित करता है कि हानिकारक इरादा (harmful intent) बड़े भाषा मॉडलों (large language models) में एक ज्यामितीय रूप से पुनः प्राप्त करने योग्य (geometrically recoverable) और रैखिक रूप से डिकोडेबल (linearly decodable) विशेषता है जो विविध आर्किटेक्चर और एलाइनमेंट अवस्थाओं, जिसमें एब्लीटरेटेड मॉडल (abliterated models) भी शामिल हैं, में मौजूद है, जिसे विशिष्ट प्रोबिंग रणनीतियों का उपयोग करके उच्च सटीकता के साथ पहचाना जा सकता है, जबकि यह भी प्रकट करता है कि AUROC जैसे डिटेक्शन मेट्रिक्स परिचालन सुरक्षा (operational safety) को बढ़ा-चढ़ाकर दिखा सकते हैं।

मूल लेखक: Isaac Llorente-Saguer

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Isaac Llorente-Saguer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, उच्च-गति वाली फैक्ट्री असेंबली लाइन के रूप में करें। टेक्स्ट एक छोर से अंदर जाता है, दर्जनों कमरों (लेयर्स) के माध्यम से प्रोसेस होता है, और दूसरे छोर से एक जवाब बनकर बाहर आता है।

लंबे समय तक, हमें लगा कि यह फैक्ट्री एक "ब्लैक बॉक्स" है। हम इनपुट और आउटपुट को देख सकते थे, लेकिन हमें पता नहीं था कि कमरों के अंदर क्या हो रहा है। यह पेपर उस पर्दे को हटाता है और एक आश्चर्यजनक रहस्य उजागर करता है: फैक्ट्री के वायरिंग में ही एक बहुत ही विशिष्ट, छिपा हुआ "खतरे का सेंसर" (danger sensor) बना हुआ है।

यहाँ उस खोज की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. "डेंजर रडार" एक सीधी रेखा है

शोधकर्ताओं ने पाया कि जब मॉडल एक हानिकारक अनुरोध (जैसे, "मैं बम कैसे बनाऊं?") पढ़ता है, तो वह केवल भ्रमित नहीं होता। इसके बजाय, मॉडल के भीतर के विद्युत संकेत (electrical signals) एक बहुत ही विशिष्ट, अनुमानित दिशा में शिफ्ट होते हैं।

मॉडल के आंतरिक विचारों को एक विशाल 3D मानचित्र के रूप में सोचें।

  • सुरक्षित अनुरोध (जैसे, "मैं केक कैसे बनाऊं?") एक क्षेत्र में क्लस्टर होते हैं।
  • हानिकारक अनुरोध दूसरे क्षेत्र में क्लस्टर होते हैं।
  • शोधकर्ताओं ने पाया कि आप इन दोनों समूहों के बीच एक सीधी रेखा खींच सकते हैं। यदि आप किसी भी नए अनुरोध को इस रेखा पर प्रोजेक्ट करते हैं, तो आप तुरंत बता सकते हैं कि वह खतरनाक है, इससे पहले कि मॉडल अपना उत्तर लिखना समाप्त करे।

यह हवाई अड्डे पर मेटल डिटेक्टर होने जैसा है। आपको यह जानने की ज़रूरत नहीं है कि हथियार क्या है; आपको बस यह जानने की ज़रूरत है कि सिग्नल "मेटल" की दिशा में बढ़ रहा है।

2. सेंसर तब भी काम करता है जब "इनकार" (Refusal) बटन टूट जाता है

यह इस पेपर का सबसे चौंकाने वाला हिस्सा है।

आमतौर पर, जब हम मॉडल से कुछ बुरा करने के लिए कहते हैं, तो वह कहता है, "मैं यह नहीं कर सकता।" हमने सोचा कि मॉडल को यह इसलिए पता चलता है क्योंकि उसे इनकार करने के लिए प्रशिक्षित किया गया है।

शोधकर्ताओं ने मॉडल के "इनकार" तंत्र को निकाल दिया (उन्होंने उस हिस्से को सर्जरी से हटा दिया जो "नहीं" कहता है)। उन्हें उम्मीद थी कि "खतरे का सेंसर" टूट जाएगा। ऐसा नहीं हुआ।

  • उपमा (Analogy): कल्पना कीजिए कि एक सुरक्षा गार्ड है जिसे बंदूक लेकर आने वाले लोगों को रोकने के लिए प्रशिक्षित किया गया है। आप गार्ड को हटा देते हैं। आप उम्मीद करते हैं कि इमारत असुरक्षित हो जाएगी। लेकिन शोधकर्ताओं ने पाया कि दरवाजे पर लगा मेटल डिटेक्टर अभी भी पूरी तरह से काम कर रहा है। गार्ड (इनकार) और डिटेक्टर (हानि की पहचान) दो अलग चीजें हैं। मॉडल अभी भी जानता है कि अनुरोध खतरनाक है; बस अब उसके पास "ना" कहने का प्रशिक्षण नहीं बचा है।

3. "लो-फॉल्स-अलार्म" (कम गलत अलार्म) की समस्या

यह पेपर सुरक्षा परीक्षणों में होने वाली एक आम गलती की ओर भी इशारा करता है। कई शोधकर्ता AUROC नामक स्कोर देखते हैं (जो एक सामान्य "सटीकता" ग्रेड की तरह है)। 98% का स्कोर बहुत शानदार लगता है।

लेकिन शोधकर्ता कहते हैं: "एक मिनट रुकिए।"

  • उपमा: कल्पना कीजिए कि एक स्मोक डिटेक्टर है जो ब्रेड टोस्ट करते समय भी बज उठता है। वह आग होने पर 99% बार धुआं पहचान लेता है (शानदार सटीकता!), लेकिन वह बिना किसी आग के भी 50% बार बज जाता है। वास्तविक जीवन में यह बेकार है क्योंकि आप इसे अनदेखा कर देंगे।

पेपर दिखाता है कि जबकि "डेंजर सेंसर" हानिकारक अनुरोधों को रैंक करने में 98% सटीक है, फिर भी यह कभी-कभी सुरक्षित अनुरोधों पर बहुत अधिक अलार्म बजा देता है। वे तर्क देते हैं कि हमें यह मापने की आवश्यकता है कि यह तब कैसा काम करता है जब हम शून्य गलत अलार्म (जैसे कि एक वास्तविक सुरक्षा प्रणाली) की मांग करते हैं। जब उन्होंने इसका परीक्षण किया, तो सेंसर अभी भी बहुत अच्छा था, लेकिन पूरी तरह से परफेक्ट नहीं था।

4. "छिपे हुए कमरे" की खोज

कुछ मॉडलों में, "डेंजर सेंसर" प्रोसेसिंग लाइन की शुरुआत और अंत में बहुत अच्छा काम करता है, लेकिन बीच में धुंधला हो जाता है।

  • उपमा: कल्पना कीजिए कि एक जासूस अपराध को सुलझाने की कोशिश कर रहा है। शुरुआत में, उसके पास एक स्पष्ट संदिग्ध होता है। जांच के बीच में, सुराग आपस में मिल जाते हैं और भ्रमित करने वाले हो जाते हैं। फिर, अंत में, संदिग्ध फिर से स्पष्ट हो जाता है।

शोधकर्ताओं ने एक दूसरे प्रकार के सेंसर का पता लगाया जो एक सीधी रेखा के बजाय एक कंपास की तरह काम करता है। जबकि पहला सेंसर (सीधी रेखा) "धुंधले मध्य" में खो जाता है, यह कंपास-आधारित सेंसर अभी भी खतरे को ढूंढ सकता है। यह एक बैकअप जीपीएस होने जैसा है जो मुख्य सिग्नल ब्लॉक होने पर भी काम करता है।

5. बड़े मॉडल = मजबूत सेंसर

उन्होंने विभिन्न आकारों के मॉडलों (छोटे से लेकर बहुत बड़े तक) का परीक्षण किया। उन्होंने पाया कि जैसे-जैसे मॉडल बड़े होते जाते हैं, यह "डेंजर सेंसर" कमजोर या भ्रमित नहीं होता है। वास्तव में, यह अधिक स्थिर और विश्वसनीय हो जाता है।

  • उपमा: यह एक मांसपेशी की तरह है। आप जितना अधिक इसका उपयोग करते हैं (या मॉडल जितना बड़ा होता है), खतरे को पहचानने की क्षमता उतनी ही मजबूत और सुसंगत होती जाती है।

मुख्य निष्कर्ष (The Big Takeaway)

यह पेपर हमें तीन मुख्य बातें बताता है:

  1. हानि दृश्यमान है: मॉडल हानिकारक इरादे को अपने मस्तिष्क में एक स्पष्ट, ज्यामितीय आकार के रूप में "देखते" हैं, ठीक वैसे ही जैसे वे "बिल्ली" और "कुत्ते" के बीच अंतर देखते हैं।
  2. इनकार वैकल्पिक है: आप मॉडल की "ना" कहने की क्षमता को तोड़ सकते हैं, लेकिन आप इसकी यह जानने की क्षमता को आसानी से नहीं तोड़ सकते कि कुछ बुरा है। यह ज्ञान भाषा की समझ में ही रचा-बसा है।
  3. हमें बेहतर परीक्षणों की आवश्यकता है: सिर्फ इसलिए कि एक सुरक्षा उपकरण कागज पर 98% सटीक दिखता है, इसका मतलब यह नहीं है कि वह वास्तविक दुनिया के लिए सुरक्षित है। हमें इसे उन सख्त स्थितियों के तहत परीक्षण करने की आवश्यकता है जहाँ गलत अलार्म की अनुमति नहीं है।

संक्षेप में: मॉडल का "विवेक" (हानि को पहचानना) भाषा समझने के तरीके का एक मौलिक हिस्सा है, और इसे हटाना हमारी सोच से कहीं अधिक कठिन है। हमें बस उस सिग्नल को पढ़ने के लिए बेहतर उपकरण बनाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →