← नवीनतम पेपर
💻 computer science

Detecting Safety Training Modification in Language Models via Activation Analysis

यह शोध पत्र AMS को प्रस्तुत करता है, जो एक एक्टिवेशन-आधारित टूल है जो एक्टिवेशन स्पेस में सुरक्षा अवधारणाओं की ज्यामितीय संरचना का विश्लेषण करके लैंग्वेज मॉडल सुरक्षा प्रशिक्षण में संशोधनों का पता लगाता है, जो विविध आर्किटेक्चर में चार विशिष्ट संशोधन प्रकारों को सफलतापूर्वक वर्गीकृत करता है और एक्टिवेशन हस्ताक्षरों एवं व्यवहार संबंधी अनुपालन के बीच एक सहसंबंध को प्रकट करता है।

मूल लेखक: Glen Messenger

प्रकाशित 2026-08-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Glen Messenger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल पुस्तकालय है जहाँ कोई भी किताबें उधार ले सकता है, लेकिन उनमें से कुछ किताबें वास्तव में बम बनाने या लोगों को ठगने के खतरनाक निर्देश हो सकती हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन "किताबों" को भाषा मॉडल (language models) कहा जाता है। हाल ही में, लोगों के एक समूह ने इन मददगार AI किताबों को लेना और गुप्त रूप से उन्हें संपादित करना शुरू कर दिया है ताकि सुरक्षा नियमों को हटाया जा सके, जिससे उन्हें "अनसेंसर्ड" (uncensored) संस्करणों में बदल दिया जाए जो किसी भी सवाल का जवाब दे सकें, चाहे वह कितना भी हानिकारक क्यों न हो। यह कुछ हद तक वैसा ही है जैसे एक लाइब्रेरियन एक मानक विश्वकोश को बदलकर उसका एक ऐसा संस्करण रख दे जहाँ "कैसे चोरी न करें" वाले पन्ने फाड़ दिए गए हों।

यह समझने के लिए कि हम इन तोड़-फोड़ करने वालों को कैसे पकड़ सकते हैं, हमें यह जानना होगा कि एक AI कैसे "सोचता" है। जब एक AI एक वाक्य पढ़ता है, तो वह केवल शब्दों को संग्रहीत नहीं करता है; वह उन्हें संख्याओं के एक जटिल मानचित्र में बदल देता है जिसे 'एक्टिवेशन्स' (activations) कहा जाता है। इस मानचित्र को एक विशाल, बहु-आयामी खेल का मैदान समझें। एक सुव्यवस्थित, सुरक्षित AI में, "अच्छे विचारों" और "बुरे विचारों" के बीच एक स्पष्ट, चौड़ा रास्ता होता है। यह एक मज़बूत बाड़ होने जैसा है जो बच्चों को फुटबॉल खेलने से दूर रखता है ताकि वे आग के साथ न खेलें। जब कोई AI को "अनसेंसर्ड" करने की कोशिश करता है, तो वे उस बाड़ को गिराने या बच्चों को इस तरह से इधर-उधर करने की कोशिश करते हैं जिससे आग और फुटबॉल का खेल आपस में मिल जाए। बड़ा सवाल यह है: क्या हम खेल के मैदान के लेआउट को देखकर यह बता सकते हैं कि क्या बाड़ के साथ छेड़छाड़ की गई है, बिना AI से वास्तव में आग लगाने की कोशिश करने के लिए कहे?

यह ठीक वही काम है जो ग्लेन मेसेंगर का शोध पत्र, "डिटेक्टिंग सेफ्टी ट्रेनिंग मॉडिफिकेशन इन लैंग्वेज मॉडल्स वाया एक्टिवेशन एनालिसिस," करने का प्रयास करता है। लेखक एक नया उपकरण पेश करते हैं जिसे AMS (एक्टिवेशन-बेस्ड मॉडल स्कैनर) कहा जाता है। AI से "पूछो और उत्तर प्राप्त करो" का खेल खेलने के बजाय (जो धीमा है और जिसे धोखा दिया जा सकता है), AMS एक स्ट्रक्चरल इंजीनियर की तरह कार्य करता है। यह AI के खेल के मैदान में प्रवेश करता है और स्थान की ज्यामिति (geometry) को मापता है। यह जाँचता है कि "अच्छे" और "बुरे" क्षेत्रों के बीच की दूरी अभी भी चौड़ी और मज़बूत है या नहीं।

अध्ययन ने 14 अलग-अलग AI मॉडलों पर इस उपकरण का परीक्षण किया, जो छोटे से लेकर बड़े तक थे, और पाया कि AMS यह पहचानने में काफी अच्छा है कि कब सुरक्षा की बाड़ पूरी तरह से गिरा दी गई है। जब शोधकर्ताओं ने उन मॉडलों को देखा जहाँ सुरक्षा प्रशिक्षण को पूरी तरह से हटा दिया गया था (जैसे बेस मॉडल या "डॉल्फिन" वेरिएंट), तो "बाड़" ढह गई, और अच्छे और बुरे विचारों के बीच की दूरी लगभग शून्य हो गई। AMS ने इन्हें उच्च सटीकता के साथ "क्रिटिकल" (CRITICAL) के रूप में चिह्नित किया।

हालाँकि, यह शोध पत्र बताता है कि कहानी केवल "बाड़ गायब है" या "बाड़ मौजूद है" जैसी सरल बात से कहीं अधिक जटिल है। शोधकर्ताओं ने सुरक्षा को संशोधित करने के चार अलग-अलग तरीके खोजे, और AMS उन्हें अलग-अलग तरह से संभालता है:

  1. पूर्ण पतन (The Total Collapse): कुछ मॉडलों में उनकी सुरक्षा ट्रेनिंग पूरी तरह से छीन ली जाती है। खेल के मैदान की बाड़ गायब हो जाती है। AMS इसे आसानी से पकड़ लेता है।
  2. टूटी हुई बाड़ (The Broken Fence): कुछ मॉडलों में उनके सुरक्षा नियमों को "ऑर्थोगोनलाइज्ड" (orthogonalized) किया जाता है, जो एक फैंसी तरीका है यह कहने का कि बाड़ को घुमाया या मरोड़ा गया है ताकि वह अब बुरे कामों को रोक न सके, भले ही रेखाएं अभी भी वहीं हों। AMS इसे भी पकड़ लेता है, खासकर जब यह यह देखने के लिए दूसरे चेक का उपयोग करता है कि क्या बाड़ सही दिशा में है।
  3. घूमी हुई बाड़ (The Rotated Fence): यहाँ एक पेचीदा मामला है। कुछ मॉडलों (जैसे गेम्मा का एक विशिष्ट संस्करण) में उनकी सुरक्षा बाड़ को इतना घुमाया गया है कि वह बुरे कामों को अंदर आने देती है, भले ही बाड़ खुद अभी भी सीधी और मज़बूत खड़ी हो। AMS का पहला चेक कहता है, "अरे, बाड़ अभी भी वहीं है! यह सुरक्षित है!" लेकिन दूसरा चेक, जो बाड़ की दिशा को देखता है, यह महसूस करता है कि वह गलत दिशा में है और उसे चिह्नित कर देता है।
  4. अदृश्य चाल (The Invisible Trick): शोध पत्र एक चौथे प्रकार के संशोधन की पहचान करता है जिसे AMS नहीं पकड़ सकता। इस मामले में, खेल के मैदान की बाड़ अभी भी खड़ी है, और वह सही दिशा में भी है, लेकिन AI को गुप्त रूप से बाड़ को अनदेखा करने के लिए प्रशिक्षित किया गया है। यह एक गार्ड की तरह है जो गेट पर बिल्कुल स्थिर खड़ा रहता है लेकिन चुपके से सबको अंदर जाने देता है। शोध पत्र इसे "बिहेवोरल फाइन-ट्यूनिंग" (behavioral fine-tuning) कहता है, और यह स्वीकार करता है कि AMS इसे पकड़ने में विफल रहता है क्योंकि खेल के मैदान की "ज्यामिति" एकदम सही दिखती है, भले ही AI खतरनाक हो।

शोधकर्ता अपने परिणामों को लेकर बहुत सावधान थे। उन्होंने पाया कि "बाड़ की मजबूती" और AI वास्तव में कितना खतरनाक व्यवहार करता है, उनके बीच का संबंध वास्तविक तो है लेकिन इसमें शोर (noise) है। यह एक पवन चक्की (weather vane) की तरह है: यदि चक्की टूटी हुई है, तो आप जानते हैं कि तूफान आने वाला है, लेकिन यदि चक्की घूम रही है, तो भी आपको बाहर देखने की ज़रूरत है ताकि सुनिश्चित हो सके। अपने परीक्षणों में, उपकरण ने नए मॉडलों पर परीक्षण किए जाने पर लगभग 71% बार सुरक्षा स्थिति को सही ढंग से पहचाना।

शोध पत्र निष्कर्ष निकालता है कि हालांकि AMS एक पहले चेक के लिए एक तेज़ और शक्तिशाली उपकरण है—जिसमें मॉडल को स्कैन करने में केवल 10 से 40 सेकंड लगते हैं—लेकिन इसे गेट पर एकमात्र गार्ड नहीं होना चाहिए। "अदृश्य चाल" (चौथे प्रकार के संशोधन) के कारण, लेखक सुझाव देते हैं कि स्पष्ट खतरों को जल्दी से छाँटने के लिए AMS का उपयोग करें, लेकिन फिर उन चालाक मॉडलों को पकड़ने के लिए पारंपरिक परीक्षण (AI से प्रश्न पूछना) का पालन करें जो अंदर से सुरक्षित दिखते हैं लेकिन बाहर से खतरनाक व्यवहार करते हैं। यह छेड़छाड़ को पहचानने का एक नया, चतुर तरीका है, लेकिन यह कोई जादुई छड़ी नहीं है जो पूरी समस्या को हल कर दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →