← नवीनतम पेपर
💬 NLP

Evaluating Adversarial Robustness of Concept Representations in Sparse Autoencoders

यह शोध पत्र प्रदर्शित करता है कि स्पार्स ऑटोएनकोडर्स (sparse autoencoders) में अवधारणा निरूपण (concept representations), प्रतिकूल इनपुट विक्षोभ (adversarial input perturbations) के प्रति अत्यधिक नाजुक होते हैं, जो यह सुझाव देता है कि वे अतिरिक्त डिनोइजिंग (denoising) या पोस्टप्रोसेसिंग के बिना विश्वसनीय मॉडल निगरानी और निरीक्षण के लिए वर्तमान में अनुपयुक्त हैं।

मूल लेखक: Aaron J. Li, Suraj Srinivas, Usha Bhalla, Himabindu Lakkaraju

प्रकाशित 2026-01-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aaron J. Li, Suraj Srinivas, Usha Bhalla, Himabindu Lakkaraju

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "नाज़ुक अनुवादक" (The Fragile Translator)

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट है (एक लार्ज लैंग्वेज मॉडल) जो एक गुप्त, जटिल भाषा बोलता है जिसे केवल वह ही समझ सकता है। यह समझने के लिए कि वह रोबोट क्या सोच रहा है, वैज्ञानिकों ने एक विशेष "अनुवादक" बनाया जिसे स्पार्स ऑटोएन्कोडर (SAE) कहा जाता है।

SAE को एक शब्दकोश के रूप में समझें जो रोबोट के गुप्त कोड को मानवीय अवधारणाओं (concepts) में अनुवादित करता है। जब रोबोट "बिल्लियों" के बारे में सोचता है, तो SAE का एक विशिष्ट बल्ब "बिल्ली" (Cat) लेबल के साथ जल उठता है। जब वह "गणित" के बारे में सोचता है, तो "गणित" (Math) लेबल वाला दूसरा बल्ब चमकता है।

लंबे समय तक, शोधकर्ताओं को लगा कि ये बल्ब भरोसेमंद थे। उन्होंने जांचा कि क्या शब्दकोश सटीक था (क्या "बिल्ली" का वास्तव में अर्थ बिल्ली ही था?) और क्या रोशनी स्पष्ट थी (क्या "बिल्ली" का उल्लेख होने पर "कुत्ता" वाला बल्ब गलती से जल जाता था?)।

यह शोध एक नया, डरावना सवाल पूछता है: क्या होगा यदि कोई कमरे में चुपके से घुस जाए और रोबोट के कान में एक बहुत ही छोटा, लगभग अदृश्य शब्द फुसफुसा दे? क्या अनुवादक अभी भी काम करेगा, या वह भ्रमित हो जाएगा और गलत बल्बों को जलाने लगेगा?

प्रयोग: "फुसफुसाहट हमला" (The Whisper Attack)

शोधकर्ताओं ने यह परीक्षण करने का निर्णय लिया कि ये अनुवादक कितने मजबूत हैं। इसके लिए उन्होंने उन्हें चकमा देने की कोशिश की। उन्होंने "विस्पर अटैक" (तकनीकी रूप से 'एडवर्सरियल परटर्बेशन' के रूप में जाना जाता है) नामक एक विधि का उपयोग किया।

कल्पना कीजिए कि आप रोबोट को बताने की कोशिश कर रहे हैं, "मैं केक बनाना चाहता हूँ।"

  • सामान्य परिदृश्य: रोबोट "केक" को समझता है, और SAE का "बेकिंग" (Baking) वाला बल्ब जल उठता है।
  • हमला: शोधकर्ताओं ने वाक्य में केवल एक शब्द बदल दिया। शायद उन्होंने "बनाना" (bake) को बदलकर "बिकेय" (bakey) कर दिया या अंत में "ज़ोर्प" (zorp) जैसा एक अजीब शब्द जोड़ दिया।
    • इनपुट: "मैं बिकेय एक केक चाहता हूँ।"

चौंकाने वाला परिणाम:
भले ही वाक्य सुनने में इंसान को लगभग बिल्कुल वैसा ही लगता है (और रोबोट अभी भी जानता है कि यह बेकिंग के बारे में है), SAE अनुवादक पूरी तरह से अपना मानसिक संतुलन खो देता है।

  • "बेकिंग" वाला बल्ब बंद हो जाता है।
  • "फर्नीचर" वाला बल्ब चालू हो जाता है।
  • "रसायन विज्ञान" (Chemistry) वाला बल्ब चालू हो जाता है।

पेपर के प्रयोगों में, उन्होंने पाया कि केवल एक शब्द बदलने से (या एक शब्द को उसके पर्यायवाची से बदलने से भी) अनुवादक का आउटपुट पूरी तरह से बिगड़ सकता है। वे एक शब्द बदलकर रोबोट को यह सोचने पर मजबूर कर सकते थे कि "हानिकारक निर्देशों" वाला वाक्य "सौम्य कला" (benign art) के बारे में है।

चार तरीके जिनसे उन्होंने इसे तोड़ने की कोशिश की

शोधकर्ताओं ने अनुवादक को तोड़ने के चार अलग-अलग तरीकों का परीक्षण किया, जैसे कि कोई मैकेनिक कार के सस्पेंशन का परीक्षण करता है:

  1. "पूर्ण अराजकता" परीक्षण (Untargeted): उन्होंने अनुवादक को कोई भी यादृच्छिक (random) सेट के बल्ब जलाने के लिए उकसाया, सिर्फ यह देखने के लिए कि क्या यह टूट जाता है। परिणाम: यह आसानी से टूट गया।
  2. "अदला-बदली" परीक्षण (Targeted): उन्होंने कोशिश की कि "खेल" (Sports) के बारे में एक वाक्य को "व्यापार" (Business) के बारे में सोचने पर मजबूर करें। परिणाम: वे सफल रहे। एक शब्द के बदलाव ने "खेल" की लाइटों को बुझा दिया और "व्यापार" की लाइटों को चमका दिया।
  3. "समूह" परीक्षण (Population): उन्होंने एक साथ जलने वाले पूरे बल्बों के समूह को बदलने की कोशिश की। परिणाम: इसे बिगाड़ना बहुत आसान था।
  4. "एकल बल्ब" परीक्षण (Individual): उन्होंने केवल एक विशिष्ट बल्ब को चालू या बंद करने की कोशिश की। परिणाम: वे अधिकांश लाइटों को बंद कर सके, लेकिन कुछ "मृत" बल्ब (जो वैसे भी कभी नहीं जलते) को जबरन चालू नहीं किया जा सका।

सबसे महत्वपूर्ण खोज: रोबोट ठीक है, अनुवादक नहीं है

यहाँ वह मोड़ है जो इस पेपर को महत्वपूर्ण बनाता है:

जब शोधकर्ताओं ने अनुवादक को धोखा देने के लिए वह एक शब्द बदला, तो उन्होंने रोबोट के मस्तिष्क (अंतर्निहित लार्ज लैंग्वेज मॉडल) की भी जांच की।

  • क्या रोबोट ने अपना विचार बदला? नहीं। वह अभी भी समझता था कि वाक्य बेकिंग के बारे में है।
  • क्या रोबोट की आंतरिक भावनाएं बदलीं? नहीं।
  • क्या SAE अनुवादक ने अपना विचार बदला? हाँ। वह पागल हो गया।

उपमा (Analogy):
कल्पना कीजिए कि एक मानव अनुवादक आपके और वक्ता के बीच खड़ा है।

  • आप कहते हैं: "मुझे भूख लगी है।"
  • वक्ता (रोबोट) आपको पूरी तरह समझता है।
  • लेकिन अनुवादक अचानक चिल्लाता है, "वह कह रहा है कि वह भालू से लड़ना चाहता है!"

समस्या यह नहीं है कि वक्ता भ्रमित है; समस्या यह है कि अनुवादक नाजुक है। इसे उन छोटे बदलावों से धोखा दिया जा सकता है जिन्हें एक इंसान भी नोटिस नहीं करेगा।

यह क्यों मायने रखता है (पेपर के अनुसार)

लेखकों का तर्क है कि यदि हम AI की निगरानी (उदाहरण के लिए, यह सुनिश्चित करने के लिए कि AI कुछ बुरा नहीं बोल रहा है) के लिए इन अनुवादकों का उपयोग करना चाहते हैं, तो हम मुसीबत में हैं।

यदि कोई बुरा व्यक्ति प्रॉम्प्ट में एक शब्द बदलकर "सुरक्षा निगरानी" (SAE) को यह सोचने के लिए मजबूर कर सकता है कि एक खतरनाक अनुरोध वास्तव में एक हानिरहित अनुरोध है, तो सुरक्षा प्रणाली विफल हो जाती है। पेपर निष्कर्ष निकालता है कि वर्तमान में, ये अनुवादक बिना सुधारे जाने के लिए निगरानी या देखरेख के लिए बहुत नाजुक हैं। वे कांच के घर की तरह हैं: देखने में सुंदर, लेकिन एक छोटा सा कंकड़ भी पूरे ढांचे को तोड़ सकता है।

एक वाक्य में सारांश

यह पेपर दिखाता है कि AI के दिमाग को "पढ़ने" के लिए उपयोग किए जाने वाले उपकरण अविश्वसनीय रूप से नाजुक हैं; इनपुट में एक छोटा, लगभग अदृश्य बदलाव अनुवादक को पूरी तरह से धोखा दे सकता है, भले ही AI ने अपना विचार बिल्कुल न बदला हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →