← नवीनतम पेपर
🤖 machine learning

H-Node Attack and Defense in Large Language Models

यह शोध पत्र H-Node एडवरसैरियल नॉइज़ कैंसिलेशन (H-Node ANC) प्रस्तुत करता है, जो एक यांत्रिक ढांचा (mechanistic framework) है जो बड़े भाषा मॉडलों में मतिभ्रम (hallucination) के प्रति संवेदनशील हिडन-स्टेट आयामों की पहचान करता है ताकि लक्षित एडवरसैरियल हमलों और प्रभावी, कम-प्रभाव वाले बचावों को सक्षम बनाया जा सके जो सामान्य तर्क क्षमताओं से समझौता किए बिना मतिभ्रम ड्रिफ्ट (hallucination drift) को महत्वपूर्ण रूप से कम करते हैं।

मूल लेखक: Eric Yocam, Varghese Vaidyan, Yong Wang

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eric Yocam, Varghese Vaidyan, Yong Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक लार्ज लैंग्वेज मॉडल (LLM) एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी कहानीकार की तरह है। कभी-कभी, यह कहानीकार तथ्य गढ़ लेता है (हैलुसिनेशन/भ्रम) लेकिन उन्हें इतने आत्मविश्वास के साथ कहता है कि आप उन पर विश्वास कर लेते हैं। यह शोध पत्र इन झूठों को पकड़ने और उन्हें आपके कानों तक पहुँचने से पहले रोकने का एक नया तरीका पेश करता है, जिसे H-Node एडवरसेरियल नॉइज़ कैंसलेशन (H-Node ANC) कहा जाता है।

यह कैसे काम करता है, इसका विवरण सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है।

1. समस्या: "झूठ बोलने वाली फ्रीक्वेंसी"

AI के मस्तिष्क को एक विशाल ऑर्केस्ट्रा के रूप में सोचें जिसमें हजारों संगीतकार (न्यूरॉन्स) एक साथ बज रहे हैं। जब AI सच बोलता है, तो ऑर्केस्ट्रा एक सुरीला गीत बजाता है। जब वह झूठ बोलता है, तो कुछ विशिष्ट संगीतकार एक अजीब, तीखी चीख जैसी आवाज़ निकालने लगते हैं जो धुन को खराब कर देती है।

लंबे समय तक, शोधकर्ताओं ने AI को ठीक करने के लिए गाने के अंत को सुनने की कोशिश की (कि अंतिम उत्तर कैसा सुनाई देता है) ताकि यह देखा जा सके कि क्या वह गलत था। लेकिन यह शोध पत्र कहता है: "नहीं, हमें संगीतकारों को बजाते समय सुनना होगा।"

शोधकर्ताओं ने पाया कि वह "चीख" (हैलुसिनेशन सिग्नल) ऑर्केस्ट्रा के एक बहुत ही विशिष्ट हिस्से में होती है, लगभग गाने के बीच में, और इसे संगीतकारों के एक बहुत छोटे, विशिष्ट समूह द्वारा बजाया जाता है। वे इन्हें H-Nodes (हैलुसिनेशन नोड्स) कहते हैं।

2. हमला: "नकली कंडक्टर"

यह साबित करने के लिए कि वे AI को नियंत्रित कर सकते हैं, शोधकर्ताओं ने "रेड टीम बनाम ब्लू टीम" का खेल खेला।

  • हमलावर (रेड टीम): वे एक चालाक कंडक्टर की तरह काम करते थे जिन्हें पता था कि कौन से संगीतकार "चीखने वाले" हैं। उन्होंने संगीत की शीट नहीं बदली; उन्होंने बस उन विशिष्ट संगीतकारों के कंधे थपथपाए ताकि वे और भी ज़ोर से और आक्रामक रूप से बजाएं।
  • परिणाम: AI अचानक अधिक बार और अधिक आत्मविश्वास के साथ झूठ बोलने लगा। हमलावर AI को इस तरह से भ्रमित (हैलुसिनेट) कर सकता था कि AI का "रक्षक" (defender) यह भी नोटिस नहीं कर पाता कि कुछ गलत हुआ है। यह कंडक्टर के कान में इतनी सूक्ष्मता से झूठ फुसफुसाने जैसा था कि बाकी ऑर्केस्ट्रा को सुनाई ही न दे।

3. बचाव: "नॉइज़-कैंसलिंग हेडफ़ोन"

अब, कल्पना करें कि AI ने एक जोड़ी सुपर-स्मार्ट नॉइज़-कैंसलिंग हेडफ़ोन पहने हुए हैं। यह ANC (एडवरसेरियल नॉइज़ कैंसलेशन) बचाव है।

  • यह कैसे काम करता है: हेडफ़ोन वास्तविक समय में ऑर्केस्ट्रा को सुनते हैं। यदि वे पता लगाते हैं कि "चीखने वाले संगीतकार" (H-Nodes) बहुत ज़ोर से बज रहे हैं, तो हेडफ़ोन तुरंत उस विशिष्ट शोर को रद्द करने के लिए एक "विपरीत ध्वनि" (reverse sound) उत्पन्न करते हैं।
  • चाल: शोधकर्ताओं ने महसूस किया कि यदि आप सभी के लिए वॉल्यूम कम कर देते हैं (स्टैटिक कैंसलेशन), तो आप गलती से अच्छे संगीतकारों को भी शांत कर सकते हैं। इसलिए, उन्होंने हेडफ़ोन को अनुकूलनशील (adaptive) बनाया।
    • यदि AI बहुत अधिक आत्मविश्वास के साथ झूठ बोल रहा है, तो हेडफ़ोन नॉइज़-कैंसलिंग सिग्नल को ज़ोर से चलाते हैं।
    • यदि AI केवल थोड़ा अनिश्चित है, तो हेडफ़ोन वॉल्यूम को केवल थोड़ा सा कम करते हैं।
    • परिणाम: इसने AI को रोबोटिक या भ्रमित बनाए बिना झूठ को रोक दिया।

4. "हाइड्रा" समस्या और "डायनामिक" समाधान

यहाँ एक चतुर मोड़ है। शोधकर्ताओं ने एक समस्या खोजी जिसे वे "हाइड्रा प्रभाव" कहते हैं।

  • परिदृश्य: जब रक्षक झूठ बोलने वाले पहले समूह (जिन्हें वे जानते हैं) को रद्द कर देता है, तो AI का मस्तिष्क इतना लचीला होता है कि "झूठ का सिग्नल" संगीतकारों के एक दूसरे समूह में कूद जाता है जिसे रक्षक देख नहीं पा रहा था। यह हाइड्रा का एक सिर काटने जैसा है, और दो नए सिर वापस उग आते हैं।
  • समाधान: शोधकर्ताओं ने एक डायनामिक इटरेटिव डिफेंस (Dynamic Iterative Defense) बनाया। केवल एक बार सुनने के बजाय, सिस्टम सुनता है, शोर को रद्द करता है, फिर से सुनता है, और फिर उस नए शोर को रद्द करता है जो दूसरे संगीतकारों में कूद गया था।
  • परिणाम: इस लूप को कुछ बार करने से, वे "हाइड्रा" के उन सिरों को पकड़ने में सक्षम रहे जो छिप रहे थे। वे केवल 8% झूठ को रोकने से बढ़कर लगभग 70% झूठ को रोकने में सक्षम हुए।

5. यह क्यों महत्वपूर्ण है

इस शोध पत्र का सबसे प्रभावशाली हिस्सा यह है कि यह बचाव सर्जिकल (सटीक) है।

  • पहले: AI के झूठ को रोकने की कोशिश अक्सर AI को कम बुद्धिमान या धीमा बना देती थी (जैसे ऑर्केस्ट्रा पर भारी कंबल डाल देना)।
  • अब: यह तरीका एक लेज़र स्कैल्पल (लेज़र चाकू) की तरह है। यह "झूठ के शोर" को इतनी सटीकता से हटा देता है कि सामान्य प्रश्नों (जैसे गणित या विज्ञान) के उत्तर देने की AI की क्षमता लगभग वैसी ही रहती है। "सच का संगीत" एकदम सही रहता है; केवल झूठ की "चीख" गायब हो जाती है।

सारांश

इस शोध पत्र को ऐसे समझें जैसे कि आपने AI के मस्तिष्क के भीतर रहने वाला एक झूठ पकड़ने वाला यंत्र (lie detector) आविष्कार किया हो।

  1. यह उन सूक्ष्म, विशिष्ट स्थानों को खोजता है जहाँ झूठ जन्म लेते हैं।
  2. यह साबित करता है कि एक हमलावर उन जगहों को छेड़कर AI को झूठ बोलने के लिए मजबूर कर सकता है।
  3. यह एक स्मार्ट फ़िल्टर बनाता है जो AI की बुद्धिमत्ता को नुकसान पहुँचाए बिना वास्तविक समय में उन झूठों को रद्द करता है।
  4. यह तब तक प्रयास करता रहता है जब तक कि वह झूठ को पकड़ न ले, भले ही AI उन्हें नई जगहों पर छिपाने की कोशिश करे।

यह AI को वास्तविक दुनिया के उपयोग के लिए सुरक्षित और विश्वसनीय बनाने की दिशा में एक बड़ा कदम है, यह सुनिश्चित करता है कि जब AI बोले, तो वह सच बोल रहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →