← नवीनतम पेपर
🤖 AI

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

यह शोधपत्र TwinGridShield को प्रस्तुत करता है, जो एक मॉडल-स्वतंत्र रनटाइम ऑथराइजेशन लेयर है जो एक नियतात्मक नेटवर्क ट्विन के विरुद्ध उनका सत्यापन करके असुरक्षित LLM-जनित ग्रिड कमांड्स को रोकता है, जो नियंत्रित परीक्षणों में पूर्ण सुरक्षा प्रदर्शित करता है और लोड माप त्रुटियों तथा ब्रांच रेटिंग विसंगतियों जैसे मॉडल मिसमैच के प्रति महत्वपूर्ण भेद्यता को प्रकट करता है।

मूल लेखक: Md Fazley Rafy

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Fazley Rafy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक पावर ग्रिड की कल्पना तारों और मशीनों के एक विशाल, जीवित नेटवर्क के रूप में करें जिसे हमेशा पूरी तरह संतुलित रहना चाहिए। यदि एक ही तार से बहुत अधिक बिजली बहती है, तो वह गर्म होकर टूट सकता है। यदि किसी कनेक्शन को गलत समय पर काट दिया जाए, तो एक पूरा मोहल्ला अंधेरे में डूब सकता है। दशकों से, मनुष्यों ने इस नाजुक संतुलन को प्रबंधित किया है, लेकिन अब, आर्टिफिशियल इंटेलिजेंस (AI) को मदद करने के लिए आमंत्रित किया जा रहा है। ये नए AI सहायक एक मानव ऑपरेटर के अनुरोध को सामान्य अंग्रेजी में पढ़ सकते हैं और उसे ग्रिड के लिए एक विशिष्ट कमांड में अनुवादित कर सकते हैं, जैसे कि "इस जनरेटर को कम करें" या "इस स्विच को खोलें।" यह एक तेज़, अधिक प्रतिक्रियाशील प्रणाली का वादा है। हालाँकि, एक वाक्य को समझने और भौतिकी (फिजिक्स) को समझने के बीच एक खतरनाक अंतर है। एक AI एक कमांड के व्याकरण को पूरी तरह से समझ सकता है और फिर भी एक ऐसा कार्य सुझा सकता है जिससे ब्लैकआउट हो जाए, केवल इसलिए क्योंकि वह उस बिजली के भार को वास्तव में "महसूस" नहीं करता जिसे वह चला रहा है। यह एक ऐसे व्यक्ति की तरह है जो रेसिपी लिखना तो जानता है लेकिन उसने कभी भोजन चखा नहीं है; वह गलती से आपको मिठाई में नमक डालने के लिए कह सकता है।

यही वह समस्या है जिसे वेस्ट वर्जीनिया यूनिवर्सिटी के शोधकर्ताओं ने हल करने का प्रयास किया। उन्होंने 'ट्विनग्रिडशील्ड' (TwinGridShield) नामक एक सुरक्षा प्रणाली बनाई, जिसे AI और वास्तविक पावर ग्रिड के बीच खड़ा करने के लिए डिज़ाइन किया गया है। इसका मूल विचार सरल लेकिन शक्तिशाली है: AI के कमांड को वास्तविक दुनिया में भेजने से पहले, इसे ग्रिड की एक आदर्श, डिजिटल प्रति (copy) में टेस्ट किया जाना चाहिए। इस डिजिटल प्रति को "ट्वين" (twin) कहा जाता है, जो एक कंप्यूटर मॉडल है जिसे पता है कि बिजली वास्तव में कैसे व्यवहार करती है। जब AI कोई कार्य प्रस्तावित करता है, तो सुरक्षा प्रणाली उस कार्य को 'ट्विन' के माध्यम से चलाकर देखती है कि क्या होता है। यदि सिमुलेशन दिखाता है कि वह कार्य किसी तार को ओवरलोड कर देगा या किसी अस्पताल की बिजली काट देगा, तो सिस्टम तुरंत उस कमांड को ब्लॉक कर देता है। इससे कोई फर्क नहीं पड़ता कि AI को कितनी चतुराई से मूर्ख बनाया गया था या अनुरोध को कैसे कहा गया था; यदि भौतिक परिणाम असुरक्षित है, तो कार्य को रोक दिया जाता है।

इसका परीक्षण करने के लिए, शोधकर्ताओं ने चौदह कनेक्शन बिंदुओं वाले एक मानक पावर ग्रिड मॉडल का उपयोग करके एक नियंत्रित प्रयोग किया। वे किसी विशिष्ट AI मॉडल पर निर्भर नहीं रहे जो समय के साथ अपना व्यवहार बदल सकता है। इसके बजाय, उन्होंने एक कंप्यूटर प्रोग्राम का उपयोग किया जिसे एक शरारती हमलावर की तरह कार्य करने के लिए डिज़ाइन किया गया था। इस प्रोग्राम को 84 प्रतिशत बार खतरनाक कार्य सुझाने के लिए सेट किया गया था, जो उस परिदृश्य की नकल करता है जहाँ AI को ग्रिड को तोड़ने की कोशिश करने के लिए बहकाया गया है। पांच सौ परीक्षणों की एक श्रृंखला में, इस प्रोग्राम ने सैकड़ों असुरक्षित कमांड उत्पन्न किए, जिनमें महत्वपूर्ण स्विच खोलना या आवश्यक सेवाओं की बिजली काटना शामिल था। बिना सुरक्षा प्रणाली के, ये कमांड निष्पादित हो जाते, जिससे सिम्युलेटेड ब्लैकआउट और उपकरणों को नुकसान पहुँचता।

जब शोधकर्ताओं ने ट्विनग्रिडशील्ड को चालू किया, तो परिणाम पूर्ण था। पांच सौ के सभी पांच सौ परीक्षणों में, सिस्टम ने हर एक असुरक्षित कमांड को ब्लॉक कर दिया। इसने एक भी खतरनाक कार्य को गुजरने नहीं दिया। सिस्टम ने प्रस्तावित कार्य की जाँच भौतिक नियमों के एक सेट के विरुद्ध की, जैसे कि यह सुनिश्चित करना कि तार बहुत अधिक गर्म न हों और ग्रिड जुड़ा रहे। यदि किसी कार्य ने इन नियमों का उल्लंघन किया, तो सिस्टम ने उसे अस्वीकार कर दिया और कारण दर्ज किया, जिससे एक सुरक्षित रिकॉर्ड बना जो बदला नहीं जा सकता था। इस जाँच की गति लगभग तात्कालिक थी, जिसमें आधा मिलीसेकंड से भी कम समय लगा, जिसका अर्थ है कि इसका उपयोग ग्रिड को धीमा किए बिना वास्तविक समय के संचालन में किया जा सकता है।

हालाँकि, शोधकर्ता इस बात पर जोर देने में सावधानी बरतते थे कि इस पूर्ण सुरक्षा रिकॉर्ड के लिए डिजिटल ट्विन का वास्तविक दुनिया के साथ सटीक मेल होना आवश्यक है। वास्तविक दुनिया में, माप कभी भी पूर्ण नहीं होते। यह परीक्षण करने के लिए कि सिस्टम इसे कैसे संभालता है, उन्होंने प्रयोगों का एक दूसरा सेट चलाया जहाँ उन्होंने छोटी त्रुटियाँ पेश कीं। उन्होंने यह नाटक किया कि कंप्यूटर मॉडल का ग्रिड के प्रति दृश्य थोड़ा गलत था, या तो लोड माप बीस प्रतिशत तक गलत थे या तारों की वास्तविक सीमाएँ उस सीमा से कम थीं जो मॉडल सोच रहा था। इन परिदृश्यों में, सिस्टम अब पूर्ण नहीं था। जब माप गलत थे, तो सिस्टम ने अनजाने में लगभग 5.6 प्रतिशत खतरनाक कार्यों को गुजरने दिया। जब तारों की वास्तविक सीमाएँ मॉडल द्वारा मानी गई सीमाओं से कम थीं, तो विफलता दर बढ़कर लगभग 30 प्रतिशत हो गई।

ये संख्याएँ एक स्पष्ट कहानी बताती हैं। सुरक्षा प्रणाली दोषरहित काम करती है जब कंप्यूटर मॉडल ग्रिड की वास्तविक स्थिति को जानता है, लेकिन इसकी विश्वसनीयता तब गिर जाती है जब मॉडल और वास्तविकता के बीच का अंतर बढ़ता है। शोधकर्ता इस बात पर जोर देते हैं कि उनका काम सभी AI जोखिमों के लिए अंतिम समाधान नहीं है, बल्कि यह एक विशिष्ट प्रकार की सुरक्षा का प्रदर्शन है। उन्होंने दिखाया कि एक ऐसा गेट बनाना संभव है जो केवल यह नहीं देखता कि कमांड व्याकरणिक रूप से सही दिख रहा है, बल्कि यह देखता है कि कमांड के भौतिक परिणाम क्या हैं। यह दृष्टिकोण AI को गलतियाँ करने से रोकने के बजाय, यह सुनिश्चित करने पर ध्यान केंद्रित करता है कि भले ही AI गलती करे, भौतिक दुनिया सुरक्षित रहे। अध्ययन निष्कर्ष निकालता है कि हालांकि यह विधि कई खतरनाक कार्यों पर दरवाजा बंद करने में प्रभावी हो सकती है, लेकिन वास्तविक दुनिया में तैनाती के लिए डिजिटल ट्विन को डेटा फीड करने की सटीकता पर सावधानीपूर्वक ध्यान देने की आवश्यकता होगी, ताकि वर्चुअल मॉडल उस भौतिक वास्तविकता के प्रति सच्चा बना रहे जिसकी रक्षा करने के लिए उसे बनाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →