← नवीनतम पेपर
💻 computer science

Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives

यह शोध पत्र छह प्रमुख LLM-एजेंट फ्रेमवर्क में एक महत्वपूर्ण प्रवर्तन अंतराल (enforcement gap) को उजागर करता है जहाँ अप्रूवल गेट्स और टाइमआउट जैसे नियंत्रण प्रिमिटिव्स, पॉज़ या कैंसिलेशन के दौरान होने वाले साइड इफेक्ट्स को रोकने में विफल रहते हैं, और SOUNDGATE का प्रस्ताव करता है, जो एक मैकेनिकल रूप से सत्यापित, उच्च-प्रदर्शन वाला रस्ट-आधारित गेट है जो विविध फ्रेमवर्क्स में सभी साइड इफेक्ट्स के पूर्ण मध्यस्थता (complete mediation) की गारंटी देता है।

मूल लेखक: Sajjad Khan

प्रकाशित 2026-07-20
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sajjad Khan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपका कंप्यूटर केवल आदेशों का पालन ही नहीं करता, बल्कि अपनी खुद की योजनाएँ भी बनाने लगता है। यह AI एजेंट्स (AI Agents) का क्षेत्र है: स्मार्ट प्रोग्राम जो ईमेल पढ़ सकते हैं, उड़ान बुक कर सकते हैं, या यहाँ तक कि पैसे भी इधर-उडर भेज सकते हैं। लेकिन क्योंकि ये एजेंट्स शक्तिशाली हैं, हमें उन्हें रोकने का एक तरीका चाहिए यदि वे भ्रमित हो जाएं या कुछ खतरनाक करने लगें। यहीं पर ह्यूमन-इन-द-लूप (Human-in-the-Loop - HITL) काम आता है। इसे एक "पॉज़ बटन" (Pause Button) की तरह समझें जो AI को मजबूर करता है कि वह इंसान से पूछे, "हे, मैं यह ईमेल भेजने वाला हूँ। क्या यह ठीक है?" इंसान "हाँ" या "ना" कहता है, और AI किसी भी अपरिवर्तनीय (irreversible) कार्य को करने से पहले उस उत्तर का इंतज़ार करता है।

इस सुरक्षा प्रणाली के काम करने के लिए, हर कोई एक सरल नियम मानता है: रुकना मतलब रुकना (Stop means Stop)। यदि AI पॉज़ बटन दबाता है, तो जब तक इंसान जवाब नहीं देता, तब तक कुछ भी नहीं होता। यह एक ट्रैफिक लाइट के लाल होने जैसा है; सभी कारों को रुकना चाहिए, और कोई भी कार रेड लाइट के दौरान चौराहे से चुपके से निकलकर नहीं जानी चाहिए। यदि लाइट लाल है, तो चौराहा खाली होना चाहिए। यह शोध पत्र जांच करता है कि क्या सॉफ्टवेयर फ्रेमवर्क (इन AI एजेंट्स को बनाने के लिए उपयोग किए जाने वाले "ट्रैफिक कंट्रोलर") वास्तव में इस वादे को निभाते हैं। शोधकर्ता जानना चाहते थे कि: जब AI अनुमति माँगने के लिए रुकता है, तो क्या पूरा सिस्टम वास्तव में जम (freeze) जाता है, या क्या यह बैकग्राउंड में चुपके से अन्य चीजों को होने दे रहा है?


महान "सिबलिंग लीक" (The Great "Sibling" Leak)

शोधकर्ताओं ने, जिनका नेतृत्व सज्जाद खान कर रहे थे, पाया कि लगभग हर प्रमुख AI फ्रेमवर्क जिसे उन्होंने टेस्ट किया, उसमें "Stop means Stop" का वादा टूट जाता है। उन्होंने एक चालाकी भरा बग खोजा जिसे वे "सिबलिंग लीक" (Sibling Leak) कहते हैं।

कल्पना कीजिए कि एक AI एजेंट एक व्यस्त रसोई है। शेफ (AI) एक ही समय में दो व्यंजन तैयार कर रहा है: व्यंजन A एक तीखा करी है जिसे परोसने के लिए मालिक की अनुमति चाहिए, और व्यंजन B एक साधारण सलाद है। शेफ करी के बारे में मालिक से पूछने के लिए रुक जाता है। एक आदर्श रसोई में, पूरी रसोई तब तक जम जानी चाहिए जब तक मालिक "जाओ" न कह दे। लेकिन जिन रसोईयों का इन शोधकर्ताओं ने परीक्षण किया, उनमें रसोई जमी नहीं। जब शेफ मालिक के जवाब का इंतज़ार कर रहा था, तब भी सलाद (व्यंजन B) को काटा जा रहा था, सजाया जा रहा था और ग्राहक को परोसा जा रहा था।

इससे भी बुरा यह है कि यदि मालिक ने करी को देखा, और कहा, "नहीं, इसे मत परोसो," और शेफ ने रुकने की कोशिश की, तो तब तक बहुत देर हो चुकी थी। "स्टॉप" कमांड ने केवल शेफ के दिमाग के उस हिस्से को फ्रीज किया जो करी के बारें में सोच रहा था, लेकिन दूसरे हिस्से अनियंत्रित रूप से चलते रहे।

टीम ने छह अलग-अलग फ्रेमवर्क (वे सॉफ्टवेयर टूलकिट जिनका उपयोग डेवलपर्स इन एजेंट्स को बनाने के लिए करते हैं) का परीक्षण किया और उनमें से पाँच में यह लीक पाया। यह विभिन्न प्रकार के कंप्यूटर सिस्टम और प्रोग्रामिंग भाषाओं में हुआ। यह केवल एक खराब कोड का टुकड़ा नहीं था; यह एक पैटर्न था जो बार-बार होता रहा।

अन्य गड़बड़ियाँ

"सिबलिंग लीक" एकमात्र समस्या नहीं थी। शोधकर्ताओं ने तीन अन्य तरीके भी खोजे जिनसे सुरक्षा ब्रेक विफल हो गए:

  1. द रीप्ले डबल-काउंट (The Replay Double-Count): यदि सिस्टम रुका और फिर दोबारा शुरू हुआ, तो कभी-कभी यह गलती से एक ही कार्य को दो बार कर देता है, जैसे क्रेडिट कार्ड को दो बार चार्ज करना क्योंकि इसे लगा कि पहली बार वाला काउंट नहीं हुआ।
  2. द कैंसलेशन ऑर्फ़न (The Cancellation Orphan): यदि किसी इंसान ने AI को एक लंबे कार्य के बीच में "रुक जाओ!" कहा, तो AI कहेगा "ठीक है, मैं रुक रहा हूँ," लेकिन कार्य बैकग्राउंड में पूरा हो जाएगा, जैसे एक धावक जो सीटी की आवाज़ सुनता है लेकिन फिर भी फिनिश लाइन तक दौड़ता रहता है।
  3. द टाइमआउट ज़ोंबी (The Timeout Zombie): यदि किसी कार्य में बहुत समय लगा और सिस्टम ने कहा "समय समाप्त!", तो वह कार्य डेडलाइन बीत जाने के बाद भी अपना काम पूरा कर लेगा, जैसे एक ज़ोंबी जो सूरज उगने के बाद भी चलता रहता है।

क्या यह वास्तव में होता है?

आप सोच सकते हैं, "खैर, शायद AI बहुत अधिक बार एक साथ दो चीजें नहीं करता।" शोधकर्ताओं ने इसकी भी जाँच की। उन्होंने पाया कि हालांकि सामान्य स्थितियों में AI एजेंट आमतौर पर एक-एक करके चीजें करते हैं, लेकिन वे कभी-कभी एक साथ कई चीजें करने की कोशिश करते हैं, खासकर जब कार्य जटिल हो या जब कोई AI को धोखा देने की कोशिश करे।

अपने परीक्षणों में, उन्होंने पाया कि फ्रंटियर AI मॉडल्स (उपलब्ध सबसे स्मार्ट मॉडल) कुछ कार्यों पर लगभग 14% समय गलती से ऐसे "सिबलिंग" स्थितियाँ बना देते हैं। हालाँकि, महत्वपूर्ण निष्कर्ष यह है कि जब वे एक साथ दो चीजें करने की कोशिश करते हैं तो क्या होता है। वास्तविक AI मॉडल और वास्तविक सॉफ्टवेयर के साथ एक लाइव टेस्ट में, जब भी AI ने एक ऐसा प्लान बनाया जिसमें मानव की प्रतीक्षा करते समय दो चीजें एक साथ करने की कोशिश की गई, तो सिस्टम 100% बार विफल रहा। 1,200 कुल रन में से, 215 बार "लीक" हुआ जहाँ सिस्टम के रुके होने के बावजूद एक क्रिया हो गई। विफलता यह नहीं थी कि AI हमेशा दो चीजें करने की कोशिश करता था; बल्कि यह थी कि जब उसने किया, तो सुरक्षा द्वार पूरी तरह से बेकार था।

समाधान: दरवाजे पर खड़ा बाउंसर (The Fix: The Bouncer at the Door)

तो, आप उस रसोई को कैसे ठीक करेंगे जहाँ शेफ अनुमति मिलने के इंतज़ार में चुपके से खाना बाहर निकालता रहता है? आप केवल शेफ को "बेहतर बनने" के लिए नहीं कह सकते, क्योंकि रसोई ही इस तरह बनाई गई है कि चीजें समानांतर (parallel) चल सकें। इसके बजाय, शोधकर्ताओं ने एक नया प्रकार का सुरक्षा गार्ड बनाया जिसे SOUNDGATE कहा जाता है।

SOUNDGATE को रसोई के सामने के दरवाजे पर खड़े एक बाउंसर के रूप में समझें।

  • पुराना तरीका: शेफ (AI) बस खाने के साथ दरवाजे से बाहर निकल जाता। यदि मालिक "रुक जाओ" कहता, तो शायद शेफ उसे सुनने के लिए बहुत दूर होता।
  • SOUNDGATE का तरीका: हर एक व्यंजन (हर क्रिया) को रसोई से बाहर निकलने से पहले बाउंसर के पास रुकना होगा। बाउंसर के पास एक सूची होती है कि क्या अनुमति है।
    • यदि मालिक कहता है "रुको," तो बाउंसर खाने को रोक देता है।
    • यदि मालिक कहता है "नहीं," तो बाउंसर खाने को फेंक देता है।
    • यदि मालिक कहता है "हाँ," तो बाउंसर उसे बाहर जाने देता है।
    • यदि शेफ दूसरी बार चुपके से बाहर निकलने की कोशिश करता है (रीप्ले), तो बाउंसर सूची चेक करता है और कहता है, "तुम यह पहले ही कर चुके हो," और उसे रोकता है।
    • यदि शेफ "रुक जाओ" के आदेश के बाद बाहर निकलने की कोशिश करता है, तो बाउंसर दरवाजा ब्लॉक कर देता है।

शोधकर्ताओं ने इस बाउंसर को Rust नामक एक बहुत ही सख्त, गणितीय रूप से सत्यापित भाषा का उपयोग करके बनाया। उन्होंने कंप्यूटर लॉजिक के साथ सिद्ध किया कि बाउंसर गलती नहीं कर सकता। उन्होंने सभी छह फ्रेमवर्क पर इसका परीक्षण किया, और यह पूरी तरह से काम कर गया। जब उन्होंने SOUNDGATE का उपयोग किया, तो शून्य लीक हुए। बाउंसर ने हर बार लाइन को थामे रखा।

यह क्यों महत्वपूर्ण है

यह शोध पत्र यह दावा नहीं करता कि AI खतरनाक है या हमें इसका उपयोग बंद कर देना चाहिए। इसके बजाय, यह दिखाता है कि हमारे वर्तमान सुरक्षा उपकरणों में एक छिपा हुआ छेद है। यह एक ऐसे सीटबेल्ट की तरह है जो देखने में तो बहुत अच्छा है लेकिन दुर्घटना होने पर वास्तव में लॉक नहीं होता।

शोधकर्ताओं ने पाया कि हालांकि यह छेद मौजूद है, लेकिन यह अक्सर "लेटेंट" (latent) होता है—अर्थात, यह वहां है, लेकिन हम इसे हमेशा नहीं देखते क्योंकि AI आमतौर पर धीमी गति से और एक-एक करके चीजें करता है। हालाँकि, जैसे-जैसे AI तेज़ होगा और अधिक जटिल, बहु-चरणीय कार्य करने लगेगा, या यदि कोई इसे धोखा देने की कोशिश करेगा, तो यह छेद एक विशाल गैप बन जाएगा।

अच्छी खबर यह है कि समाधान सरल है और इसके लिए पूरी रसोई को फिर से बनाने की आवश्यकता नहीं है। आप बस दरवाजे पर बाउंसर (SOUNDGATE) जोड़ देते हैं। यह एक छोटा सा जोड़ है जो पूरे सिस्टम को फिर से सुरक्षित बनाता है, यह सुनिश्चित करता है कि जब कोई इंसान "रुक जाओ" कहता है, तो मशीन वास्तव में रुक जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →