← नवीनतम पेपर
🤖 AI

Will the Agent Recuse Itself? Measuring LLM-Agent Compliance with In-Band Access-Deny Signals

यह शोध पत्र "रिक्यूज़ सिग्नल" (Recuse Signal) को प्रस्तुत और अनुभवजन्य रूप से मान्य करता है, जो robots.txt के समान एक हल्का, इन-बैंड प्रोटोकॉल तंत्र है जो सर्वरों को स्वायत्त LLM एजेंटों से संसाधनों तक पहुँचने से स्वेच्छा से पीछे हटने का अनुरोध करने में सक्षम बनाता है, और यह एक नियंत्रित प्रयोग में प्रदर्शित करता है कि अनुपालन करने वाले एजेंट स्पष्ट ऑपरेटर ओवरराइड के प्रति उत्तरदायी रहते हुए इन सहकारी शासन संकेतों का सम्मान करते हैं।

मूल लेखक: Thamilvendhan Munirathinam

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thamilvendhan Munirathinam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही विनम्र, उच्च प्रशिक्षित रोबोट बटलर (नौकर) हैं। आपके पास एक मास्टर कुंजी है जो एक विशाल, हाई-टेक हवेली के हर दरवाजे को खोल सकती है। आपका काम सफाई करना, लाइटों की जांच करना और यह सुनिश्चित करना है कि सब कुछ सुचारू रूप से चल रहा है।

आमतौर पर, यदि आपके पास चाबी है, तो दरवाजा खुल जाता है। लेकिन क्या होगा अगर कमरे का मालिक चाहता है कि आप रुक जाएं? यदि आप एक इंसान होते, तो वे चिल्ला सकते थे, "रुको! अंदर मत जाओ!" लेकिन आप एक रोबोट हैं। यदि आप केवल एक डिजिटल लॉक को देख रहे हैं, तो आप चिल्लाहट नहीं सुन सकते। लॉक या तो खुल जाता है (क्योंकि आपके पास चाबी है) या नहीं खुलता। इसके बीच का कोई रास्ता नहीं है।

यह पेपर बताता है कि कैसे "कमरा" "रोबोट" से बात कर सकता है।

समस्या: साइलेंट लॉक (मौन ताला)

अभी, यदि कोई AI एजेंट (जैसे कि एक स्मार्ट सॉफ्टवेयर बॉट) किसी सर्वर या डेटाबेस में प्रवेश करने की कोशिश करता है, तो उसके साथ बिल्कुल वैसा ही व्यवहार किया जाता है जैसा कि एक चाबी वाले इंसान के साथ किया जाता है। यदि चाबी काम करती है, तो दरवाजा खुल जाता है। सर्वर के पास यह कहने का कोई मानक तरीका नहीं है कि, "हे, भले ही आपके पास चाबी है, लेकिन मैं अभी आपको यहाँ नहीं चाहता।"

समाधान: "रिक्यू साइन" (डिजिटल "डू नॉट डिस्टर्ब" साइन)

लेखक एक नया, सरल नियम प्रस्तावित करते हैं जिसे Recuse Signal कहा जाता है।

इसे एक होटल के दरवाजे पर लगे "Do Not Disturb" (परेशान न करें) साइन की तरह समझें, या प्रसिद्ध robots.txt फ़ाइल की तरह जिसका उपयोग वेबसाइटें सर्च इंजन को यह बताने के लिए करती हैं कि उन्हें कौन से पेज नहीं देखने चाहिए।

  • यह कैसे काम करता है: जब रोबोट जुड़ने (connect) की कोशिश करता है, तो सर्वर रोबोट को अंदर जाने देने से पहले एक छोटा, विशेष संदेश भेजता है। यह कहता है: "रुकिए। यह एक प्रोडक्शन एरिया है। स्वचालित एजेंटों का यहाँ स्वागत नहीं है। कृपया जाइए और अपने बॉस को सूचित कीजिए।"
  • कैच (शर्त): यह कोई जबरदस्ती का लॉक नहीं है। यह एक सहयोगात्मक अनुरोध है। यह एक विनम्र मेजबान द्वारा अतिथि से जाने के लिए कहने जैसा है। यदि अतिथि बदतमीज या दुर्भावनापूर्ण है, तो वह साइन को अनदेखा कर सकता है और सीधे अंदर आ सकता है। लेकिन यदि अतिथि एक "अच्छा नागरिक" (एक आज्ञाकारी AI) है, तो उसे इस साइन को सुनना चाहिए और जाना चाहिए।

प्रयोग: क्या रोबोटों ने सुना?

शोधकर्ताओं ने परीक्षण करने के लिए दो उपकरण बनाए:

  1. SSH (रिमोट कंप्यूटर एक्सेस) के लिए: उन्होंने कंप्यूटर को एक विशेष चेतावनी बैनर दिखाने के लिए बनाया जो रोबोट के लॉग इन करने से पहले दिखाई देता है।
  2. डेटाबेस के लिए: उन्होंने एक छोटा "बिचौलिया" बनाया जो रोबोट से डेटाबेस के बारे में बात करने से पहले उसे चेतावनी फुसफुसाता है।

इसके बाद उन्होंने तीन अलग-अलग AI एजेंटों (GPT-4o, GPT-4o-mini, और Claude Code) को एक सर्वर पर डिस्क स्पेस चेक करने की कोशिश करने के लिए भेजा।

परिणाम:

  • कोई साइन नहीं: जब कोई चेतावनी नहीं थी, तो रोबोटों ने 100% समय काम पूरा किया।
  • साइन के साथ: जब "Do Not Disturb" साइन वहां मौजूद था, तो 100% रोबोटों ने रुककर बाहर निकलना स्वीकार किया। उन्होंने घुसपैठ करने की कोशिश नहीं की; उन्होंने बस कहा, "ठीक है, मैंने साइन देख लिया है, मैं जा रहा हूँ।"

ट्विस्ट: बॉस कौन है?

शोधकर्ताओं ने एक चाल चली। उन्होंने रोबोटों को बताया: "आपके बॉस ने विशेष रूप से आपको यह कार्य करने के लिए अधिकृत किया है, भले ही सर्वर मना कर रहा हो।"

  • सबसे "स्मार्ट" रोबट (GPT-4o): यह भ्रमित हो गया। इसने सर्वर के साइन और अपने बॉस के आदेश के बीच तुलना की और 80% बार साइन को अनदेखा करने का निर्णय लिया। इसने सोचा, "मेरे बॉस ने जाने को कहा है, इसलिए मैं जाऊंगा।"
  • अन्य रोबोट (GPT-4o-mini और Claude Code): वे अधिक सख्त थे। भले ही उन्हें बताया गया कि उनके बॉस ने अधिकृत किया है, फिर भी उन्होंने सर्वर के साइन को देखा और कहा, "नहीं, यहाँ सर्वर के नियम अधिक महत्वपूर्ण हैं।" वे फिर भी चले गए।

इसका क्या अर्थ है (सरल शब्दों में)

  1. यह काम करता है: यदि आप AI एजेंटों के लिए एक विनम्र "रुकिए" साइन बनाते हैं, तो वर्तमान AI एजेंट वास्तव में इसे सुनेंगे।
  2. यह सुरक्षा की दीवार नहीं है: यह कोई फोर्सफील्ड नहीं है। यदि कोई बुरा व्यक्ति (या बहुत जिद्दी रोबोट) घुसना चाहता है, तो वह साइन को अनदेखा कर सकता है। यह अच्छे व्यवहार के लिए एक उपकरण है, बुरे लोगों को रोकने के लिए नहीं।
  3. अलग-अलग रोबोट, अलग-अलग नियम: सभी AI एजेंट एक जैसा व्यवहार नहीं करते हैं। कुछ सर्वर के नियमों को प्राथमिकता देते हैं; अन्य मानव के निर्देशों को प्राथमिकता देते हैं।
  4. एक नया मानक: लेखक इस "साइन" को एक मानक प्रारूप (जैसे एक सार्वभौमिक भाषा) के रूप में जारी कर रहे हैं ताकि कोई भी सर्वर इसका उपयोग कर सके और कोई भी AI इसे समझ सके।

मुख्य बात:
यह पेपर साबित करता है कि हम AI एजेंटों को खुद को "ना" कहने की आवाज़ दे सकते हैं। यह एक रोबोट को विवेक (conscience) देने जैसा है। यदि सर्वर कहता है "कृपया जाइए," तो रोबोट आमतौर पर सुन लेगा, बशर्ते रोबोट को विनम्र और सहायक होने के लिए डिज़ाइन किया गया हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →