← नवीनतम पेपर
🤖 AI

Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human

यह शोध पत्र तर्क देता है कि एलएलएम (LLM) एजेंटों के लिए मानवीय निरीक्षण एक संसाधन-आवंटन की समस्या है न कि एक सरल वर्गीकरण कार्य, जो मॉडलिंग और एक नई ओपन-सोर्स प्रणाली के माध्यम से यह प्रदर्शित करता है कि समीक्षक की थकान और व्यक्तिपरक असहमति एक उलटे-यू (inverted-U) सुरक्षा वक्र का निर्माण करती है जहाँ इष्टतम सुरक्षा के लिए फ्लडिंग हमलों को रोकने और मानवीय सीमाओं को ध्यान में रखते हुए एस्केलेशन दरों को 100% से नीचे कैलिब्रेट करना आवश्यक है।

मूल लेखक: Emre Turan

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Emre Turan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत तेज़, बहुत सक्षम रोबोट सहायक है जो कोड लिख सकता है, फाइलें मिटा सकता है, और इंटरनेट पर बदलाव भी कर सकता है। क्योंकि यह रोबोट वास्तविक नुकसान पहुँचा सकता है, इसलिए आपने एक "मानव गार्ड" को प्रभारी के रूप में रखा है। नियम सरल है: यदि रोबोट कुछ जोखिम भरा करना चाहता है, तो उसे रुकना होगा और मानव से पूछना होगा, "क्या यह ठीक है?"

अधिकांश लोग मानते हैं कि रोबोट जितना अधिक पूछेगा, सिस्टम उतना ही सुरक्षित होगा। वे सोचते हैं, "यदि रोबोट दिन में 500 बार पूछता है, तो मानव हर गलती को पकड़ लेगा!"

यह शोध पत्र तर्क देता है कि यह धारणा गलत है। वास्तव में, बहुत अधिक पूछने से सिस्टम वास्तव में कम सुरक्षित हो जाता है।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र के निष्कर्षों का विवरण दिया गया है:

1. "रबर स्टैम्प" की समस्या (मानव थकान)

कल्पना कीजिए कि मानव गार्ड एक व्यस्त हवाई अड्डे पर सुरक्षा गार्ड है।

  • गार्ड A दिन में 5 बैगों की जाँच करता है। वे तरोताजा, सतर्क हैं और हर एक को ध्यान से देखते हैं।
  • गार्ड B दिन में 500 बैगों की जाँच करता है। पहले 499 केवल सामान्य मोजे और शर्ट हैं। जब तक 500वां बैग आता है, गार्ड B थक चुका होता है, ऊब जाता है, और बस घर जाना चाहता है। वे बिना देखे ही सब कुछ "रबर स्टैम्प" (बिना सोचे-समझे अनुमति देना) करने लगते हैं।

शोध पत्र दिखाता है कि यदि कोई दुर्भावनापूर्ण कर्ता (एक हैकर) मासूम बैगों की एक धारा के भीतर एक खतरनाक बम छिपा देता है, तो गार्ड B इसे संभवतः मिस कर देगा क्योंकि वह थक गया है। गार्ड A, जिसने केवल 5 बैगों की जाँच की थी, उस बम को तुरंत पकड़ लेता।

सबक: अधिक निगरानी का मतलब हमेशा अधिक सुरक्षा नहीं होता। यदि आप इंसान को बहुत अधिक "क्या यह ठीक है?" वाले सवालों से थका देते हैं, तो वे ध्यान देना बंद कर देते हैं, और खतरनाक चीजें निकल जाती हैं।

2. कोई "परफेक्ट उत्तर" नहीं है (विषयपरकता)

पत्र ने यह भी देखा कि मनुष्य यह कैसे तय करते हैं कि क्या "जोखिम भरा" है। उन्होंने तीन अलग-अलग लोगों से 125 अलग-अलग कार्यों (जैसे "एक फोल्डर हटाना" या "एक प्रोग्राम इंस्टॉल करना") को लेबल करने के लिए कहा।

  • परिणाम: मनुष्य आपस में केवल आधे समय ही सहमत हुए।
  • उपमा: कल्पना कीजिए कि तीन शेफ से पूछना कि क्या सूप "बहुत नमकीन" है। एक कहता है हाँ, एक कहता है नहीं, और एक अनिश्चित है। यहाँ कोई एक "सही" उत्तर नहीं है।

इसका अर्थ यह है कि हम केवल यह नहीं कह सकते कि "गार्ड 99% सटीक है," क्योंकि तुलना करने के लिए कोई परफेक्ट स्कोरकार्ड नहीं है। "जोखिम भरा" लेबल अक्सर राय और संदर्भ का मामला होता है।

3. "स्वीट स्पॉट" (उल्टा-U वक्र)

शोधकर्ताओं ने इस संबंध को मॉडल किया कि रोबोट कितनी बार मदद मांगता है और सिस्टम वास्तव में कितना सुरक्षित है। उन्होंने पाया कि यह वक्र एक उल्टे "U" (या एक पहाड़ी) के आकार का है।

  • बहुत कम पूछना: रोबोट खुद से बहुत अधिक कार्य करता है और गलतियाँ करता है। (कम सुरक्षा)।
  • बहुत अधिक पूछना: मानव थक जाता है, देखना बंद कर देता है, और गलत चीजों पर रबर स्टैम्प लगाने लगता है। (कम सुरक्षा)।
  • स्वीट स्पॉट (सही संतुलन): एक मध्य मार्ग है। सबसे सुरक्षित सिस्टम वह है जहाँ रोबोट मदद के लिए उतना ही पूछता है जितना सुरक्षित रहने के लिए आवश्यक है, लेकिन इतना अधिक नहीं कि वह मानव को थका दे।

सबक: सबसे अच्छी सुरक्षा नीति यह नहीं है कि "हर चीज़ के लिए अनुमति मांगें।" यह है कि "उन चीज़ों के लिए अनुमति मांगें जो वास्तव में महत्वपूर्ण हैं, और आसान चीज़ों को बिना थके संभालने दें।"

4. "फ्लडिंग अटैक" (बाढ़ जैसा हमला)

पत्र ने यह भी दिखाया कि बुरे तत्व इस थकान का उपयोग हमारे खिलाफ कर सकते हैं।

  • हमला: एक हैकर 100 हानिरहित अनुरोधों की एक धारा भेजता है, जिसके बाद एक खतरनाक अनुरोध आता है।
  • परिणाम: यदि सिस्टम हर चीज़ के बारे में मानव से पूछने के लिए सेट है, तो मानव 100 हानिरहित अनुरोधों के बाद थक जाएगा और 101वें खतरनाक अनुरोध पर रबर स्टैम्प लगा देगा।
  • बचाव: यदि सिस्टम "स्मार्ट" है और केवल वास्तव में संदिग्ध चीज़ों के बारे में मानव से पूछता है (हानिरहित शोर को अनदेखा करता है), तो मानव तरोताजा रहता है और खतरनाक चीज़ को पकड़ लेता है।

सारांश कि यह शोध पत्र वास्तव में क्या करता है

यह शोध पत्र किसी नए प्रकार के रोबोट या मानव को कम थकाने के नए तरीके का आविष्कार नहीं कर रहा है। वे विचार अन्य क्षेत्रों में पहले से मौजूद हैं।

इसके बजाय, यह शोध पत्र एक मापने वाले टेप (Measuring Tape) की तरह है।

  • इसने यह मापने के लिए एक उपकरण बनाया कि कितना "पूछना" बहुत अधिक है।
  • इसने साबित किया कि मानव ध्यान एक सीमित संसाधन है, जैसे कि एक बैटरी।
  • इसने दिखाया कि यदि आप तुच्छ प्रश्नों से उस बैटरी को खाली कर देते हैं, तो सिस्टम असुरक्षित हो जाता है।

मुख्य बात:
AI एजेंटों को सुरक्षित रखने के लिए, हमें केवल समस्या पर अधिक मनुष्यों को झोंकने की आवश्यकता नहीं है। हमें इस बारे में स्मार्ट होना चाहिए कि हम उनसे कब पूछें। हमें मानव के ध्यान की रक्षा करने की आवश्यकता है ताकि जब वास्तविक खतरा आए, तो वे अभी भी "ना" कहने के लिए पर्याप्त रूप से जागृत हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →