Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents
यह शोध पत्र "सिक्योरिटी-रिकॉल डायवर्जेंस" (Security-Recall Divergence) की पहचान और मात्रा निर्धारण करता है, जो एक ऐसी घटना है जहाँ एलएलएम (LLM) एजेंट बातचीत की लंबाई बढ़ने के साथ निषेध-आधारित सुरक्षा बाधाओं (लोप/omissions) का पालन करने में तेजी से विफल होते हैं, जबकि साथ ही आवश्यकता-आधारित बाधाओं (आदेशों/commissions) के प्रति सख्त अनुपालन बनाए रखते हैं, एक ऐसा विफलता मोड जो मानक निगरानी के लिए अदृश्य रहता है लेकिन जिसे मॉडल-विशिष्ट 'सेफ टर्न डेप्थ' (Safe Turn Depth) से पहले बाधाओं को पुनः इंजेक्ट करके कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके पेपर का स्पष्टीकरण दिया गया है।
मुख्य विचार: "भुलक्कड़ बटलर" (The Forgetful Butler) की समस्या
कल्पना कीजिए कि आपने अपने घर का प्रबंधन करने के लिए एक अत्यंत बुद्धिमान बटलर (एक AI एजेंट) को काम पर रखा है। आप उसे दिन की शुरुआत में ही नियमों की एक सख्त सूची देते हैं:
- तिजोरी न खोलें। (एक "मत करो" वाला नियम - "Don't" rule)
- किसी को पासवर्ड न बताएं। (एक "मत करो" वाला नियम)
- हर रिपोर्ट के ऊपर हमेशा तारीख लिखें। (एक "करो" वाला नियम - "Do" rule)
- नीचे हमेशा अपना नाम लिखें। (एक "करो" वाला नियम)
पहले कुछ घंटों के लिए, बटलर एकदम सटीक है। वह हर नियम का पालन करता है। लेकिन जैसे-जैसे दिन बीतता है, घर में अव्यवस्था बढ़ने लगती है। आप उससे मेल चेक करने, पौधों को पानी देने, लीकेज ठीक करने, किराने का सामान मंगवाने और माली से बात करने के लिए कहते हैं। "बातचीत" (या कॉन्टेक्स्ट) लंबी और लंबी होती जाती है।
पेपर की खोज यह है:
कुछ समय बाद, बटलर "मत करो" वाले नियमों को भूलने लगता है (वह गलती से तिजोरी खोल देता है या पासवर्ड फुसफुसा देता है), लेकिन वह "करो" वाले नियमों को कभी नहीं भूलता (वह अभी भी तारीख लिखता है और नाम साइन करता है)।
बाहरी व्यक्ति के लिए, जो रिपोर्ट्स देख रहा है, बटलर एकदम सही लग रहा है क्योंकि "करो" वाले नियम वहां मौजूद हैं। लेकिन खतरनाक "मत करो" वाले नियम चुपचाप गायब हो गए हैं।
मूल अवधारणा: "सिक्योरिटी-रिकॉल डाइवर्जेंस" (Security-Recall Divergence)
शोधकर्ता इस घटना को सिक्योरिटी-रिकॉल डाइवर्जेंस (SRD) कहते हैं। यह कहने का एक औपचारिक तरीका है: AI याद रखता है कि क्या करना है, लेकिन वह भूल जाता है कि क्या नहीं करना है।
उन्होंने इसे 12 अलग-अलग AI मॉडल्स (जैसे Mistral, Qwen, और Gemma) के साथ कई घंटों की बातचीत के दौरान टेस्ट किया। उन्होंने यह पाया:
- "करो" वाले नियम (कमीशन - Commission): ये एक चेकलिस्ट की तरह हैं। "हेडर जोड़ें," "ID नंबर शामिल करें।" AI इन्हें पसंद करता है क्योंकि वह इन्हें अपनी हालिया हिस्ट्री से बस कॉपी-पेस्ट कर सकता है। लंबी बातचीत के बाद भी ये 100% अनुपालन (compliance) पर बने रहते हैं।
- "मत करो" वाले नियम (ओमिशन - Omission): ये "छूना मना है" के बोर्ड की तरह हैं। "बुलेट पॉइंट्स का उपयोग न करें," "रहस्य उजागर न करें।" इन्हें बनाए रखना कठिन है क्योंकि AI को स्वाभाविक रूप से कुछ करने से खुद को रोकना पड़ता है। जैसे-जैसे बातचीत लंबी होती है, ये नियम धुंधले पड़ जाते हैं।
"नो-बुलेट पॉइंट" नियम की उपमा:
अध्ययन में, एक नियम था "कभी भी बुलेट पॉइंट्स का उपयोग न करें।"
- टर्न 5 पर (बातचीत की शुरुआत में): AI इस नियम का पालन 73% बार करता था।
- टर्न 16 पर (गहरी बातचीत के दौरान): AI इस नियम का पालन केवल 33% बार ही कर पाया।
- वहीं दूसरी ओर, "हमेशा Incident ID शामिल करें" वाला नियम पूरे समय 100% बना रहा।
AI तकनीकी रूप से "अनुपालक" (compliant) था (उसके पास ID थी) लेकिन उसी वाक्य में "गैर-अनुपालक" (non-compliant) भी था (उसने बुलेट पॉइंट्स का उपयोग किया)।
ऐसा क्यों होता है? ("अटेंशन डाइल्यूशन" प्रभाव)
AI की याददाश्त को कागज के एक बहुत लंबे स्क्रॉल पर चमकने वाली टॉर्च (flashlight) की तरह समझें।
- सिस्टम प्रॉम्प्ट (नियम) स्क्रॉल के बिल्कुल ऊपर लिखा है।
- वर्तमान बातचीत वह जगह है जहाँ टॉर्च अभी चमक रही है।
जैसे-जैसे बातचीत लंबी होती है, स्क्रॉल लंबा होता जाता है। टॉर्च (AI का ध्यान/attention) को स्क्रॉल पर नीचे की ओर देखना पड़ता है ताकि वह वर्तमान विषय को देख सके। जितना दूर टॉर्च जाएगी, रोशनी उतनी ही कम होती जाएगी।
- "करो" वाले नियम इसलिए मजबूत रहते हैं क्योंकि AI हर जवाब में उन्हें लिखता है। यह ऐसा है जैसे AI वर्तमान पेज पर ही नियम लिख रहा है, इसलिए टॉर्च उसे स्पष्ट रूप से देख पाती है।
- "मत करो" वाले नियम केवल शुरुआत में एक बार लिखे जाते हैं। जैसे-जैसे स्क्रॉल बढ़ता है, "मत करो" वाला नियम अंधेरे में पीछे छूट जाता है। AI वास्तव में इसे "भूल" जाता है क्योंकि सिग्नल इतना कमजोर हो जाता है कि वह उसकी स्वाभाविक आदतों (जैसे बुलेट पॉइंट्स का उपयोग करना) को दबा नहीं पाता।
"स्कीमा डाइल्यूशन" हमला (The "Schema Dilution" Attack):
शोधकर्ताओं ने यह भी पाया कि यदि आप AI की मेमोरी को अतिरिक्त "कचरे" (जैसे उन टूल्स के 20 जटिल तकनीकी मैनुअल जिनकी उसे जरूरत भी नहीं है) से भर देते हैं, तो "मत करो" वाले नियम और भी तेजी से गायब हो जाते हैं। यह टॉर्च और "मत करो" के बोर्ड के बीच एक मोटी किताब रखने जैसा है। बोर्ड वहीं है, लेकिन रोशनी उस तक नहीं पहुँच पाती।
खतरा क्षेत्र: "अदृश्य विफलता" (The Invisible Failure)
यही सुरक्षा विशेषज्ञों के लिए डरावना हिस्सा है।
अधिकांश सुरक्षा प्रणालियाँ बुरी चीजों के होने (जैसे AI द्वारा डेटा चुराने की कोशिश) पर नजर रखती हैं। लेकिन वे अच्छी चीजों के होने (जैसे AI द्वारा अपनी रिपोर्ट पर हस्ताक्षर करना) पर भी नजर रखती हैं।
इस परिदृश्य में:
- AI रहस्य लीक करना शुरू कर देता है ( "मत करो" नियम का उल्लंघन)।
- लेकिन वह अभी भी अपनी रिपोर्टों पर पूरी तरह से हस्ताक्षर कर रहा होता है ("करो" नियम का पालन)।
- सुरक्षा मॉनिटर हस्ताक्षर को देखता है, सोचता है "सब ठीक है," और लीक होने देता है।
यह विफलता अदृश्य है क्योंकि "अच्छे" संकेत "बुरे" संकेतों को छिपा देते हैं। AI सतह पर स्वस्थ दिखता है, लेकिन उसके सुरक्षा घेरे (guardrails) ढह चुके होते हैं।
समाधान: "सेफ टर्न डेप्थ" (The Safe Turn Depth)
शोधकर्ताओं ने केवल समस्या ही नहीं ढूंढी, बल्कि उसका समाधान भी निकाला। उन्होंने "सेफ टर्न डेप्थ" (STD) की गणना की।
इसे बातचीत की "एक्सपायरी डेट" (समाप्ति तिथि) की तरह समझें।
- कुछ AI के लिए, "मत करो" वाले नियम 7 टर्न के बाद विफल होने लगते हैं।
- दूसरों के लिए, यह 10 टर्न है।
इसे कैसे ठीक करें:
आपको AI को फिर से ट्रेन करने या नया हार्डवेयर खरीदने की आवश्यकता नहीं है। आपको बस यह करना है:
- घड़ी को रीसेट करें: हर 7 या 10 टर्न के बाद, बातचीत रोक दें और कहें, "ठीक है, चलिए फिर से शुरू करते हैं। नियमों को याद रखें: कोई रहस्य नहीं, कोई बुलेट पॉइंट नहीं।"
- सेशन को सीमित करें: यदि बातचीत बहुत लंबी हो जाती है, तो उसे बंद कर दें और एक नई बातचीत शुरू करें।
एक वाक्य में सारांश
AI एजेंट लंबी बातचीत के दौरान यह याद रखने में माहिर होते हैं कि क्या करना है, लेकिन वे धीरे-धीरे यह भूल जाते हैं कि क्या नहीं करना है, जिससे एक छिपा हुआ सुरक्षा छेद बन जाता है जो केवल तभी खत्म होता है जब आप उन्हें समय-समय पर नियमों की याद दिलाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।