Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems
यह शोध पत्र "कंपोजिशनल बिहेवियरल लीकेज" (CBL) को पहचानता और औपचारिक रूप देता है, जो प्रॉम्प्ट-निर्मित एजेंटिक प्रणालियों में एक सूक्ष्म विफलता मोड है जहाँ ट्रांसफॉर्मर सेल्फ-अटेंशन में आर्किटेक्चरल गैर-अलगाव के कारण एक प्रॉम्प्ट मॉड्यूल को संपादित करना अन्य मॉड्यूल के व्यवहार को चुपचाप बदल देता है, जो अनुभवजन्य परीक्षणों के माध्यम से यह प्रदर्शित करता है कि ऐसा हस्तक्षेप, हालांकि व्यक्तिगत निर्णयों के लिए अक्सर सीमा से नीचे होता है, बड़े पैमाने पर तैनाती में एक महत्वपूर्ण संचयी जोखिम पैदा करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अलग-अलग निर्देश पुस्तिकाओं (instruction manuals) को आपस में जोड़कर एक रोबोट सहायक बना रहे हैं। आपके पास "विनम्र कैसे बनें" का एक पेज है, "कर्मचारी कैसे नियुक्त करें" का दूसरा, और "कोड कैसे लिखें" का तीसरा। आप उन सभी को एक विशाल दस्तावेज़ में चिपका देते हैं और वह दस्तावेज़ रोबोट (एक AI) को पढ़ने के लिए दे देते हैं।
हर कोई यह बड़ी धारणा बनाता है: "यदि मैं 'विनम्र कैसे बनें' वाला पेज बदलता हूँ, तो इससे रोबोट के 'भर्ती करने' के कार्य करने के तरीके में अनजाने में कोई बदलाव नहीं आएगा।"
यह शोध पत्र कहता है: यह धारणा गलत है।
यहाँ शोधकर्ताओं द्वारा की गई खोजों का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "निर्देशों का रिसाव" (Instruction Bleed)
शोधकर्ता इस घटना को "इंस्ट्रक्शन ब्लीड" (या कंपोजिशनल बिहेवियरल लीकेज) कहते हैं।
AI के मस्तिष्क को एक विशाल, खुले कमरे की तरह समझें जहाँ निर्देश के सभी पन्ने फर्श पर फैले हुए हैं। एक सामान्य कंप्यूटर प्रोग्राम में, यदि आप "रसोई" वाले अनुभाग में एक नियम बदलते हैं, तो "गैरेज" वाला अनुभाग बिल्कुल वैसा ही रहता है क्योंकि वे अलग-अलग कमरों में हैं।
लेकिन AI के साथ, "कमरा" एक बड़ा खुला स्थान है। AI सब कुछ एक साथ पढ़ता है, और हर शब्द को दूसरे हर शब्द से जोड़ता है। शोधकर्ताओं ने पाया कि यदि आप चुपचाप एक ऐसा पेज संपादित करते हैं जो महत्वपूर्ण नहीं होना चाहिए (जैसे कि "भर्ती" मैनुअल में एक रैंडम रेसिपी जोड़ना), तो यह चुपचाप इस बात को बदल सकता है कि AI नौकरी के उम्मीदवारों को कैसे स्कोर देता है।
उपमा: कल्पना कीजिए कि आप एक कहानी लिख रहे हैं। यदि आप अचानक "कार मरम्मत" के अध्याय के बीच में "तीखी मिर्चों" के बारे में एक पैराग्राफ जोड़ देते हैं, तो AI अवचेतन रूप से यह सोचने लग सकता है कि कार की मरम्मत "तीखी" या "गरम" होनी चाहिए, भले ही आपने उसे ऐसा करने के लिए नहीं कहा हो। अर्थ एक अनुभाग से दूसरे अनुभाग में "रिसने" (bleed) लगता है।
2. प्रयोग: जॉब इंटरव्यू बॉट
इसे साबित करने के लिए, शोधकर्ताओं ने एक वास्तविक दुनिया के AI एजेंट का उपयोग करके एक विशिष्ट परीक्षण बनाया जिसे नौकरी के आवेदनों का मूल्यांकन करने के लिए डिज़ाइन किया गया था।
- सेटअप: उनके पास एक "फोकल" मॉड्यूल (वह हिस्सा जो यह स्कोर करता है कि एक बायोडाटा नौकरी से कितनी अच्छी तरह मेल खाता है) था।
- चाल: उन्होंने एक पूरी तरह से असंबंधित मॉड्यूल (रेसिपी का मूल्यांकन करने के नियमों का एक सेट) लिया और उसमें तीन प्रकार के बदलाव किए:
- वॉल्यूम (Volume): बस रेसिपी वाले हिस्से को लंबा बनाना।
- कंटेंट (Content): रेसिपी नियमों में एक अजीब, अप्रासंगिक चरित्र विवरण जोड़ना।
- फॉर्म (Form): शब्दों को बदले बिना रेसिपी अनुभाग में फ़ॉन्ट, इमोजी या हेडिंग बदलना।
परिणाम:
- लंबाई या फॉर्मेट (इमोजी/हेडिंग) बदलने से भर्ती के स्कोर पर कोई खास असर नहीं पड़ा।
- लेकिन, कंटेंट (वह अजीब चरित्र विवरण जोड़ना) बदलने से AI ने नौकरी के उम्मीदवारों को स्कोर देने के तरीके को व्यवस्थित रूप से बदल दिया।
- स्कोर थोड़ा बदल गया, लेकिन लगातार बदला। AI ने सबको खारिज करना या सबको नौकरी पर रखना शुरू नहीं किया; इसने बस स्कोर को थोड़ा अलग कर दिया।
3. यह क्यों महत्वपूर्ण है: "साइलेंट ड्रिफ्ट" (Silent Drift)
इस खोज का सबसे डरावना हिस्सा यह है कि किसी ने इसे होते हुए नोटिस नहीं किया।
- "सब-थ्रेशोल्ड" प्रभाव: AI ने कोई बड़ी, स्पष्ट गलती नहीं की (जैसे कि सर्जन की नौकरी के लिए एक जोकर को रखना)। इसके बजाय, इसने स्कोर को बहुत मामूली रूप से बदल दिया।
- रूपक (Metaphor): कल्पना कीजिए कि एक तराजू है जिसका उपयोग सेब तौलने के लिए किया जाना चाहिए। यदि आप कमरे के दूसरी ओर एक भारी किताब रख देते हैं (असंबंधित निर्देश), तो तराजू टूटता नहीं है, लेकिन यह हर सेब को 0.5 पाउंड भारी तौलने लगता है। आप किसी एक सेब को "फटते" या गायब होते नहीं देखेंगे, लेकिन यदि आप 1,000 सेब तौलते हैं, तो आपकी कुल इन्वेंट्री गणना गलत होगी।
- जोखिम: वास्तविक जीवन में, यदि किसी AI का उपयोग हजारों नौकरी आवेदकों को रैंक करने के लिए किया जाता है, तो ये सूक्ष्म, शांत बदलाव तय कर सकते हैं कि किसे इंटरव्यू मिलेगा और किसे खारिज किया जाएगा, भले ही AI पूरी तरह से काम करता हुआ दिखाई दे।
4. यह क्यों होता है?
शोध पत्र बताता है कि AI का आर्किटेक्चर (जिसे "ट्रांसफॉर्मर" कहा जाता है) पूरे दस्तावेज़ को एक साथ देखने के लिए डिज़ाइन किया गया है। इसके पास अलग-अलग निर्देश मॉड्यूल के बीच कोई "दीवारें" नहीं हैं।
- "बिना दीवारों वाली वास्तविकता": भले ही आप टेक्स्ट में सितारों की एक रेखा (
***) या### Hiring Rulesजैसा हेडिंग डालें, AI इसे एक सख्त सीमा के रूप में नहीं मानता है। AI के लिए, यह सब शब्दों का एक बड़ा प्रवाह है। - "मेमोरी" का मुद्दा: AI की एक सीमित "वर्किंग मेमोरी" होती है। जब आप अधिक टेक्स्ट जोड़ते हैं (भले ही वह असंबंधित हो), तो यह मूल कार्य पर पूरी तरह से ध्यान केंद्रित करने के लिए आवश्यक स्थान को कम कर देता है।
5. शोधकर्ता क्या प्रस्तावित करते हैं
यह शोध पत्र केवल समस्या की ओर इशारा नहीं करता है; यह इसे जांचने का एक नया तरीका भी प्रदान करता है।
- नया परीक्षण: किसी AI सिस्टम को लॉन्च करने से पहले, आपको केवल यह जांचना नहीं चाहिए कि यह काम करता है या नहीं। आपको यह भी जांचना चाहिए कि निर्देशों का एक हिस्सा बदलने से दूसरे हिस्से में खराबी तो नहीं आ रही है।
- "रिग्रेशन" टेस्ट: वे सुझाव देते हैं कि जब भी कोई डेवलपर एक नया निर्देश मॉड्यूल जोड़ता है, तो उन्हें पुराने मॉड्यूल्स का पुन: परीक्षण (re-test) करना चाहिए ताकि यह सुनिश्चित हो सके कि नए जुड़ाव ने "ब्लीड" (रिसाव) तो नहीं किया।
सारांश
यह शोध पत्र प्रकट करता है कि जब हम विभिन्न टेक्स्ट निर्देशों को आपस में जोड़कर AI एजेंट बनाते हैं, तो हम एक अस्थिर आधार पर निर्माण कर रहे होते हैं। निर्देशों के एक हिस्से को बदलना अन्य हिस्सों में AI के व्यवहार को चुपचाप और सूक्ष्म रूप से बदल सकता है, भले ही परिवर्तन असंबंधित प्रतीत हों। यह एक "साइलेंट ड्रिफ्ट" है जिसे वर्तमान परीक्षण विधियाँ मिस कर देती हैं, लेकिन इसके भर्ती या ऋण देने जैसे निर्णयों में वास्तविक दुनिया के परिणाम हो सकते हैं। लेखक इन अदृश्य रिसावों को पकड़ने के लिए एक नई चेकलिस्ट प्रदान करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।