Arbiter: Detecting Interference in LLM Agent System Prompts
यह शोध पत्र आर्बिटर (Arbiter) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो कोडिंग एजेंट सिस्टम प्रॉम्प्ट्स में हस्तक्षेप पैटर्न का पता लगाने के लिए औपचारिक नियमों को मल्टी-मॉडल एलएलएम (LLM) विश्लेषण के साथ जोड़ता है, जिससे यह पता चलता है कि प्रॉम्प्ट आर्किटेक्चर विफलता के प्रकारों को प्रभावित करता है और मल्टी-मॉडल मूल्यांकन उन विशिष्ट कमजोरियों को उजागर करता है जिन्हें सिंगल-मॉडल दृष्टिकोण द्वारा नहीं पकड़ा जा सका।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने लिए कोड लिखने के लिए एक सुपर-स्मार्ट, अविश्वसनीय रूप से तेज़ रोबोट सहायक को काम पर रखा है। आप इस रोबोट को एक विशाल निर्देश पुस्तिका (जिसे सिस्टम प्रॉम्प्ट कहा जाता है) देते हैं जो इसे बताती है कि उसे ठीक से कैसे व्यवहार करना है, किन उपकरणों का उपयोग करना है और किन नियमों का पालन करना है।
यह शोध पत्र Arbiter नामक एक नए टूल के बारे में है जो इन निर्देश पुस्तिकाओं के लिए एक "क्वालिटी कंट्रोल इंस्पेक्टर" (गुणवत्ता नियंत्रण निरीक्षक) के रूप में कार्य करता है। शोधकर्ताओं ने पाया कि हालांकि ये पुस्तिकाएं मूल रूप से सॉफ्टवेयर ही हैं, लेकिन इन्हें साधारण अंग्रेजी में लिखा जाता है और इनमें कोई सुरक्षा जांच (safety checks), कोई स्पेल-चेकर नहीं है, और उपयोग करने से पहले कोई टेस्ट रन भी नहीं किया गया है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. समस्या: "भ्रमित रोबोट" (The Confused Robot)
सिस्टम प्रॉम्प्ट को अपने रोबोट के लिए एक संविधान की तरह समझें।
- समस्या: एक सामान्य कंप्यूटर प्रोग्राम में, यदि आप दो ऐसे नियम लिखते हैं जो एक-दूसरे का विरोध करते हैं (जैसे, "हमेशा टोपी पहनें" और "कभी टोपी न पहनें"), तो कंप्यूटर क्रैश हो जाता है या एरर देता है।
- वास्तविकता: AI के साथ, रोबोट क्रैश नहीं होता। वह बस यह तय करने के लिए अपने "सबसे अच्छे अनुमान" का उपयोग करता है कि किस नियम का पालन करना है। कभी-कभी वह सही नियम चुनता है; कभी-कभी गलत। रोबोट चुपचाप संघर्ष (conflict) को अनदेखा कर देता है, जिससे अजीब व्यवहार होता है जिसे कोई देख नहीं पाता जब तक कि कुछ टूट न जाए।
- पेंच: आप रोबोट से उसके अपने मैनुअल की जांच करने के लिए नहीं कह सकते। यह एक ऐसे व्यक्ति से पूछने जैसा है जो वर्तमान में भ्रमित है कि वह क्यों भ्रमित है। वह बस इसे सहजता से दिखा देगा और काम जारी रखेगा।
2. समाधान: "Arbiter" (जासूस)
शोधकर्ताओं ने Arbiter नामक एक फ्रेमवर्क बनाया है जो एक बाहरी ऑडिटर के रूप में कार्य करता है। यह इन छिपे हुए संघर्षों को खोजने के लिए दो मुख्य रणनीतियों का उपयोग करता है:
रणनीति A: "नियम पुस्तिका की जाँच" (निर्देशित मूल्यांकन - Directed Evaluation)
यह एक सख्त शिक्षक की तरह है जो नियमों की एक विशिष्ट सूची के विरुद्ध छात्र के होमवर्क की जाँच करता है।
- यह टूल मैनुअल को टुकड़ों में तोड़ता है।
- यह विशिष्ट, ज्ञात त्रुटियों की तलाश करता है (जैसे "नियम A कहता है X, लेकिन नियम B कहता है Not X")।
- परिणाम: इसने एक मैनुअल (Claude Code) में 21 स्पष्ट विरोधाभास पाए, जिनमें से अधिकांश वहां थे जहां अलग-अलग टीमों ने ऐसे नियम लिखे थे जो आपस में बात नहीं कर रहे थे।
रणनीति B: "जिज्ञासु खोजकर्ता" (अनिर्देशित छानबीन - Undirected Scouring)
यह सबसे चतुर हिस्सा है। विशिष्ट त्रुटियों को खोजने के बजाय, यह टूल मैनुअल को कई अलग-अलग AI मॉडलों को भेजता है (जैसे 10 अलग-अलग जासूसों को एक ही रहस्य उपन्यास पढ़ने के लिए कहना) और कहता है: "बस इसे ध्यान से पढ़ें और मुझे बताएं कि क्या अजीब या दिलचस्प लगता है।"
- अलग-अलग मॉडल क्यों? ठीक वैसे ही जैसे अलग-अलग लोगों के अलग-अलग दृष्टिकोण होते हैं, अलग-अलग AI मॉडल अलग-अलग चीजें नोटिस करते हैं। एक सुरक्षा जोखिम पकड़ सकता है, जबकि दूसरा लॉजिक की गलती पकड़ सकता है।
- प्रक्रिया: दूसरा AI पहले वाले के नोट्स लेता है और उन चीजों को देखता है जो पहले वाले ने छोड़ दी थीं। वे तब तक बारी-बारी से काम करते रहते हैं जब तक कि लगातार तीन AI जासूस यह न कह दें, "मुझे कुछ भी नया नहीं दिख रहा है।"
- परिणाम: इसने 152 अजीब पैटर्न खोजे, जिनमें से कुछ वे भी थे जिन्हें सख्त नियम पुस्तिका वाली जांच मिस कर देती।
3. बड़ी खोज: आर्किटेक्चर मायने रखता है (Architecture Matters)
शोधकर्ताओं ने पाया कि मैनुअल का आकार यह निर्धारित करता है कि किस प्रकार की गलतियाँ होंगी:
- "द मोनोलिथ" (एक विशाल दीवार - The Monolith): एक विशाल, 1,500 पन्नों का दस्तावेज़ (जैसे Claude Code)।
- बग: क्योंकि यह बहुत बड़ा हो गया, इसलिए दीवार के अलग-अलग हिस्से एक-दूसरे का विरोध करते हैं। यह एक ऐसे घर की तरह है जहाँ किचन टीम ने एक ऐसा दरवाजा लगाया है जिसे बेडरूम टीम ने अंदर से लॉक कर दिया है।
- "द फ्लैट" (एक सरल सूची - The Flat): एक छोटा, 300 पन्नों का दस्तावेज़ (जैसे Codex CLI)।
- बग: यह इतना सरल है कि इसमें बहुत अधिक विरोधाभास नहीं हैं, लेकिन यह जटिल चीजें भी नहीं कर सकता। यह शक्ति के बदले सुरक्षा का सौदा करता है।
- "द मॉड्यूलर" (लेगो सेट - The Modular): एक मैनुअल जो अंतिम क्षण में असेंबल किए गए अलग-अलग कोड ब्लॉक्स से बना है (जैसे Gemini CLI)।
- बग: व्यक्तिगत ब्लॉक ठीक से काम करते हैं, लेकिन उनके कनेक्शन टूटे हुए हैं।
- वास्तविक उदाहरण: शोधकर्ताओं ने Google के Gemini CLI में एक गंभीर बग पाया। मैनुअल में "यादें सहेजने" (save memories) का एक नियम था और "इतिहास को कंप्रेस करने" (compress history) का एक नियम था। कंप्रेशन नियम ने अनजाने में "सहेजी गई यादों" को डिलीट कर दिया क्योंकि दोनों नियमों ने आपस में संवाद नहीं किया था। Google पहले ही इस बग के लक्षण (symptom) को ठीक कर चुका था, लेकिन मूल कारण (टूटा हुआ कनेक्शन) अभी भी वहीं था।
4. चौंकाने वाली लागत
सबसे आश्चर्यजनक हिस्सा इस शोध पत्र की कीमत है।
- Google, OpenAI और Anthropic के तीन प्रमुख AI सिस्टम का विश्लेषण करने के लिए, शोधकर्ताओं ने $0.27 USD (27 सेंट) खर्च किए।
- यह न्यूनतम मजदूरी के एक मिनट की लागत से भी कम है।
- सीख: हमारे पास इन AI "संविधानों" की पूरी तरह से जांच करने के उपकरण हैं जो लगभग मुफ्त हैं, लेकिन कोई ऐसा कर नहीं रहा है।
सारांश उपमा (Summary Analogy)
एक गगनचुंबी इमारत बनाने की कल्पना करें।
- वर्तमान स्थिति: हम निर्माण दल को बिना किसी आर्किटेक्ट द्वारा ब्लूप्रिंट की जांच किए, एक अव्यवस्थित अंग्रेजी में लिखा गया 1,000 पन्नों का निर्देश मैनुअल सौंप रहे हैं। यदि मैनुअल कहता है "यहाँ पुल बनाएं" और "यहाँ पुल न बनाएं," तो श्रमिक केवल अनुमान लगाते हैं।
- Arbiter की भूमिका: Arbiter उस मैनुअल को पढ़ता है, दस अलग-अलग विशेषज्ञ इंजीनियरों को खामियां खोजने के लिए कहता है, और हमें बताता है कि ब्लूप्रिंट कहाँ एक-दूसरे का विरोध करते हैं।
- परिणाम: हमने पाया कि इन मैनुअल को लिखने का तरीका विशिष्ट प्रकार की आपदाओं का कारण बनता है, और हम उन्हें एक कप कॉफी की कीमत पर ठीक कर सकते हैं।
मुख्य बात (The Bottom Line): सिस्टम प्रॉम्प्ट AI में सबसे महत्वपूर्ण सॉफ्टवेयर हैं, फिर भी वे सबसे कम टेस्ट किए गए हैं। यह शोध पत्र साबित करता है कि हम उनकी छिपी हुई खतरनाकियों को आसानी से और सस्ते में ढूंढ सकते हैं, लेकिन हमें उन्हें केवल टेक्स्ट फाइलों के रूप में नहीं, बल्कि गंभीर सॉफ्टवेयर के रूप में मानना शुरू करना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।