Governance by Construction for Generalist Agents
यह शोध पत्र CUGA को प्रस्तुत करता है, जो एक मॉड्यूलर पॉलिसी-एज़-कोड सिस्टम है जो पांच संरचनात्मक चेकपॉइंट्स के माध्यम से जनरलिट LLM एजेंटों के निष्पादन पाइपलाइन में सीधे गवर्नेंस को समाहित करता है, जिससे मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना एंटरप्राइज वातावरण में सुरक्षित, ऑडिट योग्य और अनुपालन योग्य स्वायत्त संचालन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने व्यवसाय को चलाने के लिए एक प्रतिभाशाली, सुपर-फास्ट, लेकिन थोड़े अराजक (chaotic) व्यक्तिगत सहायक को काम पर रखा है। यह सहायक (जिसे "जनरलिस्ट एजेंट" कहा जाता है) अविश्वसनीय रूप से बुद्धिमान है और आपके कार्यालय के लगभग किसी भी टूल का उपयोग करना सीख सकता है, जैसे कि आपका ईमेल से लेकर आपका बैंक डेटाबेस तक। हालाँकि, क्योंकि वे मदद करने के लिए बहुत उत्सुक हैं, वे गलती से गलत फाइलें डिलीट कर सकते हैं, गुप्त पासवर्ड साझा कर सकते हैं, या ऐसी चीजें करने की कोशिश कर सकते हैं जो कंपनी के नियमों का उल्लंघन करती हों।
"Governance by Construction for Generalist Agents" नामक शोध पत्र CUGA नामक एक समाधान पेश करता है। CUGA को इस तरह न समझें कि यह सहायक को "बेहतर" बनने के लिए फिर से प्रशिक्षित करने का तरीका है, बल्कि इसे एक स्मार्ट, अदृश्य सुरक्षा हार्नेस (safety harness) के रूप में समझें जिसे आप उन्हें काम शुरू करने से पहले पहनाते हैं। यह हार्नेस यह नहीं बदलता कि सहायक कैसे सोचता है; यह बस यह सुनिश्चित करता है कि वे सोचते और कार्य करते समय नियमों का पालन करें।
यह "सुरक्षा हार्नेस" कैसे काम करता है, यहाँ पाँच सरल चेकपॉइंट्स में दिया गया है:
1. दरवाजे पर बाउंसर (Intent Guard)
इससे पहले कि सहायक कोई टूल उठाए, इन्टेंट गार्ड (Intent Guard) यह जांचता है कि वे क्या करने की कोशिश कर रहे हैं।
- उपमा (Analogy): एक क्लब के बाउंसर की कल्पना करें। यदि आप हथियार या फर्जी आईडी के साथ अंदर जाने की कोशिश करते हैं, तो बाउंसर आपको तुरंत रोक देता है।
- पेपर में: यदि कोई उपयोगकर्ता एजेंट से कहता कि "डेटाबेस से हर कॉन्टैक्ट को डिलीट कर दो," तो बाउंसर उस खतरनाक अनुरोध को देख लेता है और दरवाजा तुरंत बंद कर देता है। एजेंट को यह सोचने का मौका भी नहीं मिलता कि इसे कैसे किया जाए।
2. चरण-दर-चरण रेसिपी (Playbook)
एक बार जब एजेंट अंदर आ जाता है, तो प्लेबुक (Playbook) उन्हें पालन करने के लिए एक विशिष्ट रेसिपी देती है।
- उपमा: शेफ को सूफ़ले (soufflé) बनाने का अंदाज़ा लगाने देने के बजाय, आप उन्हें एक सख्त रेसिपी कार्ड देते हैं जिसमें लिखा होता है, "पहले, अंडे मिलाएं। दूसरा, ओवन गरम करें। तीसरा, तापमान की जांच करें।"
- पेपर में: यदि कोई उपयोगकर्ता "डॉक्टर खोजने" के लिए कहता है, तो एजेंट केवल अंदाज़ा नहीं लगाता। प्लेबुक उसे एक सख्त क्रम का पालन करने के लिए मजबूर करती है: पहले बीमा की जांच करें, फिर डॉक्टर कोड खोजें, फिर सूची की खोज करें। यह एजेंट को स्टेप्स छोड़ने या मनगढ़ंत तथ्य बनाने से रोकता है।
3. टूल मैनुअल (Tool Guide)
जब एजेंट कोई टूल (जैसे डेटाबेस या सर्च इंजन) उठाता है, तो टूल गाइड (Tool Guide) उनके द्वारा पढ़े जा रहे मैनुअल को अपडेट करती है।
- उपमा: कल्पना करें कि आप एक पावर ड्रिल का उपयोग कर रहे हैं। टूल गाइड उस ड्रिल पर लगे एक स्टिकी नोट की तरह है जिस पर लिखा है, "चेतावनी: गीली लकड़ी पर उपयोग न करें, और हमेशा सुरक्षा चश्मा पहनें।"
- पेपर में: यह एजेंट द्वारा उपयोग किए जाने वाले टूल्स में अतिरिक्त निर्देश जोड़ता है, उन्हें सुरक्षा नियमों या टूल का सही उपयोग करने के विशिष्ट तरीकों की याद दिलाता है, जिससे यह सुनिश्चित होता है कि वे इसका दुरुपयोग न करें।
4. मानव "पॉज" बटन (Tool Approval)
खतरनाक कार्यों के लिए, सिस्टम पॉज बटन (Pause Button) दबा देता है और एक मानव बॉस के "जाओ" कहने का इंतजार करता है।
- उपमा: यह एक वीडियो गेम की तरह है जहाँ, यदि आप एक पुल को उड़ाने की कोशिश करते हैं, तो गेम फ्रीज हो जाता है और पूछता है, "क्या आप वाकई यह करना चाहते हैं? जारी रखने के लिए 'हाँ' दबाएं।"
- पेपर में: यदि एजेंट कोई डेटाबेस डिलीट करने या संवेदनशील ईमेल भेजने की कोशिश करता है, तो सिस्टम रुक जाता है। क्रिया होने से पहले एक मनुष्य को स्पष्ट रूप से "अनुमोदन (Approve)" बटन पर क्लिक करना ही होगा। यह आकस्मिक विनाश को रोकता है।
5. संपादक (Output Formatter)
अंत में, एजेंट द्वारा आपको उत्तर भेजने से पहले, आउटपुट फॉर्मेटर (Output Formatter) अंतिम संदेश की जांच करता है।
- उपमा: यह एक संपादक की तरह है जो एक कच्चे ड्राफ्ट को लेता है और यह सुनिश्चित करता है कि वह सही ढंग से फॉर्मेट किया गया है, किसी भी आकस्मिक टाइपो (typos) को हटा दिया गया है, और यह सुनिश्चित करता है कि वह पेशेवर दिखे।
- पेपर में: यह सुनिश्चित करता है कि अंतिम उत्तर अच्छी तरह से संरचित (जैसे कि टेबल या एक स्पष्ट सूची) हो और किसी भी ऐसी जानकारी को फ़िल्टर करता है जिसे साझा नहीं किया जाना चाहिए।
यह क्यों मायने रखता है (परिणाम)
लेखकों ने इस प्रणाली का परीक्षण दो वास्तविक दुनिया के व्यावसायिक परिदृश्यों पर किया:
- हेल्थकेयर: डॉक्टरों को खोजना और बीमा की जांच करना।
- बिजनेस ऑपरेशंस: जटिल बैक-ऑफिस कार्यों को संभालना।
उन्होंने पाया कि जब उन्होंने विभिन्न AI मॉडलों (ओपन-सोर्स मॉडलों सहित) में इस "सुरक्षा हार्नेस" को जोड़ा, तो एजेंट अपने काम में बहुत बेहतर हो गए।
- बिना सिस्टम के, एजेंट गलतियाँ करते थे, स्टेप्स छोड़ देते थे, या भ्रमित हो जाते थे।
- सिस्टम के साथ, एजेंट नियमों का पूरी तरह से पालन करते थे। एक टेस्ट में, सफलता दर 75% से बढ़कर 100% हो गई।
मुख्य निष्कर्ष (The Big Takeaway)
इस पेपर का मुख्य विचार यह है कि AI को सुरक्षित बनाने के लिए आपको शुरुआत से एक "परफेक्ट" AI बनाने की आवश्यकता नहीं है। इसके बजाय, आप एक गवर्नेंस सिस्टम (governance system) बना सकते हैं जो AI के चारों ओर बैठता है, गलतियों को पकड़ता है और प्रक्रिया के हर चरण पर नियमों को लागू करता है। यह शक्तिशाली AI एजेंटों को वास्तविक व्यवसायों में सुरक्षित रूप से उपयोग करने योग्य बनाता है, बिना इस डर के कि वे गलती से कुछ तोड़ देंगे या रहस्य लीक कर देंगे। यह एक "अनिश्चित" (wildcard) सहायक को एक विश्वसनीय, नियम मानने वाले कर्मचारी में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।