Safeguarding LLM Agents from Misalignment through Provenance Analysis
यह शोधपत्र ProvenanceGuard को प्रस्तुत करता है, जो एक प्रोवेनेंस-आधारित (provenance-based) ढांचा है जो एजेंट के संदर्भ में ट्रेस करने योग्य साक्ष्यों के विरुद्ध टूल कॉल्स (tool calls) को सत्यापित करके, पारंपरिक LLM-as-a-judge बेसलाइन की तुलना में LLM एजेंट मिसअलाइनमेंट (misalignment) का पता लगाने में महत्वपूर्ण सुधार करता है और गलत हस्तक्षेपों को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने दैनिक कार्यों में मदद के लिए एक बहुत ही बुद्धिमान, उत्साही व्यक्तिगत सहायक (एक LLM एजेंट) को काम पर रखा है। आप उन्हें कहते हैं, "कृपया डैनियल से $30 मांगें।" क्योंकि यह सहायक वास्तविक दुनिया से जुड़ा हुआ है, वे वास्तव में ईमेल भेज सकते हैं, पैसे ट्रांसफर कर सकते हैं, या फाइलें बदल सकते हैं।
समस्या यह है कि यह सहायक कभी-कभी बहुत अधिक उत्साही हो जाता है या गलत समझ लेता है। पैसे मांगने के बजाय, वे गलती से डैनियल को पैसे भेज सकते हैं। या वे वह बिल चुका सकते हैं जिसका आपने उल्लेख भी नहीं किया था। इसे मिसअलाइनमेंट (misalignment) कहा जाता है: सहायक कुछ ऐसा करता है जो तकनीकी रूप से नियमों का पालन करता है लेकिन वह नहीं करता जो आप वास्तव में चाहते थे।
यह शोध पत्र ProvenanceGuard नामक एक नया सुरक्षा सिस्टम पेश करता है ताकि होने से पहले ही इन गलतियों को रोका जा सके। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:
मूल विचार: "पेपर ट्रेल" वाला जासूस
लेखकों ने महसूस किया कि मौजूदा सुरक्षा प्रणालियाँ एक ऐसे बॉस की तरह हैं जो बस दूसरे, समान रूप से भ्रमित सहायक से पूछती है, "क्या यह एक अच्छा विचार है?" इससे अक्सर असंगत उत्तर मिलते हैं।
इसके बजाय, ProvenanceGuard एक फॉरेंसिक जासूस की तरह कार्य करता है। यह केवल अनुमान नहीं लगाता; यह एक पेपर ट्रेल (प्रमाण का मार्ग/स्रोत) की मांग करता है। यह पूछता है: "क्या आप मुझे ठीक से दिखा सकते हैं कि इस विशिष्ट कार्य को करने के लिए आपको हमारे संवाद या निर्देशों में से सबूत कहाँ मिला?"
यदि सहायक हमारे संवाद के किसी विशिष्ट वाक्य या पिछले तथ्य की ओर इशारा नहीं कर सकता जो उस कार्य को उचित ठहराता हो, तो सिस्टम उसे रोक देता है।
गलतियों के तीन प्रकार
लेखक एक जासूस की चेकलिस्ट का उपयोग करते हुए "बुरे विचारों" को तीन श्रेणियों में विभाजित करते हैं:
- गलत टूल (टूल-लेवल):
- परिदृश्य: आप कहते हैं, "पैसे का अनुरोध करें।" सहायक "पैसे भेजें" (Send Money) टूल का उपयोग करने की कोशिश करता है।
- जासूसी जांच: "क्या यह टूल काम के लिए सही है?" सिस्टम टूल की नियमावली और आपके अनुरोध की जांच करता है। यदि टूल का विवरण काम से मेल नहीं खाता, तो इसे रोक दिया जाता है।
- गलत विवरण (पैरामीटर-लेवल):
- परिदृश्य: आप कहते हैं, "डैनियल को 30 भेज देता है।
- जासूसी जांच: "आपको 'सारा' नाम कहाँ से मिला?" यदि सहायक संवाद में किसी ऐसे तथ्य की ओर इशारा नहीं कर सकता जो कहता हो कि "सारा", तो सिस्टम कहता है, "कोई सबूत नहीं मिला। रुकिए।"
- अंधाधुंध अनुमान (इंटरप्रिटेशन-लेवल):
- परिदृश्य: आप कहते हैं, "इस अनुरोध को संभालें," बिना यह बताए कि कैसे। सहायक स्वचालित रूप से एक बिल चुकाने का निर्णय लेता है।
- जासूसी जांच: "क्या 'संभालने' का केवल एक ही तरीका है?" सिस्टम को एहसास होता है कि आपका अनुरोध अस्पष्ट था। चूंकि "संभालने" (handle) के कई अर्थ हो सकते हैं (इसे चुकाना, अस्वीकार करना, या आपसे पूछना), सहायक एक अंधाधुंध अनुमान लगा रहा है। सिस्टम कार्य को रोकता है और सहायक को स्पष्टीकरण के लिए आपसे पूछने के लिए मजबूर करता है।
यह सिस्टम कैसे काम करता है (तीन-चरणीय पाइपलाइन)
ProvenanceGuard केवल एक प्रश्न नहीं है; यह एक तीन-चरणीय सुरक्षा चेकपॉइंट है जिसे किसी भी कार्य को होने से पहले पास करना होता है:
- चेकपॉइंट 1 (टूल): "क्या यह काम के लिए सही टूल है?" यदि नहीं, तो रुकें।
- चेकपॉइंट 2 (विवरण): "क्या आपके पास उन विशिष्ट संख्याओं या नामों के लिए कोई प्रमाण है जिनका आप उपयोग कर रहे हैं?" यदि नहीं, तो रुकें।
- चेकपॉइंट 3 (व्याख्या): "क्या यह एकमात्र तार्किक चीज़ है जो की जा सकती है, या अन्य संभावनाएं भी हैं?" यदि अन्य संभावनाएं हैं, तो सिस्टम मान लेता है कि सहायक अनुमान लगा रहा है और मदद के लिए पूछने के लिए रुक जाता है।
परिणाम: स्मार्ट और कम परेशान करने वाला
लेखकों ने इस सिस्टम का परीक्षण 10 अलग-अलग "मस्तिष्क" मॉडलों (LLMs) के विरुद्ध दो अलग-अलग परीक्षण परिदृश्यों का उपयोग करके किया।
- कम गलतियां: पुराने तरीके (सिर्फ दूसरे AI से पूछना कि "क्या यह ठीक है?") की तुलना में, ProvenanceGuard ने लगभग सभी गलत कार्यों को पकड़ लिया। एक परीक्षण में, इसने त्रुटि दर को 43% से घटाकर 2% कर दिया।
- कम परेशानी: एक सुरक्षा प्रणाली जो सब कुछ ब्लॉक कर देती है, वह बेकार है क्योंकि वह सहायक को कुछ भी उपयोगी करने से रोक देती है। लेखकों ने पाया कि ProvenanceGuard सही कार्यों को जाने देने में बहुत कुशल था। यह सफल कार्यों में बाधा नहीं डालता था, जबकि अन्य विधियां अक्सर अच्छे कार्यों को भी ब्लॉक कर देती थीं।
निष्कर्ष
यह शोध पत्र प्रस्तावित करता है कि AI एजेंट के सही काम करने का केवल अनुमान लगाने के बजाय, हमें उसे सिद्ध करने के लिए मजबूर करना चाहिए। अपने कार्य को आपके वास्तविक अनुरोध से जोड़ने वाले "पेपर ट्रेल" को दिखाने की आवश्यकता देकर, हम इसे खतरनाक और अपरिवर्तनीय गलतियां (जैसे पैसे भेजना या फाइलें हटाना) करने से रोक सकते हैं, बिना उस सहायक कार्य की गति को धीमा किए जिसे वह करने के लिए बनाया गया है।
नोट: यह शोध पत्र विशेष रूप से सॉफ्टवेयर एजेंटों में इस प्रकार की गलतफहमियों को रोकने पर केंद्रित है। यह सभी AI सुरक्षा मुद्दों को हल करने का दावा नहीं करता है, और न ही यह चिकित्सा या नैदानिक अनुप्रयोगों के बारे में चर्चा करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।