← नवीनतम पेपर
🤖 AI

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

यह शोध पत्र RAIL Guard को प्रस्तुत करता है, जो एक क्लोज्ड-लूप जिम्मेदार एआई पाइपलाइन है जो आठ आयामों में एलएलएम (LLM) एजेंट आउटपुट का पुनरावृत्ति रूप से मूल्यांकन और उपचार करती है, यह प्रदर्शित करते हुए कि फीडबैक-संचालित स्व-मरम्मत न्यूनतम उपयोगिता हानि के साथ उच्च अभिसरण प्राप्त करती है जबकि यह पहचानती है कि पारदर्शिता और जवाबदेही जैसे संरचनात्मक मुद्दों के लिए एल्गोरिदम के बजाय आर्किटेक्चरल समाधानों की आवश्यकता होती है।

मूल लेखक: Sumit Verma, Pritam Prasun, Pritish Kumar

प्रकाशित 2026-07-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sumit Verma, Pritam Prasun, Pritish Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक सहायक बनने के लिए सिखा रहे हैं। आप उसे ज्ञान से भरा एक मस्तिष्क देते हैं, लेकिन आपको यह भी सुनिश्चित करना होगा कि वह गलती से कुछ बुरा न कह दे, कोई रहस्य उजागर न कर दे, या कुछ खतरनाक करने की कोशिश न करे। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "रिस्पॉन्सिबल एआई" (Responsible AI) कहा जाता है। लंबे समय तक, रोबोट को सुरक्षित रखने का तरीका बहुत सरल था: यदि रोबोट ने कुछ गलत कहा, तो एक सुरक्षा गार्ड उस पर "STOP" का साइन लगा देता था, उत्तर को कचरे में फेंक देता था, और रोबोट को फिर से शुरू करने के लिए कहता था। यह एक शिक्षक की तरह है जो छात्र से कहता है, "तुम्हारा उत्तर गलत है, जाओ कोने में बैठो और फिर से कोशिश करो," बिना कभी यह समझाए कि वह क्यों गलत था या उसे कैसे ठीक किया जाए। यह काम तो करता है, लेकिन यह धीमा, निराशाजनक और बहुत अधिक ऊर्जा बर्बाद करने वाला है। बड़ा सवाल जो वैज्ञानिक अब पूछ रहे हैं वह यह है कि: केवल खराब उत्तर को फेंकने के बजाय, क्या हम वास्तव में रोबोट को अपनी गलती सुधारने और गलती से सीखते हुए दोबारा प्रयास करने में मदद कर सकते हैं?

यही वह समस्या है जिसे 'रिस्पॉन्सिबल एआई लैब्स' (Responsible AI Labs) की टीम ने अपने नए सिस्टम, जिसे RAIL Guard कहा जाता है, के साथ हल करने की कोशिश की है। वे देखना चाहते थे कि क्या वे एक "क्लोज्ड-लूप" (closed-loop) पाइपलाइन बना सकते हैं—एक ऐसा सुरक्षा जाल जो न केवल खराब आउटपुट को पकड़ता है बल्कि सक्रिय रूप से रोबोट को तब तक उसे फिर से लिखने में मदद करता है जब तक कि वह सुरक्षित और उपयोगी न हो जाए। उन्होंने इसे चार सबसे उन्नत एआई मॉडल्स (ओपनएआई, एंथ्रोपिक और गूगल के वर्ज़न सहित) पर हजारों अलग-अलग परिदृश्यों में परखा, कोडिंग लिखने से लेकर बैंक खातों को मैनेज करने तक।

यहाँ उन्हें क्या पता चला। सबसे पहले, उन्होंने पाया कि पुराना "रुको-और-दोबारा-कोशिश-करो" (stop-and-retry) वाला तरीका वास्तव में काफी अक्षम है। जब उन्होंने पारंपरिक तरीके का उपयोग किया, जिसमें केवल खराब उत्तरों को ब्लॉक कर दिया जाता था और एआई को बिना किसी हिंट के फिर से प्रयास करने के लिए कहा जाता था, तो वह केवल 49.1% बार ही समस्या को ठीक कर पाया। यह एक छात्र से बिना किसी संकेत के तीन बार सही उत्तर का अनुमान लगाने के लिए कहने जैसा था; अंततः वे भाग्यशाली हो सकते हैं, लेकिन अक्सर वे विफल ही होते रहते हैं।

हालाँकि, जब उन्होंने अपने नए RAвILL Guard सिस्टम पर स्विच किया, तो परिणाम क्रांतिकारी रहे। केवल "नहीं" कहने के बजाय, सिस्टम एक मददगार ट्यूटर की तरह काम करने लगा। इसने आठ अलग-अलग श्रेणियों (जैसे निष्पक्षता, सुरक्षा और ईमानदारी) में एआई के उत्तर का विश्लेषण किया, एआई को बताया कि कौन से हिस्से गलत थे, और फिर उसे उत्तर फिर से लिखने के लिए कहा। इस "मूल्यांकन-पुनर्लेखन-पुनर्मूल्यांकन" (evaluate-rewrite-reevaluate) लूप के साथ, सिस्टम ने समस्याओं को ठीक करने में 96.9% सफलता दर हासिल की। यह एक शिक्षक के चिल्लाने "गलत!" और एक शिक्षक के कहने, "तुम्हारी गणित सही है, लेकिन तुम्हारा लहजा रूखा था; इसे विनम्रता से बोलने की कोशिश करो," और फिर छात्र को सही करते हुए देखने के बीच का अंतर है।

लेकिन इसमें एक पेच था। पेपर सुझाव देता है कि जबकि यह "ट्यूटर" दृष्टिकोण सुरक्षा संबंधी मुद्दों को ठीक करने में अद्भुत था, इसने कभी-कभी उत्तरों को कम उपयोगी या कम मददगार बना दिया। जब सिस्टम ने एआई को अपने उत्तरों को आक्रामक रूप से फिर से लिखने के लिए मजबूर किया, तो सलाह की गुणवत्ता लगभग 22.3% गिर गई। यह ऐसा था जैसे रोबोट इतना चिंतित हो गया कि वह विनम्र और सुरक्षित रहे, कि वह दिलचस्प बनना ही भूल गया। शोधकर्ताओं ने एक बीच का रास्ता भी खोजा: यदि वे एआई को फीडबैक का उपयोग करके अपनी गलतियों को खुद ठीक करने देते हैं (एक विधि जिसे "सेल्फ-रिपेयर" कहा जाता है), तो वह अपनी उपयोगिता खोए बिना 86.6% समस्याओं को ठीक कर सकता था।

अध्ययन ने कुछ गहरे, संरचनात्मक मुद्दों को भी उजागर किया जिन्हें कोई भी पुनर्लेखन ठीक नहीं कर सकता था। उन्होंने पाया कि तीन विशिष्ट क्षेत्र—पारदर्शिता (जानकारी कहाँ से आती है यह समझाना), जवाबदेही (यह स्वीकार करना कि एआई ही बोल रहा है), और समावेशिता (यह सुनिश्चित करना कि हर कोई शामिल महसूस करे)—लगभग हर बार विफल रहे, जिनकी विफलता दर 82.5% और 93.0% के बीच थी। पेपर का तर्क है कि ये केवल "खराब उत्तर" नहीं हैं जिन्हें पुनर्लेखन से ठीक किया जा सके; ये रोबोट के ब्लूप्रिंट में एक दोष की तरह हैं। इन्हें ठीक करने के लिए, आपको केवल आउटपुट को बदलने की नहीं, बल्कि एआई के आर्किटेक्चर को बदलने की आवश्यकता है।

अंत में, टीम ने देखा कि क्या होता है जब इन एआई एजेंटों को चीजें करने के लिए टूल्स मिलते हैं, जैसे ईमेल भेजना या फाइलें स्थानांतरित करना। उन्होंने पाया कि केवल संदेश के टेक्स्ट की जांच करना पर्याप्त नहीं था। एक एआई कह सकता है, "मैं उस फाइल को डिलीट नहीं करूँगा," लेकिन फिर भी चुपके से उसे डिलीट कर सकता है। कार्यों (actions) को होने से पहले ही जाँचकर, उन्होंने असुरक्षित टूल निष्पादन को 33% कम कर दिया। दिलचस्प बात यह है कि उन्होंने देखा कि अलग-अलग एआई मॉडल अलग-अलग व्यवहार करते हैं; कुछ स्वाभाविक रूप से टेक्स्ट में बुरे अनुरोधों को मना करने में बेहतर होते हैं, जबकि अन्य को गलतियाँ करने से रोकने के लिए एक सख्त "प्री-एक्शन" (pre-action) चेक की आवश्यकता होती है।

संक्षेप में, यह पेपर सुझाव देता है कि सुरक्षित एआई का भविष्य गलतियों को रोकने के लिए बड़ी दीवारें बनाने के बारे में नहीं है, बल्कि बेहतर फीडबैक लूप बनाने के बारे में है जो एआई को सीखने और खुद को सुधारने में मदद करते हैं। भले ही हम सब कुछ एक साधारण पुनर्लेखन से ठीक नहीं कर सकते, हम निश्चित रूप से अपने एआई सहायकों को सुरक्षित, स्मार्ट और अधिक उपयोगी बनाकर, त्रुटि को पकड़ने और उसे ठीक करने के बीच के अंतर को पाट सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →