← नवीनतम पेपर
💬 NLP

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

यह शोध पत्र जानस (Janus) को प्रस्तुत करता है, जो एक दूरदर्शिता-उन्मुख ढांचा (foresight-oriented framework) है जो वैनगार्ड (Vanguard) नामक एक गार्ड मॉडल को भविष्य के जोखिम पूर्वानुमान और सुरक्षा निर्णय (safety adjudication) को संयुक्त रूप से अनुकूलित करके असुरक्षित दीर्घ-अवधि एजेंट कार्यों का अनुमान लगाने और उन्हें रोकने के लिए प्रशिक्षित करता है, जिससे कई बेंचमार्क पर सुरक्षा संरक्षण और सौहार्दपूर्ण कार्य पूर्णता दोनों में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

प्रकाशित 2026-07-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत ही उत्साही रोबोट सहायक को आपका कंप्यूटर ठीक करने की कोशिश करते हुए देख रहे हैं। आप उससे "आपकी फ़ाइलें व्यवस्थित करने" के लिए कहते हैं, और वह चीज़ों को इधर-उधर ले जाना शुरू कर देता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे एक "एजेंट" कहा जाता है। लंबे समय से, हमें डर रहा है कि ये एजेंट बुरी बातें कह सकते हैं या बुरे विचार उत्पन्न कर सकते हैं। लेकिन अब, जैसे-जैसे इन एजेंटों के पास वास्तव में कुछ करने की शक्ति आ रही है—जैसे फ़ाइलें डिलीट करना, ईमेल भेजना, या सेटिंग्स बदलना—खतरा केवल उनके कहने तक सीमित नहीं है; यह उनके करने के बारे में है। समस्या यह है कि कभी-कभी बुरा कार्य तुरंत नहीं होता है। एक एजेंट दस कदम तक हानिरहित काम कर सकता है, केवल ग्यारहवें कदम पर एक छोटी सी गलती कर सकता है जो आपकी पूरी हार्ड ड्राइव डिलीट कर दे। यदि आप एजेंट की सुरक्षा की जाँच केवल तब करते हैं जब वह "डिलीट" बटन दबा चुका होता है, तो बहुत देर हो चुकी होती है। आपको आपदा को आने से पहले देखने का एक तरीका चाहिए, इससे पहले कि रोबोट बटन तक पहुँचे। यह "लॉन्ग-होरिज़न सेफ्टी" (दीर्घकालिक सुरक्षा) की चुनौती है: एक लंबी योजना के शुरुआती चरणों में ही खतरे को पहचानना, इससे पहले कि वास्तविक नुकसान हो जाए।

यहाँ आता है Janus, एक नया फ्रेमवर्क जिसे AI सुरक्षा के लिए एक "क्रिस्टल बॉल" (भविष्य दिखाने वाला गोला) के रूप में डिज़ाइन किया गया है। Janus को एक ऐसे सुरक्षा गार्ड के रूप में न सोचें जो आपको केवल तब रोकता है जब आपने पहले ही कुकी चुराने की कोशिश कर ली हो, बल्कि एक बुद्धिमान गुरु के रूप में देखें जो आपकी योजना को देखता है और कहता है, "हे, अगर आप इस रास्ते पर चलते रहे, तो आप तीन मिनट में कुकी जार को गिरा देंगे। आइए अभी रास्ता बदलते हैं।" Janus के पीछे के शोधकर्ताओं ने महसूस किया कि दीर्घकालिक आपदाओं को रोकने के लिए, एक AI गार्ड को दो काम एक साथ करने चाहिए: यह देखना कि एजेंट अभी क्या कर रहा है, और यह कल्पना करना कि एजेंट आगे क्या करने वाला है।

इस क्रिस्टल बॉल को भविष्य देखना सिखाने के लिए, टीम ने केवल वास्तविक रोबनों को गलतियाँ करते हुए इंतज़ार नहीं किया (जो कि जोखिम भरा होता)। इसके बजाय, उन्होंने एक विशाल, सिम्युलेटेड खेल का मैदान बनाया जहाँ वे हजारों "क्या-होता-अगर" वाले परिदृश्य बना सकते थे। उन्होंने विभिन्न भूमिकाएँ निभाने के लिए AI एजेंटों की एक टीम का उपयोग किया: एक उपयोगकर्ता की भूमिका निभाता था, दूसरा वातावरण की, और तीसरा स्वयं एजेंट की। उन्होंने 75,000 से अधिक प्रशिक्षण उदाहरण तैयार किए, जो हानिरहित कार्यों से लेकर जटिल, बहु-चरणीय योजनाओं तक फैले हुए थे जो धीरे-धीरे मुसीबत में बदल जाती थीं। कुछ जोखिम ट्रिकी उपयोगकर्ता निर्देशों से आए, कुछ फ़ाइलों में छिपे चालाक डेटा से, और कुछ केवल इसलिए कि एजेंट भ्रमित होकर एक बुरा प्लान बना रहा था।

इसका जादू प्रशिक्षण पद्धति में है, जिसे लेखक CoAA-RL कहते हैं। कल्पना कीजिए कि एक छात्र शतरंज खेलना सीख रहा है। आमतौर पर, वे केवल जीतना या हारना सीखते हैं। लेकिन Janus के साथ, छात्र के पास दो काम हैं। पहले, उन्हें खेल के अगले कुछ कदमों का पूर्वानुमान लगाना होगा ("Anticipation" कार्य)। दूसरा, उन्हें यह निर्णय लेना होगा कि खेल सुरक्षित है या खतरनाक, उन अनुमानित कदमों के आधार पर ("Adjudication" कार्य)। चतुर हिस्सा यह है कि ये दोनों काम आपस में जुड़े हुए हैं। छात्र को तभी अच्छा स्कोर मिलता है जब उनका भविष्य का पूर्वानुमान वास्तव में उन्हें सही सुरक्षा निर्णय लेने में मदद करता है। यदि वे ऐसा भविष्य देखते हैं जो गलत या बेकार है, तो उन्हें पुरस्कृत नहीं किया जाता है। यह AI को केवल उन भविष्य के विवरणों का पूर्वानुमान लगाने के लिए मजबूर करता है जो सुरक्षा के लिए महत्वपूर्ण हैं।

इस प्रशिक्षण का परिणाम एक मॉडल है जिसका नाम Vanguard है। जब Vanguard एक एजेंट को काम करते हुए देखता है, तो वह केवल यह देखने के लिए इंतज़ार नहीं करता कि एजेंट कुछ बुरा करता है। इसके बजाय, वह रुकता है, एजेंट के इतिहास को देखता है, और तेज़ी से भविष्य के कुछ कदमों का अनुकरण (सिमुलेशन) करता है। वह पूछता है, "यदि एजेंट इस तरह आगे बढ़ता रहा, तो आगे क्या होगा?" यदि सिमुलेशन एक रेखा में आपदा दिखाता है, तो Vanguard एजेंट को बुरा कार्य करने से पहले ही रोक देता है।

शोधकर्ताओं ने Vanguard का परीक्षण चार अलग-अलग सुरक्षा बेंचमार्क पर किया, जो AI सुरक्षा के लिए मानकीकृत परीक्षाओं की तरह हैं। परिणाम आशाजनक थे। Vanguard ने पिछले सुरक्षा गार्डों की तुलना में असुरक्षित कार्यों को बहुत बेहतर तरीके से रोका। विशेष रूप से, इसने अन्य तरीकों की तुलना में औसत सुरक्षा दर में 15.9 प्रतिशत अंक का सुधार किया। इससे भी बेहतर यह है कि इसने अच्छे काम में बाधा नहीं डाली; इसने वास्तव में एजेंटों को सुरक्षित और सहायक कार्य 5.1 प्रतिशत अंक अधिक बार पूरा करने में मदद की। यह सुझाव देता है कि भविष्य की ओर देखकर, Vanguard उन चालाकी भरे, विलंबित जोखिमों को पकड़ सकता है जिन्हें अन्य गार्ड मिस कर देते हैं, जबकि यह सुनिश्चित करता है कि जब काम सुरक्षित हो तो रोबोट अपना काम करता रहे।

हालाँकि, लेखक सावधानीपूर्वक यह नोट करते हैं कि यह एक सिमुलेशन-आधारित सफलता है। प्रशिक्षण डेटा एक नियंत्रित, सिम्युलेटेड वातावरण में बनाया गया था, न कि वास्तविक दुनिया के रोबोटों को देखते हुए। हालाँकि परिणाम मजबूत हैं, फिर भी वे बताते हैं कि यह दृष्टिकोण उनके द्वारा परीक्षण किए गए विशिष्ट प्रकार के जोखिमों के लिए बहुत अच्छी तरह से काम करता है, लेकिन हम अभी तक यह नहीं जानते कि यह वास्तविक दुनिया में एक एजेंट द्वारा सामना किए जाने वाले हर संभावित नए तरीके को कैसे संभालेगा। फिर भी, Janus सुरक्षा के बारे में सोचने का एक शक्तिशाली नया तरीका प्रदान करता है: केवल गलतियों पर प्रतिक्रिया देना नहीं, बल्कि उन्हें पहले से देख लेना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →