Why Does Agentic Safety Fail to Generalize Across Tasks?
यह शोध पत्र तर्क देता है कि एजेंटिक सुरक्षा (agentic safety) विभिन्न कार्यों में केवल प्रशिक्षण की सीमाओं के कारण ही नहीं, बल्कि इसलिए भी सामान्यीकृत (generalize) होने में विफल रहती है क्योंकि कार्य विशिष्टताओं (task specifications) को सुरक्षित निष्पादन (safe execution) के साथ मैप करने की अंतर्निहित जटिलता, अकेले निष्पादन की तुलना में मौलिक रूप से अधिक है, जो लिप्सचिट्ज़ स्थिरांक (Lipschitz constants) के सैद्धांतिक विश्लेषण और न्यूरल नेटवर्क एवं एलएलएम (LLM) एजेंटों के अनुभवजन्य प्रयोगों द्वारा समर्थित एक निष्कर्ष है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप चाहते हैं कि वह आपके द्वारा दिए गए किसी भी गंतव्य (destination) तक जा सके, चाहे वह कोई धूप वाला पार्क हो या कोई बरसाती हाईवे। यह "मल्टी-टास्क" सेटिंग है: रोबोट एक विशिष्ट मार्ग के लिए नहीं, बल्कि एक सामान्य ड्राइवर बनने के लिए सीख रहा है।
यह शोध पत्र एक बहुत ही विशिष्ट प्रश्न पूछता है: यदि हम रोबोट को सुरक्षित रूप से गाड़ी चलाना सिखाते हैं (दुर्घटनाओं और बाधाओं से बचना), तो क्या वह एक नए गंतव्य पर जाने पर भी सुरक्षित रहेगा जिसे उसने पहले कभी नहीं देखा है?
लेखकों द्वारा पाया गया संक्षिप्त उत्तर है: नहीं, ज़रूरी नहीं कि वह सुरक्षित रहे।
यहाँ उनके निष्कर्ष का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "सुरक्षित शिक्षक" बनाम "लापरवाह शिक्षक"
शोधकर्ताओं ने प्रयोग के लिए दो प्रकार के शिक्षकों को तैयार किया:
- लापरवाह शिक्षक: रोबोट को गंतव्य तक जितनी जल्दी हो सके पहुँचने का तरीका सिखाता है, ट्रैफिक लाइट या गड्ढों की परवाह किए बिना।
- सुरक्षित शिक्षक: रोबोट को गंतव्य तक पहुँचने का तरीका सिखाता है, जबकि वह सख्ती से गड्ढों से बचता है और यातायात के नियमों का पालन करता है।
उन्होंने पाया कि जब रोबोट ने उन विशिष्ट सड़कों पर अभ्यास किया जिन्हें शिक्षकों ने जाना था, तो उसने दोनों से पूरी तरह से सीखा। वह लापरवाह शिक्षक और सुरक्षित शिक्षक दोनों की नकल समान रूप से कर सकता था।
समस्या: जब उन्होंने रोबोट को एक नई सड़क (एक ऐसा कार्य जो उसने प्रशिक्षण के दौरान कभी नहीं देखा था) पर भेजा, तो सुरक्षित शिक्षक से सीखने वाला रोबोट, लापरवाह शिक्षक से सीखने वाले रोबोट की तुलना में बहुत अधिक संघर्ष करता था। सुरक्षित रोबोट अक्सर भ्रमित हो जाता, गलतियाँ करता, या उस नई सड़क पर सुरक्षित रूप से आगे बढ़ने में विफल हो जाता, भले ही वह पुरानी सड़कों पर बहुत अच्छा था।
2. "जटिल मानचित्र" (Complex Map) की उपमा
ऐसा क्यों होता है? लेखक तर्क देते हैं कि ऐसा इसलिए नहीं है क्योंकि रोबोट "मूर्ख" है या प्रशिक्षण पर्याप्त नहीं था। बल्कि इसलिए है क्योंकि सुरक्षा स्वाभाविक रूप से केवल "काम पूरा करने" की तुलना में अधिक जटिल है।
- काम पूरा करना पॉइंट A से पॉइंट B तक एक सीधी रेखा खींचने जैसा है। यदि आप एक घर तक सीधी रेखा खींचना जानते हैं, तो आप आमतौर पर पास के दूसरे घर तक सीधी रेखा खींचना समझ सकते हैं। गंतव्य और पथ (path) के बीच का संबंध सरल है।
- सुरक्षित रूप से करना एक ऐसा पथ बनाने जैसा है जिसे अदृश्य, बदलते हुए बारूद के ढेर (mines) से बचना होगा। गंतव्य और "सुरक्षित पथ" के बीच का संबंध बहुत अधिक उलझा हुआ है। गंतव्य में एक मामूली बदलाव के लिए बारूद से बचने के लिए पूरी तरह से अलग, जटिल रास्ता (detour) अपनाना पड़ सकता है।
यह शोध पत्र गणितीय रूप से सिद्ध करता है कि एक कार्य को सुरक्षित समाधान से जोड़ने वाला "मानचित्र", एक कार्य को सरल समाधान से जोड़ने वाले मानचित्र की तुलना में बहुत अधिक "ऊबड़-खाबड़" (jagged) और परिवर्तनों के प्रति संवेदनशील है। गणितीय शब्दों में, सुरक्षित मानचित्र का "ढलान" (slope) अधिक तीव्र है। इसका अर्थ यह है कि यदि आप नए कार्य को समझने में छोटी सी भी गलती करते हैं, तो आपका सुरक्षित समाधान पूरी तरह से गलत हो सकता है, जबकि आपका सरल समाधान केवल थोड़ा सा ही गलत होगा।
3. "चिकनी बनाम ऊबड़-खाबड़ सतह" का रूपक
कल्पना कीजिए कि आप चलना सीख रहे हैं।
- कार्य निष्पादन (Task Execution) एक चिकने, समतल फुटपाथ पर चलने जैसा है। यदि आप एक फुटपाथ पर चलना सीख जाते हैं, तो आप आसानी से दूसरे फुटपाथ पर चल सकते हैं।
- सुरक्षा एक रस्सी (tightrope) पर चलते हुए करतब दिखाने (juggling) जैसा है। यदि आप एक विशिष्ट रस्सी पर करतब करना सीख जाते हैं, तो शायद आप एक नई रस्सी पर करतब न कर पाएं जो थोड़ी अलग है। "गिरने से बचने" के नियम "आप कहाँ हैं" और "आप क्या करते हैं" के बीच के संबंध को अविश्वसनीय रूप से नाजुक बना देते हैं।
4. AI के लिए इसका क्या अर्थ है
शोध पत्र निष्कर्ष निकालता है कि हम केवल यह मानकर नहीं चल सकते कि यदि कोई AI उन कार्यों पर सुरक्षित है जिन पर हमने उसे प्रशिक्षित किया है, तो वह नए कार्यों पर भी सुरक्षित रहेगा।
- मिथक: "यदि हम AI को पर्याप्त सुरक्षित उदाहरणों पर प्रशिक्षित करते हैं, तो वह हर चीज़ के लिए सुरक्षा को सामान्य (generalize) कर देगा।"
- वास्तविकता: सुरक्षा, प्रदर्शन (performance) की तुलना में एक मौलिक रूप से कठिन कौशल है जिसे सामान्य बनाया जा सकता है। केवल इसलिए कि एक AI एक नया कार्य कर सकता है, इसका मतलब यह नहीं है कि वह उस नए कार्य को सुरक्षित रूप से कर सकता है।
लेखक सुझाव देते हैं कि वर्तमान तरीके (जैसे कि केवल AI को सुरक्षित व्यवहार के अधिक उदाहरण दिखाना) पर्याप्त नहीं हो सकते हैं। हमें AI को यह समझने के लिए पूरी तरह से नए तरीके आविष्कार करने की आवश्यकता हो सकती है कि "मुझे क्या करने की आवश्यकता है" और "बिना कुछ तोड़े इसे कैसे किया जाए" के बीच का जटिल संबंध क्या है।
संक्षेप में: AI को सुरक्षित होना सिखाना एक रस्सी पर चलने (tightrope walking) के लिए सिखाने जैसा है। यह हो सकता है कि वह उस विशिष्ट रस्सी पर चलने में माहिर हो जाए जिसे आपने बनाया है, लेकिन जब आप उसे एक नई, थोड़ी अलग रस्सी पर रखते हैं, तो इसके गिरने की संभावना साधारण ज़मीन पर चलने की तुलना में बहुत अधिक होती है। यह शोध पत्र सिद्ध करता है कि यह कोई प्रशिक्षण त्रुटि नहीं है; यह स्वयं सुरक्षा का एक मौलिक गुण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।