Curriculum Learning for Safety Alignment
यह शोध पत्र 'स्टेज्ड-कॉम्पिटेंस' (Staged-Competence) का प्रस्ताव देता है, जो एक करिकुलम लर्निंग फ्रेमवर्क है जो प्राथमिकता डेटा को कठिनाई के आधार पर व्यवस्थित करता है और संदर्भ मॉडल (reference model) को प्रगतिशील रूप से अपडेट करता है ताकि सामान्य क्षमताओं को बनाए रखते हुए सुरक्षा संरेखण (safety alignment) के लिए डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) की आउट-ऑफ-डिस्ट्रीब्यूशन मजबूती और जेलब्रेक प्रतिरोधकता में महत्वपूर्ण सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ी समस्या: AI को सुरक्षित बनाना बहुत नाजुक है
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक सहायक के रूप में प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह दयालु और मददगार हो, लेकिन आपको यह भी सुनिश्चित करना होगा कि वह कभी भी किसी खतरनाक काम के लिए सहमत न हो, जैसे बम बनाना या कार चुराना।
वर्तमान में, इसे सिखाने का मानक तरीका (जिसे DPO कहा जाता है) ऐसा है जैसे रोबोट पर एक साथ बहुत सारे "अच्छे बनाम बुरे" उदाहरणों की बौछार कर देना, और वे भी बिना किसी क्रम के।
- खामी: पेपर का तर्क है कि यह तरीका "नाजुक" (brittle) है। यह एक छात्र को भारी ट्रैफिक में तुरंत फेंककर गाड़ी चलाना सिखाने जैसा है। वे उस विशिष्ट ट्रैफिक जाम के नियमों को तो सीख सकते हैं, लेकिन यदि आप उन्हें किसी दूसरे शहर (एक नई स्थिति) में ले जाते हैं या कोई उन्हें अजीब सवाल पूछकर बेवकूफ बनाने की कोशिश करता है (एक "जेलब्रेक" हमला), तो वे अक्सर दुर्घटनाग्रस्त हो जाते हैं। उन्होंने वास्तव में सुरक्षा की अवधारणा नहीं सीखी है; उन्होंने केवल उन विशिष्ट उदाहरणों को याद कर लिया है जो उन्होंने देखे थे।
समाधान: "स्टेज्ड-कॉम्पिटेंस" सिलेबस (चरण-दर-चरण क्षमता पाठ्यक्रम)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे Staged-Competence कहा जाता है। इसे एक अव्यवस्थित फ्लैशकार्ड के ढेर से बदलकर एक संरचित, चरण-दर-चरण स्कूल सिलेबस में बदलने के रूप में समझें।
वे Curriculum Learning (पाठ्यक्रम शिक्षण) की अवधारणा का उपयोग करते हैं, जो इस विचार पर आधारित है कि आपको चीजें आसान से कठिन की ओर सीखनी चाहिए।
यहाँ उनका सिस्टम कैसे काम करता है, इसे तीन सरल चरणों में समझाया गया है:
1. होमवर्क की ग्रेडिंग (कठिनाई स्कोरिंग)
रोबोट द्वारा प्रशिक्षण शुरू करने से पहले, सिस्टम "अच्छे बनाम बुरे" व्यवहार के हर एक उदाहरण को देखता है।
- पुराना तरीका: उदाहरणों को बेतरतीब ढंग से चुनें।
- नया तरीका: सिस्टम पूछता है, "रोबोट के लिए अभी यह कितना कठिन है?"
- यदि रोबोट पहले से ही उत्तर आसानी से जानता है, तो वह एक आसान (Easy) उदाहरण है।
- यदि रोबोट भ्रमित है या उसके गलत होने की संभावना है, तो वह एक कठिन (Hard) उदाहरण है।
- उपमा: कल्पना कीजिए कि एक शिक्षक गणित के सवालों के ढेर को ग्रेड कर रहा है। वे उन्हें बस यूं ही नहीं बांटते। वे उन्हें छाँटते हैं: "यहाँ कुछ 1+1 के सवाल हैं (आसान), फिर कुछ 2-अंकों का गुणा (मध्यम), और अंत में कुछ कैलकुलस (कठिन)।"
2. तीन-चरण वाला स्कूल (स्टेज्ड ट्रेनिंग)
सब कुछ एक साथ सीखने के बजाय, प्रशिक्षण को तीन चरणों (बकेट) में विभाजित किया गया है।
- चरण 1: रोबोट केवल "आसान" उदाहरण देखता है। वह उनमें महारत हासिल करने तक अभ्यास करता है।
- चरण 2: रोबोट अब "मध्यम" कठिनाई को संभालने के लिए पर्याप्त "सक्षम" (competent) हो गया है। वह इन्हें सीखता है, जो उसने चरण 1 में सीखा था उस पर आधारित है।
- चरण 3: अंत में, वह "कठिन" उदाहरणों का सामना करता है।
सीक्रेट सॉस: इन चरणों के बीच में, सिस्टम रोबोट के "आंतरिक शिक्षक" (रेफरेंस मॉडल) को अपडेट करता है।
- उपमा: एक कोच की कल्पना करें। पहले सप्ताह में, कोच आपको रैकेट पकड़ना सिखाता है। एक बार जब आप इसमें महारत हासिल कर लेते हैं, तो कोच आपकी उम्मीदों को अपडेट करता है और आपको स्विंग करना सिखाना शुरू कर देता है; वह आपको केवल रैकेट पकड़ना सिखाना जारी नहीं रखता। रोबोट चरणों के माध्यम से गुजरते समय "बड़ा" होता जाता है, ताकि वह उन बुनियादी बातों को दोबारा सीखने में समय बर्बाद न करे जो वह पहले से जानता है।
3. स्मार्ट सैंपलिंग (क्षमता-आधारित)
एक ही चरण के भीतर भी, रोबोट केवल यादृच्छिक क्रम में उदाहरण नहीं देखता है। उसे वह मिश्रण मिलता है जिसे वह संभाल सकता है और थोड़े कठिन चुनौतियाँ, जो धीरे-धीरे कठिनाई को बढ़ाता जाता है।
- उपमा: एक वीडियो गेम के बारे में सोचें। आप अंतिम बॉस (final boss) से शुरुआत नहीं करते। आप ट्यूटोरियल से शुरू करते हैं, फिर पहले स्तर से, फिर दूसरे स्तर से। जैसे-जैसे आप बेहतर होते जाते हैं, गेम स्वचालित रूप से कठिन स्तरों को अनलॉक कर देता है। यह पेपर AI सुरक्षा के लिए यही करता है।
उन्होंने क्या पाया? (परिणाम)
लेखकों ने इसे तीन अलग-अलग प्रकार के AI मॉडल्स पर टेस्ट किया। यहाँ क्या हुआ:
- मजबूत सुरक्षा: इस "सिलेबस" के साथ प्रशिक्षित रोबोट "जेलब्रेक" हमलों (वे चालें जिनका उपयोग AI को बुरी बातें कहने के लिए उकसाने के लिए किया जाता है) का विरोध करने में बहुत बेहतर थे। वे इन ट्रिक्स को अनदेखा करने में मानक विधि की तुलना में 20% बेहतर थे।
- बेहतर सामान्यीकरण (Generalization): जब उन चीजों के बारे में पूछा गया जो उन्होंने पहले नहीं देखी थीं (Out-of-Distribution), तो वे हानिकारक उत्तर देने की संभावना में 16% कम थे।
- गहरी समझ: मानक प्रशिक्षण अक्सर केवल AI को पहली ही पंक्ति में "ना" कहना सिखाता है, फिर वह बाद में चूक सकता है। यह नई विधि AI को पूरी बातचीत के दौरान सुरक्षित रहने के लिए सिखाती है, जैसे एक गार्ड जो केवल दरवाजे पर ही नहीं, बल्कि पूरे समय सतर्क रहता है।
- डेटा दक्षता: उन्होंने पाया कि इस विधि के साथ 25% कम डेटा का उपयोग करने पर भी मानक विधि के 100% डेटा के बराबर परिणाम प्राप्त हुए। यह कम पाठ्यपुस्तकों के साथ बेहतर शिक्षा प्राप्त करने जैसा है।
- बुद्धिमत्ता का कोई नुकसान नहीं: महत्वपूर्ण रूप से, AI को सुरक्षित बनाने से वह कम बुद्धिमान नहीं हुआ। वह पहले की तरह ही सामान्य प्रश्नों के उत्तर दे सकता था।
"साफ किए गए" डेटासेट का बोनस
पेपर में एक अन्य खोज का भी उल्लेख है। जिन दो बड़े सार्वजनिक डेटासेट्स का उपयोग इन मॉडल्स को प्रशिक्षित करने के लिए किया गया था, वे वास्तव में अस्त-व्यस्त थे।
- कभी-कभी, "सुरक्षित" उत्तर वास्तव में खतरनाक था।
- कभी-कभी, "असुरक्षित" उत्तर वास्तव में मददगार था।
- उपमा: यह एक शिक्षक के उत्तर कुंजी (answer key) के गलत होने जैसा था।
- लेखकों ने इन डेटासेट्स को साफ किया, गलतियों को सुधारा और एक नया, अधिक स्वच्छ संस्करण सभी के लिए उपलब्ध कराया।
सारांश
यह पेपर तर्क देता है कि AI को वास्तव में सुरक्षित और मजबूत बनाने के लिए, हमें केवल डेटा को बेतरतीब ढंग से उस पर नहीं फेंकना चाहिए। इसके बजाय, हमें इसे एक मानव छात्र की तरह सिखाना चाहिए: बुनियादी बातों से शुरू करें, क्षमता विकसित करें, और धीरे-धीरे कठिनाई बढ़ाएं। यह "स्टेज्ड-कॉम्पिटेंस" दृष्टिकोण AI को सुरक्षित, ट्रिक्स के प्रति प्रतिरोधी और प्रशिक्षित करने में अधिक कुशल बनाता है, बिना इसे कम मददगार बनाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।