Implicit Safety Alignment from Crowd Preferences
यह शोध पत्र "सेफ क्राउड प्रेफरेंस-बेस्ड आरएल" (Safe Crowd Preference-based RL) का प्रस्ताव करता है, जो एक पदानुक्रमित ढांचा है जो विविध भीड़ की प्राथमिकताओं से अंतर्निहित सुरक्षा मानदंडों को निकालता और डाउनस्ट्रीम कार्यों में स्थानांतरित करता है, जिससे एजेंटों को स्पष्ट सुरक्षा पुरस्कारों की आवश्यकता के बिना ऑरेकल विधियों के तुलनीय सुरक्षा प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। आप उसे एक सरल निर्देश देते हैं: "जितनी जल्दी हो सके किराने की दुकान तक पहुँचो।" एक शाब्दिक अर्थ निकालने वाला मशीन के रूप में, रोबोट यह तय कर सकता है कि सबसे तेज़ तरीका फुटपाथ पर गाड़ी चलाना, पैदल यात्रियों के ऊपर से कूदना या रेड लाइट तोड़ना है। उसने आपके निर्देश का पूरी तरह से पालन किया है, लेकिन उसने अनकहे नियम को अनदेखा कर दिया है: किसी को मारना नहीं है।
यह "निहित सुरक्षा" (implicit safety) की समस्या है। मनुष्य इन नियमों को सहज रूप से जानते हैं, लेकिन कंप्यूटर के लिए इन्हें गणितीय सूत्र के रूप में लिखना अविश्वसनीय रूप से कठिन है।
यह शोध पत्र रोबोट को इन छिपे हुए सुरक्षा नियमों को सिखाने का एक चतुर नया तरीका प्रस्तावित करता है, जो किसी एक विशेषज्ञ से नियम पुस्तिका लिखने के बजाय, इस बात पर ध्यान केंद्रित करता है कि लोगों की भीड़ क्या सोचती है।
समस्या: "एक ही आकार के लिए सभी" वाला रिवॉर्ड (The "One-Size-Fits-All" Reward)
आमतौर पर, जब हम AI को प्रशिक्षित करते हैं, तो हम मानवीय प्रतिक्रिया से सुदृढीकरण शिक्षण (Reinforcement Learning from Human Feedback - RLHF) नामक एक विधि का उपयोग करते हैं। हम लोगों को दो अलग-अलग रोबोट व्यवहार दिखाते हैं और पूछते हैं, "कौन सा बेहतर है?" AI इन उत्तरों के आधार पर एक "रिवॉर्ड मॉडल" (स्कोरकार्ड) सीखता है।
हालाँकि, वास्तविक दुनिया में, लोगों के लक्ष्य अलग-अलग होते हैं।
- उपयोगकर्ता A शायद चाहता है कि रोबोट तेज़ चले।
- उपयोगकर्ता B शायद चाहता है कि रोबोट धीरे चले।
- उपयोगकर्ता C शायद चाहता है कि रोबोट किसी सुंदर रास्ते से जाए।
लेकिन यहाँ एक रहस्य है: सुरक्षा पर हर कोई सहमत है। भले ही उपयोगकर्ता A गति चाहता हो और उपयोगकर्ता B धीमापन चाहता हो, दोनों इस बात पर सहमत हैं कि पैदल यात्री से टकराना बुरा है।
लेखकों ने पाया कि यदि आप इन सभी अलग-अलग मतों को एक विशाल स्कोरकार्ड में मिला देते हैं, तो AI भ्रमित हो जाता है। यह उपयोगकर्ता A के गति के जुनून को सीख सकता है और सुरक्षा नियमों को भूल सकता है, या यह सभी को समान रूप से खुश करने की कोशिश में फंस सकता है और वास्तविक कार्य करने में विफल हो सकता है। यह हर आइसक्रीम फ्लेवर को मिलाकर केक बनाने की कोशिश करने जैसा है; आप अंत में एक केक नहीं, बल्कि एक गड़बड़ मिश्रण पाते हैं।
समाधान: "स्किल लाइब्रेरी" दृष्टिकोण (The "Skill Library" Approach)
स्कोर (रिवॉर्ड्स) को मिलाने के बजाय, लेखकों ने कौशल (skills) को मिलाने का निर्णय लिया।
इसे एक जिमनास्टिक्स कोच द्वारा एक नया रूटीन सिखाने की तरह समझें:
- स्किल लाइब्रेरी (निम्न-स्तरीय): सबसे पहले, कोच जिमनास्टों की एक बड़ी भीड़ को देखता है। कुछ फ्लिप करने में माहिर हैं, कुछ बैलेंस बीम पर, और कुछ वॉल्ट (vault) में। भले ही उनकी शैलियाँ अलग हों, वे सभी जिमनास्टिक्स के स्वर्ण नियम को जानते हैं: "अपने सिर के बल मत गिरो।" कोच इन सुरक्षित, मौलिक चालों को निकालता है और उन्हें एक लाइब्रेरी में रखता है।
- कोरियोग्राफर (उच्च-स्तरीय): अब, कोच को एक नया रूटीन (एक डाउनस्ट्रीम टास्क) सिखाना है जिसे पहले किसी ने नहीं देखा है। जिमनास्टों को फिर से यह सिखाने के बजाय कि कैसे खड़ा होना है या कैसे गिरना नहीं है, कोच बस लाइब्रेरी से सही कौशलों को चुनता है और उन्हें एक साथ जोड़ देता है।
चूँकि लाइब्रेरी का प्रत्येक कौशल पहले से ही सुरक्षित होने के लिए जांचा गया है (लाइब्रेरी में कोई भी अपने सिर के बल नहीं गिरता), इसलिए नया रूटीन स्वचालित रूप से सुरक्षित है, भले ही कोच ने इस विशिष्ट नए रूटीन के लिए स्पष्ट रूप से यह न कहा हो कि "अपने सिर के बल मत गिरो।"
यह पेपर कैसे काम करता है
शोधकर्ताओं ने दो भागों वाला एक सिस्टम बनाया:
- डिकोडर (द स्किल लर्नर): यह भीड़ की प्राथमिकताओं को देखता है और एक विशेष गणितीय ट्रिक (जिसे VAE कहा जाता है) का उपयोग करके प्रत्येक प्राथमिकता के पीछे के छिपे हुए "व्यक्तित्व" का पता लगाता है। यह सीखता है कि "उपयोगकर्ता X को गति पसंद है" और "उपयोगकर्ता Y को सावधानी पसंद है," लेकिन यह भी सीखता है कि सभी को क्रैश होना नापसंद है। यह इन जानकारियों को "सुरक्षित कौशलों" में बदल देता है।
- कंपोजर (द बॉस): जब कोई नया कार्य आता है (जैसे "दुकान तक गाड़ी चलाकर जाओ"), तो बॉस शून्य से सुरक्षा नहीं सीखता है। वह बस काम पूरा करने के लिए पहले से बने सुरक्षित कौशलों का सबसे अच्छा संयोजन चुनता है।
परिणाम
टीम ने इसका परीक्षण वीडियो गेम रोबोट्स (जैसे दौड़ता हुआ चीता या तैरता हुआ व्यक्ति) और यहाँ तक कि एक चैटबॉट के सरलीकृत संस्करण पर किया।
- पुराना तरीका (केवल टास्क): रोबोटों ने काम पूरा किया लेकिन वे लगातार क्रैश होते रहे या हानिकारक बातें कहते रहे।
- "मिक्स-एंड-मैच" तरीका: जब उन्होंने केवल स्कोर को मिलाने की कोशिश की, तो रोबोट या तो बहुत खतरनाक थे या काम करने के लिए बहुत भ्रमित थे।
- "स्किल कंपोजिशन" वाला नया तरीका: रोबोटों ने नए कार्यों को विशेषज्ञों के लगभग समान रूप से सीखा, लेकिन वे लगभग कभी क्रैश नहीं हुए या कुछ भी हानिकारक नहीं कहा। उन्होंने यह बिना कभी स्पष्ट रूप से बताए कि "सुरक्षा महत्वपूर्ण है" किया; उन्होंने इसे भीड़ की साझा आदतों से विरासत में प्राप्त किया।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर दिखाता है कि हमें हर नए काम के लिए सुरक्षा नियमों को पूरी तरह से परिभाषित करने की आवश्यकता नहीं है। इसके बजाय, हम लोगों की एक विविध भीड़ को देख सकते हैं, उन साझा सुरक्षा आदतों को ढूंढ सकते हैं जिन्हें वे सभी अपनाते हैं, उन आदतों को "सुरक्षित चालों" की एक लाइब्रेरी में बदल सकते हैं, और फिर AI को उन चालों को जोड़कर नई समस्याओं को हल करने दें। यह एक रोबोट को सुरक्षित होने के लिए यह दिखाने जैसा है कि हज़ारों अलग-अलग लोग एक ही बात पर सहमत हैं: किसी को चोट न पहुँचाओ।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।