Toxic Subword Pruning for Dialogue Response Generation on Large Language Models
यह शोध पत्र ToxPrune को प्रस्तुत करता है, जो एक नवीन और कुशल एल्गोरिदम है जो प्रशिक्षित लार्ज लैंग्वेज मॉडल्स से विषाक्त शब्दावली (toxic vocabulary) से जुड़े उपशब्दों (subwords) को हटा देता है, जिससे पारंपरिक वेट-आधारित सुरक्षा संरेखण (weight-based safety alignment) की उच्च लागत या जोखिमों के बिना विषाक्त सामग्री के निर्माण को प्रभावी ढंग से रोका जा सकता है और साथ ही संवाद विविधता और प्रदर्शन को बढ़ाया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, रचनात्मक रोबोट मित्र है जिसे बातें करना पसंद है। कभी-कभी, यह रोबोट थोड़ा ज्यादा अनियंत्रित हो जाता है और अभद्र, अपमानजनक या "विषाक्त" (toxic) शब्द बोलने लगता है। आमतौर पर, इसे ठीक करने के लिए, डेवलपर्स को रोबोट को खोलकर उसके पुर्जे अलग करने होते हैं, उसे फिर से प्रशिक्षित (retrain) करना पड़ता है, या एक जटिल सुरक्षा गार्ड स्थापित करना पड़ता है जो हर वाक्य को बाहर जाने से पहले जाँचता है। यह महंगा, धीमा है, और कभी-कभी रोबोट नियमों को तोड़ने का कोई न कोई तरीका ढूंढ ही लेता है।
यह पेपर एक बहुत ही सरल तकनीक पेश करता है जिसे ToxPrune (टॉक्सिक सबवर्ड प्रूनिंग) कहा जाता है। इसे ऐसे न समझें कि आप रोबोट को फिर से प्रशिक्षित कर रहे हैं, बल्कि यह रोबोट के बोलने से पहले ही उसके शब्दकोश (dictionary) को संपादित करने जैसा है।
यह कैसे काम करता है, इसके लिए कुछ रोजमर्रा के उदाहरण दिए गए हैं:
1. "लेगो" (Lego) की उपमा
लार्ज लैंग्वेज मॉडल्स (LLMs) "fuck" या "stupid" जैसे शब्दों को एकल ब्लॉक के रूप में नहीं देखते। इसके बजाय, वे उन्हें छोटे टुकड़ों के रूप में देखते हैं, जैसे लेगो ब्रिक्स (जिन्हें "सबवर्ड्स" कहा जाता है)।
- शब्द "fucking" दो ब्रिक्स से बना हो सकता है: "f" और "ucking"।
- शब्द "reading" "read" और "ing" से बना हो सकता है।
कभी-कभी, एक "विषाक्त" (toxic) ब्रिक एक बुरे शब्द और एक अच्छे शब्द के बीच साझा की जाती है। उदाहरण के लिए, "f" ब्रिक "f*cking" (बुरा) में भी इस्तेमाल हो सकती है और "fun" (अच्छा) में भी।
2. "कैंची" (Scissors) विधि
लेखक एक सरल एल्गोरिदम प्रस्तावित करते हैं: एक कैंची लें और उन विशिष्ट लेगो ब्रिक्स को काट दें जिनसे बुरे शब्द बने हैं।
- प्रक्रिया: आप कंप्यूटर को उन शब्दों की एक सूची देते हैं जिन्हें आप नहीं चाहते (जैसे कि एक "बुरे शब्दों की सूची")। कंप्यूटर उन शब्दों को उनके सूक्ष्म लेगो ब्रिक्स में तोड़ देता है।
- प्रूनिंग (छंटाई): फिर यह रोबोट के मस्तिष्क में जाकर कहता है, "यदि आप इन विशिष्ट ब्रिक्स का उपयोग करके कोई वाक्य बनाने की कोशिश करते हैं, तो आप नहीं कर सकते।" यह प्रभावी रूप से उन ब्रिक्स को रोबोट के उपलब्ध टूलकिट से हटा देता है।
- परिणाम: रोबोट आपके प्रश्न का उत्तर देने की कोशिश करता है, लेकिन क्योंकि "बुरे ब्रिक्स" गायब हैं, इसलिए वह केवल "अच्छे ब्रिक्स" का उपयोग करके एक अलग वाक्य बनाने के लिए मजबूर हो जाता है।
3. जब आप ऐसा करते हैं तो क्या होता है?
पेपर ने दो प्रकार के रोबोटों पर इसका परीक्षण किया:
A. एक "बुरा" रोबोट (NSFW-3B)
इस रोबोट को विशेष रूप से अभद्र होने और गंदे शब्द बोलने के लिए प्रशिक्षित किया गया था।
- पहले: यदि आप पूछते, "आपके शौक क्या हैं?", तो यह उत्तर देता, "मेरे शौक f*cking boring हैं।"
- ToxPrune के बाद: क्योंकि "f*cking" के ब्रिक्स हटा दिए गए थे, रोबोट यह नहीं कह सका। इसके बजाय, उसे यह कहने के लिए मजबूर किया गया, "मेरे शौक रहस्यमयी कहानियाँ पढ़ना और ट्रक चलाना हैं।"
- आश्चर्य: न केवल इसने अभद्र होना बंद कर दिया, बल्कि यह बातचीत करने में बेहतर भी हो गया। इसने अधिक विविध शब्दों का उपयोग करना शुरू कर दिया और एक ही बुरे वाक्यांश को दोहराने में नहीं फंसा। यह ऐसा था जैसे किसी बुरी आदत को हटा दिया गया हो जो वास्तव में इसकी रचनात्मकता को रोक रही थी।
B. एक "अच्छा" रोबोट (Llama-3.1)
यह रोबोट पहले से ही विनम्र और सुरक्षित था।
- पहले: यह विनम्र था लेकिन कभी-कभी थोड़ा दोहराव वाला (repetitive) था।
- ToxPrune के बाद: भले ही यह पहले से ही सुरक्षित था, लेकिन कुछ सामान्य "ब्रिक्स" (जो विषाक्त और गैर-विषाक्त शब्दों के बीच साझा थे) को हटाने से यह अधिक विविध हो गया। इसने एक ही विचार को व्यक्त करने के लिए शब्दों की एक विस्तृत श्रृंखला का उपयोग करना शुरू कर दिया, जिससे बातचीत अधिक स्वाभाविक और कम रोबोटिक महसूस होने लगी।
4. यह अलग क्यों है?
आमतौर पर, यदि आप चाहते हैं कि कोई रोबोट बुरी बातें न करे, तो आप निम्न प्रयास कर सकते हैं:
- इसके मस्तिष्क को फिर से लिखना: महंगा और धीमा (जैसे किसी नई डिग्री के लिए स्कूल जाना)।
- दरवाजे पर एक फिल्टर लगाना: एक सुरक्षा गार्ड जो हर वाक्य की जाँच करता है। यदि गार्ड बहुत सख्त है, तो वे उपयोगी वाक्यों को भी ब्लॉक कर सकते हैं।
ToxPrune अलग है क्योंकि यह रसोई में सामग्री बदलने जैसा है। आपको सुरक्षा गार्ड की आवश्यकता नहीं है; बस आपके पास शेल्फ पर विषाक्त सामग्रियां मौजूद ही नहीं हैं। रोबोट शारीरिक रूप से एक विषाक्त भोजन नहीं बना सकता क्योंकि सामग्रियां ही गायब हैं।
मुख्य निष्कर्ष
पेपर का दावा है कि केवल एक भाषा मॉडल के शब्दकोश से विषाक्त शब्दों के छोटे निर्माण खंडों (building blocks) को हटाकर, आप:
- विषाक्त रोबोटों को बुरी बातें करने से रोक सकते हैं, भले ही उन्हें विषाक्त होने के लिए प्रशिक्षित किया गया हो।
- बातचीत की गुणवत्ता में सुधार कर सकते हैं, जिससे यह अधिक विविध और दिलचस्प बन जाती है।
- इसे तुरंत कर सकते हैं, बिना मॉडल को फिर से प्रशिक्षित किए या महंगी कंप्यूटिंग शक्ति खर्च किए।
यह एक "लाइटवेट" समाधान है जो रोबोट की एक बुरा शब्द न बोल पाने की अक्षमता को कुछ बेहतर कहने के अवसर में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।