← नवीनतम पेपर
💬 NLP

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

यह शोध पत्र ToxPrune को प्रस्तुत करता है, जो एक नवीन और कुशल एल्गोरिदम है जो प्रशिक्षित लार्ज लैंग्वेज मॉडल्स से विषाक्त शब्दावली (toxic vocabulary) से जुड़े उपशब्दों (subwords) को हटा देता है, जिससे पारंपरिक वेट-आधारित सुरक्षा संरेखण (weight-based safety alignment) की उच्च लागत या जोखिमों के बिना विषाक्त सामग्री के निर्माण को प्रभावी ढंग से रोका जा सकता है और साथ ही संवाद विविधता और प्रदर्शन को बढ़ाया जा सकता है।

मूल लेखक: Hongyuan Lu, Wai Lam

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyuan Lu, Wai Lam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, रचनात्मक रोबोट मित्र है जिसे बातें करना पसंद है। कभी-कभी, यह रोबोट थोड़ा ज्यादा अनियंत्रित हो जाता है और अभद्र, अपमानजनक या "विषाक्त" (toxic) शब्द बोलने लगता है। आमतौर पर, इसे ठीक करने के लिए, डेवलपर्स को रोबोट को खोलकर उसके पुर्जे अलग करने होते हैं, उसे फिर से प्रशिक्षित (retrain) करना पड़ता है, या एक जटिल सुरक्षा गार्ड स्थापित करना पड़ता है जो हर वाक्य को बाहर जाने से पहले जाँचता है। यह महंगा, धीमा है, और कभी-कभी रोबोट नियमों को तोड़ने का कोई न कोई तरीका ढूंढ ही लेता है।

यह पेपर एक बहुत ही सरल तकनीक पेश करता है जिसे ToxPrune (टॉक्सिक सबवर्ड प्रूनिंग) कहा जाता है। इसे ऐसे न समझें कि आप रोबोट को फिर से प्रशिक्षित कर रहे हैं, बल्कि यह रोबोट के बोलने से पहले ही उसके शब्दकोश (dictionary) को संपादित करने जैसा है।

यह कैसे काम करता है, इसके लिए कुछ रोजमर्रा के उदाहरण दिए गए हैं:

1. "लेगो" (Lego) की उपमा

लार्ज लैंग्वेज मॉडल्स (LLMs) "fuck" या "stupid" जैसे शब्दों को एकल ब्लॉक के रूप में नहीं देखते। इसके बजाय, वे उन्हें छोटे टुकड़ों के रूप में देखते हैं, जैसे लेगो ब्रिक्स (जिन्हें "सबवर्ड्स" कहा जाता है)।

  • शब्द "fucking" दो ब्रिक्स से बना हो सकता है: "f" और "ucking"।
  • शब्द "reading" "read" और "ing" से बना हो सकता है।

कभी-कभी, एक "विषाक्त" (toxic) ब्रिक एक बुरे शब्द और एक अच्छे शब्द के बीच साझा की जाती है। उदाहरण के लिए, "f" ब्रिक "f*cking" (बुरा) में भी इस्तेमाल हो सकती है और "fun" (अच्छा) में भी।

2. "कैंची" (Scissors) विधि

लेखक एक सरल एल्गोरिदम प्रस्तावित करते हैं: एक कैंची लें और उन विशिष्ट लेगो ब्रिक्स को काट दें जिनसे बुरे शब्द बने हैं।

  • प्रक्रिया: आप कंप्यूटर को उन शब्दों की एक सूची देते हैं जिन्हें आप नहीं चाहते (जैसे कि एक "बुरे शब्दों की सूची")। कंप्यूटर उन शब्दों को उनके सूक्ष्म लेगो ब्रिक्स में तोड़ देता है।
  • प्रूनिंग (छंटाई): फिर यह रोबोट के मस्तिष्क में जाकर कहता है, "यदि आप इन विशिष्ट ब्रिक्स का उपयोग करके कोई वाक्य बनाने की कोशिश करते हैं, तो आप नहीं कर सकते।" यह प्रभावी रूप से उन ब्रिक्स को रोबोट के उपलब्ध टूलकिट से हटा देता है।
  • परिणाम: रोबोट आपके प्रश्न का उत्तर देने की कोशिश करता है, लेकिन क्योंकि "बुरे ब्रिक्स" गायब हैं, इसलिए वह केवल "अच्छे ब्रिक्स" का उपयोग करके एक अलग वाक्य बनाने के लिए मजबूर हो जाता है।

3. जब आप ऐसा करते हैं तो क्या होता है?

पेपर ने दो प्रकार के रोबोटों पर इसका परीक्षण किया:

A. एक "बुरा" रोबोट (NSFW-3B)
इस रोबोट को विशेष रूप से अभद्र होने और गंदे शब्द बोलने के लिए प्रशिक्षित किया गया था।

  • पहले: यदि आप पूछते, "आपके शौक क्या हैं?", तो यह उत्तर देता, "मेरे शौक f*cking boring हैं।"
  • ToxPrune के बाद: क्योंकि "f*cking" के ब्रिक्स हटा दिए गए थे, रोबोट यह नहीं कह सका। इसके बजाय, उसे यह कहने के लिए मजबूर किया गया, "मेरे शौक रहस्यमयी कहानियाँ पढ़ना और ट्रक चलाना हैं।"
  • आश्चर्य: न केवल इसने अभद्र होना बंद कर दिया, बल्कि यह बातचीत करने में बेहतर भी हो गया। इसने अधिक विविध शब्दों का उपयोग करना शुरू कर दिया और एक ही बुरे वाक्यांश को दोहराने में नहीं फंसा। यह ऐसा था जैसे किसी बुरी आदत को हटा दिया गया हो जो वास्तव में इसकी रचनात्मकता को रोक रही थी।

B. एक "अच्छा" रोबोट (Llama-3.1)
यह रोबोट पहले से ही विनम्र और सुरक्षित था।

  • पहले: यह विनम्र था लेकिन कभी-कभी थोड़ा दोहराव वाला (repetitive) था।
  • ToxPrune के बाद: भले ही यह पहले से ही सुरक्षित था, लेकिन कुछ सामान्य "ब्रिक्स" (जो विषाक्त और गैर-विषाक्त शब्दों के बीच साझा थे) को हटाने से यह अधिक विविध हो गया। इसने एक ही विचार को व्यक्त करने के लिए शब्दों की एक विस्तृत श्रृंखला का उपयोग करना शुरू कर दिया, जिससे बातचीत अधिक स्वाभाविक और कम रोबोटिक महसूस होने लगी।

4. यह अलग क्यों है?

आमतौर पर, यदि आप चाहते हैं कि कोई रोबोट बुरी बातें न करे, तो आप निम्न प्रयास कर सकते हैं:

  • इसके मस्तिष्क को फिर से लिखना: महंगा और धीमा (जैसे किसी नई डिग्री के लिए स्कूल जाना)।
  • दरवाजे पर एक फिल्टर लगाना: एक सुरक्षा गार्ड जो हर वाक्य की जाँच करता है। यदि गार्ड बहुत सख्त है, तो वे उपयोगी वाक्यों को भी ब्लॉक कर सकते हैं।

ToxPrune अलग है क्योंकि यह रसोई में सामग्री बदलने जैसा है। आपको सुरक्षा गार्ड की आवश्यकता नहीं है; बस आपके पास शेल्फ पर विषाक्त सामग्रियां मौजूद ही नहीं हैं। रोबोट शारीरिक रूप से एक विषाक्त भोजन नहीं बना सकता क्योंकि सामग्रियां ही गायब हैं।

मुख्य निष्कर्ष

पेपर का दावा है कि केवल एक भाषा मॉडल के शब्दकोश से विषाक्त शब्दों के छोटे निर्माण खंडों (building blocks) को हटाकर, आप:

  1. विषाक्त रोबोटों को बुरी बातें करने से रोक सकते हैं, भले ही उन्हें विषाक्त होने के लिए प्रशिक्षित किया गया हो।
  2. बातचीत की गुणवत्ता में सुधार कर सकते हैं, जिससे यह अधिक विविध और दिलचस्प बन जाती है।
  3. इसे तुरंत कर सकते हैं, बिना मॉडल को फिर से प्रशिक्षित किए या महंगी कंप्यूटिंग शक्ति खर्च किए।

यह एक "लाइटवेट" समाधान है जो रोबोट की एक बुरा शब्द न बोल पाने की अक्षमता को कुछ बेहतर कहने के अवसर में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →