← नवीनतम पेपर
💬 NLP

CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification

यह शोध पत्र CausalDetox का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो विषाक्त पीढ़ी (toxic generation) के लिए कारणत: उत्तरदायी विशिष्ट अटेंशन हेड्स की पहचान करता है और उनमें हस्तक्षेप करता है, जिसमें 'प्रोबेबिलिटी ऑफ नेसेसिटी एंड सफिशिएंसी' (PNS) का उपयोग करके भाषाई प्रवाह को बनाए रखते हुए इन्फरेंस-टाइम स्टीयरिंग और फाइन-ट्यूनिंग के माध्यम से महत्वपूर्ण विषाक्तता में कमी प्राप्त की जाती है।

मूल लेखक: Yian Wang, Yuen Chen, Agam Goyal, Hari Sundaram

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yian Wang, Yuen Chen, Agam Goyal, Hari Sundaram

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना करें जो एक अति-बुद्धिमान, अविश्वसनीय रूप से तेज़ शेफ की तरह है जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और समस्याओं को हल कर सकता है। इस शेफ ने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। समस्या क्या है? क्योंकि उन्होंने सब कुछ पढ़ लिया है, इसलिए उन्होंने कुछ बहुत ही बदतमीजी, घृणास्पद और जहरीली चीजें भी सीख ली हैं। कभी-कभी, जब आप उनसे कोई सवाल पूछते हैं, तो वे मदद करने वाले व्यंजन के बजाय गलती से एक "जहरीला व्यंजन" (घृणास्पद भाषण, अपमान या पूर्वाग्रह) परोस देते हैं।

इसे रोकने के मौजूदा तरीके ऐसे हैं जैसे किसी खराब भोजन को ठीक करने के लिए या तो:

  1. पूरा किचन ही फेंक देना: शेफ को शुरू से फिर से प्रशिक्षित करना (जो महंगा और धीमा है)।
  2. प्लेट पर फिल्टर लगाना: "बुरे" या "बदसूरत" जैसे विशिष्ट शब्दों को ब्लॉक करना (जो अक्सर वाक्य की संरचना को बिगाड़ देता है और शेफ को रोबोटिक बना देता है)।

"CausalDetox" नामक शोध पत्र एक बहुत अधिक स्मार्ट, सर्जिकल दृष्टिकोण प्रस्तावित करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "बुरे सेबों" को ढूंढना

शेफ के दिमाग के अंदर (AI मॉडल), हजारों छोटे कार्यकर्ता होते हैं जिन्हें अटेंशन हेड्स (Attention Heads) कहा जाता है। इन्हें विशेषज्ञ सू-शेफ (sous-chefs) के रूप में समझें।

  • कुछ सू-शेफ गणित में बहुत अच्छे हैं।
  • कुछ कविता में बहुत अच्छे हैं।
  • दुर्भाग्य से, कुछ वे हैं जो मुख्य शेफ के कान में घृणास्पद विचार फुसफुसाते रहते हैं।

पुराने तरीके यह अनुमान लगाने की कोशिश करते थे कि कौन से सू-शेफ बुरे हैं यह देखकर कि वे बुरे शब्दों के पास कौन है (सहसंबंध/correlation)। यह कहने जैसा है कि, "जो व्यक्ति कूड़ेदान के पास खड़ा है, वही उसे फेंक रहा होगा।" लेकिन यह हमेशा सच नहीं होता; वह बस वहां खड़ा भी हो सकता है।

2. समाधान: "आवश्यकता और पर्याप्तता" की परीक्षा

लेखकों ने PNS (Probability of Necessity and Sufficiency) नामक अवधारणा का उपयोग किया है। आइए इसे एक जासूसी कहानी में अनुवादित करें:

  • आवश्यकता (Necessity): यदि हम इस विशिष्ट सू-शेफ को हटा दें, तो क्या जहरीला व्यंजन बनना रुक जाएगा? (क्या वह जहर के लिए आवश्यक है?)
  • पर्याप्तता (Sufficiency): यदि हम केवल इस सू-शेफ को काम करने दें, तो क्या वह जहरीले व्यंजन की गारंटी देता है? (क्या वह जहर पैदा करने के लिए पर्याप्त है?)

CausalDetox उन सूक्ष्म सू-शेफों के समूह को खोजने के लिए परीक्षण करता है जो विषाक्तता के लिए दोनों रूप से आवश्यक और पर्याप्त हैं। यह उस विशिष्ट सामग्री को खोजने जैसा है जो एक केक को बम में बदल देती है। एक बार मिल जाने के बाद, वे केवल उन्हीं कुछ कार्यकर्ताओं को अलग कर देते हैं, और उन हजारों निर्दोषों को अनदेखा कर देते हैं जो गणित या कविता कर रहे हैं।

3. शेफ को ठीक करने के दो तरीके

एक बार जब वे "जहरीले सू-शेफों" की पहचान कर लेते हैं, तो वे समस्या को ठीक करने के लिए दो रणनीतियों का उपयोग करते हैं:

रणनीति A: "संदर्भ-जागरूक स्टीयरिंग व्हील" (स्थानीय हस्तक्षेप/Local Intervention)

कल्पना करें कि शेफ कार चला रहा है। कभी-कभी सड़क साफ होती है, लेकिन कभी-कभी वहां गड्ढे (एक जहरीला ट्रिगर) होते हैं।

  • पुराना तरीका: स्टीयरिंग व्हील पर एक स्थायी ब्लॉक लगाना ताकि कार कभी बाएं न मुड़ सके (वैश्विक हस्तक्षेप/Global Intervention)। यह कार को सड़क से बाहर जाने से तो रोकता है, लेकिन यह बाएं मुड़ने की क्षमता को भी कठिन बना देता है जब आपको वास्तव में इसकी आवश्यकता होती है।
  • CausalDetox का तरीका: वे ड्राइवर को एक स्मार्ट GPS देते हैं। जब कार एक विशिष्ट गड्ढे (एक विशिष्ट संदर्भ) के पास पहुँचती है, तो GPS स्टीयरिंग व्हील को बस इतना ही मोड़ता है कि गड्ढे से बचा जा सके, और फिर कार को सामान्य रूप से चलने देता है।
    • यह बेहतर क्यों है: यह गतिशील है। यह जानता है कि विषाक्तता कब और कहाँ होने की संभावना है और केवल तभी हस्तक्षेप करता है। यह बातचीत को स्वाभाविक और प्रवाहपूर्ण बनाए रखता है।

रणनीति B: "स्थायी पुन: प्रशिक्षण" (Fine-Tuning)

केवल स्टीयरिंग व्हील को हर बार धकेलने के बजाय, वे इन "जहरीले सू-शेफों" को एक विशेष प्रशिक्षण कक्ष में ले जाते हैं।

  • वे इन विशिष्ट कार्यकर्ताओं को सिखाते हैं कि उनका काम जहरीला होना नहीं है।
  • वे उन कुछ कार्यकर्ताओं के तंत्रिका पथों (neural pathways) को फिर से व्यवस्थित करते हैं ताकि "जहरीला विचार" उनसे पूरी तरह से अलग हो जाए।
  • परिणाम: शेफ स्वाभाविक रूप से सुरक्षित हो जाता है। आपको अब GPS स्टीयरिंग व्हील की आवश्यकता भी नहीं है क्योंकि बुरी आदतों को भुला दिया गया है।

4. नया "प्रशिक्षण मैदान" (PARATOX)

यह परीक्षण करने के लिए कि उनकी विधि काम करती है या नहीं, उन्हें एक आदर्श टेस्ट किचन की आवश्यकता थी। उन्होंने PARATOX नामक एक नया बेंचमार्क बनाया।

  • कल्पना करें कि उन्होंने एक जहरीला वाक्य लिया (जैसे, "तुम मूर्ख हो") और AI को इसे गैर-विषाक्त संस्करण में फिर से लिखने के लिए कहा जिसका अर्थ बिल्कुल वही हो लेकिन वह विनम्र हो (जैसे, "आप गलती कर रहे हैं")।
  • यह एक "पहले और बाद के" जोड़े का निर्माण करता है। यह एक गंदे कमरे और एक साफ कमरे की अगल-बगल की फोटो रखने जैसा है। यह उन्हें यह देखने की अनुमति देता है कि उनका "सफाई दल" (CausalDetox) बिना फर्नीचर (अर्थ) बदले कितनी अच्छी तरह काम कर रहा है।

परिणाम: यह क्यों मायने रखता है

शोध पत्र दिखाता है कि CausalDetox एक गेम-चेंजर है:

  • यह अधिक स्वच्छ है: यह पिछले तरीकों की तुलना में काफी अधिक विषाक्तता को हटा देता है (5% तक बेहतर)।
  • यह अधिक सहज है: शेफ रोबोटिक नहीं लगता। वाक्य अभी भी स्वाभाविक रूप से बहते हैं क्योंकि उन्होंने पूरे किचन को नहीं रोका, केवल खराब सामग्रियों को हटाया है।
  • यह तेज़ है: बुरे सू-शेफों को खोजना पुराने तरीकों की तुलना में 7 गुना तेज़ है।
  • यह सुरक्षित है: यह गणित या तर्क करने की शेफ की क्षमता को नहीं तोड़ता है; यह केवल बुरे व्यवहार को लक्षित करता है।

संक्षेप में

पूरे इंटरनेट को प्रतिबंधित करने या शेफ के पूरे मस्तिष्क को फिर से लिखने के बजाय, CausalDetox एक सर्जन की तरह कार्य करता है। यह उन सटीक सूक्ष्म कोशिकाओं की पहचान करता है जो बीमारी (विषाक्तता) का कारण बनती हैं, उन्हें हटा देता है या पुन: प्रोग्राम करता है, और शरीर के बाकी हिस्से (AI) को पूरी तरह से, स्वाभाविक रूप से और सुरक्षित रूप से कार्य करना जारी रखने देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →