Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models
यह शोध पत्र एक विधि प्रस्तुत करता है जिसे ड्यूल लॉजिट कैलिब्रेशन (Dual Logit Calibration) के साथ कन्वर्जेंट-डाइवर्जेंट रूटिंग (Convergent-Divergent Routing) कहा जाता है, ताकि बड़े भाषा मॉडलों की सामान्य क्षमताओं को संरक्षित करते हुए उन्हें उपयोगितावाद (utilitarianism) या कर्तव्यवाद (deontology) जैसे विशिष्ट नैतिक ढांचों की ओर निर्देशित करके उनके नैतिक तर्क पर सूक्ष्म-स्तरीय, व्याख्यात्मक नियंत्रण प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, हलचल भरे ट्रेन स्टेशन के रूप में करें। इस स्टेशन के भीतर, हजारों ट्रेनें (डेटा पाथवे) लगातार चल रही हैं, जो यह तय करने के लिए सूचना ले जा रही हैं कि AI को आगे क्या कहना चाहिए। आमतौर पर, ये ट्रेनें जटिल तरीकों से आपस में मिलती और अलग होती हैं, और AI का "नैतिक दिशा-सूचक" (moral compass) उन सभी अलग-अलग विचारों का एक धुंधला मिश्रण होता है जिन्हें उसने कभी पढ़ा है।
कभी-कभी, हम चाहते हैं कि AI एक सख्त नियम मानने वाले (Deontology) की तरह व्यवहार करे, और कभी-कभी हम चाहते हैं कि वह "अधिकतम लोगों के लिए अधिकतम भलाई" के कैलकुलेटर (Utilitarianism) की तरह काम करे। समस्या यह है कि AI की सोच बदलने के मौजूदा तरीके एक लाउडस्पीकर के ऊपर से निर्देश चिल्लाने या एक विशाल, कुंद लीवर से पूरे ट्रेन स्टेशन को मोड़ने की कोशिश करने जैसा है। यह अनिश्चित है, अक्सर अन्य चीजों को खराब कर देता है, और आप वास्तव में कभी नहीं जान पाते कि AI आपकी कितनी बात सुन रहा है।
यह शोध पत्र AI की नैतिक तर्क क्षमता को नियंत्रित करने का एक नया, सर्जिकल तरीका पेश करता है जिसे कन्वर्जेंट-डाइवर्जेंट रूटिंग (CDR) कहा जाता है। यह कैसे काम करता है, इसके सरल चरण यहाँ दिए गए हैं:
1. "स्विचिंग पॉइंट्स" को खोजना (ब्रांच पॉइंट्स)
शोधकर्ताओं ने पाया कि AI के मस्तिष्क के भीतर कुछ विशिष्ट स्थान हैं जहाँ "नियम-मानने वाले" ट्रेन ट्रैक और "कैलकुलेटर" ट्रेन ट्रैक कुछ समय के लिए साथ-साथ चलते हैं, और फिर अलग हो जाते हैं।
- उपमा: कल्पना कीजिए कि एक हाईवे है जहाँ "न्यूयॉर्क" जाने वाली कारों और "बोस्टन" जाने वाली कारों के लिए लेन कुछ समय तक साझा है। फिर, वे एक विशिष्ट एग्जिट रैंप पर पहुँचते हैं जहाँ सड़क विभाजित हो जाती है।
- नवाचार: पूरे हाईवे को मोड़ने की कोशिश करने के बजाय, शोधकर्ताओं ने AI की परतों के भीतर इन सटीक विभाजन बिंदुओं को खोज लिया। वे इन्हें "ब्रांच पॉइंट्स" कहते हैं।
2. "गेटकीपर" रणनीति (बाइनरी कंट्रोल)
एक बार जब उन्होंने विभाजन को खोज लिया, तो उन्होंने वहां एक साधारण गेट स्थापित कर दिया।
- उपमा: यदि आप चाहते हैं कि AI एक "नियम-मानने वाला" बने, तो वे बस विभाजन बिंदु पर "कैलकुलेटर" वाले रास्ते का गेट बंद कर देते हैं। "नियम-मानने वाले" की ट्रेनें चलती रहती हैं, लेकिन "कैलकुलेटर" की ट्रेनों को उस विशिष्ट खंड में प्रवेश करने से रोक दिया जाता है।
- परिणाम: यह अकेले ही आश्चर्यजनक रूप से प्रभावी था। केवल अवांछित पथ को रोककर, AI स्वाभाविक रूप से वांछित नैतिक ढांचे की तरह सोचने लगा, बिना पूरे मॉडल को फिर से प्रशिक्षित (retrain) किए।
3. "फाइन-ट्यूनिंग डायल" (डुअल लॉजिट कैलिब्रेशन)
रास्ता रोकना एक साधारण "हाँ/ना" के चुनाव के लिए तो अच्छा है, लेकिन क्या होगा यदि आप चाहते हैं कि AI 70% नियम-मानने वाला और 30% कैलकुलेटर हो?
- उपमा: कल्पना कीजिए कि AI के विचार पेंट के दो रंगों के मिश्रण की तरह हैं: नीला (नियम) और पीला (परिणाम)।
- पिछले तरीकों ने नीले रंग की एक बड़ी बाल्टी डालने की कोशिश की, जिससे अक्सर पूरा मिश्रण एक कीचड़ जैसा, अप्रत्याशische रंग बन जाता था।
- यह शोध पत्र एक सटीक मिक्सिंग डायल का उपयोग करता है। उन्होंने AI के मस्तिष्क में दो विशिष्ट "दिशाओं" (जैसे दो अलग-अलग नॉब) की पहचान की जो नीले और पीले रंग की मात्रा को नियंत्रित करती हैं।
- वे इन नॉबों को ठीक उतना ही घुमाने के लिए एक गणितीय सूत्र (Dual Logit Calibration) का उपयोग करते हैं ताकि अंतिम रंग बिल्कुल वैसा ही हो जैसा उपयोगकर्ता चाहता है (जैसे, 70% नीला, 30% पीला)।
4. यह बेहतर क्यों है
- सटीकता: यह एक हथौड़े के बजाय एक स्कैल्पल (सर्जिकल चाकू) के उपयोग जैसा है। वे केवल उन विशिष्ट तारों को छूते हैं जहाँ नैतिक निर्णय लिया जा रहा है, जिससे AI के मस्तिष्क के बाकी हिस्से (गणित करने, कविता लिखने या सामान्य ज्ञान का उत्तर देने की उसकी क्षमता) पूरी तरह से अछूते रहते हैं।
- पूर्वानुमेयता (Predictability): पुराने तरीकों के साथ, डायल घुमाने से AI पागल हो सकता था या काम करना बंद कर सकता था। इस तरीके के साथ, यदि आप किसी शैली के 50% की मांग करते हैं, तो आपको ठीक 50% ही मिलता है। यह एक विश्वसनीय, कैलिब्रेटेड नियंत्रण है।
- पुनः प्रशिक्षण की आवश्यकता नहीं: उन्हें AI को नई चीजें सिखाने की आवश्यकता नहीं है। वे बस AI के चलते समय उसके आंतरिक गियर को ट्यून करते हैं।
निचोड़
शोधकर्ताओं ने वास्तविक जीवन के नैतिक संकटों (जैसे प्रसिद्ध "ट्रॉली समस्या" या रोजमर्रा के नैतिक विकल्पों) पर इसका परीक्षण किया। उन्होंने पाया कि उनकी विधि विश्वसनीय रूप से AI को एक सख्त नियम-आधारित दृष्टिकोण से तर्क करने या परिणाम-आधारित दृष्टिकोण से तर्क करने के लिए बना सकती है, और यहाँ तक कि उन्हें किसी भी अनुपात में मिला सकती है जैसा कि उपयोगकर्ता चाहता है। महत्वपूर्ण रूप से, AI ने अन्य कार्यों को करने की अपनी क्षमता नहीं खोई; वह बस अपनी नैतिक "पर्सोना" को कमांड पर बदलने में माहिर हो गया।
संक्षेप में: उन्होंने AI के मस्तिष्क में उस सटीक स्विच को खोज लिया है जहाँ नैतिक दर्शन अलग होते हैं, और AI को उस विशिष्ट नैतिक दृष्टिकोण की ओर मोड़ने के लिए एक सटीक रिमोट कंट्रोल बनाया है जिसे आप चाहते हैं, बिना किसी दूसरी चीज़ को नुकसान पहुँचाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।