Mechanistic Analysis of Alignment Algorithms in Language Models
यह शोध पत्र छह प्राथमिकता-अनुकूलन एल्गोरिदम का एक व्यवस्थित यांत्रिक विश्लेषण प्रदान करता है, जो यह प्रकट करता है कि जबकि वे सभी मॉडल व्यवहार को संरेखित करते हैं, वे लेटेंट स्पेस (latent space) में गुणात्मक रूप से भिन्न और आर्किटेक्चर-निर्भर ज्यामितीय रूपांतरण उत्पन्न करते हैं, जिनमें से कुछ विधियाँ विशेषता पृथक्करणीयता (feature separability) को बढ़ाती हैं जबकि अन्य गैर-रचनात्मक रोटेशन के माध्यम से इसे कम करती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: हुड के नीचे देखना
कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से प्रतिभाशाली लेकिन शरारती छात्रों की तरह हैं। वे बहुत कुछ जानते हैं, लेकिन कभी-कभी वे अभद्र, असुरक्षित या अनुपयोगी बातें कर सकते हैं। इसे ठीक करने के लिए, शोधकर्ता उन्हें मददगार, हानिरहित और ईमानदार बनाने के लिए "अलाइनमेंट एल्गोरिदम" का उपयोग करते हैं।
लंबे समय तक, हमने इन शिक्षण विधियों को एक ब्लैक बॉक्स की तरह माना। हम छात्र को एक टेस्ट देते थे, देखते थे कि क्या उन्हें अच्छा ग्रेड मिला (आउटपुट), और मान लेते थे कि शिक्षण सफल रहा। हमें यह नहीं पता था कि उस ग्रेड को प्राप्त करने के लिए छात्र के मस्तिष्क में वास्तव में क्या बदलाव आए।
यह पेपर उस ब्लैक बॉक्स को खोलने का निर्णय लेता है। लेखक मैकेनिकों की तरह काम करते हैं जो केवल यह नहीं देखते कि कार चल रही है या नहीं; वे हुड खोलकर देखते हैं कि जब आप एक नया ट्यूनिंग किट इंस्टॉल करते हैं, तो इंजन के गियर और तार वास्तव में खुद को कैसे पुनर्व्यवस्थित कर रहे हैं।
प्रयोग: छह ट्यूनिंग किट, तीन कारें
शोधकर्ताओं ने तीन अलग-अलग कार मॉडलों (AI आर्किटेक्चर: Llama, SmolLM, और Qwen) पर छह अलग-अलग "ट्यूनिंग किट" (अलाइनमेंट एल्गोरिदम) का परीक्षण किया।
छह ट्यूनिंग किट ये हैं:
- PPO (क्लासिक, भारी-भरकम विधि)
- DPO (एक सीधा, सरल दृष्टिकोण)
- SimPO (DPO का एक सुव्यवस्थित संस्करण)
- ORPO (एक विधि जो सब कुछ एक साथ करने की कोशिश करती है)
- KTO (मानव मनोविज्ञान/प्रॉस्पेक्ट थ्योरी पर आधारित एक विधि)
- GRPO (एक विधि जो उत्तरों के समूहों की तुलना करती है)
उन्होंने AI के मस्तिष्क के अंदर देखने के लिए तीन मुख्य उपकरणों का उपयोग किया:
- लीनियर प्रोब्स (Linear Probes): एक मेटल डिटेक्टर की तरह, यह AI की परतों को स्कैन करता है ताकि यह देखा जा सके कि "वरीयता" (preference) संकेत (यह जानना कि क्या अच्छा है बनाम क्या बुरा है) कहाँ सबसे मजबूत हैं।
- स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders - SAEs): एक प्रिज्म की तरह जो सफेद रोशनी को अलग-अलग रंगों में तोड़ देता है, यह AI के जटिल, उलझे हुए विचारों को व्यक्तिगत, समझने योग्य "फीचर्स" (जैसे विशिष्ट अवधारणाएं या नियम) में तोड़ देता है।
- क्रॉसकोडर्स (Crosscoders): दो ब्लूप्रिंट के आमने-सामने तुलना की तरह, यह देखता है कि "पुराना" AI (ट्यूनिंग से पहले) और "नया" AI (ट्यूनिंग के बाद) अपने आंतरिक फीचर्स को कैसे साझा करते हैं या बदलते हैं।
निष्कर्ष: सभी ट्यूनिंग किट एक समान नहीं होते
पेपर ने पाया कि हालांकि ये सभी विधियाँ बाहर से AI को बेहतर व्यवहार करने के लिए प्रेरित करती हैं, लेकिन वे AI के आंतरिक मस्तिष्क को बहुत अलग तरीकों से बदल देती हैं।
1. "रचनात्मक" निर्माता (KTO और GRPO)
उपमा: कल्पना कीजिए कि आप एक घर का नवीनीकरण कर रहे हैं। KTO और GRPO कुशल ठेकेदारों की तरह हैं जो नए कमरे जोड़ते हैं और मौजूदा दीवारों को मजबूत करते हैं।
- क्या हुआ: इन विधियों ने AI के लिए "अच्छे" और "बुरे" उत्तरों के बीच स्पष्ट अंतर करना आसान बना दिया। उन्होंने केवल फर्नीचर को इधर-उधर नहीं किया; उन्होंने नए, उच्च-गुणवत्ता वाले फीचर्स जोड़े जिससे AI को वरीयताओं को बेहतर ढंग से समझने में मदद मिली।
- परिणाम: AI का आंतरिक "अच्छा बनाम बुरा" सिग्नल अधिक स्पष्ट और सुस्पष्ट हो गया।
2. "संरक्षक" (PPO और SimPO)
उपमा: ये कोमल माली की तरह हैं। वे खरपतवार काटते हैं लेकिन बगीचे को नष्ट नहीं करते।
- क्या हुआ: इन विधियों ने AI की मूल आंतरिक संरचना को काफी हद तक बरकरार रखा। उन्होंने AI के विचारों की ज्यामिति को नाटकीय रूप से नहीं बदला।
- परिणाम: अच्छा और बुरा बताने की AI की क्षमता पहले जैसी ही रही, बस थोड़ी परिष्कृत हुई।
3. "विकृत करने वाले" (DPO और ORPO)
उपमा: ये उन नवीनीकरण करने वालों की तरह हैं जो पूरे घर को घुमा देते हैं। कमरे अभी भी वहीं हैं, लेकिन दरवाजे अब गलत जगहों पर हैं, और लेआउट भ्रमित करने वाला है।
- क्या हुआ:
- DPO ने मौजूदा "अच्छे बनाम बुरे" संकेतों को घुमा (rotate) दिया। जानकारी अभी भी वहीं है, लेकिन यह इस तरह से मुड़ी हुई है कि AI के लिए इसे स्पष्ट रूप से पढ़ना कठिन हो जाता है (जैसे किसी ऐसे मानचित्र को पढ़ने की कोशिश करना जिसे घुमा दिया गया हो)।
- ORPO और भी आक्रामक था; इसने उन विशिष्ट फीचर्स की आवाज़ कम (volume turn down) कर दी जो AI को वरीयताओं को समझने में मदद करते थे। इसने प्रभावी रूप से उन्हीं संकेतों को म्यूट कर दिया जिन्हें इसे मजबूत करना चाहिए था।
- परिणाम: भले ही AI एक टेस्ट में सही उत्तर दे सकता है, लेकिन उसका आंतरिक "कंपास" (दिशा सूचक) जो यह बताता है कि क्या अच्छा है या क्या बुरा, धुंधला या विकृत हो गया।
"यह निर्भर करता है" कारक: आर्किटेक्चर मायने रखता है
पेपर ने यह भी पाया कि एक ही ट्यूनिंग किट अलग-अलग कार मॉडलों पर अलग तरह से काम करती है।
- उपमा: टोयोटा पर एक विशिष्ट इंजन अपग्रेड लगाने से वह तेज़ हो सकती है, लेकिन वही सटीक अपग्रेड फोर्ड पर लगाने से वह लड़खड़ा सकती है।
- वास्तविकता: उदाहरण के लिए, ORPO विधि ने एक मॉडल पर ठीक से काम किया लेकिन दूसरे मॉडल पर प्रदर्शन में भारी गिरावट का कारण बना। इसका मतलब है कि आप यह मान नहीं सकते कि एक AI के लिए काम करने वाली विधि दूसरे AI के लिए भी उसी तरह काम करेगी। आपको मॉडल के विशिष्ट "इंजन" (आर्किटेक्चर) को देखना होगा।
मुख्य निष्कर्ष
पेपर निष्कर्ष निकालता है कि अलाइनमेंट कोई जादुई स्विच नहीं है। यह एक जटिल, अस्त-व्यस्त प्रक्रिया है जो आपके द्वारा उपयोग किए जाने वाले एल्गोरिदम और आपके द्वारा उपयोग किए जाने वाले मॉडल के आधार पर AI के मस्तिष्क को अनूठे तरीकों से नया आकार देती है।
- कुछ विधियाँ AI की समझ को बढ़ाती हैं (KTO, GRPO)।
- कुछ विधियाँ समझ को मोड़ती/घुमाती हैं (DPO)।
- कुछ विधियाँ समझ को कमजोर करती हैं (ORPO)।
- कुछ विधियाँ चीजों को स्थिर रखती हैं (PPO, SimPO)।
यह क्यों मायने रखता है: यदि हम केवल अंतिम उत्तर (ब्लैक बॉक्स दृश्य) को देखते हैं, तो हमें लग सकता है कि ये सभी विधियाँ समान हैं। लेकिन अंदर देखते हुए, हम देखते हैं कि कुछ विधियाँ छिपी हुई कमजोरियां या भ्रमित करने वाले आंतरिक संकेत पैदा कर सकती हैं जो बाद में समस्याएं पैदा कर सकते हैं। वास्तव में सुरक्षित और विश्वसनीय AI बनाने के लिए, हमें केवल अंतिम आउटपुट को ही नहीं, बल्कि इन आंतरिक तंत्रों को समझने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।