d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
यह शोध पत्र d2 को प्रस्तुत करता है, जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो विशेषीकृत ट्राजेक्टरी लाइकलीहुड अनुमानकों (d2-AnyOrder और d2-StepMerge) का उपयोग करता है ताकि तार्किक और गणितीय बेंचमार्क पर तर्क करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे नया अत्याधुनिक प्रदर्शन (state-of-the-art performance) प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार है जो एक खाली कैनवास से शुरू करके और विवरण जोड़ते हुए धीरे-धीरे एक उत्कृष्ट कृति (मास्टरपीस) बना सकता है। डिफ्यूजन लैंग्वेज मॉडल्स (DLMs) इसी तरह काम करते हैं। पारंपरिक AI लेखकों के विपरीत जो एक समय में एक शब्द बनाकर वाक्य बनाते हैं (जैसे ईंटें जमा करना), ये मॉडल "शोर" (जैसे पुराने टीवी पर दिखने वाली स्टेटिक/झिलमिलाहट) के एक ढेर से शुरुआत करते हैं और धीरे-धीरे उसे "डिनोइज़" (शोर हटाना) करते हुए, एक सुसंगत कहानी या समाधान प्रकट करते हैं।
यह शोध पत्र d2 नामक एक नई प्रशिक्षण विधि पेश करता है ताकि इन कलाकारों को कठिन पहेलियाँ (जैसे गणित की समस्याएँ या तर्क के खेल) बेहतर तरीके से हल करना सिखाया जा सके। यह कैसे काम करता है, इसका विवरण सरल उपमाओं का उपयोग करके यहाँ दिया गया है।
समस्या: "अंधा" आलोचक (The "Blind" Critic)
AI को तर्क करना सिखाने के लिए, शोधकर्ता रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करते हैं। इसे एक खेल की तरह समझें जहाँ AI एक पहेली को हल करने की कोशिश करता है, और एक "क्रिटिक" (एक रिवॉर्ड सिस्टम) उसे एक स्कोर देता है। यदि AI को अच्छा स्कोर मिलता है, तो वह इसे फिर से करना सीखता है।
हालाँकि, डिफ्यूजन मॉडल्स के साथ एक समस्या है। प्रभावी ढंग से सीखने के लिए, AI को यह जानने की आवश्यकता है कि उस विशिष्ट शब्दों के क्रम (sequence) को उत्पन्न करने की संभावना कितनी थी।
- पारंपरिक AI (Autoregressive) के लिए: यह एक पत्र लिखने जैसा है। आप जानते हैं कि आपने पहले, दूसरे और तीसरे स्थान पर क्या लिखा। इसकी "संभावना" (likelihood) की गणना करना आसान और तेज़ है।
- डिफ्यूजन AI के लिए: यह पत्थर के एक ब्लॉक से उभरती हुई मूर्ति को देखने जैसा है। AI हजारों छोटे-छोटे समायोजन करता है। अंतिम मूर्ति की सटीक संभावना जानने के लिए, आपको सैद्धांतिक रूप से पूरी वीडियो को पीछे ले जाना होगा और मूर्तिकला की हर एक फ्रेम को फिर से चलाना होगा। प्रशिक्षण के हर चरण के लिए ऐसा करना कंप्यूटेशनल रूप से असंभव (बहुत धीमा और महंगा) है।
क्योंकि वे इस "स्कोर" की सटीक गणना नहीं कर पा रहे थे, इसलिए पिछले तरीके केवल अनुमान लगा रहे थे, जिससे उनकी तर्क करने की क्षमता कमजोर रह गई।
समाधान: d2 (स्मार्ट स्कोरकीपर)
लेखकों ने d2 बनाया है, जो एक सुपर-एफिशिएंट स्कोरकीपर की तरह काम करता है। यह बिना हर बार पूरी फिल्म दोबारा चलाए, AI की यात्रा की "संभावना" का पता लगा लेता है। उन्होंने दो अलग-अलग प्रकार के कलाकारों के लिए दो अलग-अलग उपकरण बनाए हैं:
टूल 1: d2-AnyOrder ("जादुई दर्पण")
कुछ डिफ्यूजन मॉडल विशेष होते हैं; वे अंतिम छवि को किसी भी क्रम में प्रकट कर सकते हैं। आप पहले आँखें, फिर नाक, फिर बैकग्राउंड बना सकते हैं, या इसके विपरीत, और यह फिर भी काम करेगा।
- उपमा: कल्पना कीजिए कि आपके पास एक जादुई दर्पण है। पूरी पेंटिंग को स्टेप-बाय-स्टेप देखने के बजाय, आप तैयार पेंटिंग को देख सकते हैं और तुरंत देख सकते हैं कि कलाकार ने हर एक स्टेप पर क्या कहा होगा, वह भी एक साथ।
- परिणाम: यह टूल, जिसे d2-AnyOrder कहा जाता है, एक ही नज़र में (एक कंप्यूटर पास में) सटीक स्कोर की गणना करता है। यह अविश्वसनीय रूप से सटीक है और AI को बहुत तेज़ी से सीखने में मदद करता है।
टूल 2: d2-StepMerge ("चंकिंग रणनीति")
अधिकांश लोकप्रिय डिफ्यूजन मॉडल (जैसे प्रसिद्ध LLaDA) किसी भी क्रम में पेंट नहीं कर सकते; उन्हें एक विशिष्ट क्रम का पालन करना पड़ता है। उनके पास "जादुई दर्पण" नहीं है।
- उपमा: चूंकि हम पूरी फिल्म को एक साथ नहीं देख सकते, इसलिए हम फिल्म को टुकड़ों (chunks) में बाँट देते हैं। हर एक फ्रेम देखने के बजाय, हम फिल्म को 10-सेकंड के सेगमेंट में देखते हैं। हम प्रत्येक सेगमेंट के लिए स्कोर का अनुमान लगाते हैं और उन्हें जोड़ देते हैं।
- परिणाम: यह टूल, जिसे d2-StepMerge कहा जाता है, एक अनुमान (approximation) है। यह पूर्णतः सटीक नहीं है, लेकिन लेखकों ने गणितीय रूप से सिद्ध किया है कि त्रुटि (error) छोटी और नियंत्रण योग्य है। यह थोड़ी सी सटीकता के बदले भारी गति का लाभ उठाता है, जिससे यह मानक मॉडल्स के लिए व्यावहारिक बन जाता है।
परिणाम: नौसिखिए से ग्रैंडमास्टर तक
शोधकर्ताओं ने इन टूल्स का परीक्षण AI के लिए सबसे कठिन पहेलियों पर किया:
- लॉजिक गेम्स: सुडोकू और काउंटडाउन (एक गणित का खेल)।
- गणित की समस्याएँ: GSM8K और MATH500 (गणित तर्क के लिए मानक बेंचमार्क)।
परिणाम:
- बिना किसी अतिरिक्त "चीट शीट" (सुपरवाइज्ड फाइन-ट्यूनिंग) के: d2 फ्रेमवर्क ने मॉडल्स को पहले के किसी भी तरीके की तुलना में बेहतर तर्क करना सिखाया।
- प्रतियोगिता को पछाड़ना: सुडोकू और काउंटडाउन टेस्ट पर, d2-प्रशिक्षित मॉडल्स ने क्रमशः 92% और 56% के करीब स्कोर प्राप्त किया, जो पिछले सर्वश्रेष्ठ तरीकों को कुचलते हुए हैं जो लगभग 22% और 42% पर अटके हुए थे।
- गणित में महारत: जटिल गणितीय बेंचमार्क पर, d2 ने एक नया "स्टेट-ऑफ-द-आर्ट" रिकॉर्ड बनाया, जिससे सिद्ध हुआ कि डिफ्यूजन मॉडल्स तर्क करने में पारंपरिक टेक्स्ट-जेनरेटिंग मॉडल्स जितने ही अच्छे हो सकते हैं, लेकिन अतिरिक्त लाभ के साथ कि वे तेज़ और अधिक नियंत्रणीय हैं।
सारांश
पेपर कहता है: "हमने डिफ्यूजन AI मॉडल्स को स्पष्ट रूप से सोचना सिखाने का एक तरीका खोज लिया है।"
- उन्होंने महसूस किया कि AI के काम को ग्रेड करने का पुराना तरीका बहुत धीमा और गलत था।
- उन्होंने d2 का आविष्कार किया, जो एक नया ग्रेडिंग सिस्टम है जो या तो पूरी तरह से सटीक है (विशेष मॉडल्स के लिए) या स्मार्टली कुशल है (मानक मॉडल्स के लिए)।
- इस नए सिस्टम का उपयोग करके, AI मॉडल्स ने तर्क करने के कठिन कार्यों को पहले से काफी बेहतर तरीके से हल करना सीखा, बिना उत्तरों को पहले से सीखे।
संक्षेप में, d2 डिफ्यूजन मॉडल्स को उनकी अपनी सोचने की प्रक्रिया को सटीक रूप से "पीछे मुड़कर देखने" की क्षमता देता है, जिससे वे अपनी गलतियों से सीख सकते हैं और वास्तविक तर्क विशेषज्ञ बन सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।