dVoting: Fast Voting for dLLMs
यह शोधपत्र dVoting प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त तकनीक है जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (dLLMs) की समानांतर पीढ़ी क्षमताओं का लाभ उठाकर निरंतरता-आधारित टोकन वोटिंग के माध्यम से आउटपुट को पुनरावृत्ति से परिष्कृत करती है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ कई बेंचमार्क पर तर्क प्रदर्शन में उल्लेखनीय वृद्धि होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कठिन पहेली को सुलझाने की कोशिश कर रहे हैं, लेकिन अकेले सोचने के बजाय, आप अपने पाँच दोस्तों को विचार-मंथन (brainstorming) के लिए इकट्ठा करते हैं।
पुराना तरीका (Autoregressive Models):
आमतौर पर, AI मॉडल एक अकेले व्यक्ति की तरह काम करते हैं जो एक बार में एक शब्द करके कहानी लिखता है। यदि वे शुरुआत में कोई गलती कर देते हैं, तो उन्हें उस गलती के आधार पर पूरी कहानी लिखते रहना पड़ता है या फिर से शुरू से शुरुआत करनी पड़ती है। यह धीमा और कठोर है।
नया तरीका (Diffusion Models / dLLMs):
यह शोध पत्र एक नए प्रकार के AI को पेश करता है जिसे डिफ्यूजन लार्ज लैंग्वेज मॉडल (dLLM) कहा जाता है। इस AI को एक लेखक के रूप में नहीं, बल्कि एक मूर्तिकार के रूप में सोचें।
- यह पत्थर के एक ब्लॉक से शुरू होता है जहाँ शब्द छिपे हुए (masked) होते हैं।
- यह एक साथ पूरे ब्लॉक को देख सकता है और अनुमान लगा सकता है कि शब्द क्या हो सकते हैं।
- महत्वपूर्ण बात यह है कि यह किसी भी समय मूर्तिकला के किसी भी हिस्से को मिटा सकता है और फिर से लिख सकता है। इसे बाएं से दाएं लिखने की आवश्यकता नहीं है; यह शुरुआत खत्म होने से पहले अंत को ठीक कर सकता है।
समस्या: "ब्रूट फोर्स" (Brute Force) दृष्टिकोण
सर्वश्रेष्ठ उत्तर प्राप्त करने के लिए, शोधकर्ताओं ने एक सरल ट्रिक आजमाई: वोटिंग (Voting)।
उन्होंने AI से उत्तर पाँच बार उत्पन्न करने के लिए कहा और फिर उस उत्तर को चुना जो सबसे अधिक बार आया (बहुमत मतदान/Majority Voting)।
- अच्छा क्या है: यह बहुत अच्छा काम करता है! AI अधिक स्मार्ट हो जाता है।
- बुरा क्या है: यह अविश्वसनीय रूप से महंगा है। AI को पूरी कहानी पाँच बार लिखने के लिए कहना ऐसा है जैसे पाँच अलग-अलग आर्किटेक्ट्स को केवल सबसे अच्छा फ्लोर प्लान चुनने के लिए पाँच पूर्ण घर बनाने के लिए काम पर रखना। यह बहुत सारा समय और पैसा (कंप्यूटिंग पावर) बर्बाद करता है।
समाधान: DVOTING (एक "स्मार्ट एडिटर")
लेखक, सिचेंग फेंग और उनकी टीम ने यह देखते हुए कुछ दिलचस्प महसूस किया कि उनके पाँच AI दोस्त कैसे काम करते हैं: वे कहानी के अधिकांश हिस्से पर सहमत होते हैं।
यदि आप पाँच लोगों को "जेनेट के बत्तखों" के बारे में एक कहानी लिखने के लिए कहते हैं, तो वे "जेनेट," "बत्तख," "अंडे," और "देती है" जैसे शब्दों पर सहमत होंगे। वे केवल कठिन गणित वाले हिस्सों या अंतिम निष्कर्ष पर असहमत होंगे।
DVOTING एक ऐसी विधि है जो AI को उन हिस्सों को दोबारा लिखने में समय बर्बाद करने से रोकती है जिन पर सभी पहले से ही सहमत हैं। यह कैसे काम करता है, यहाँ एक रचनात्मक उपमा दी गई है:
"ग्रुप प्रोजेक्ट" की उपमा
कल्पना कीजिए कि छात्रों का एक समूह एक ग्रुप निबंध (essay) पर काम कर रहा है।
- राउंड 1: हर कोई एक ड्राफ्ट लिखता है।
- चेक करना: शिक्षक (DVOTING) पाँचों ड्राफ्टों को देखता है।
- अवलोकन: "अरे, सभी ने 'जेनेट के बत्तख 16 अंडे देती हैं' बिल्कुल एक ही तरह से लिखा है। वह हिस्सा ठोस है।"
- अवलोकन: "लेकिन गणित वाले हिस्से पर, तीन छात्रों ने '18 डॉलर' कहा, एक ने '20' और एक ने '15' कहा। वह हिस्सा संदिग्ध है।"
- सुधार (Remasking): छात्रों को पूरा निबंध फिर से लिखने के बजाय, शिक्षक कहता है: "पहला वाक्य वैसा ही रहने दें जैसा वह है। केवल गणित वाले हिस्से को मिटाएं और केवल उसी को फिर से लिखें।"
- दोहराना: छात्र केवल गणित वाले हिस्से को फिर से लिखते हैं। शिक्षक फिर से चेक करता है। यदि वे अभी भी असहमत हैं, तो वे केवल उस हिस्से को फिर से लिखते हैं। यदि वे सहमत हो जाते हैं, तो प्रोजेक्ट पूरा हो जाता है।
यह एक बड़ी बात क्यों है?
- गति: केवल "अनिश्चित" हिस्सों को फिर से लिखकर, AI काम को बहुत तेज़ी से पूरा कर लेता है। यह पूरी किताब को फिर से टाइप करने के बजाय केवल गलतियों (typos) को बदलकर दस्तावेज़ को एडिट करने जैसा है।
- स्मार्टर: यह वास्तव में तर्क (reasoning) करने में बेहतर होता है क्योंकि यह अपनी ऊर्जा उन कठिन हिस्सों पर केंद्रित करता है जहाँ गलतियाँ होती हैं।
- कोई ट्रेनिंग आवश्यक नहीं: सबसे अच्छी बात? आपको AI को फिर से प्रशिक्षित करने या उसे नए कौशल सिखाने की आवश्यकता नहीं है। आप बस इसे काम करने के लिए निर्देशों का एक नया सेट देते हैं (एक "वोटिंग रणनीति")। यह एक स्मार्ट कर्मचारी को नई डिग्री देने के बजाय उसे एक बेहतर वर्कफ़्लो देने जैसा है।
परिणाम
इस शोध पत्र ने कठिन गणित और विज्ञान की समस्याओं पर इसका परीक्षण किया (जैसे कि वे जो आप हाई स्कूल या कॉलेज की परीक्षाओं में देखते हैं)।
- DVOTING ने AI की सटीकता में उल्लेखनीय सुधार किया (कठिन परीक्षणों पर लगभग 5% से 15% तक)।
- इसने यह काम बहुत कम कंप्यूटिंग पावर का उपयोग करते हुए किया। वास्तव में, यह पुराने "ब्रूट फोर्स" तरीके की तुलना में 22 गुना तेज़ था जिसने समान काम करने की कोशिश की थी।
संक्षेप में
DVOTING AI के लिए एक स्मार्ट एडिटर की तरह है। AI को शुरू से वही कहानी पाँच बार लिखने के लिए कहने के बजाय, यह AI को एक बार लिखने के लिए कहता है, और फिर केवल उन हिस्सों को ठीक करता है जहाँ AI भ्रमित है। यह समय बचाता है, पैसा बचाता है, और सही उत्तर अधिक बार देता है। यह एक सरल, चतुर तरीका है जो इन नए "मूर्तिकार" AI को वास्तविक दुनिया के उपयोग के लिए बहुत व्यावहारिक बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।