ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
ThreadWeaver एक नवीन फ्रेमवर्क है जो एक दो-चरणीय प्रक्षेपवक्र जनरेटर (two-stage trajectory generator), मानक अनुमान इंजनों (standard inference engines) के साथ संगत एक ट्राइ-आधारित रोलआउट डिज़ाइन (trie-based rollout design), और एक समानांतरता-जागरूक सुदृढीकरण शिक्षण रणनीति (parallelization-aware reinforcement learning strategy) को संयोजित करके बड़े भाषा मॉडलों में अत्याधुनिक समानांतर तर्क प्रदर्शन प्राप्त करता है, जिससे अनुक्रमिक सटीकता से मेल खाते हुए अनुमान विलंबता (inference latency) को महत्वपूर्ण रूप से कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बेहद प्रतिभाशाली लेकिन बहुत धीमी गति से सोचने वाला सहायक (एक लार्ज लैंग्वेज मॉडल) है, जो जटिल गणितीय समस्याओं को हल करने के लिए अपने विचार की प्रक्रिया का हर एक चरण, एक बार में एक शब्द लिखकर बताता है। आज के अधिकांश AI मॉडल इसी तरह काम करते हैं: वे एक सीधी रेखा में सोचते हैं। यदि किसी समस्या के लिए 10,000 चरणों की आवश्यकता है, तो सहायक को उन सभी 10,000 शब्दों को क्रमवार लिखने में बहुत समय लगता है। भले ही आप उन्हें एक तेज़ कंप्यूटर दे दें, वे गति नहीं बढ़ा सकते क्योंकि वे एक शब्द लिखने के बाद ही अगला शब्द लिखने के लिए सख्ती से बंधे हुए हैं।
ThreadWeaver एक नया फ्रेमवर्क है जो इस सहायक को अपनी बुद्धिमत्ता खोए बिना "मल्टीटास्किंग" करना सिखाता है। यह एक अकेले व्यक्ति पर निर्भर रहने के बजाय विशेषज्ञों की एक टीम को काम पर रखने जैसा है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: "असेंबली लाइन" की बाधा
एक मानक AI मॉडल को असेंबली लाइन पर एक अकेले कर्मचारी के रूप में सोचें। वे एक पुर्जा उठाते हैं, उस पर काम करते हैं, उसे अगले स्टेशन पर भेजते हैं, और यही प्रक्रिया दोहराते हैं। यदि काम बहुत बड़ा है, तो लाइन लंबी हो जाती है, और प्रतीक्षा समय बहुत अधिक हो जाता है। आप काम को तेज़ करने के लिए उसी लाइन में और अधिक कर्मचारी नहीं जोड़ सकते; कर्मचारी को क्रम में ही कदम उठाने होंगे।
2. समाधान: "ThreadWeaver" टीम
ThreadWeaver AI को यह समझने में मदद करता है कि कब एक समस्या को विभाजित किया जा सकता है। एक अकेले कर्मचारी द्वारा सब कुछ करने के बजाय, AI सीखता है कि, "हे, मैं इस समस्या के तीन हिस्सों को एक साथ कर सकता हूँ!"
- द फोर्क (विभाजन/Splitting Up): जब AI समस्या के ऐसे हिस्से पर पहुँचता है जहाँ अलग-अलग रास्ते एक-दूसरे पर निर्भर नहीं होते (जैसे दो अलग-अलग गणितीय सूत्रों की जाँच करना), तो वह काम को विभाजित कर देता है। यह कई "थ्रेड्स" (मिनी-टीमें) बनाता है जो इन हिस्सों पर एक साथ काम करती हैं।
- द जॉइन (वापस मिलना/Coming Back Together): एक बार जब मिनी-टीमें अपने विशिष्ट कार्यों को पूरा कर लेती हैं, तो वे सभी मुख्य कर्मचारी के पास रिपोर्ट करती हैं। मुख्य कर्मचारी फिर उनके निष्कर्षों को जोड़ता है और समस्या के शेष भाग को जारी रखता है।
3. उन्होंने यह कैसे सीखा (तीन जादुई तरकीबें)
शोधकर्ताओं ने केवल AI को मल्टीटास्किंग करने के लिए नहीं कहा; उन्होंने इसे सही ढंग से करने के लिए एक विशेष प्रशिक्षण प्रणाली बनाई ताकि यह भ्रमित न हो।
तरकीब 1: "ब्लूप्रिंट" जनरेटर (दो-चरणीय डेटा निर्माण)
AI को मल्टीटास्किंग करना सिखाने से पहले, शोधकर्ताओं को उदाहरणों की आवश्यकता थी कि इसे कैसे किया जाए। उन्होंने मौजूदा "सिंगल-वर्कर" समाधानों को लिया और एक स्मार्ट AI का उपयोग करके उन्हें "टीम-वर्क" ब्लूप्रिंट में फिर से लिखा। उन्होंने ठीक से चिह्नित किया कि काम कहाँ विभाजित किया जाना चाहिए और कहाँ जोड़ा जाना चाहिए। इसने AI को अध्ययन करने के लिए एक उच्च-गुणवत्ता वाला "निर्देश मैनुअल" दिया।तरकीब 2: "ट्रैफिक कंट्रोलर" (ट्राई-आधारित डिज़ाइन/Trie-Based Design)
आमतौर पर, AI को समानांतर (parallel) काम करने के लिए सक्षम बनाने के लिए महंगे, कस्टम-निर्मित कंप्यूटर सिस्टम की आवश्यकता होती है। ThreadWeaver चतुर है क्योंकि यह मानक, बाजार में उपलब्ध कंप्यूटर सिस्टम के साथ काम करता है।- उपमा: एक लाइब्रेरी की कल्पना करें जहाँ किताबें आमतौर पर एक-एक करके पढ़ी जाती हैं। ThreadWeaver एक स्मार्ट लाइब्रेरियन की तरह है जो किताबों को एक "ट्री" (वृक्ष) संरचना में व्यवस्थित करता है। जब कोई पाठक किताब मांगता है, तो लाइब्रेरियन तुरंत जानता है कि किस शाखा को अलग-अलग पाठकों को एक साथ भेजना है, और फिर परिणामों को एकत्र करना है। यह AI को बिना किसी बड़े हार्डवेयर बदलाव के मानक सर्वरों पर चलने की अनुमति देता है।
तरकीब 3: "कोच" (स्मार्ट रीइन्फोर्समेंट लर्निंग)
AI को एक रिवॉर्ड सिस्टम (जैसे वीडियो गेम स्कोर) का उपयोग करके प्रशिक्षित किया गया था।- लक्ष्य: सही उत्तर प्राप्त करना (सटीकता/Accuracy)।
- बोनस: काम को विभाजित करके कार्य को तेज़ी से पूरा करना (गति/Speed)।
- शर्त: यदि AI काम को विभाजित करता है लेकिन गलत उत्तर देता है, तो उसे कोई अंक नहीं मिलता। यदि वह सही उत्तर देता है लेकिन बहुत अधिक समय लेता है, तो उसे कम अंक मिलते हैं। "कोच" (एक एल्गोरिदम जिसे P-GRPO कहा जाता है) ने AI को सही संतुलन खोजने के लिए प्रशिक्षित किया: काम को केवल तभी विभाजित करें जब इससे मदद मिले, और हमेशा सुनिश्चित करें कि अंतिम उत्तर सही हो।
4. परिणाम: तेज़, लेकिन कम बुद्धिमान नहीं
शोधकर्ताओं ने इसका परीक्षण बहुत कठिन गणितीय समस्याओं (जैसे राष्ट्रीय प्रतियोगिताओं में पाई जाने वाली समस्याएं) पर किया।
- सटीकता: ThreadWeaver AI सबसे अच्छे "सिंगल-वर्कर" मॉडल्स जितना ही स्मार्ट था। मल्टीटास्किंग करने की कोशिश में इसने अपनी बुद्धिमत्ता नहीं खोई।
- गति: क्योंकि यह एक साथ समस्या के कई हिस्सों पर काम कर सकता था, इसलिए इसने कार्यों को काफी तेज़ी से पूरा किया। कुछ मामलों में, यह मानक मॉडल्स की तुलना में 1.5 गुना तेज़ था।
सारांश
ThreadWeaver को एक अकेले जीनियस को प्रोजेक्ट मैनेजर बनने के लिए सिखाने के रूप में सोचें। हर गणना खुद करने के बजाय, वे यह पहचानने में सक्षम होते हैं कि समस्या के कौन से हिस्से एक टीम को सौंपे जा सकते हैं। वे टीम का समन्वय करते हैं, परिणामों की प्रतीक्षा करते हैं, और फिर काम पूरा करते हैं। परिणाम एक ऐसा सिस्टम है जो अकेले जीनियस जितना ही सटीक है लेकिन बहुत कम समय में काम पूरा कर देता है, और वह भी बिना किसी विशेष, महंगे हार्डवेयर के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।