← नवीनतम पेपर
🤖 AI

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex एक ऐसा सिस्टम है जो स्पार्स अटेंशन एल्गोरिदम के तीव्र प्रोटोटाइपिंग और परिनियोजन को सक्षम करने के लिए एक कुशल बैकएंड के साथ पायथन-एम्बेडेड फ्रंटएंड को जोड़ता है, जिससे AI एजेंट ऐसे डिज़ाइन खोजने में सक्षम होते हैं जो फुल अटेंशन की तुलना में 3.46× तक उच्च थ्रूपुट प्राप्त करते हैं और इन लाभों को उभरते हुए बड़े-स्तरीय आर्किटेक्चर तक विस्तारित करते हैं।

मूल लेखक: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय (एक लार्ज लैंग्वेज मॉडल, या LLM) चला रहे हैं जहाँ एक लाइब्रेरियन (AI) को एक बहुत लंबी कहानी, एक बार में एक शब्द करके लिखनी है।

हर बार जब लाइब्रेरियन एक नया शब्द लिखता है, तो उसे यह सुनिश्चित करने के लिए कि नया शब्द फिट बैठता है या नहीं, अब तक लिखे गए सब कुछ को पीछे मुड़कर देखना पड़ता है। एक पारंपरिक पुस्तकालय में, लाइब्रेरियन को हर एक शेल्फ से गुजरना होगा, हर किताब की जांच करनी होगी और हर वाक्य को पढ़ना होगा। जैसे-जैसे कहानी लंबी होती जाती है (हजारों शब्द), यह "चलना और जांचना" अविश्वसनीय रूप से धीमा और थकाऊ हो जाता है। यही फुल अटेंशन (Full Attention) की समस्या है।

स्पार्स अटेंशन (Sparse Attention) लाइब्रेरियन को एक स्मार्ट शॉर्टकट देने जैसा है: "केवल पिछले 5 पन्नों और शुरुआत के सबसे महत्वपूर्ण 3 अध्यायों को देखो।" यह बहुत सारा समय बचाता है। हालांकि, इन शॉर्टकट्स को बनाना वर्तमान में इंजीनियरों के लिए एक दुःस्वप्न है। यह एक नए शॉर्टकट विचार के लिए हर बार एक कस्टम, हाई-स्पीड ट्रेन ट्रैक बनाने जैसा है। यदि आप एक नया विचार टेस्ट करना चाहते हैं, तो आपको पूरा ट्रैक शुरू से फिर से बनाना पड़ता है, जिसमें हफ्तों लग जाते हैं।

पेश है, Vortex।

Vortex एक नया सिस्टम है जो इन शॉर्टकट्स के लिए एक "यूनिवर्सल ट्रेन ट्रैक बिल्डर" की तरह काम करता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "पेज्ड" (Paged) लाइब्रेरी

आधुनिक पुस्तकालयات किताबों को एक लंबी, निरंतर पंक्ति में स्टोर नहीं करते हैं। जगह बचाने के लिए, वे किताबों को बिखरे हुए, गैर-निरंतर बक्सों (जिन्हें पेज्ड अटेंशन - Paged Attention कहा जाता है) में स्टोर करते हैं।

  • पुराना तरीका: यदि आप कंप्यूटर को "विशिष्ट बिखरे हुए बक्सों को देखने" के लिए कहना चाहते थे, तो आपको प्रत्येक बॉक्स को खोजने, उसे उठाने और क्रम में रखने के लिए जटिल, लो-लेवल कोड लिखना पड़ता था। यह समुद्र तट पर रेत के विशिष्ट कणों को एक-एक करके खोदकर निकालने के लिए रोबोट से कहने जैसा था।
  • Vortex का तरीका: Vortex सोचने का एक नया तरीका पेश करता है जिसे vTensor कहा जाता है। यह लाइब्रेरियन को एक "जादुई मानचित्र" देता है। आपको यह जानने की ज़रूरत नहीं है कि बॉक्स भौतिक रूप से कहाँ स्थित हैं; आपको बस कहना है, "मुझे सबसे प्रासंगिक शीर्ष 5 बॉक्स चाहिए," और जादुई मानचित्र बिखरे हुए स्टोरेज में उन्हें खोजने के जटिल विवरणों को खुद संभाल लेगा।

2. भाषा: vFlow (द "रेसिपी बुक")

Vortex के साथ एक प्रोग्रामिंग भाषा आती है जिसे vFlow कहा जाता है।

  • उदाहरण: कल्पना कीजिए कि आप एक शेफ हैं। कंप्यूटर को यह बताने के लिए कोड लिखने के बजाय कि हर एक गाजर को कैसे काटना है, आप बस एक रेसिपी लिखते हैं: "गाजर लें, उन्हें काटें, और प्याज के साथ मिलाएं।"
  • यह कैसे मदद करता है: शोधकर्ता (और यहाँ तक कि AI एजेंट भी) कोड की कुछ ही लाइनों में नए प्रकार के शॉर्टकट (स्पार्स अटेंशन एल्गोरिदम) की "रेसिपी" लिख सकते हैं। उन्हें हार्डवेयर के जटिल विवरणों का विशेषज्ञ होने की आवश्यकता नहीं है। वे बस यह बताते हैं कि वे क्या करना चाहते हैं, और Vortex कुशलतापूर्वक यह तय करता है कि इसे कैसे करना है।

3. AI एजेंट: द "ऑटोनॉमस इनवेंटर" (स्वायत्त आविष्कारक)

यह सबसे रोमांचक हिस्सा है। पेपर दिखाता है कि Vortex इतना आसान है कि AI एजेंट (कंप्यूटर प्रोग्राम जो इंसानों की तरह कार्य करने के लिए डिज़ाइन किए गए हैं) खुद नए शॉर्टकट खोजने के लिए इसका उपयोग कर सकते हैं।

  • प्रयोग: शोधकर्ताओं ने AI एजेंटों से "लाइब्रेरियन को तेज़ करने के 20 नए तरीके खोजने" के लिए कहा।
  • परिणाम: AI एजेंटों ने केवल पुराने विचारों की नकल नहीं की; उन्होंने बिल्कुल नई और विविध रेसिपी बनाईं। इनमें से एक AI-जनरेटेड शॉर्टकट ने मानक विधि की तुलना में लाइब्रेरियन को 3.46 गुना तेज़ बना दिया, बिना कहानी की सटीकता खोए।
  • लूप: AI ने 18 घंटों के दौरान अपनी रेसिपी को बार-बार आज़माया, विफल हुआ और उसमें सुधार किया। अंततः इसने गति और सटीकता के बीच एक ऐसा सटीक संतुलन खोज लिया जो शायद इंसान मिस कर देते।

4. परिणाम: भविष्य को तेज़ बनाना

Vortex केवल छोटे मॉडल्स के लिए नहीं है; यह दुनिया के सबसे बड़े और जटिल पुस्तकालयों पर भी काम करता है।

  • बड़े मॉडल्स: टीम ने एक विशाल मॉडल (MiniMax-M2.7) पर परीक्षण किया जिसमें 229 बिलियन पैरामीटर्स थे, जो सुपर-कंप्यूटर चिप्स (NVIDIA B200) पर चल रहा था। वहां भी, Vortex के शॉर्टकट्स ने सिस्टम को 1.37 गुना तेज़ बना दिया।
  • नए आर्किटेक्चर: उन्होंने इसे एक नए प्रकार के लाइब्रेरी डिज़ाइन पर भी इस्तेमाल किया जिसे MLA (DeepSeek और GLM जैसे मॉडल्स द्वारा उपयोग किया जाता है) कहा जाता है। उन्होंने vFlow में इसके लिए एक कस्टम शॉर्टकट बनाया और 4.7 गुना स्पीडअप प्राप्त किया।

सारांश

Vortex को एक अनुवादक और एक निर्माण दल (construction crew) के रूप में सोचें जो एक साथ मिलकर काम करते हैं।

  1. यह जटिल, अव्यवस्थित हार्डवेयर नियमों को सरल, पठनीय रेसिपी में अनुवादित करता है।
  2. यह मनुष्यों और AI एजेंटों को लंबे टेक्स्ट पढ़ने के लिए नए "शॉर्टकट" जल्दी से आविष्कार करने, टेस्ट करने और तैनात करने की अनुमति देता है।
  3. यह जो पहले महीनों का इंजीनियरिंग प्रोजेक्ट हुआ करता था, उसे घंटों का काम बना देता है, जिससे हमें अपनी बुद्धिमत्ता से समझौता किए बिना AI मॉडल्स को चलाने के तेज़ तरीके खोजने में मदद मिलती है।

पेपर का दावा है कि प्रयोग करना आसान बनाकर, Vortex ने पहले ही ऐसे एल्गोरिदम खोजने में मदद की है जो वर्तमान में प्रोडक्शन में उपयोग किए जाने वाले किसी भी चीज़ की तुलना में काफी तेज़ हैं, जो यह साबित करता है कि हम नए हार्डवेयर की प्रतीक्षा किए बिना अपने AI मॉडल्स को तेज़ और अधिक कुशल बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →