← नवीनतम पेपर
💻 computer science

JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

JetFlow एक नवीन स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है जो एक कॉज़ल पैरेलल ड्राफ्ट हेड को ब्रांच-वाइज सुसंगत टोकन ट्री जेनरेट करने के लिए प्रशिक्षित करके मौजूदा तरीकों की स्केलिंग सीमाओं को दूर करता है, जिससे स्वीकृति दरों से समझौता किए बिना विविध LLM वर्कलोड पर महत्वपूर्ण गति (9.64x तक) प्राप्त होती है।

मूल लेखक: Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत ही सख्त संपादक (AI मॉडल) है जो आपको केवल एक बार में एक शब्द लिखने की अनुमति देता है। इससे पहले कि आप दूसरा शब्द लिख सकें, संपादक को पहला शब्द पढ़ना होगा, उसकी जाँच करनी होगी और आपको हरी झंडी देनी होगी। इससे पहले कि आप तीसरे शब्द के लिए आगे बढ़ें, वे दूसरे शब्द की जाँच करेंगे, और इसी तरह यह सिलसिला चलता रहेगा। यह "एक बार में एक शब्द" वाला नियम लेखन को बहुत धीमा बना देता है, भले ही संपादक अविश्वसनीय रूप से बुद्धिमान हो।

स्पेक्युलेटिव डिकोडिंग (Speculative Decoding) इस प्रक्रिया को तेज करने की एक तकनीक है। संपादक के हर एक शब्द की प्रतीक्षा करने के बजाय, आप एक तेज़, सस्ता सहायक (एक "ड्राफ्टर" या मसौदा तैयार करने वाला) नियुक्त करते हैं जो आपके लिए अगले कुछ शब्दों का अनुमान लगाता है। फिर आप इन अनुमानों को संपादक को एक साथ दिखाते हैं। यदि संपादक उनके अनुमानों से सहमत होता है, तो आप एक शब्द लिखने के समय में कई शब्द लिख पाते हैं। यदि संपादक असहमत होता है, तो आप गलत अनुमानों को फेंक देते हैं और फिर से शुरुआत करते हैं।

समस्या: "गति बनाम सटीकता" का जाल

पेपर बताता है कि पिछले तरीकों ने एक सीमा का सामना किया। वे एक दुविधा का सामना कर रहे थे:

  1. "सावधान" सहायक: कुछ सहायक बहुत सावधान होते हैं। वे अगले शब्द का अनुमान लगाते हैं, फिर अपने पहले अनुमान के आधार पर उसके बाद वाले शब्द का अनुमान लगाते हैं, और इसी तरह। इससे उनके अनुमान बहुत सटीक होते हैं (संपादक उन्हें अक्सर स्वीकार करता है), लेकिन यह धीमा है क्योंकि उन्हें कदम-दर-कदम सोचना पड़ता है।
  2. "तेज़" सहायक: अन्य सहायक सुपर फास्ट होते हैं। वे बिना यह सोचे कि शब्द आपस में कैसे जुड़ते हैं, एक साथ शब्दों की एक पूरी सूची चिल्लाकर बोल देते हैं। यह बहुत तेज़ है, लेकिन सूची अक्सर बिना किसी अर्थ के होती है (जैसे, "बिल्ली... उड़ी... को... चाँद... कल")। संपादक को उनके अधिकांश सुझावों को खारिज करना पड़ता है क्योंकि वे कहानी के प्रवाह में फिट नहीं बैठते, जिससे सहायक की गति बेकार चली जाती है।

पेपर इसे "कॉजैलिटी-एफिशिएंसी डिलेमा" (Causality-Efficiency Dilemma) कहता है। आपको आमतौर पर तेज़ लेकिन गलत होने, या सटीक लेकिन धीमे होने के बीच किसी एक को चुनना पड़ता था।

समाधान: JETFLOW

लेखकों ने JETFLOW नामक एक नया सिस्टम बनाया है जो इस जाल को तोड़ता है। कल्पना कीजिए कि JETFLOW एक सुपर-असिस्टेंट है जो समानांतर (parallel) रूप से सोच सकता है लेकिन फिर भी कहानी के तर्क का सम्मान करता है।

यह कैसे काम करता है, इसके लिए एक सरल उपमा देखें:

  • पेड़ का रूपक (The Tree Metaphor): कल्पना कीजिए कि कहानी एक पेड़ है। तना वह टेक्स्ट है जो आपने पहले ही लिख लिया है। आप नई शाखाएं (भविष्य के शब्द) उगाना चाहते हैं।
    • पुराने "तेज़" सहायक शाखाओं को बेतरतीब ढंग से उगाते। एक शाखा कहती "बिल्ली", दूसरी कहती "कुत्ता", और तीसरी कहती "चाँद"। उन्हें नहीं पता कि कौन सा रास्ता असली है, इसलिए वे मृत शाखाएं उगाने में समय बर्बाद करते हैं।
    • पुराने "सावधान" सहायक एक शाखा उगाते, उसकी जाँच करते, फिर अगली शाखा उगाते। यह सुरक्षित है, लेकिन धीमा है।
    • JETFLOW तने को देखता है और तुरंत एक साथ कई संभावित शाखाओं का खाका खींच देता है। लेकिन यहाँ जादू यह है: यह सुनिश्चित करता है कि प्रत्येक शाखा कहानी के नियमों का पालन करे। यदि एक शाखा "बिल्ली" से शुरू होती है, तो उस विशेष शाखा पर अगला शब्द ऐसा होना चाहिए जो एक बिल्ली कर सकती है। यह शाखाओं को आपस में मिक्स नहीं करता है।

JETFLOW इसे कैसे करता है

  1. एक पास, कई रास्ते (One Pass, Many Paths): JETFLOW एक विशेष "हेड" (AI का एक हिस्सा) का उपयोग करता है जो मुख्य संपादक के छिपे हुए विचारों को देखता है। एक ही नज़र में, यह अगले शब्दों का एक पूरा पेड़ (tree) अनुमानित करता है।
  2. प्रवाह का सम्मान (Respecting the Flow): यह एक विशेष "मास्क" (ट्रैफिक नियमों के एक सेट की तरह) का उपयोग करता है जो सहायक को मजबूर करता है कि वह केवल अपने विशिष्ट पथ पर आने वाले शब्दों को ही देखे। यह सहायक को भविष्य में झांकने या अलग-अलग कहानियों को आपस में मिलाने से रोकता है।
  3. परिणाम: क्योंकि सहायक के अनुमान कहानी के प्रवाह के साथ तार्किक रूप से सुसंगत होते हैं, मुख्य संपादक (टारगेट मॉडल) एक बार में शब्दों की एक लंबी श्रृंखला को स्वीकार कर लेता है।

परिणाम: कितनी तेज़?

पेपर ने शक्तिशाली कंप्यूटर चिप्स (H100 GPUs) का उपयोग करके गणित की समस्याओं, कोडिंग कार्यों और चैट बातचीत पर इसका परीक्षण किया।

  • गणित की समस्याएँ: कठिन गणित परीक्षणों पर, JETFLOW ने AI को मानक धीमी विधि की तुलना में 9.6 गुना तेज़ बना दिया।
  • चैटिंग: खुली बातचीत (open-ended conversations) के लिए, यह 4.5 गुना तेज़ था।
  • स्केलेबिलिटी (Scalability): सहायक को जितने अधिक "अनुमान" (बजट) की अनुमति दी गई, यह उतना ही तेज़ होता गया। पुराने तरीकों के विपरीत जो बहुत अधिक शब्दों का अनुमान लगाने पर भ्रमित या धीमे हो जाते थे, JETFLOW तेज़ और अधिक कुशल बना रहा।

सारांश में

JETFLOW उन सहायकों की एक टीम को नियुक्त करने जैसा है जो एक साथ कई अलग-अलग कहानी के अंत चिल्ला सकते हैं, लेकिन वे इतने स्मार्ट हैं कि वे जानते हैं कि प्रत्येक अंत को अपने आप में अर्थपूर्ण होना चाहिए। यह मुख्य संपादक को टेक्स्ट के बड़े हिस्सों को तुरंत स्वीकृत करने की अनुमति देता है, जिससे कहानी की गुणवत्ता खोए बिना "एक बार में एक शब्द" की गति सीमा को तोड़ा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →