← नवीनतम पेपर
🤖 machine learning

Requests of a Feather Must Flock Together: Batch Size vs. Prefix Homogeneity in LLM Inference

यह शोध पत्र फेदर (Feather) को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग-आधारित (reinforcement learning-based) प्रीफिक्स-अवेयर शेड्यूलर है जो एक हल्के चंक्ड हैश ट्री (Chunked Hash Tree) का उपयोग करके बैच आकार और प्रीफिक्स होमोजेनिटी के बीच के संतुलन को अनुकूलित करता है, जिससे मौजूदा अत्याधुनिक शेड्यूलर्स की तुलना में KV कैश एक्सेस ओवरहेड को कम करके LLM इन्फरेंस थ्रूपुट में 2–10× की वृद्धि प्राप्त होती है।

मूल लेखक: Saksham Rathi, Preeti, Mythili Vutukuru

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saksham Rathi, Preeti, Mythili Vutukuru

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही व्यस्त, तेज़ गति वाली लाइब्रेरी चला रहे हैं जहाँ एक अकेला लाइब्रेरियन (GPU) एक ही समय में अलग-अलग लोगों (अनुरोधों/requests) के हज़ारों सवालों के जवाब देने की कोशिश कर रहा है।

लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, लाइब्रेरियन को हर एक शब्द बनाने के लिए एक विशाल "संदर्भ" (context) की किताब (Key-Value cache) को पढ़ना पड़ता है। यह शोध पत्र तर्क देता है कि अनुरोधों को व्यवस्थित करने का वर्तमान तरीका अक्षम है क्योंकि यह इस बात पर बहुत अधिक ध्यान केंद्रित करता है कि एक साथ कितने सवाल हल किए जा रहे हैं, बजाय इसके कि वे सवाल कितने समान हैं।

यहाँ उनके समाधान, Feather की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "भीड़ भरी बस" बनाम "एक ही परिवार का समूह"

वर्तमान में, अधिकांश सिस्टम यात्रा को कुशल बनाने के लिए एक बस (एक "बैच") में अधिक से अधिक लोगों को भरने की कोशिश करते हैं। वे "पहले आओ, पहले पाओ" नियम का उपयोग करते हैं।

  • समस्या: यदि आप 500 अजनबियों को एक बस में रखते हैं, तो वे सभी 500 अलग-अलग जगहों पर जाना चाहते हैं। ड्राइवर को 500 अलग-अलग स्टॉप पर रुकना पड़ता है, और लगातार दिशा बदलनी पड़ती है। यह अराजक और धीमा है।
  • खोज: लेखकों ने पाया कि यदि आप 100 लोगों का एक छोटा समूह लेते हैं जो एक ही सड़क पर रहते हैं (एक "प्रिफिक्स" साझा करते हैं), तो ड्राइवर बिना रुके उसी सड़क पर सीधे जा सकता है। भले ही बस पूरी तरह भरी न हो, लेकिन यात्रा बहुत तेज़ होती है क्योंकि ड्राइवर को बार-बार स्टीयरिंग नहीं घुमानी पड़ती।

मुख्य अंतर्दृष्टि: एक विशाल समूह के बजाय, जो अलग-अलग जगहों पर जा रहे हों, एक छोटा समूह जो एक ही जगह जा रहा हो, उसे रखना बेहतर है। इसे प्रिफिक्स होमोजेनिटी (Prefix Homogeneity) कहा जाता है।

2. पुराना तरीका: "पेड़ पर चढ़ने वाला" (The Tree Climber)

मौजूदा सिस्टम (जैसे SGLang) इन समूहों को खोजने के लिए एक विशाल, जटिल पारिवारिक वृक्ष (Radix Tree) को देखने की कोशिश करते हैं ताकि यह देखा जा सके कि किसके पूर्वज समान हैं।

  • समस्या: इन मिलानों को खोजने के लिए इस पेड़ पर चढ़ने में कंप्यूटर के "दिमाग" (CPU) की बहुत अधिक ऊर्जा और समय लगता है। वास्तव में, पेड़ पर चढ़ने में लगने वाला समय कभी-कभी उस समय के लगभग बराबर होता था जितना कि लाइब्रेरियन द्वारा वास्तव में सवालों के जवाब देने में लगाया गया था! यह ऐसा था जैसे यात्रियों को व्यवस्थित करने में 10 मिनट खर्च करना और फिर केवल 10 मिनट तक गाड़ी चलाना।

3. समाधान: "Feather"

लेखकों ने एक नया शेड्यूलर बनाया है जिसे Feather कहते हैं, जो इन दोनों समस्याओं को ठीक करता है।

भाग अ: "चंक्ड हैश ट्री" (CHT) – एक स्मार्ट चेकलिस्ट

विशाल पारिवारिक वृक्ष पर चढ़ने के बजाय, Feather एक चतुर शॉर्टकट का उपयोग करता है।

  • उपमा: कल्पना करें कि किसी व्यक्ति के नाम के हर एक अक्षर की जाँच करने के बजाय, आप केवल उनके पते के पहले कुछ "टुकड़ों" (chunks) की जाँच करते हैं।
  • यह कैसे काम करता है: Feather लंबे टेक्स्ट को छोटे ब्लॉकों (chunks) में तोड़ता है और प्रत्येक ब्लॉक को एक अनूखा "फिंगरप्रिंट" (hash) देता है। वह इस बात की एक सरल सूची रखता है कि वर्तमान में कौन से फिंगरप्रिंट उपयोग किए जा रहे हैं।
  • लाभ: यह तुरंत देख सकता है, "ओह, इस नए अनुरोध के फिंगरप्रिंट उसी समूह के समान हैं जो पहले से ही बस में हैं।" यह इसे इतनी तेज़ी से करता है कि "CPU दिमाग" पर कोई खास ज़ोर नहीं पड़ता। यह टिकट चेक करने के लिए पूरी किताब पढ़ने के बजाय बारकोड स्कैनर का उपयोग करने जैसा है।

भाग ब: "रीइन्फोर्समेंट लर्निंग" (RL) – एक स्मार्ट डिस्पैचर

Feather केवल समान समूहों को ही नहीं खोजता; यह यह भी सीखता है कि बस में लोग जोड़ना कब बंद करना है

  • दुविधा: यदि आप बस में लोग जोड़ते रहते हैं, तो अंततः आपको ऐसे व्यक्ति को जोड़ना पड़ सकता है जो एक अलग सड़क पर रहता है। यदि आप उन्हें जोड़ते हैं, तो पूरा समूह अस्त-व्यस्त हो जाता है, और गति कम हो जाती है।
  • सीखना: Feather एक स्मार्ट डिस्पैचर की तरह कार्य करता है जिसने परीक्षण और त्रुटि (trial and error) के माध्यम से सीखा है: "यदि मैं एक और व्यक्ति को जोड़ता हूँ, तो हम अपनी गति खो सकते हैं। आइए इस बस को अभी भेज दें जब यह अभी भी तेज़ है, और अगले समूह का इंतज़ार करें।"
  • परिणाम: यह गतिशील रूप से यह तय करता है कि बस को लॉन्च करने का सही क्षण क्या है, जिससे एक भरा हुआ बस और एक ही सड़क पर रहने वाले लोगों के बीच संतुलन बना रहे।

4. परिणाम: लाइब्रेरी की गति बढ़ाना

जब लेखकों ने Feather का परीक्षण किया:

  • गति: जब लोग समान प्रश्न पूछ रहे थे, तो इसने वर्तमान सर्वोत्तम तरीकों की तुलना में सिस्टम को 2 से 10 गुना तेज़ बना दिया।
  • सुरक्षा: यदि प्रश्न पूरी तरह से अलग थे (कोई साझा सड़क नहीं थी), तो Feather भ्रमित नहीं हुआ; इसने पुराने तरीकों के समान ही प्रदर्शन किया।
  • दक्षता: इसने कंप्यूटर की मेमोरी में "ट्रैफिक जाम" को कम कर दिया, जिसका अर्थ है कि लाइब्रेरियन को किताब के पन्ने लेने के लिए बार-बार इधर-उधर नहीं दौड़ना पड़ा।

सारांश

Feather एआई (AI) अनुरोधों को व्यवस्थित करने का एक नया तरीका है। अनुरोधों को एक ही बैच में अधिक से अधिक ठूँसने के बजाय, यह समान अनुरोधों को एक साथ समूहित करता है (जैसे एक ही गंतव्य पर जाने वाला एक परिवार) और उन समूहों को खोजने के लिए एक सुपर-फास्ट, कम-ऊर्जा वाले तरीके का उपयोग करता है। यह बिल्कुल जानता है कि यात्रा को सुचारू और तेज़ बनाए रखने के लिए समूह में लोगों को जोड़ना कब रोकना है।

शोध पत्र का दावा है कि यह दृष्टिकोण महंगे नए हार्डवेयर की आवश्यकता के बिना, केवल "ट्रैफिक" को स्मार्ट तरीके से व्यवस्थित करके, एआई प्रतिक्रिया समय को काफी तेज़ कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →