Theoretically Optimal Attention/FFN Ratios in Disaggregated LLM Serving
यह शोध पत्र एक विश्लेषणात्मक ढांचे और एक क्लोज्ड-फॉर्म प्रोविजनिंग नियम को प्रस्तुत करता है ताकि डिसैग्रिगेटेड (disaggregated) LLM सर्विंग में सैद्धांतिक रूप से इष्टतम अटेंशन-टू-एफएफएन (Attention-to-FFN) संसाधन अनुपात निर्धारित किया जा सके, जो डिवाइस के आइडल टाइम और स्टेप-लेवल ब्लॉकिंग को कम करने के लिए स्टोकेस्टिक वर्कलोड डायनेमिक्स और सिंक्रोनाइज़ेशन ओवरहेड्स को ध्यान में रखता है।