Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode
यह शोध पत्र प्रकट करता है कि जहाँ फिजिकल एआई (Physical AI) का बैच-1 एलएलएम (LLM) इन्फरेंस मेमोरी-डॉमिनेटेड है, वहीं तेज़ जीपीयू (GPU) असंगत रूप से अधिक लॉन्च-साइड ओवरहेड्स से ग्रस्त होते हैं जो आनुपातिक लेटेंसी लाभ को रोकते हैं, और मानक क्वांटाइजेशन विधियाँ अक्सर अपेक्षित स्पीडअप प्राप्त करने में विफल रहती हैं जब तक कि उन्हें GPTQ+ExLlamaV2 जैसे अत्यधिक अनुकूलित कर्नेल्स के साथ जोड़ा न जाए।