A 35B Hybrid-Attention Mixture-of-Experts Model on a 6GB 2011 GPU: Hand-Written 4-bit CUDA Inference for Fermi
यह शोध पत्र एक हाइब्रिड निष्पादन रणनीति को लागू करके 2011 के 6GB फर्मी (Fermi) GPU पर 35-बिलियन-पैरामीटर वाले Qwen3.6 MoE मॉडल के एंड-टू-एंड इन्फरेंस (inference) का प्रदर्शन करता है, जो GPU प्रीफिल के लिए वेट्स (weights) को स्ट्रीम करता है और CPU डिकोडिंग के लिए एक हैंड-रिटन SSSE3 इंटिजर कर्नल का उपयोग करता है, साथ ही प्रदर्शन लाभों और लीगेसी सिलिकॉन पर फ्रंटियर-क्लास AI चलाने की व्यावहारिक हार्डवेयर सीमाओं दोनों को प्रलेखित करता है।