Fragile Knowledge, Robust Instruction-Following: The Width Pruning Dichotomy in Llama-3.2
यह शोध पत्र प्रकट करता है कि Llama-3.2 मॉडलों में GLU-MLP परतों की संरचित चौड़ाई प्रूनिंग (structured width pruning) एक अनूठा व्यापार-समझौता (trade-off) उत्पन्न करती है जहाँ विस्तार अनुपात (expansion ratio) को कम करने से पैरामीट्रिक ज्ञान घटता है और ऊर्जा दक्षता बढ़ती है, फिर भी विरोधाभासी रूप से यह बहु-चरणीय तर्क क्षमताओं को सुरक्षित रखते हुए निर्देश-अनुपालन और सत्यता को बढ़ाता है।