Compute Where it Counts: Self Optimizing Language Models
यह शोध पत्र सेल्फ-ऑप्टिमाइज़िंग लैंग्वेज मॉडल्स (SOL) को प्रस्तुत करता है, जो एक फ्रोजन (frozen) LLM को एक हल्के पॉलिसी नेटवर्क के साथ जोड़ता है ताकि स्पर्सिटी (sparsity), प्रूनिंग और क्वांटाइजेशन को समायोजित करके प्रति टोकन परिवर्तनीय कंप्यूटेशन बजट को गतिशील रूप से आवंटित किया जा सके, जिससे स्टेटिक एलोकेशन रणनीतियों की तुलना में इन्फरेंस गुणवत्ता और दक्षता में उल्लेखनीय सुधार होता है।