Scalable LLM Reasoning Acceleration with Low-rank Distillation
यह शोध पत्र Caprese को प्रस्तुत करता है, जो एक संसाधन-कुशल डिस्टिलेशन विधि है जो सिंथेटिक नमूनों के एक छोटे सेट और न्यूनतम अतिरिक्त मापदंडों का उपयोग करके बड़े भाषा मॉडलों की गणितीय तर्क क्षमताओं को बहाल करती है जो कुशल अनुमान तकनीकों द्वारा बाधित हो गई हैं, जबकि साथ ही भाषा प्रदर्शन को कम किए बिना सक्रिय मापदंडों, विलंबता (latency) और टोकन संख्या को कम करती है।