RAP: Runtime Adaptive Pruning for LLM Inference
यह शोध पत्र RAP को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) द्वारा संचालित फ्रेमवर्क है जो बदलते मेमोरी बजट और वर्कलोड स्थितियों के तहत उपयोगिता को अधिकतम करने के लिए मॉडल वेट्स और KV-कैशे रिटेंशन को संयुक्त रूप से अनुकूलित करके, वास्तविक समय में LLM इन्फरेंस प्रूनिंग रणनीतियों को गतिशील रूप से अनुकूलित करता है।