How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
यह शोध पत्र शैडो मास्क डिस्टिलेशन (Shadow Mask Distillation) प्रस्तुत करता है, जो एक नवीन विधि है जिसे सुदृढीकरण अधिगम (Reinforcement Learning) पोस्ट-ट्रेनिंग के दौरान रोलआउट चरण में KV कैश संपीड़न (KV cache compression) लागू करने से होने वाले गंभीर ऑफ-पॉलिसी बायस (off-policy bias) और ग्रेडिएंट वेरिएंस को कम करने के लिए डिज़ाइन किया गया है, जिससे लंबी-संदर्भ तर्क (long-context reasoning) कार्यों के लिए मेमोरी-कुशल संरेखण सक्षम होता है।