Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation
यह शोध पत्र LARS (लो-मेमोरी एक्टिवेशन-रैंक सबस्पेस) को पेश करता है, जो एक नया अनुकूलन ढांचा (अडैप्टेशन फ्रेमवर्क) है जो मॉडल पैरामीटर्स के बजाय एक्टिवेशन सबस्पेस को सीमित करके ऑन-डिवाइस LLM फाइन-ट्यूनिंग में सुधार करता है, जिससे अनुक्रम लंबाई (सीक्वेंस लेंथ) से मेमोरी खपत का अलगाव होता है और पारंपरिक PEFT विधियों जैसे कि LoRA की तुलना में मेमोरी फुटप्रिंट को काफी कम कर देता है।