Rethinking Layer Redundancy in Large Language Models: Calibration Objectives and Search for Depth Pruning
यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स में लेयर रिडंडेंसी (परत अतिरेक) एक अंतर्निहित संरचनात्मक गुण नहीं है बल्कि यह कैलिब्रेशन उद्देश्य पर कार्यात्मक रूप से निर्भर है, जो यह प्रदर्शित करता है कि विशिष्ट सर्च एल्गोरिदम के उपयोग की तुलना में उद्देश्य का चयन डेप्थ प्रूनिंग परिणामों पर अधिक प्रभाव डालता है।