TELL-TALE: Task Efficient LLMs with Task Aware Layer Elimination
यह शोध पत्र TALE को पेश करता है, जो एक इन्फरेंस-टाइम विधि है जो बिना पुनरप्रशिक्षण (retraining) के कार्य-विशिष्ट प्रदर्शन को अनुकूलित करने और कम्प्यूटेशनल लागत को कम करने के लिए लार्ज लैंग्वेज मॉडल्स में अप्रासंगिक परतों (layers) को गतिशील रूप से समाप्त करती है।