CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference
CRISP एक प्री-LLM, टेक्स्ट-ड्रिवन विजुअल टोकन प्रूनिंग फ्रेमवर्क है जो निर्देश-प्रासंगिक टोकन की पहचान करने और सिमेंटिक विविधता को बढ़ाने के लिए एक दो-चरणीय पाइपलाइन का उपयोग करता है, जिससे लार्ज विजन-लैंग्वेज मॉडल्स के लिए 99.5% से अधिक सटीकता प्रतिधारण (accuracy retention) प्राप्त होता है और इन्फरेंस लेटेंसी में 2 गुना से अधिक की कमी आती है।