Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA
यह अध्ययन डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (विशेष रूप से LLaDA) में LLMLingua-2 प्रॉम्प्ट कंप्रेशन पद्धति की हस्तांतरणीयता का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ सारांश (summarization) कार्यों के लिए यह सुदृढ़ बनी रहती है, वहीं महत्वपूर्ण तर्क संबंधी जानकारी के छूट जाने के कारण गणितीय तर्क क्षमता (mathematical reasoning) काफी कम हो जाती है, जो यह संकेत देता है कि ऑटोरेग्रेसिव-केंद्रित संपीड़न रणनीतियाँ डिफ्यूजन आर्किटेक्चर पर समान रूप से लागू नहीं होती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान शेफ (AI) है जो आपके द्वारा दी गई रेसिपी के आधार पर एक जटिल व्यंजन बनाने की कोशिश कर रहा है। आमतौर पर, यह शेफ रेसिपी को शुरू से अंत तक, एक बार में एक शब्द करके पढ़ता है और स्टेप-दर-स्टेप व्यंजन बनाता है। यह अधिकांश वर्तमान AI मॉडल के काम करने का तरीका है।
लेकिन, एक नया प्रकार का शेफ है, जिसे डिफ्यूजन मॉडल (विशेष रूप से LLaDA नाम का एक मॉडल) कहा जाता है। लाइन-बाय-लाइन रेसिपी पढ़ने के बजाय, यह शेफ एक खाली पन्ने से शुरुआत करता जो लकीरों और रेखाचित्रों (scribbles) से भरा होता है, और फिर धीरे-धीरे उस पूरे पन्ने को "डिनोइज़" (denoise) करता है—यानी पूरे रेसिपी को एक साथ रिफाइन करता है—जब तक कि अंतिम व्यंजन सामने नहीं आ जाता।
शोधकर्ताओं ने यह देखना चाहा कि क्या एक लोकप्रिय टूल, जिसे LLMLingua-2 कहा जाता है (जो "लाइन-बाय-लाइन" वाले शेफ के लिए रेसिपी को छोटा करने के लिए बनाया गया है), इस नए "एक साथ सब कुछ" वाले शेफ के लिए भी उतना ही अच्छा काम करेगा।
यहाँ उन्हें क्या मिला, सरल उपमाओं (analogies) के माध्यम से समझाया गया है:
1. "छोटा किया गया रेसिपी" प्रयोग
टीम ने लंबे, विस्तृत प्रॉम्प्ट्स (रेसिपी) लिए और LLMLingua-2 का उपयोग करके उन्हें लगभग आधा कर दिया। उन्होंने "मुख्य विचार" को बरकरार रखा लेकिन उन शब्दों को हटा दिया जिन्हें उन्होंने अनावश्यक समझा।
- लक्ष्य: समय और कंप्यूटिंग पावर बचाना (जैसे कि एक लंबा मेनू प्रिंट करने की लागत कम करना)।
- परीक्षण: उन्होंने इन छोटी की गई रेसिपीज़ को डिफ्यूजन शेफ (LLaDA) को दिया और उससे तीन चीजें करने को कहा:
- गणित की समस्या हल करना (जैसे सेब और संतरों से जुड़ी एक कठिन वर्ड प्रॉब्लम)।
- समाचार का सारांश बनाना (एक लंबे लेख को छोटे विवरण में बदलना)।
- मूल रूप में पुनर्गठन करना (छोटी की गई रेसिपी से मूल पूरी रेसिपी को फिर से लिखने का प्रयास करना)।
2. आश्चर्यजनक परिणाम: "दिखने में अच्छा, स्वाद में गलत"
शोधकर्ताओं ने पाया कि डिफ्यूजन शेफ के लिए, एक रेसिपी जो मूल रेसिपी के समान दिखती है, वह हमेशा उसी तरह से काम नहीं करती।
"सारांश" कार्य (मजबूत पक्ष):
जब समाचार या चैट लॉग का सारांश बनाने के लिए कहा गया, तो डिफ्यूजन शेफ ने छोटी की गई रेसिपीज़ को बहुत अच्छी तरह से संभाला। भले ही कुछ शब्द गायब थे, शेफ मुख्य कहानी को समझने में सक्षम था।- उपमा: यदि आप एक शेफ को कहते हैं, "सलाद बनाओ जिसमें लेट्यूस और टमाटर हो," तो वे एक बेहतरीन सलाद बना सकते हैं भले ही आप ड्रेसिंग का जिक्र करना भूल गए हों। मुख्य विचार ही काफी था।
"गणित" कार्य (कमजोर पक्ष):
जब गणित की समस्या हल करने के लिए कहा गया, तो छोटी की गई रेसिपीज़ के कारण शेफ विफल रहा, भले ही छोटा किया गया टेक्स्ट मूल टेक्स्ट के बहुत समान लग रहा था।- उपमा: कल्पना कीजिए कि एक गणित की समस्या कहती है, "मेरे पास 5 सेब हैं, और मैं अपने दोस्त को 2 देता हूँ।" कंप्रेशन टूल "2" शब्द को हटा सकता है क्योंकि उसे लगता है कि वाक्य बिना इसके भी अर्थपूर्ण है। एक इंसान के लिए जो केवल सार (gist) पढ़ रहा है, यह ठीक लग सकता है। लेकिन डिफ्यूजन शेफ के लिए, उस विशिष्ट संख्या को खोना एक महत्वपूर्ण सामग्री को खोने जैसा है। शेफ गलत उत्तर का अनुमान लगाता है क्योंकि एक सूक्ष्म, विशिष्ट विवरण गायब था।
3. "पुनर्गठन" की पहेली
शोधकर्ताओं ने शेफ से छोटी की गई रेसिपी को लेकर मूल पूरी रेसिपी को वापस लिखने के लिए भी कहा।
- परिणाम: शेफ ने अर्थ (semantic similarity) को पकड़ने में बहुत अच्छा काम किया। यदि आप दोनों टेक्स्ट की तुलना करें, तो वे 94% समान दिखे।
- पेंच (The Catch): भले ही अर्थ मौजूद था, लेकिन शेफ अक्सर उन सूक्ष्म, महत्वपूर्ण विवरणों को छोड़ देता था जिनकी बाद में गणित की समस्या हल करने के लिए आवश्यकता थी। यह एक ऐसे शेफ की तरह है जो केक का वर्णन तो पूरी तरह से कर सकता है लेकिन यह लिखना भूल जाता है कि इसमें ठीक 3 अंडे चाहिए, न कि 2।
4. ऐसा क्यों हुआ?
पेपर बताता है कि दो प्रकार के शेफ (Autoregressive बनाम Diffusion) रेसिपी का उपयोग अलग तरह से करते हैं:
- लाइन-बाय-लाइन शेफ: पहले शब्द को पढ़ता है, फिर दूसरे को। यदि शुरुआत में कोई शब्द गायब है, तो शायद अगले स्टेप के लिए यह उतना महत्वपूर्ण न हो।
- "एक साथ सब कुछ" वाला शेफ: वह लिखने के लिए पूरी रेसिपी को एक साथ देखता है। यदि कोई विशिष्ट संख्या या संबंध "बड़ी तस्वीर" (big picture) से गायब है, तो डिफ्यूजन शेफ तुरंत भ्रमित हो जाता है क्योंकि वे बाद में "खाली जगहों को भरने" (fill in the blanks) का काम उस तरह से नहीं कर पाते जैसे दूसरा शेफ कर सकता है।
निष्कर्ष (The Bottom Line)
अध्ययन यह निष्कर्ष निकालता है कि आप दोनों प्रकार के शेफ के लिए एक ही "रेसिपी शेवर" (रेसिपी छोटा करने वाला टूल) का उपयोग नहीं कर सकते।
मानक AI मॉडल (जो बाएँ-से-दाएँ पढ़ते हैं) के लिए प्रॉम्प्ट को छोटा करने के लिए डिज़ाइन किए गए टूल्स, डिफ्यूजन मॉडल (जो एक साथ सब कुछ देखते हैं) के लिए पूरी तरह से काम नहीं करते हैं। हालांकि छोटे किए गए प्रॉम्प्ट्स मूल टेक्स्ट के बहुत समान लग रहे थे, लेकिन उन्होंने अक्सर उन सूक्ष्म, विशिष्ट विवरणों को हटा दिया जिनकी डिफ्यूजन मॉडल को गणित जैसी कठिन समस्याओं को हल करने के लिए आवश्यकता थी।
संक्षेप में: डिफ्यूजन मॉडल के लिए, "मुख्य विचार रखना" पर्याप्त नहीं है। आपको सटीक विवरणों को बनाए रखना होगा, अन्यथा शेफ रास्ता भटक जाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।