← नवीनतम पेपर
💬 NLP

Prompt Compression in Diffusion Large Language Models: Evaluating LLMLingua-2 on LLaDA

यह अध्ययन डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (विशेष रूप से LLaDA) में LLMLingua-2 प्रॉम्प्ट कंप्रेशन पद्धति की हस्तांतरणीयता का मूल्यांकन करता है, जिससे यह पता चलता है कि जहाँ सारांश (summarization) कार्यों के लिए यह सुदृढ़ बनी रहती है, वहीं महत्वपूर्ण तर्क संबंधी जानकारी के छूट जाने के कारण गणितीय तर्क क्षमता (mathematical reasoning) काफी कम हो जाती है, जो यह संकेत देता है कि ऑटोरेग्रेसिव-केंद्रित संपीड़न रणनीतियाँ डिफ्यूजन आर्किटेक्चर पर समान रूप से लागू नहीं होती हैं।

मूल लेखक: Sterling Huang, Abigayle Brown, Jiyoo Noh, Jiakang Xu, Wantong Huo, Kaung Myat Kyaw, Jonathan Chan

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sterling Huang, Abigayle Brown, Jiyoo Noh, Jiakang Xu, Wantong Huo, Kaung Myat Kyaw, Jonathan Chan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान शेफ (AI) है जो आपके द्वारा दी गई रेसिपी के आधार पर एक जटिल व्यंजन बनाने की कोशिश कर रहा है। आमतौर पर, यह शेफ रेसिपी को शुरू से अंत तक, एक बार में एक शब्द करके पढ़ता है और स्टेप-दर-स्टेप व्यंजन बनाता है। यह अधिकांश वर्तमान AI मॉडल के काम करने का तरीका है।

लेकिन, एक नया प्रकार का शेफ है, जिसे डिफ्यूजन मॉडल (विशेष रूप से LLaDA नाम का एक मॉडल) कहा जाता है। लाइन-बाय-लाइन रेसिपी पढ़ने के बजाय, यह शेफ एक खाली पन्ने से शुरुआत करता जो लकीरों और रेखाचित्रों (scribbles) से भरा होता है, और फिर धीरे-धीरे उस पूरे पन्ने को "डिनोइज़" (denoise) करता है—यानी पूरे रेसिपी को एक साथ रिफाइन करता है—जब तक कि अंतिम व्यंजन सामने नहीं आ जाता।

शोधकर्ताओं ने यह देखना चाहा कि क्या एक लोकप्रिय टूल, जिसे LLMLingua-2 कहा जाता है (जो "लाइन-बाय-लाइन" वाले शेफ के लिए रेसिपी को छोटा करने के लिए बनाया गया है), इस नए "एक साथ सब कुछ" वाले शेफ के लिए भी उतना ही अच्छा काम करेगा।

यहाँ उन्हें क्या मिला, सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. "छोटा किया गया रेसिपी" प्रयोग

टीम ने लंबे, विस्तृत प्रॉम्प्ट्स (रेसिपी) लिए और LLMLingua-2 का उपयोग करके उन्हें लगभग आधा कर दिया। उन्होंने "मुख्य विचार" को बरकरार रखा लेकिन उन शब्दों को हटा दिया जिन्हें उन्होंने अनावश्यक समझा।

  • लक्ष्य: समय और कंप्यूटिंग पावर बचाना (जैसे कि एक लंबा मेनू प्रिंट करने की लागत कम करना)।
  • परीक्षण: उन्होंने इन छोटी की गई रेसिपीज़ को डिफ्यूजन शेफ (LLaDA) को दिया और उससे तीन चीजें करने को कहा:
    1. गणित की समस्या हल करना (जैसे सेब और संतरों से जुड़ी एक कठिन वर्ड प्रॉब्लम)।
    2. समाचार का सारांश बनाना (एक लंबे लेख को छोटे विवरण में बदलना)।
    3. मूल रूप में पुनर्गठन करना (छोटी की गई रेसिपी से मूल पूरी रेसिपी को फिर से लिखने का प्रयास करना)।

2. आश्चर्यजनक परिणाम: "दिखने में अच्छा, स्वाद में गलत"

शोधकर्ताओं ने पाया कि डिफ्यूजन शेफ के लिए, एक रेसिपी जो मूल रेसिपी के समान दिखती है, वह हमेशा उसी तरह से काम नहीं करती।

  • "सारांश" कार्य (मजबूत पक्ष):
    जब समाचार या चैट लॉग का सारांश बनाने के लिए कहा गया, तो डिफ्यूजन शेफ ने छोटी की गई रेसिपीज़ को बहुत अच्छी तरह से संभाला। भले ही कुछ शब्द गायब थे, शेफ मुख्य कहानी को समझने में सक्षम था।

    • उपमा: यदि आप एक शेफ को कहते हैं, "सलाद बनाओ जिसमें लेट्यूस और टमाटर हो," तो वे एक बेहतरीन सलाद बना सकते हैं भले ही आप ड्रेसिंग का जिक्र करना भूल गए हों। मुख्य विचार ही काफी था।
  • "गणित" कार्य (कमजोर पक्ष):
    जब गणित की समस्या हल करने के लिए कहा गया, तो छोटी की गई रेसिपीज़ के कारण शेफ विफल रहा, भले ही छोटा किया गया टेक्स्ट मूल टेक्स्ट के बहुत समान लग रहा था।

    • उपमा: कल्पना कीजिए कि एक गणित की समस्या कहती है, "मेरे पास 5 सेब हैं, और मैं अपने दोस्त को 2 देता हूँ।" कंप्रेशन टूल "2" शब्द को हटा सकता है क्योंकि उसे लगता है कि वाक्य बिना इसके भी अर्थपूर्ण है। एक इंसान के लिए जो केवल सार (gist) पढ़ रहा है, यह ठीक लग सकता है। लेकिन डिफ्यूजन शेफ के लिए, उस विशिष्ट संख्या को खोना एक महत्वपूर्ण सामग्री को खोने जैसा है। शेफ गलत उत्तर का अनुमान लगाता है क्योंकि एक सूक्ष्म, विशिष्ट विवरण गायब था।

3. "पुनर्गठन" की पहेली

शोधकर्ताओं ने शेफ से छोटी की गई रेसिपी को लेकर मूल पूरी रेसिपी को वापस लिखने के लिए भी कहा।

  • परिणाम: शेफ ने अर्थ (semantic similarity) को पकड़ने में बहुत अच्छा काम किया। यदि आप दोनों टेक्स्ट की तुलना करें, तो वे 94% समान दिखे।
  • पेंच (The Catch): भले ही अर्थ मौजूद था, लेकिन शेफ अक्सर उन सूक्ष्म, महत्वपूर्ण विवरणों को छोड़ देता था जिनकी बाद में गणित की समस्या हल करने के लिए आवश्यकता थी। यह एक ऐसे शेफ की तरह है जो केक का वर्णन तो पूरी तरह से कर सकता है लेकिन यह लिखना भूल जाता है कि इसमें ठीक 3 अंडे चाहिए, न कि 2।

4. ऐसा क्यों हुआ?

पेपर बताता है कि दो प्रकार के शेफ (Autoregressive बनाम Diffusion) रेसिपी का उपयोग अलग तरह से करते हैं:

  • लाइन-बाय-लाइन शेफ: पहले शब्द को पढ़ता है, फिर दूसरे को। यदि शुरुआत में कोई शब्द गायब है, तो शायद अगले स्टेप के लिए यह उतना महत्वपूर्ण न हो।
  • "एक साथ सब कुछ" वाला शेफ: वह लिखने के लिए पूरी रेसिपी को एक साथ देखता है। यदि कोई विशिष्ट संख्या या संबंध "बड़ी तस्वीर" (big picture) से गायब है, तो डिफ्यूजन शेफ तुरंत भ्रमित हो जाता है क्योंकि वे बाद में "खाली जगहों को भरने" (fill in the blanks) का काम उस तरह से नहीं कर पाते जैसे दूसरा शेफ कर सकता है।

निष्कर्ष (The Bottom Line)

अध्ययन यह निष्कर्ष निकालता है कि आप दोनों प्रकार के शेफ के लिए एक ही "रेसिपी शेवर" (रेसिपी छोटा करने वाला टूल) का उपयोग नहीं कर सकते।

मानक AI मॉडल (जो बाएँ-से-दाएँ पढ़ते हैं) के लिए प्रॉम्प्ट को छोटा करने के लिए डिज़ाइन किए गए टूल्स, डिफ्यूजन मॉडल (जो एक साथ सब कुछ देखते हैं) के लिए पूरी तरह से काम नहीं करते हैं। हालांकि छोटे किए गए प्रॉम्प्ट्स मूल टेक्स्ट के बहुत समान लग रहे थे, लेकिन उन्होंने अक्सर उन सूक्ष्म, विशिष्ट विवरणों को हटा दिया जिनकी डिफ्यूजन मॉडल को गणित जैसी कठिन समस्याओं को हल करने के लिए आवश्यकता थी।

संक्षेप में: डिफ्यूजन मॉडल के लिए, "मुख्य विचार रखना" पर्याप्त नहीं है। आपको सटीक विवरणों को बनाए रखना होगा, अन्यथा शेफ रास्ता भटक जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →