← नवीनतम पेपर
💬 NLP

Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning

यह शोध पत्र प्रॉम्प्ट-लेवल डिस्टिलेशन (PLD) को प्रस्तुत करता है, जो एक नॉन-पैरामीट्रिक विधि है जो एक टीचर मॉडल से स्पष्ट रीजनिंग पैटर्न को संरचित सिस्टम निर्देशों में निकालती है, जिससे छोटे मॉडल नगण्य विलंबता के साथ फ्रंटियर-स्तर की रीजनिंग सटीकता प्राप्त करने में सक्षम होते हैं और विनियमित एवं उच्च-मात्रा वाले अनुप्रयोगों के लिए पूर्ण व्याख्यात्मकता बनाए रखते हैं।

मूल लेखक: Sanket Badhe, Deep Shah

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sanket Badhe, Deep Shah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय जासूस (शिक्षक/Teacher) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन किसी मामले को सुलझाने में बहुत अधिक समय लेता है। हर बार जब वे कोई रहस्य सुलझाते हैं, तो वे अपने हर एक विचार, सुराग और तार्किक चरण को समझाने के लिए एक विशाल, 50 पन्नों की डायरी लिखते हैं। इसे चेन-ऑफ-थॉट (Chain-of-Thought) कहा जाता है। यह सटीक है, लेकिन यदि आपको उत्तर अभी चाहिए, तो उस 50 पन्नों की डायरी का इंतज़ार करना बहुत धीमा और महंगा है।

दूसरी ओर, आपके पास एक तेज़, कुशल इंटर्न (छात्र/Student) है जो तुरंत उत्तर दे सकता है। लेकिन यदि आप इंटर्न से बस "इसे हल करो" कहेंगे, तो वे गलत अनुमान लगा सकते हैं क्योंकि उनमें जासूस जैसा गहरा तर्क करने का कौशल नहीं है।

आमतौर पर, इसे ठीक करने के लिए, कंपनियाँ इंटर्न को जासूस की 50 पन्नों की डायरियों को याद करने के लिए "सिखाने" की कोशिश करती हैं। इसे फाइन-ट्यूनिंग (Fine-Tuning) कहा जाता है। लेकिन यह अव्यवस्थित है: इसके लिए बहुत अधिक डेटा की आवश्यकता होती है, यदि जासूस कोई नया तरीका सीखता है तो इसे अपडेट करना कठिन होता है, और इंटर्न का मस्तिष्क (मॉडल का कोड) स्थायी रूप से बदल जाता है, जिससे यह सत्यापित करना कठिन हो जाता है कि उन्होंने कोई निर्णय क्यों लिया।

शोध पत्र का समाधान: "प्रॉम्प्ट-लेवल डिस्टिलेशन" (PLD)

लेखक प्रॉम्प्ट-लेवल डिस्टिलेशन (PLD) नामक एक स्मार्ट तरीका प्रस्तावित करते हैं। इंटर्न को डायरियाँ रटाने के बजाय, वे जासूस के तर्क पर आधारित एक चीट शीट (Cheat Sheet) (एक सिस्टम प्रॉम्प्ट) बनाते हैं।

यह कैसे काम करता है, इसके चरणों को एक सरल उपमा (Analogy) का उपयोग करके यहाँ समझाया गया है:

1. जासूस नियम लिखता है (सुपरवाइज्ड इंस्ट्रक्शन एक्सट्रैक्शन)

केवल मामला सुलझाने के बजाय, जासूस को एक साथ दो चीजें करने के लिए कहा जाता है:

  • मामला सुलझाएं।
  • अपने लंबे, जटिल तर्क को एक सरल, एक-वाक्य के नियम में अनुवाद (Translate) करें।
    • उदाहरण: यह लिखने के बजाय कि एक अनुबंध (contract) वैध क्यों है, जासूस लिखता है: "यदि अनुबंध कहता है 'कानूनी बैकअप के लिए रख सकता है,' तो उत्तर 'अनुमति है' (Allowed) होगा।"

2. नियमों को व्यवस्थित करना (क्लस्टरिंग लॉजिक सिंथेसिस)

जासूस एक या एक हज़ार ऐसे एक-वाक्य के नियम लिख सकता है। कुछ डुप्लिकेट हो सकते हैं; कुछ एक ही नियम के थोड़े अलग संस्करण हो सकते हैं।

  • टीम समान नियमों को एक साथ समूह में रखने के लिए एक स्मार्ट सॉर्टर (एक एल्गोरिदम जिसे DBSCAN कहा जाता है) का उपयोग करती है।
  • इसके बाद वे जासूस से प्रत्येक समूह को एक आदर्श, मास्टर नियम में मिलाने के लिए कहते हैं।
    • परिणाम: 1,000 बिखरे हुए नोट्स के बजाय, अब आपके पास एक साफ, व्यवस्थित सूची में 20 स्वर्णिम नियम हैं।

3. "तनाव परीक्षण" लूप (संघर्ष समाधान/Conflict Resolution)

कभी-कभी, दो नियम एक-दूसरे का विरोध कर सकते हैं (जैसे, नियम A कहता है "अनुमति है," लेकिन नियम B समान स्थिति के लिए "अनुमति नहीं है" कहता है)।

  • टीम इन नियमों का उपयोग करके इंटर्न का परीक्षण करती है।
  • जब इंटर्न कोई गलती करता है, तो टीम वह त्रुटि जासूस को दिखाती है।
  • जासूस नियम को स्पष्ट बनाने के लिए उसे ठीक करता है। वे इसे तब तक दोहराते हैं जब तक कि नियम पूर्ण न हो जाएं और उनमें कोई विरोधाभास न रहे।

4. अंतिम परिणाम (इन्फरेंस/Inference)

अब, इंटर्न (छोटा, तेज़ मॉडल) को इस चीट शीट को अपने "सिस्टम प्रॉम्प्ट" के रूप में दिया जाता है।

  • जब कोई नया प्रश्न आता है, तो इंटर्न को 50 पन्नों की डायरी लिखने की आवश्यकता नहीं होती है।
  • वे बस चीट शीट देखते हैं, मिलान करने वाले नियम को ढूंढते हैं, और तुरंत उत्तर दे देते हैं।
  • जादू: छोटा मॉडल अब बड़े जासूस जितनी सटीकता से सोचता है, लेकिन एक ज़ीरो-शॉट अनुमान की तरह तेज़ है, बिना अपने स्वयं के मस्तिष्क कोड को बदले।

यह एक बड़ी बात क्यों है?

  • गति और लागत: "चीट शीट" दृष्टिकोण तत्काल है। आपको मॉडल के "सोचने" के लिए लंबे चेन-ऑफ-लॉजिक का इंतज़ार नहीं करना पड़ता; तर्क पहले से ही लिखा हुआ है। यह सस्ता और तेज़ है, जो कानूनी अनुबंधों की जाँच करने या कंटेंट फ़िल्टर करने के लिए एकदम सही है।
  • पारदर्शिता: क्योंकि चीट शीट पर तर्क साधारण अंग्रेजी में लिखा गया है, इसलिए एक इंसान इसे पढ़ सकता है और कह सकता है, "हाँ, वह नियम समझ में आता है।" पारंपरिक फाइन-ट्यूनिंग के साथ, तर्क मॉडल के कोड के अंदर छिपा होता है (एक "ब्लैक बॉक्स"), और कोई नहीं जानता कि उसने निर्णय क्यों लिया।
  • "पुनः प्रशिक्षण" (Re-training) की आवश्यकता नहीं: यदि जासूस अधिक स्मार्ट हो जाता है या कानून बदल जाते हैं, तो आपको इंटर्न को फिर से सिखाने की आवश्यकता नहीं है। आप बस चीट शीट को अपडेट कर देते हैं।

उन्होंने क्या सिद्ध किया?

लेखकों ने कठिन तर्क पहेलियों और कानूनी अनुबंध प्रश्नों का उपयोग करके छोटे मॉडलों (जैसे, 4-बिलियन पैरामीटर वाला मॉडल) पर इसका परीक्षण किया।

  • पहले: छोटा मॉडल लगभग 57% उत्तर सही देता था।
  • PLD के बाद: उसी छोटे मॉडल ने 90% उत्तर सही दिए, जो बहुत बड़े, धीमे मॉडलों के प्रदर्शन से मेल खाते हैं।
  • उन्होंने दिखाया कि यह विभिन्न प्रकार के मॉडलों और विभिन्न प्रकार के तर्क संबंधी समस्याओं (जैसे कानूनी अनुबंध और तार्किक तर्क परीक्षण) के लिए काम करता है।

कमी (सीमाएँ)

शोध पत्र नोट करता है कि यह स्थिर नियमों (Static Rules) (जैसे "यदि X, तो Y") के लिए सबसे अच्छा काम करता है। यह उन समस्याओं के लिए उतना अच्छा काम नहीं कर सकता जिनमें मॉडल को जटिल गणित करने या वास्तविक समय में नए, चरण-दर-चरण तर्क बनाने की आवश्यकता होती है, क्योंकि उन कार्यों के लिए केवल "नियम देखने" के बजाय "सोचने" की आवश्यकता होती है।

संक्षेप में: यह शोध पत्र एक धीमे, बुद्धिमान विशेषज्ञ के मस्तिष्क को एक छोटे, तेज़ कार्यकर्ता के लिए एक पठनीय निर्देश पुस्तिका में बदलने का तरीका पेश करता है, जो आपको दोनों दुनियाओं का सर्वश्रेष्ठ देता है: उच्च सटीकता और तत्काल गति।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →