Unlocking Prompt Infilling Capability for Diffusion Language Models
यह शोध पत्र यह प्रदर्शित करता है कि केवल रिस्पॉन्स-ओनली मास्किंग के बजाय फुल-सीक्वेंस मास्किंग को शामिल करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग का विस्तार करके, मास्कड डिफ्यूजन लैंग्वेज मॉडल्स प्रभावी रूप से इनफिल प्रॉम्प्ट्स की क्षमता को अनलॉक कर सकते हैं, जिससे मैन्युअल रूप से डिज़ाइन किए गए टेम्पलेट्स के बराबर या उनसे बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Unlocking Prompt Infilling Capability for Diffusion Language Models" पेपर का सरल भाषा में अनुवाद दिया गया है:
मुख्य विचार: "अंधा" कलाकार (The "Blind" Artist)
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली कलाकार (AI मॉडल) है जो एक बिखरे हुए, टेढ़े-मेढ़े कैनवास को देखकर उसे धीरे-धीरे साफ करके एक सुंदर चित्र बना सकता है। डिफ्यूजन लैंग्वेज मॉडल्स (Diffusion Language Models) इसी तरह काम करते हैं। पारंपरिक AI के विपरीत, जो एक टाइप करने वाले की तरह बाएं से दाएं एक बार में एक शब्द लिखता है, यह कलाकार एक ही बार में पूरी तस्वीर देख सकता है और उसके किसी भी हिस्से को ठीक कर सकता है, चाहे वह आसमान हो, पेड़ हों या लोग।
समस्या:
भले ही यह कलाकार तस्वीर के किसी भी हिस्से को ठीक कर सकता है, लेकिन जिस तरह से उन्हें स्कूल में प्रशिक्षित (Supervised Fine-Tuning) किया गया था, वह बहुत अजीब था।
- पुरानी ट्रेनिंग: शिक्षक ने कलाकार को एक सटीक, साफ निर्देश कार्ड (Prompt) और एक बिखरा हुआ, टेढ़ा-मेढ़ा उत्तर कार्ड (Response) दिया। शिक्षक ने कहा, "केवल उत्तर कार्ड को ठीक करो। निर्देश कार्ड को मत छेड़ो।"
- परिणाम: कलाकार उत्तरों को ठीक करने में तो उस्ताद बन गया, लेकिन अगर आप उसे एक बिखरा हुआ निर्देश कार्ड देते और उसे ठीक करने के लिए कहते, तो वह सुन्न (freeze) हो जाता। उसे कभी सिखाया ही नहीं गया था कि उसे निर्देशों को छूने की अनुमति है। उसने सोचा, "मुझे केवल उत्तर ठीक करने के लिए कहा गया है!"
पेपर का समाधान:
शोधकर्ताओं ने महसूस किया कि यह कलाकार के दिमाग (architecture) की खामी नहीं थी, बल्कि यह उनके प्रशिक्षण मैनुअल (training manual) की खामी थी। उन्होंने एक नया नियम पेश किया: फुल-सीक्वेंस मास्किंग (Full-Sequence Masking)।
- नई ट्रेनिंग: अब, शिक्षक कलाकार को एक बिखरा हुआ निर्देश कार्ड और एक बिखरा हुआ उत्तर कार्ड देता है। कलाकार को दोनों को ठीक करना होता है।
- परिणाम: कलाकार यह सीख जाता है कि वह निर्देशों को भी ठीक कर सकता है! यह एक सुपरपावर को अनलॉक करता है जिसे प्रॉम्ट इनफिलिंग (Prompt Infilling) कहा जाता है।
वास्तविक जीवन में यह कैसे काम करता है: "खाली स्थान भरने" का जादू (The "Fill-in-the-Blank" Magic)
कल्पना कीजिए कि आप एक शिक्षक हैं जो छात्रों के निबंधों को ग्रेड दे रहे हैं। आपके पास ग्रेडिंग के लिए एक टेम्पलेट है, लेकिन आपने कुछ हिस्से खाली छोड़ दिए हैं क्योंकि आप चाहते हैं कि AI यह तय करे कि आपके द्वारा दिए गए कुछ उदाहरणों के आधार पर सबसे अच्छा तरीका क्या होगा।
इस पेपर से पहले:
आप AI को देते हैं: "इस निबंध को [खाली स्थान] मानदंडों के आधार पर ग्रेड करें।"
AI घबरा जाता है। वह मानदंडों का अनुमान लगाने की कोशिश करता है लेकिन अक्सर अर्थहीन बातें लिखने लगता है या लिखना बंद कर देता है क्योंकि उसे वाक्य के "ग्रेडिंग नियमों" वाले हिस्से को भरने के लिए प्रशिक्षित नहीं किया गया था।
इस पेपर के बाद:
आप AI को वही टेम्पलेट देते हैं। चूंकि इसे निर्देशों और उत्तरों दोनों को ठीक करने के लिए प्रशिक्षित किया गया था, इसलिए यह आपके उदाहरणों को देखता है, समझता है कि आप किस तरह की ग्रेडिंग चाहते हैं, और खाली स्थानों को पूरी तरह से भर देता है। यह शायद एक नया और चतुर तरीका भी बना सकता है जिससे निबंध को स्कोर किया जाए, जिसके बारे में आपने सोचा भी नहीं था!
यह क्यों महत्वपूर्ण है: तीन मुख्य बातें
1. यह एक ट्रेनिंग की समस्या है, हार्डवेयर की नहीं
यह पेपर साबित करता है कि AI मॉडल्स में पहले से ही प्रॉम्ट्स को ठीक करने की क्षमता थी; बस उन्हें इसका अभ्यास नहीं कराया गया था। यह एक ऐसी कार की तरह है जिसमें टर्बो बटन तो है लेकिन वह इंजन से जुड़ा नहीं है। शोधकर्ताओं ने बस तार जोड़ दिया (ट्रेनिंग का तरीका बदल दिया), और अचानक कार बहुत तेज चलने लगी।
2. "स्व-सुधार" करने वाला प्रॉम्ट (The "Self-Improving" Prompt)
AI अब किसी कार्य के कुछ उदाहरण देख सकता है और उस कार्य को सबसे अच्छी तरह से करने के लिए अपना खुद का "निर्देश मैनुअल" लिख सकता है।
- उपमा (Analogy): कल्पना कीजिए कि आप एक शेफ को आपके पसंदीदा व्यंजन के कुछ उदाहरण देते हैं। आपके द्वारा रेसिपी कार्ड लिखने के बजाय, शेफ उन उदाहरणों को देखता है, अपने लिए एक परफेक्ट रेसिपी कार्ड लिखता है, और फिर उस नए कार्ड का उपयोग करके व्यंजन बनाता है। परिणाम अक्सर उस तुलना में बेहतर होता जब आपने खुद रेसिपी लिखने की कोशिश की होती।
3. यह हर जगह काम करता है
शोधकर्ताओं ने गणित के सवालों और सारांश (summaries) की गुणवत्ता को परखने पर इसका परीक्षण किया।
- गणित: AI गणितीय समस्या के विवरण के लापता हिस्सों को भर सका जिससे वह मानक तरीकों की तुलना में बेहतर तरीके से हल कर सका।
- ग्रेडिंग: जब AI को जज के रूप में काम करना था, तो इसने एक ऐसा स्कोरिंग सिस्टम बनाया जो मानव जजों के साथ बेहतर तालमेल बिठा सका, बजाय किसी भी मानव-निर्मित सिस्टम के।
"सीक्रेट सॉस" (Full-Sequence Masking)
यह पेपर तीन तरह की ट्रेनिंग की तुलना करता है:
- पुराना तरीका (Response-Only): केवल उत्तर को ठीक करें। (परिणाम: AI निर्देश ठीक करने में खराब है)।
- नया तरीका (Full-Sequence): निर्देशों सहित सब कुछ ठीक करें। (परिणाम: AI अपने निर्देशों को समझने और सुधारने में उस्ताद बन जाता है)।
- हाइब्रिड तरीका (Hybrid Way): पहले सब कुछ ठीक करें, फिर उत्तरों का थोड़ा और अभ्यास करें। (परिणाम: दोनों का सबसे अच्छा संगम)।
निष्कर्ष (The Bottom Line)
यह पेपर AI समुदाय के लिए एक चेतावनी है। हम अक्सर सोचते हैं कि हमें नई चीजें करने के लिए बड़े, अधिक जटिल AI दिमाग बनाने की आवश्यकता है। लेकिन कभी-कभी, हमें बस उन्हें सिखाने का तरीका बदलने की आवश्यकता होती है। उन्हें अपने स्वयं के निर्देशों में "खाली स्थान भरने" का अभ्यास करने देकर, हम एक ऐसी बुद्धिमत्ता और लचीलेपन को अनलॉक करते हैं जो वहीं मौजूद था, बस सही चाबी का इंतज़ार कर रहा था।
संक्षेप में: उन्होंने एक बेहतर कार नहीं बनाई; उन्होंने बस ड्राइवर को टर्बो बटन का उपयोग करना सिखाया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।