← नवीनतम पेपर
💬 NLP

Generative Prompt Internalization

यह शोध पत्र जेनेरेटिव प्रॉम्प्ट इंटरनलाइजेशन (GenPI) का प्रस्ताव करता है, जो एक हल्का संयुक्त प्रशिक्षण (joint training) तरीका है जो बड़े भाषा मॉडलों को जटिल प्रॉम्प्ट और उनके अंतर्निहित तर्क को स्वायत्त रूप से उत्पन्न करने और आंतरिक रूप से आत्मसात करने में सक्षम बनाता है, जिससे स्पष्ट, लंबे प्रॉम्प्ट के कम्प्यूटेशनल ओवरहेड के बिना उच्च प्रदर्शन और कुशल अनुमान प्राप्त होता है।

मूल लेखक: Haebin Shin, Lei Ji, Yeyun Gong, Sungdong Kim, Eunbi Choi, Minjoon Seo

प्रकाशित 2026-02-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haebin Shin, Lei Ji, Yeyun Gong, Sungdong Kim, Eunbi Choi, Minjoon Seo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "जेनरेटिव प्रॉम्प्ट इंटरनलाइजेशन" (GenPI) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ स्पष्टीकरण दिया गया है।

समस्या: "भारी बैकपैक"

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) सहायक (AI) को एक जटिल काम करने के लिए काम पर रख रहे हैं, जैसे कि किसी वेबसाइट को चलाना या कंप्यूटर सर्वर को मैनेज करना।

यह सुनिश्चित करने के लिए कि सहायक काम सही ढंग से करे, आपको हर बार जब भी आप उससे कोई सवाल पूछें, उसे एक विशाल निर्देश पुस्तिका (instruction manual) देनी पड़ती है। यह मैनुअल 1,000+ शब्दों का है। यह उसे बताता है:

  • "आप एक लिनक्स (Linux) विशेषज्ञ हैं।"
  • "हमेशा कार्य करने से पहले सोचें।"
  • "यदि स्क्रीन कट जाए, तो दूसरा कमांड आज़माएँ।"
  • "इसे कैसे करना है, इसके तीन उदाहरण यहाँ दिए गए हैं।"

समस्या: जब भी आप नया सवाल पूछते हैं, आपको इस भारी मैनुअल को साथ ले जाना पड़ता है, इसे पढ़ना पड़ता है और फिर से सहायक को सौंपना पड़ता है।

  • यह धीमा है: मैनुअल ले जाने में समय लगता है (कंप्यूटेशनल ओवरहेड)।
  • यह महंगा है: आप जितने अधिक शब्द भेजते हैं, सेवा प्रदाता (service provider) के लिए इसकी लागत उतनी ही अधिक होती है।
  • यह दोहराव वाला है: आप बार-बार एक ही नियम दोहरा रहे हैं, जैसे एक शिक्षक खेल के हर एक मोड़ से पहले नियमों को बार-बार दोहराता है।

पुराने समाधान: मैनुअल को "कंप्रेस" करना

वैज्ञानिकों ने इसे हल करने की कोशिश की:

  1. मैनुअल का सारांश बनाना: मैनुअल को छोटा बनाने के लिए शब्दों को काटने की कोशिश करना। समस्या: यदि आप बहुत अधिक काट देते हैं, तो सहायक नियम भूल जाता है और गलतियाँ करता है।
  2. मैनुअल को याद करना (डिस्टिलेशन): सहायक को मैनुअल याद करने के लिए सिखाने की कोशिश करना ताकि आपको उसे दिखाना न पड़े। समस्या: सिखाने का पुराना तरीका यह था कि, "देखो मैंने क्या किया था जब मेरे पास मैनुअल था, और अनुमान लगाओ कि बिना मैनुअल के मैं क्या करता।" सहायक ने प्रशिक्षण के दौरान वास्तव में मैनुअल को कभी देखा ही नहीं था, इसलिए वह वास्तव में यह नहीं समझ पाया कि नियम क्यों मौजूद थे।

नया समाधान: GenPI (द "इंटरनलाइज्ड शेफ")

लेखक जेनरेटिव प्रॉम्प्ट इंटरनलाइजेशन (GenPI) का प्रस्ताव करते हैं।

GenPI को एक ऐसे छात्र के रूप में न देखें जो रेसिपी को रट लेता है, बल्कि एक मास्टर शेफ (Master Chef) के रूप में देखें जिसने रेसिपी को इतनी गहराई से आत्मसात (internalize) कर लिया है कि वह कार्ड देखे बिना भी व्यंजन बना सकता है और यह भी समझा सकता है कि उसने उन सामग्रियों को क्यों चुना।

यहाँ बताया गया है कि GenPI कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "रोल-प्ले" ट्रेनिंग (जादुई ट्रिक)

आमतौर पर, AI को प्रशिक्षित करने के लिए, आपको एक मानव की आवश्यकता होती है जो "यूजर" (User) के रूप में कार्य करे और दूसरे की जो "एनवायरनमेंट" (जैसे कंप्यूटर या वेबसाइट) के रूप में कार्य करे। हर नए कार्य के लिए ऐसा करना कठिन है।

GenPI एक चतुर ट्रिक का उपयोग करता है जिसे सेल्फ रोल-प्लेइंग (Self Role-Playing) कहा जाता है।

  • कल्पना कीजिए कि AI एक अभिनेता है।
  • शोधकर्ता AI को कहते हैं: "ठीक है, अगले 1,000 लाइनों के लिए, आप सवाल पूछने वाले 'यूजर' हैं। फिर, अपनी टोपी बदलें और 'कंप्यूटर' बनें जो उनके जवाब देता है।"
  • AI खुद से बात करता है, एक पूरी बातचीत का अनुकरण (simulate) करता है। यह वास्तविक मनुष्यों या वास्तविक सर्वरों की आवश्यकता के बिना "यूजर बनाम कंप्यूटर" इंटरैक्शन का एक नकली डेटासेट बनाता है। यह एक अकेले कमरे में स्क्रिप्ट सीखने के लिए अकेले रिहर्सल करने वाले अभिनेता की तरह है।

2. "क्यों" का सबक (सीक्रेट सॉस)

यह सबसे महत्वपूर्ण हिस्सा है। AI को प्रशिक्षित करते समय, GenPI केवल यह नहीं कहता कि "यह करो।" यह AI को एक साथ दो चीजें करने के लिए कहता है:

  1. आउटपुट जेनरेट करना: "यहाँ सही उत्तर है।"
  2. कारण जेनरेट करना: "यह वह निर्देश पुस्तिका (instruction manual) है जिसका मैं पालन कर रहा था, और यहाँ बताया गया है कि मुझे उस नियम का पालन करने के लिए अपना उत्तर क्यों बदलना पड़ा।"

उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।

  • पुराना तरीका: शिक्षक कहता है, "तुमने यह गलत किया। यह सही उत्तर है। इसे याद कर लो।"
  • GenPI तरीका: शिक्षक कहता है, "तुमने यह गलत किया। यह सही उत्तर है। लेकिन साथ ही, वह नियम पुस्तिका भी लिखो जिसे मैं पकड़े हुए था, और विस्तार से समझाओ कि उस नियम पुस्तिका ने तुम्हें अपना उत्तर बदलने के लिए कैसे मजबूर किया।"

AI को कारण और स्वयं प्रॉम्प्ट जेनरेट करने के लिए मजबूर करके, AI तर्क को वास्तव में समझ जाता है, न कि केवल पैटर्न को।

3. परिणाम: "लाइटवेट" AI

एक बार प्रशिक्षित होने के बाद, AI को अब उस भारी निर्देश पुस्तिका की आवश्यकता नहीं होती है।

  • पहले: आप 1,000 शब्दों का प्रॉम्प्ट + अपना सवाल भेजते हैं।
  • बाद में: आप बस अपना सवाल भेजते हैं। AI के दिमाग में "नियम" पहले से ही बसे हुए हैं।

यह क्यों मायने रखता है (लाभ)

  • गति: यह एक भारी भार ढोने वाले ट्रक चलाने के बजाय एक सुव्यवस्थित स्पोर्ट्स कार चलाने जैसा है। AI बहुत तेज़ी से जवाब देता है क्योंकि यह हज़ारों अतिरिक्त शब्दों को प्रोसेस नहीं कर रहा होता है।
  • लागत: कम शब्द भेजने का मतलब है कि AI चलाने में कम पैसा खर्च होता है।
  • सटीकता: क्योंकि AI ने सीखा कि नियम क्यों महत्वपूर्ण हैं (कारणों को जेनरेट करके), यह उन तरीकों की तुलना में जटिल कार्यों को बेहतर तरीके से संभालता है जो केवल टेक्स्ट को कंप्रेस करने की कोशिश करते थे।

सारांश

GenPI एक ऐसी विधि है जो AI को निर्देश पुस्तिका को पूरा "निगलने" के लिए सिखाती है। निर्देश पुस्तिका को हर जगह साथ ले जाने के बजाय, AI अपने दिमाग में निर्देश पुस्तिका को फिर से बनाने और अपने व्यवहार को समझाने के बारे में सीख जाता है। यह AI एजेंटों को तेज़, सस्ता और स्मार्ट बनाता है, विशेष रूप से वेब ब्राउज़ करने या कंप्यूटर सिस्टम प्रबंधित करने जैसे जटिल कार्यों के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →