← नवीनतम पेपर
💬 NLP

SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding

यह शोध पत्र SyRuP को प्रस्तुत करता है, जो एक डिकोडिंग-टाइम फ्रेमवर्क है जो बेस मॉडल ट्यूनिंग की आवश्यकता के बिना उम्मीदवारों को पुन: रैंक करने के लिए टोकन-स्तरीय अनुपालन स्कोर उत्पन्न करने हेतु एक क्रॉस-अटेंशन रिवॉर्ड हेड को प्रशिक्षित करके लार्ज लैंग्वेज मॉडल के सिस्टम प्रॉम्प्ट्स के प्रति अनुपालन को बढ़ाता है।

मूल लेखक: Seoyeon Kim, Minjae Kang, Jaehyung Kim

प्रकाशित 2026-07-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seoyeon Kim, Minjae Kang, Jaehyung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, विद्वान रोबोट से बात कर रहे हैं जिसने पुस्तकालय की लगभग हर किताब पढ़ ली है। यह रोबोट एक लार्ज लैंग्वेज मॉडल (LLM) है। आमतौर पर, जब आप इससे कोई सवाल पूछते हैं, तो यह अपने प्रशिक्षण के आधार पर उत्तर देता है। लेकिन कभी-कभी, आप इसे बातचीत शुरू करने से पहले नियमों का एक विशिष्ट सेट देना चाहते हैं। आप कह सकते हैं, "एक गुस्सैल समुद्री डाकू (पायरेट) की तरह व्यवहार करो," या "केवल तुकबंदी में उत्तर दो," या "हिंसा का उल्लेख कभी न करें।" ये नियम सिस्टम प्रॉम्प्ट (system prompts) कहलाते हैं। ये एक जॉब डिस्क्रिप्शन या उस पोशाक की तरह हैं जो रोबोट किसी विशिष्ट बातचीत के लिए पहनता है।

समस्या यह है कि ये रोबोट उन निर्देशों का पालन करने के आदी होते हैं जो बातचीत के अंदर आते हैं, न कि उन नियमों के जो बातचीत शुरू होने से पहले पत्थर की लकीर की तरह तय किए गए हों। जब नियम जटिल हो जाते हैं—जैसे "एक समुद्री डाकू बनो, लेकिन 19वीं सदी की व्याकरण का उपयोग करो, 'e' अक्षर से बचो, और मज़ेदार रहो"—तो रोबोट अक्सर बातचीत के बीच में ही नियम भूल जाता है। वह एक समुद्री डाकू की तरह बात करना शुरू कर सकता है, फिर अचानक एक आधुनिक किशोर में बदल सकता है, या 'e' अक्षर से बचने के नियम को भूल सकता है। वैज्ञानिकों ने इसे ठीक करने के लिए रोबोट को फिर से प्रशिक्षित (retraining) करने की कोशिश की है (जो महंगा और धीमा है) या पहले से लिखे जा चुके उत्तर का अनुमान लगाने की कोशिश की है (जो एक उपन्यास लिखने के बाद संपादक की तरह काम करने जैसा है, जब लेखक पहले ही उसे पूरा कर चुका हो)। बड़ा सवाल यह है: क्या हम रोबंड के दिमाग को बदले बिना या उसके खत्म होने का इंतज़ार किए बिना, उसे लिखते समय इन जटिल नियमों का पालन करने के लिए निर्देशित कर सकते हैं?

यहीं पर SYRUP नामक एक नई विधि आती है। इस रोबोट के दिमाग को एक विशाल, जमी हुई लाइब्रेरी की तरह समझें जिसे हमें पुनर्व्यवस्थित करने की अनुमति नहीं है। SYRUP एक सुपर-स्मार्ट, नन्हे लाइब्रेरियन की तरह है जो रोबोट के लिखते समय उसके ठीक बगल में खड़ा रहता है। हर बार जब रोबोट अगला शब्द चुनने वाला होता है, तो यह लाइब्रेरियन दो चीजें जाँचता है: "क्या यह शब्द कहानी के अनुकूल है?" और "क्या यह शब्द समुद्री डाकू की पोशाक के अनुकूल है?"

यहाँ यह वास्तव में कैसे काम करता है। रोबोट के पास आगे कहने के लिए अपने शीर्ष 10 पसंदीदा शब्दों की एक सूची होती है। आमतौर पर, वह केवल नंबर एक पसंदीदा शब्द चुन लेता है। लेकिन SYRUP हस्तक्षेप करता है। यह "सिस्टम प्रॉम्प्ट" (समुद्री डाकू की पोशाक) को एक अलग, विशेष मेमोरी कार्ड के रूप में देखता है। यह एक विशेष उपकरण जिसका नाम क्रॉस-अटेंशन रिवॉर्ड हेड (cross-attention reward head) है, का उपयोग करके रोबोट के वर्तमान विचारों से पूछता है, "हे, अगर तुम यह शब्द कहते हो, तो क्या यह समुद्री डाकू के अंदाज़ से मेल खाता है?" लाइब्रेरियन फिर शीर्ष 10 शब्दों को एक स्कोर देता है। यदि रोबोट "Hello" कहना चाहता है, लेकिन समुद्री डाकू की पोशाक के लिए "Ahoy" की आवश्यकता है, तो लाइब्रेरियन "Ahoy" के स्कोर को बढ़ाता है और "Hello" के स्कोर को कम कर देता है। रोबोट फिर वह शब्द चुनता है जिसका संयुक्त स्कोर सबसे अधिक होता है।

यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण पुराने तरीकों की तुलना में बहुत बेहतर है। शोधकर्ताओं ने तीन अलग-अलग रोबोट दिमागों पर SYRUP का परीक्षण किया और पाया कि इसने केवल बेहतर प्रॉम्प्ट देने या उत्तरों को लिखने के बाद फिर से रैंक करने की तुलना में जटिल नियमों का पालन करने में लगातार मदद की। वास्तव में, एक परीक्षण में, SYRUP ने अगली सर्वश्रेष्ठ विधि की तुलना में रोबोट के प्रदर्शन में लगभग 5.6% का सुधार किया। यह छोटा लग सकता है, लेकिन AI की दुनिया में, यह एक बहुत बड़ी छलांग है।

यह पत्र कुछ अन्य विचारों को भी खारिज करता है। यह दिखाता है कि नियमों को मुख्य बातचीत के टेक्स्ट में मिला देना (जैसे उपयोगकर्ता के प्रश्न के भीतर समुद्री डाकू के निर्देशों को छिपाना) पर्याप्त नहीं है; रोबंड को नियमों का वास्तव में पालन करने के लिए उन्हें एक अलग, विशिष्ट स्मृति के रूप में मानने की आवश्यकता है। इसने यह भी पाया कि हालांकि हम रोबोट को शुरुआत से फिर से प्रशिक्षित करके उसे नियमों का पालन करने में बेहतर बना सकते हैं, लेकिन इसमें बहुत अधिक समय और पैसा लगता है। SYRUP एक "डिकोडिंग-टाइम" विधि है, जिसका अर्थ है कि यह रोबोट के सोचते समय काम करती है, मूल दिमाग को स्थिर रखती है और केवल एक छोटा, हल्का एड-ऑन (add-on) प्रशिक्षित करती है।

दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि SYRUP उन नियमों पर भी काम करता है जिन्हें उसने पहले नहीं देखा है। उन्होंने इसे निर्देशों के एक सेट पर प्रशिक्षित किया और फिर इसे पूरी तरह से अलग नियमों (जैसे सख्त फॉर्मेटिंग या शब्द गणना) पर टेस्ट किया, और यह अभी भी अच्छा प्रदर्शन करता रहा। यह सुझाव देता है कि विधि रोबोट को विशिष्ट उत्तरों को याद करने के बजाय "बॉस की बात सुनने" का एक सामान्य कौशल सिखाती है।

हालाँकि, शोध पत्र सावधानीपूर्वक नोट करता है कि यह सब कुछ हल करने वाली जादुई छड़ी नहीं है। यह विधि रोबोट की सोचने की प्रक्रिया में थोड़ा अतिरिक्त समय जोड़ती है क्योंकि लाइब्रेरियन को शब्दों की जाँच करनी पड़ती है। लेकिन लेखक सुझाव देते हैं कि यह लागत बहुत कम है, खासकर अन्य जटिल तरीकों की तुलना में जो समान कार्य करने की कोशिश करते हैं। वे यह भी चेतावनी देते हैं कि यदि आप "नियम-पालन" को बहुत अधिक ज़ोर देते हैं, तो रोबोट अजीब या अप्राकृतिक लगने लगेगा, इसलिए संतुलन बनाए रखना ज़रूरी है।

संक्षेप में, SYRUP सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट अपने पूरे दिमाग को फिर से प्रशिक्षित किए बिना जटिल नियमों का पालन करे, तो आपको केवल यह उम्मीद नहीं करनी चाहिए कि उसे याद रहेगा। इसके बजाय, आपको उसे एक समर्पित, वास्तविक समय का मार्गदर्शक देना चाहिए जो उसके द्वारा बोले जाने वाले हर एक शब्द की जांच नियमों के विरुद्ध करे, यह सुनिश्चित करते हुए कि अंतिम कहानी उस पोशाक के प्रति सच्ची रहे जो उसने शुरुआत से पहनी थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →