Structured Prompts Improve Evaluation of Language Models
यह अध्ययन एक पुनरुत्पादनीय (reproducible) DSPy+HELM फ्रेमवर्क पेश करता है जो यह प्रदर्शित करता है कि संरचित प्रॉम्प्टिंग रणनीतियाँ भाषा मॉडल के प्रदर्शन में महत्वपूर्ण सुधार करती हैं और बेंचमार्क रैंकिंग को बदल देती हैं, जिससे यह स्पष्ट होता है कि प्रॉम्प्ट का चयन एक महत्वपूर्ण कारक है जिसे अक्सर स्थिर मूल्यांकन कॉन्फ़िगरेशन में अनदेखा कर दिया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक टैलेंट स्काउट हैं जो एक नए रेस्टोरेंट के लिए सबसे अच्छे शेफ को काम पर रखने की कोशिश कर रहे हैं। आपके पास शीर्ष शेफों (भाषा मॉडलों या LMs) की एक सूची है, और आप देखना चाहते हैं कि कौन सबसे अच्छा भोजन बनाता है।
अतीत में, इन शेफों का परीक्षण करने का मानक तरीका उन्हें एक ही, कठोर रेसिपी (एक "स्टैटिक प्रॉम्प्ट") देना था और यह देखना था कि वे उसका कितनी अच्छी तरह पालन करते हैं। यदि शेफ A ने रेसिपी का पूरी तरह से पालन किया लेकिन शेफ B उस विशिष्ट शब्दावली के साथ संघर्ष करने लगा, तो आप शेफ A को उच्च रैंक देते।
समस्या:
इस शोध पत्र के लेखकों ने महसूस किया कि यह थोड़ा अनुचित है। ठीक वैसे ही जैसे एक शेफ इतालवी खाना बनाने में माहिर हो सकता है लेकिन एक विशिष्ट फ्रांसीसी रेसिपी का पालन करने में संघर्ष कर सकता है, एक स्मार्ट AI समस्याओं को हल करने में शानदार हो सकता है लेकिन वह केवल इसलिए "गलत समझ" सकता है क्योंकि प्रश्न पूछने का तरीका कुछ अलग था। यदि आप केवल एक प्रश्न पूछते हैं, तो आप शेफ की वास्तविक क्षमता नहीं देख रहे हैं; आप केवल यह देख रहे हैं कि वे उस एक विशिष्ट वाक्य को कितनी अच्छी तरह संभालते हैं।
समाधान: "मेन्यू" दृष्टिकोण
शोधकर्ताओं ने केवल एक रेसिपी का उपयोग करना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने एक ही प्रश्न को पूछने के विभिन्न तरीकों का एक पूरा "मेन्यू" बनाने के लिए DSPy नामक टूल का उपयोग किया।
इसे इस प्रकार सोचें:
- पुराना तरीका: आप शेफ से कहते हैं, "मेरे लिए एक बर्गर बनाओ।" (कुछ शेफ बेहतरीन बर्गर बनाते हैं; अन्य अस्पष्ट निर्देश से भ्रमित हो जाते हैं)।
- नया तरीका: आप शेफ को निर्देशों का एक मेन्यू देते हैं:
- "मेरे लिए एक बर्गर बनाओ, लेकिन पहले मुझे अपनी चरण-दर-चरण योजना बताओ।" (यह Chain-of-Thought है)।
- "यहाँ तीन उदाहरण दिए गए हैं जो मैंने पहले बनाए थे; उसी शैली की नकल करें।" (यह Few-Shot है)।
- "कल्पना करें कि आप एक विश्व प्रसिद्ध शेफ हैं; अब मेरे लिए एक बर्गर बनाएं।" (यह Optimization है)।
उन्होंने क्या पाया:
जब उन्होंने इस "मेन्यू" दृष्टिकोण का उपयोग करके शेफ का परीक्षण किया, तो तीन बड़ी चीजें हुईं:
- हर कोई बेहतर हुआ: औसतन, शेफ एक बेहतर मेन्यू मिलने पर 6% बेहतर प्रदर्शन करते हैं। यह पता चला कि शेफ खराब नहीं थे; उन्हें बस निर्देशों को अधिक स्पष्ट करने की आवश्यकता थी।
- रैंकिंग बदल गई: "लीडरबोर्ड" (कि कौन नंबर 1 है, इसकी सूची) पूरी तरह से बदल गया। कुछ मामलों में, एक शेफ जिसे नंबर 3 पर रैंक किया गया था, अचानक नंबर 1 पर आ गया क्योंकि अंततः उसे ऐसे निर्देश दिए गए जो उसकी ताकत से मेल खाते थे।
- उपमा: यह एक ऐसी दौड़ की तरह है जहाँ हर कोई कीचड़ भरे ट्रैक पर दौड़ रहा है। एक बार जब आपने सड़क पक्की कर दी (बेहतर प्रॉम्प्ट दिए), तो वह धावक जो पहले कीचड़ में फिसल रहा था, अचानक सबसे तेज़ दौड़ने वाला बन गया।
- "जादुई ट्रिक" सरल थी: उन्हें उम्मीद थी कि सबसे जटिल, कंप्यूटर-जनरेटेड निर्देश सबसे अच्छे होंगे। लेकिन उन्होंने पाया कि सबसे बड़ा उछाल केवल "चरण-दर-चरण सोचें" (Chain-of-Thought) कहने से आया।
- उपमा: यह एक छात्र से गणित के टेस्ट में "अपना काम दिखाएं" (show their work) कहने जैसा है। एक बार जब वे अपने चरणों को लिखना शुरू करते हैं, तो वे बहुत अधिक बार सही उत्तर प्राप्त करते हैं। अतिरिक्त फैंसी निर्देश जोड़ने से बहुत अधिक मदद नहीं मिली।
लागत:
इनमें से कुछ नए निर्देश बहुत लंबे थे (जैसे शेफ को 50 पन्नों की कुकबुक देना), जिससे चलाने में अधिक समय और पैसा खर्च होता है। हालांकि, "चरण-दर-चरण सोचें" वाला तरीका सबसे सटीक (sweet spot) था: इसने बिना किसी अतिरिक्त समय या लागत के भारी सुधार दिया।
बड़ी सीख:
शोध पत्र यह निष्कर्ष निकालता है कि हम वर्तमान "लीडरबोर्ड" पर भरोसा नहीं कर सकते जो एकल, स्थिर प्रश्न के आधार पर AI मॉडल को रैंक करते हैं। रैंकिंग इस बात पर बहुत अधिक निर्भर करती है कि आप प्रश्न कैसे पूछते हैं, न कि केवल इस पर कि AI कितना स्मार्ट है।
संक्षेप में: यदि आप जानना चाहते हैं कि सबसे अच्छा AI कौन सा है, तो उन्हें केवल एक प्रश्न न पूछें। उन्हें उत्तर देने के कुछ अलग तरीके दें, और आप वास्तव में आश्चर्यचकित हो सकते हैं कि वास्तव में कौन जीतता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।