Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading
यह शोध पत्र तर्क देता है कि स्थिर प्रॉम्प्ट्स (static prompts) पर निर्भर वर्तमान LLM मूल्यांकन ढांचे भ्रामक हैं क्योंकि प्रॉम्प्ट अनुकूलन (prompt optimization) मॉडल रैंकिंग को महत्वपूर्ण रूप से बदल देता है, जिससे किसी विशिष्ट कार्य के लिए सर्वश्रेष्ठ मॉडल की सटीक पहचान करने हेतु प्रति-मॉडल प्रॉम्प्ट अनुकूलन आवश्यक हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: "एक ही आकार सबके लिए" वाला जाल
कल्पना कीजिए कि आप एक रेस्टोरेंट के लिए सबसे अच्छा शेफ खोजने की कोशिश कर रहे हैं। आपके पास पांच अलग-अलग शेफ हैं (मान लीजिए कि वे मॉडल A, B, C, D और E हैं)। उन्हें परखने के लिए, आप उन सभी को एक ही रेसिपी कार्ड देते हैं: "स्टू बनाओ। इसमें नमक, काली मिर्च और प्याज का उपयोग करें।"
आप उन्हें खाना बनाते हुए देखते हैं, स्टू चखते हैं, और उन्हें रैंक करते हैं। शेफ B जीतता है। आप शेफ B को काम पर रख लेते हैं।
समस्या: शेफ B उस विशिष्ट रेसिपी को फॉलो करने में बहुत अच्छा है, लेकिन हो सकता है कि शेफ D वास्तव में एक जीनियस हो जिसे चमकने के लिए बस रेसिपी को थोड़ा अलग तरीके से लिखे जाने की आवश्यकता हो। शायद शेफ D को निर्देश की आवश्यकता है कि, "पहले प्याज को धीमी आंच पर पकाएं, फिर नमक डालें," ताकि वह अपना सर्वश्रेष्ठ काम कर सके।
यह पेपर तर्क देता है कि AI मॉडल्स (लार्ज लैंग्वेज मॉडल्स) को टेस्ट करने के तरीके वर्तमान में उसी हायरिंग मैनेजर की तरह हैं। वे हर एक AI को वही सटीक स्टैटिक प्रॉम्प्ट (रेसिपी कार्ड) देते हैं और इस आधार पर रैंक करते हैं कि उस विशिष्ट कार्ड के साथ किसने सबसे अच्छा प्रदर्शन किया।
लेखक कहते हैं कि यह भ्रामक है। वास्तविक दुनिया में, यदि आप एक AI को काम पर रखते हैं, तो आप उसे केवल एक जेनेरिक प्रॉम्प्ट नहीं देंगे; आप उस विशिष्ट AI के सर्वोत्तम प्रदर्शन को प्राप्त करने के लिए निर्देशों को थोड़ा बदलेंगे (ट्वीक करेंगे)। यह पेपर उस प्रक्रिया को प्रॉम्प्ट ऑप्टिमाइजेशन (PO) कहता है।
प्रयोग: रेसिपी बदलें, विजेता बदल जाएगा
शोधकर्ताओं ने पांच लोकप्रिय AI मॉडल्स को लिया और विभिन्न कार्यों (जैसे गणित की समस्याओं को हल करना, व्यावसायिक प्रश्नों के उत्तर देना या डेटा निकालना) पर उनका परीक्षण किया।
- राउंड 1 (पुराना तरीका): उन्होंने प्रत्येक मॉडल को एक ही "बेस" प्रॉम्प्ट दिया। उन्होंने उन्हें रैंक किया।
- राउंड 2 (नया तरीका): उन्होंने प्रत्येक मॉडल के लिए व्यक्तिगत रूप से प्रॉम्प्ट को "ट्यून" करने के लिए एक स्वचालित टूल का उपयोग किया। उन्होंने AI से पूछा, "हम निर्देशों को कैसे फिर से लिख सकते हैं ताकि आप उन्हें सबसे अच्छी तरह समझ सकें?" और फिर से टेस्ट चलाया।
परिणाम: रैंकिंग पूरी तरह से बदल गई।
- कुछ मामलों में, जो मॉडल राउंड 1 में आखिरी स्थान पर आया था, वह राउंड 2 में पहले स्थान पर पहुँच गया।
- जो मॉडल पुराने टेस्ट में "सर्वश्रेष्ठ" था, वह जरूरी नहीं कि तब भी सर्वश्रेष्ठ हो जब उसे उसके विशिष्ट मस्तिष्क के अनुकूल निर्देशों के साथ दिया जाए।
उपमा (Analogy): यह ट्रैक पर दौड़ने वालों के परीक्षण जैसा है।
- पुराना तरीका: आप सभी को भारी जूते पहनाकर दौड़ने के लिए कहते हैं। रनर A जीतता है क्योंकि उसे भारी जूतों की आदत है।
- नया तरीका: आप रनर A को हल्के स्नीकर्स और रनर B को कस्टम ऑर्थोटिक्स (विशेष जूते) देते हैं। अचानक, रनर B जीत जाता है।
- निष्कर्ष: यदि आपने उन्हें भारी जूतों में ही टेस्ट किया होता, तो आप मैराथन के लिए गलत धावक को चुन लेते।
अध्ययन से मुख्य निष्कर्ष
1. "सर्वश्रेष्ठ" मॉडल प्रॉम्प्ट पर निर्भर करता है
पेपर ने पाया कि एक प्रतियोगिता का "विजेता" इस बात पर निर्भर करता है कि निर्देश कैसे लिखे गए हैं। यदि आप किसी विशिष्ट कार्य के लिए सबसे अच्छा AI चुनना चाहते हैं, तो आपको उस विशिष्ट AI के लिए निर्देशों को अनुकूलित (optimize) करना होगा। यदि आप ऐसा नहीं करते हैं, तो आप एक ऐसे मॉडल को चुन सकते हैं जो वास्तव में आपकी जरूरतों के लिए औसत दर्जे का है।
2. अलग-अलग मॉडल्स अलग तरह से प्रतिक्रिया करते हैं
इंसानों की तरह, अलग-अलग AI के भी अलग "व्यक्तित्व" या संवेदनशीलता होती है।
- कुछ मॉडल्स (जैसे अध्ययन में मॉडल B) प्रॉम्प्ट परिवर्तनों के प्रति बहुत संवेदनशील थे। एक छोटा सा बदलाव उन्हें बहुत बेहतर प्रदर्शन करने में मदद करता है।
- अन्य मॉडल्स किसी विशिष्ट कार्य (जैसे सरल रूटिंग) में पहले से ही इतने अच्छे थे कि प्रॉम्प्ट को ट्वीक करने से उन्हें ज्यादा फायदा नहीं हुआ, या कभी-कभी उन्हें भ्रमित भी कर दिया।
3. "क्रिटिक" (Critic) भी भ्रमित हो सकता है
शोधकर्ताओं ने अन्य मॉडल्स के लिए प्रॉम्प्ट को फिर से लिखने में मदद करने के लिए एक "क्रिटिक" AI (GPT-4o) का उपयोग किया। आमतौर पर, यह बहुत अच्छा काम करता था। हालांकि, कभी-कभी क्रिटिक बहुत अधिक चतुर हो गया या निर्देश इतने जटिल हो गए कि मॉडल विफल हो गया।
- उदाहरण के लिए: एक मामले में, अनुकूलित प्रॉम्प्ट ने AI को इतना अधिक "स्टेप-बाय-स्टेप सोचने" के लिए कहा कि उसने वास्तविक टेस्ट प्रश्न के बजाय प्रॉम्प्ट में दिए गए उदाहरण प्रश्नों के उत्तर देना शुरू कर दिया। यह एक छात्र की तरह था जो परीक्षा देने के बजाय अभ्यास टेस्ट के उत्तरों को जोर से पढ़ रहा हो।
आपके लिए इसका क्या अर्थ है (प्रैक्टिशनर के लिए)
यदि आप एक व्यवसाय चला रहे हैं जो किसी काम (जैसे ग्राहकों के ईमेल का जवाब देना या दस्तावेजों का विश्लेषण करना) के लिए AI चुनने की कोशिश कर रहा है, तो केवल एक स्टैंडर्ड बेंचमार्क पर भरोसा न करें।
पेपर निष्कर्ष निकालता है कि अपने विशिष्ट कार्य के लिए सबसे अच्छा मॉडल खोजने के लिए, आपको:
- अपना कार्य लें।
- विभिन्न मॉडल्स को आजमाएं।
- प्रत्येक मॉडल के लिए व्यक्तिगत रूप से प्रॉम्प्ट को ऑप्टिमाइज़ करें यह देखने के लिए कि वे वास्तव में क्या करने में सक्षम हैं।
- और फिर, विजेता चुनें।
यदि आप स्टेप 3 को छोड़ देते हैं और केवल एक जेनेरिक प्रॉम्प्ट का उपयोग करते हैं, तो आप एक भ्रामक टेस्ट के आधार पर गलत निर्णय लेने की संभावना रखते हैं।
सारांश
यह पेपर एक चेतावनी है: किसी मछली को पेड़ पर चढ़ने की क्षमता से न आंकें, और न ही किसी AI को एक जेनेरिक प्रॉम्प्ट का पालन करने की क्षमता से आंकें। यह जानने के लिए कि वास्तव में सबसे अच्छा कौन है, आपको उनकी भाषा बोलनी होगी। यदि आप प्रत्येक मॉडल के लिए प्रॉम्प्ट को ऑप्टिमाइज़ नहीं करते हैं, तो आपके मूल्यांकन के परिणाम गलत हैं, और आप काम के लिए गलत टूल चुन सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।