← नवीनतम पेपर
📊 statistics

LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization

यह शोध पत्र प्रॉम्प्ट ड्यूल ऑप्टिमाइज़र (PDO) को प्रस्तुत करता है, जो एक सैंपल-एफिशिएंट और लेबल-मुक्त फ्रेमवर्क है, जो चयन को ड्यूलिंग-बैंडिट समस्या के रूप में फ्रेम करके और डबल थॉमसन सैंपलिंग के साथ गाइडेड म्यूटेशन का उपयोग करके प्रॉम्प्ट्स को अनुकूलित करता है, ताकि बिना किसी ग्राउंड-ट्रुथ लेबल की आवश्यकता के पेयरवाइज LLM जज फीडबैक के माध्यम से श्रेष्ठ प्रॉम्प्ट्स की पहचान की जा सके।

मूल लेखक: Yuanchen Wu, Saurabh Verma, Justin Lee, Fangzhou Xiong, Poppy Zhang, Amel Awadelkarim, Xu Chen, Yubai Yuan, Shawndra Hill

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanchen Wu, Saurabh Verma, Justin Lee, Fangzhou Xiong, Poppy Zhang, Amel Awadelkarim, Xu Chen, Yubai Yuan, Shawndra Hill

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भ्रमित रोबोट को एक कठिन पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। आप उसे सीधे उत्तर कुंजी (answer key) नहीं दे सकते (क्योंकि वास्तविक दुनिया में, अक्सर आपके पास अभी तक ऐसी कोई कुंजी नहीं होती है)। इसके बजाय, आपको रोबोट के लिए निर्देश (प्रॉम्प्ट्स) लिखने होंगे, इस उम्मीद में कि वह समस्या को हल करने का सबसे अच्छा तरीका खुद खोज ले।

समस्या क्या है? एक आदर्श निर्देश लिखना कठिन है। आप लाखों अलग-अलग संस्करण लिखने की कोशिश कर सकते हैं, लेकिन इसमें बहुत समय लगता है और बहुत पैसा खर्च होता है। मौजूदा अधिकांश तरीके एक "गोल्ड स्टैंडर्ड" उत्तर कुंजी से तुलना करके सबसे अच्छे निर्देश का अनुमान लगाने की कोशिश करते हैं। लेकिन क्या होगा यदि आपके पास वह कुंजी ही न हो?

यह पेपर PDO (प्रॉम्प्ट ड्यूल ऑप्टिमाइज़र) पेश करता है, जो बिना किसी उत्तर कुंजी के बेहतरीन निर्देश खोजने का एक चतुर नया तरीका है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है।

1. समस्या: "ब्लाइंड टेस्ट टेस्ट" (अंधा स्वाद परीक्षण)

कल्पना कीजिए कि आप एक नए सूप की सबसे अच्छी रेसिपी खोजने की कोशिश कर रहे हैं। आपके पास कोई रेसिपी बुक या तुलना करने के लिए कोई "परफेक्ट" सूप नहीं है। आपके पास बस कई अलग-अलग रेसिपी (प्रॉम्प्ट्स) हैं और एक बहुत ही अपनी राय रखने वाला, लेकिन कभी-कभी अविश्वसनीय खाद्य समीक्षक (AI जज) है।

यदि आप समीक्षक से पूछते हैं, "इस सूप को 1 से 10 के बीच रेट करें," तो वे असंगत हो सकते हैं। एक दिन वे इसे 7 देंगे, दूसरे दिन 4, सिर्फ इसलिए क्योंकि वे भूखे थे या थके हुए थे। इसे नॉइज़ (noise) कहा जाता है।

2. समाधान: "टूर्नामेंट स्टाइल" (ड्यूलिंग बैंडिट्स)

हर सूप को व्यक्तिगत रूप से रेट करने के लिए कहने के बजाय, PDO खेल बदल देता है। यह ड्यूल्स (मुकाबले) आयोजित करता है।

  • सेटअप: आप दो रेसिपी लेते हैं और समीक्षक से पूछते हैं: "सूप A और सूप B के बीच, कौन सा बेहतर स्वाद देता है?"
  • तर्क: इंसान और AI, सटीक स्कोर जैसे "7.3" देने की तुलना में यह कहने में बहुत बेहतर होते हैं कि "मुझे B के बजाय A पसंद है।" यह वैसा ही है जैसे किसी प्लेलिस्ट से अपना पसंदीदा गाना चुनना, बजाय इसके कि हर गाने को 1 से 10 के पैमाने पर रेट किया जाए।

PDO इसे एक टूर्नामेंट ब्रैकेट की तरह मानता है। यह केवल दो रैंडम रेसिपी को आपस में लड़ने के लिए नहीं चुनता; यह यह तय करने के लिए एक स्मार्ट रणनीति का उपयोग करता है कि सबसे अधिक सीखने के लिए किसे, किसके साथ लड़ना चाहिए।

3. PDO के दो गुप्त हथियार

PDO टूर्नामेंट जीतने के लिए दो मुख्य तरकीबों का उपयोग करता है:

A. "स्मार्ट मैचमेकर" (डबल थॉमसन सैंपलिंग)

कल्पना कीजिए कि आप टूर्नामेंट आयोजित कर रहे हैं। आप सबसे अच्छे सूप को सबसे खराब सूप से लड़ाने में समय बर्बाद नहीं करना चाहते (यह उबाऊ है और इससे कुछ पता नहीं चलता)। आप यह भी नहीं चाहते कि दो बेकार सूप आपस में लड़ें।

PDO एक गणितीय "अंतर्ज्ञान" (जिसे डबल थॉमसन सैंपलिंग कहा जाता है) का उपयोग करके सबसे दिलचस्प मुकाबले चुनने के लिए करता है।

  • यह वर्तमान स्कोर को देखता है और कहता है, "हम्म, सूप A और सूप B की गुणवत्ता बहुत करीब है। यदि हम उन्हें लड़ाते हैं, तो हमें बहुत कुछ पता चलेगा कि वास्तव में कौन बेहतर है।"
  • यह अपने सीमित बजट को स्पष्ट अंतर वाले मुकाबलों के बजाय इन "कड़े मुकाबलों" पर केंद्रित करता है। इससे पैसा और समय बचता है।

B. "इवोल्यूशनरी शेफ" (टॉप-परफ़ॉर्मर म्यूटेशन)

एक बार जब टूर्नामेंट "चैंपियन सूप" को ढूंढ लेता है, तो PDO वहीं नहीं रुक जाता। वह जानता है कि चैंपियन में अभी भी कोई गुप्त सामग्री (secret ingredient) कम हो सकती है।

  • म्यूटेशन (Mutation): यह विजेता रेसिपी को लेता है और उसमें एक छोटा, रचनात्मक बदलाव करता है। शायद यह थोड़ा नमक डाल दे, पकाने का समय बदल दे, या निर्देशों को थोड़ा अलग तरीके से लिख दे।
  • प्रूनिंग (Pruning): यह नए, थोड़े बेहतर संस्करणों के लिए जगह बनाने के लिए पूल से सबसे खराब रेसिपी को हटा देता है।
  • परिणाम: रेसिपी का पूल लगातार विकसित होता रहता है, बेहतर होता जाता है, जैसे कि कोई वीडियो गेम का कैरेक्टर लेवल अप कर रहा हो।

4. यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, "ग्राउंड ट्रुथ" (परफेक्ट आंसर की) प्राप्त करना महंगा है। आपको हजारों निबंधों को ग्रेड करने या मेडिकल डायग्नोसिस की जांच करने के लिए मनुष्यों को काम पर रखने की आवश्यकता हो सकती है।

PDO सिद्ध करता है कि एक महान समाधान खोजने के लिए आपको उत्तर कुंजी की आवश्यकता नहीं है। आपको बस चाहिए:

  1. दो विकल्पों की तुलना करने का एक तरीका (A बनाम B)।
  2. सही तुलना चुनने के लिए एक स्मार्ट सिस्टम।
  3. विजेताओं को विकसित करने का एक तरीका।

निष्कर्ष

PDO को एक AI के लिए एक स्मार्ट कोच के रूप में समझें। "तुम गलत हो!" चिल्लाने के बजाय (जिसके लिए सही उत्तर जानना आवश्यक है), कोच कहता है, "ठीक है, इस तरीके को आजमाओ, फिर उस तरीके को आजमाओ। मुझे बताओ कि कौन सा बेहतर लगा। अब, आइए सर्वश्रेष्ठ को लें और इसमें थोड़ा बदलाव करें।"

ऐसा करके, AI बहुत तेज़ी से, सस्ते में और अधिक विश्वसनीयता के साथ बेहतरीन निर्देश खोज लेता है, भले ही किसी को अभी तक "सही" उत्तर पता न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →