← नवीनतम पेपर
🤖 machine learning

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

यह शोध पत्र प्रॉम्प्ट चयन को एक बहु-उद्देश्यीय शुद्ध-अन्वेषण बैंडिट समस्या (multi-objective pure-exploration bandit problem) के रूप में रूपरेखाबद्ध करके प्रॉम्प्ट प्रदर्शन की बहुआयामी प्रकृति को संबोधित करता है, और पारेटो सेट रिकवरी (Pareto set recovery) तथा सर्वश्रेष्ठ व्यवहार्य प्रॉम्प्ट पहचान के लिए नवीन एल्गोरिदम प्रस्तावित करता है जो सैद्धांतिक रूप से गारंटीकृत हैं और कई लार्ज लैंग्वेज मॉडल्स में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करने के लिए अनुभवजन्य रूप से मान्य हैं।

मूल लेखक: Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang

प्रकाशित 2026-05-15
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नए व्यंजन के लिए एकदम सही रेसिपी खोजने की कोशिश कर रहे हैं। आपके पास हजारों संभावित रेसिपी (प्रॉम्प्ट्स) वाली एक विशाल कुकबुक है, लेकिन आपके पास उन्हें टेस्ट करने के लिए केवल सीमित समय और सामग्री (एक "बजट") है।

लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, ये "रेसिपी" वे निर्देश हैं जो हम AI को देते हैं। समस्या यह है कि एक "अच्छी" रेसिपी सिर्फ स्वाद (सटीकता/accuracy) के बारे में नहीं होती; इसे जल्दी पकाया जाना भी चाहिए (संक्षिप्तता/brevity), स्वस्थ होना चाहिए (सुरक्षा/safety), और सस्ता भी होना चाहिए (लागत/cost)। अधिकांश पिछले तरीकों ने केवल एक चीज़ को देखकर सबसे अच्छी रेसिपी खोजने की कोशिश की, जैसे कि केवल स्वाद। लेकिन असल जिंदगी में, आपको अक्सर ऐसे ट्रेड-ऑफ (समझौतों) को संतुलित करना पड़ता है: सबसे स्वादिष्ट व्यंजन बनाने में बहुत अधिक समय लग सकता है, या सबसे तेज़ व्यंजन बेस्वाद हो सकता है।

यह पेपर, जिसका शीर्षक है "Efficient Multi-Objective Prompt Optimization via Pure-Exploration Bandits," यह प्रस्तावित करता है कि जब आपको एक साथ कई लक्ष्यों को संभालना हो और आपके पास समय की कमी हो, तो AI के लिए बेहतरीन निर्देश खोजने का एक स्मार्ट तरीका क्या है।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "स्वाद बनाम गति" का द्वंद्व (The "Taste vs. Speed" Dilemma)

लेखक बताते हैं कि एक AI प्रॉम्प्ट का मूल्यांकन करना एक कार को परखने जैसा है। आप केवल यह नहीं देख सकते कि वह कितनी तेज़ चलती है (सटीकता); आपको यह भी देखना होगा कि वह कितनी गैस का उपयोग करती है (संक्षिप्तता) या क्या वह सुरक्षित है (बाधाएं/constraints)।

  • पुराना तरीका: पिछले तरीकों ने इन सभी कारकों को एक एकल स्कोर में मिलाने की कोशिश की (जैसे कि "गति घटाने गैस की लागत")। यह अक्सर बारीकियों को छोड़ देता है। कभी-कभी आप सबसे तेज़ कार चाहते हैं, भले ही वह अधिक गैस पीती हो, जब तक कि वह फट न जाए (सुरक्षा बाधा)।
  • नया लक्ष्य: यह पेपर दो विशिष्ट चीजें खोजना चाहता है:
    1. सर्वश्रेष्ठ व्यवहार्य प्रॉम्प्ट (The Best Feasible Prompt): सबसे अच्छा रेसिपी जो एक सख्त सुरक्षा या गति सीमा को पूरा करती है (जैसे, "एक ऐसा स्वादिष्ट व्यंजन खोजें जिसे 10 मिनट से कम समय में बनाया जा सके")।
    2. पारेटो सेट (The Pareto Set): "सर्वश्रेष्ठ संभव ट्रेड-ऑफ" का एक मेनू। ये वे रेसिपी हैं जहाँ आप एक चीज़ (स्वाद) को बेहतर बनाए बिना दूसरी चीज़ (गति) को खराब किए बिना नहीं रह सकते। यह शीर्ष दावेदारों की एक सूची है जो सबसे अच्छा संतुलन दर्शाती है।

2. समाधान: "टेस्टिंग मेनू" रणनीति (Bandits)

लेखक इस समस्या को एक गेम शो की तरह देखते हैं जिसका नाम है "मल्टी-आर्म्ड बैंडिट" (Multi-Armed Bandit)। कल्पना कीजिए कि स्लॉट मशीनों (प्रॉम्प्ट्स) की एक पंक्ति है। आपके पास लीवर खींचने के लिए सीमित सिक्के (बजट) हैं। आप हारने वालों पर अपने सारे सिक्के बर्बाद किए बिना सबसे अच्छी मशीन खोजना चाहते हैं।

वे इस खेल को प्रबंधित करने के लिए दो नए एल्गोरिदम पेश करते हैं:

A. GENSEC: बाधाओं के लिए "एलिमिनेशन गेम"

इसे सर्वश्रेष्ठ व्यवहार्य प्रॉम्प्ट खोजने के लिए एक टूर्नामेंट ब्रैकेट के रूप में समझें।

  • यह कैसे काम करता है: आप 100 रेसिपी के साथ शुरू करते हैं। आप प्रत्येक का कुछ हिस्सा चखते हैं।
  • ट्विस्ट: हर दौर में, आप उन रेसिपी को तुरंत बाहर कर देते हैं जो स्पष्ट रूप से बहुत धीमी हैं (सीमा का उल्लंघन करती हैं) या स्पष्ट रूप से वर्तमान लीडर से बदतर स्वाद वाली हैं।
  • जादू: हर रेसिपी को पूरी तरह से अद्वितीय, असंबंधित आइटम मानने के बजाय, यह एल्गोरिदम नोटिस करता है कि रेसिपी अक्सर "सामग्री" (विशेषताओं) को साझा करती हैं। यदि रेसिपी A और रेसिपी B दोनों में "लहसुन" का उपयोग किया गया है, और आप रेसिपी A से लहसुन के बारे में कुछ सीखते हैं, तो आप रेसिपी B के बारे में अनुमान लगा सकते हैं। यह उन्हें तेज़ी से सीखने में मदद करता है, जैसे कि एक शेफ जो जानता है कि यदि लहसुन वाला एक व्यंजन बहुत नमकीन है, तो लहसुन वाला दूसरा व्यंजन भी शायद वैसा ही होगा।
  • परिणाम: उन्होंने पाया कि यह विधि संभावित "परफेक्ट" स्कोर का 80-90% प्राप्त करती है, जबकि पुराने तरीके (केवल रैंडमली चखना) केवल 20-50% ही प्राप्त कर पाते थे।

B. GENPSI: ट्रेड-ऑफ के लिए "मैप मेकर"

यह एल्गोरिदम पारेटो सेट (सर्वश्रेष्ठ ट्रेड-ऑफ का मेनू) खोजने के लिए डिज़ाइन किया गया है।

  • यह कैसे काम करता है: एक विजेता खोजने के बजाय, यह संभावनाओं के "फ्रंटियर" को मैप करने की कोशिश करता है। यह पूछता है: "कौन सी रेसिपी इतनी अच्छी है कि आप एक चीज़ को बेहतर बनाने के लिए दूसरी चीज़ को नुकसान दिए बिना नहीं रह सकते?"
  • रणनीति: यह एक समान एलिमिनेशन प्रक्रिया का उपयोग करता है लेकिन रेसिपी के बीच के "अंतर" को देखता है। यदि कोई रेसिपी स्पष्ट रूप से किसी दूसरी रेसिपी द्वारा हावी (dominated) है (हर तरह से बदतर है), तो उसे हटा दिया जाता है। यदि वह एक अनूठा ट्रेड-ऑफ है (शानदार गति, ठीक-ठाक स्वाद), तो वह बनी रहती है।
  • परिणाम: इस विधि ने ग्राउंड ट्रुथ की तुलना में 90% से अधिक "हाइपरवॉल्यूम" (एक शानदार तरीका जो अच्छे ट्रेड-ऑफ के कुल क्षेत्र को दर्शाता है) को रिकवर किया, जबकि बेसलाइन केवल लगभग 80% ही कर पाए।

3. "सीक्रेट सॉस": कनेक्शन से सीखना

उनकी सफलता का एक प्रमुख हिस्सा यह महसूस करना है कि प्रॉम्प्ट यादृच्छिक (random) नहीं होते; वे आपस में जुड़े होते हैं।

  • उपमा: कल्पना कीजिए कि आप 100 अलग-अलग कारों का परीक्षण कर रहे हैं। यदि आप एक लाल स्पोर्ट्स कार का परीक्षण करते हैं और पाते हैं कि वह तेज़ है, तो आपको हर लाल स्पोर्ट्स कार का शून्य से परीक्षण करने की आवश्यकता नहीं है। आप जानते हैं कि वे एक ही इंजन प्रकार को साझा करते हैं।
  • पेपर का दृष्टिकोण: वे इन कनेक्शनों को देखने के लिए एक "फीचर मैप" (प्रॉम्प्ट के लिए एक फिंगरप्रिंट की तरह) का उपयोग करते हैं। इन साझा पैटर्न को समझने के लिए एक न्यूरल नेटवर्क (MLP) का उपयोग करके, उनके एल्गोरिदम बहुत तेज़ी से सीखते हैं, क्योंकि वे हर प्रॉम्प्ट को एक अलग द्वीप के रूप में नहीं देखते।

4. प्रमाण: द किचन टेस्ट

लेखकों ने वास्तविक रसोई में (वास्तविक AI मॉडल जैसे Llama-3 और Gemma का उपयोग करके) वास्तविक रेसिपी (समाचार लेखों का सारांश) के साथ इसका परीक्षण किया।

  • सेटअप: उन्हें समाचारों का सारांश (सटीकता) तैयार करना था जबकि सारांश को छोटा (संक्षिप्तता) रखना था।
  • परिणाम: उनके "बैंडिट" शेफ (GENSEC और GENPSI) ने "रैंडम टेस्टर" (Uniform) या अन्य मानक तरीकों की तुलना में लगातार बेहतर, सुरक्षित और अधिक संतुलित प्रॉम्प्ट खोजे, विशेष रूप से तब जब उनके पास परीक्षण के लिए बहुत कम समय (बजट) था।

सारांश

संक्षेप में, यह पेपर कहता है: "रैंडम अंदाज़े लगाना बंद करें और केवल एक नंबर को देखना बंद करें।"

प्रॉम्प्ट चयन को एक रणनीतिक खेल के रूप में मानकर, जहाँ आप खराब विकल्पों को जल्दी हटा देते हैं और विभिन्न प्रॉम्प्टों के बीच की समानताओं से सीखते हैं, आप बहुत कम प्रयासों के साथ और बहुत तेज़ी से सटीकता, गति और सुरक्षा के बीच सही संतुलन पा सकते हैं। यह एक स्मार्ट 'सू-शेफ' होने जैसा है जो जानता है कि यदि एक व्यंजन बहुत नमकीन है, तो अगला भी शायद वैसा ही होगा, जिससे आपको कुकबुक के हर व्यंजन को चखने से बचने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →