← नवीनतम पेपर
💬 NLP

Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models

यह शोध पत्र IAPO को प्रस्तुत करता है, जो एक नया फ्रेमवर्क है जो ब्लैक-बॉक्स लार्ज लैंग्वेज मॉडल्स को उपयोगकर्ता की प्राथमिकताओं और कम्प्यूटेशनल बजट के साथ बेहतर ढंग से संरेखित करने के लिए प्रॉम्प्ट्स और इन्फरेंस स्केलिंग रणनीतियों (जैसे कि Best-of-N सैंपलिंग) को संयुक्त रूप से अनुकूलित करता है।

मूल लेखक: Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बड़ी पार्टी के लिए खाना पकाने के लिए एक पेशेवर शेफ को काम पर रख रहे हैं। आपके पास भोजन को उत्तम बनाने के दो तरीके हैं:

  1. रेसिपी (द प्रॉम्प्ट): आप शेफ को एक बहुत ही विशिष्ट रेसिपी दे सकते हैं।
  2. टेस्टिंग (इन्फरेंस स्केलिंग): आप शेफ से व्यंजन के पांच अलग-अलग संस्करण बनाने के लिए कह सकते हैं और फिर उनमें से सबसे अच्छा चुन सकते हैं।

अब तक, अधिकांश लोगों ने केवल एक चीज़ पर ध्यान केंद्रित करके इसे हल करने की कोशिश की है। या तो वे पूरी रेसिपी को बेहतर बनाने में अपना सारा समय बिताते हैं, या वे बस शेफ को कहते हैं, "दस संस्करण बनाओ और सबसे अच्छा चुनो।"

समस्या क्या है? वे आपस में बात नहीं कर रहे हैं। एक रेसिपी जो एक त्वरित व्यंजन के लिए पूरी तरह से काम करती है, वह वास्तव में एक बहुत खराब रेसिपी हो सकती है यदि शेफ दस संस्करण बनाने और सबसे अच्छा चुनने की योजना बना रहा है। कुछ रेसिपी "स्थिर" और सुसंगत होती हैं, जबकि अन्य "उच्च-जोखिम, उच्च-पुरस्कार" वाली होती हैं—वे अक्सर विफल हो सकती हैं, लेकिन जब वे सफल होती हैं, तो वे शानदार होती हैं।

यह पेपर IAPO पेश करता है, जो रेसिपी और टेस्टिंग प्रक्रिया दोनों को एक साथ अनुकूलित (optimize) करने का एक तरीका है।

मुख्य विचार: "स्मार्ट पार्टी प्लानर"

IAPO को एक स्मार्ट पार्टी प्लानर के रूप में सोचें। केवल एक रेसिपी चुनने के बजाय, प्लानर आपकी विशिष्ट स्थिति ( "संदर्भ" या "Context") को देखता है:

  • आपका बजट: "मेरे पास सामग्री के लिए केवल $50 हैं।"
  • आपकी प्राथमिकताएं: "मुझे भोजन के शानदार होने की तुलना में उसके स्वस्थ होने की अधिक परवाह है।"

स्मार्ट प्लानर केवल एक रेसिपी नहीं चुनता; वह यह निर्णय भी लेता है: "चूंकि आपका बजट कम है, इसलिए मैं इस सरल, विश्वसनीय रेसिपी का उपयोग करूँगा और केवल एक संस्करण बनाऊँगा। लेकिन चूंकि आपका बजट बहुत बड़ा है और आप पूर्णता चाहते हैं, इसलिए मैं इस जटिल, प्रयोगात्मक रेसिपी का उपयोग करूँगा और 20 संस्करण बनाऊँगा, फिर सबसे अच्छा वाला चुनूँगा।"

सीक्रेट सॉस: PSST ("ट्रिमिंग" विधि)

प्लानर यह कैसे सीखता है कि कौन सी रेसिपी और कौन सी टेस्टिंग रणनीति सबसे अच्छा काम करती है, बिना आपके सभी पैसे खर्च किए हर एक संयोजन का परीक्षण किए? वे PSST (प्रॉम्प्ट स्केलिंग वाया सीक्वेंशियल ट्रिमिंग) का उपयोग करते हैं।

कल्पना कीजिए कि आपके पास टेस्ट करने के लिए 100 अलग-अलग रेसिपी हैं। आपके पास उन सभी 100 रेसिपी के सभी संस्करणों को पकाने के लिए पैसे नहीं हैं।

इसके बजाय, प्लानर एक "टूर्नामेंट ऑफ फ्लेवर्स" करता है:

  1. राउंड 1: वे हर रेसिपी का थोड़ा सा हिस्सा पकाते हैं।
  2. कट (छंटनी): वे तुरंत उन निचले 50% रेसिपी को फेंक देते हैं जिनका स्वाद बहुत खराब था।
  3. राउंड 2: वे बचे हुए "उत्तरजीवियों" (survivors) को लेते हैं और उन्हें थोड़ा बड़ा हिस्सा पकाते हैं।
  4. कट (छंटनी): वे फिर से निचले आधे हिस्से को फेंक देते हैं।
  5. फ़िनाले: वे तब तक इसे जारी रखते हैं जब तक कि केवल चैंपियन रेसिपी और "टेस्टिंग" की सही मात्रा शेष न रह जाए।

इन हारने वालों को जल्दी "ट्रिम" करके, वे आपके स्वाद को संतुष्ट करने के लिए सबसे अच्छा तरीका खोजने के साथ-साथ बहुत सारा पैसा (या "कंप्यूटेशनल बजट") बचाते हैं।

यह क्यों मायने रखता है?

AI (लार्ज लैंग्वेज मॉडल्स) की दुनिया में, "खाना पकाने" में पैसा और बिजली लगती है।

  • पुराना तरीका: लोग या तो बहुत कंजूस थे (बुरे परिणाम) या बहुत फिजूलखर्ची करने वाले (बहुत अधिक पैसा खर्च करना)।
  • IAPO का तरीका: AI "इन्फरेंस-अवेयर" (inference-aware) बन जाता है। वह जानता है कि यदि उससे "गहराई से सोचने" (अधिक सैंपल जेनरेट करने) के लिए कहा जाएगा, तो उसे एक अलग प्रकार के निर्देशों का उपयोग करना चाहिए बजाय इसके कि वह एक त्वरित, वन-शॉट उत्तर दे।

संक्षेप में: यह पेपर AI को कुशल होना सिखाता है, जिससे वह समय होने पर स्मार्ट बनता है, और जब उसे तेज़ होने की आवश्यकता होती है तो विश्वसनीय बनता है, और यह सब आपके बजट का सम्मान करते हुए किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →