← नवीनतम पेपर
💬 NLP

UtilityMax Prompting: A Formal Framework for Multi-Objective Large Language Model Optimization

यह शोध पत्र यूटिलिटीमैक्स प्रॉम्प्टिंग (UtilityMax Prompting) प्रस्तुत करता है, जो एक औपचारिक ढांचा है जो अस्पष्ट प्राकृतिक भाषा निर्देशों को गणितीय प्रभाव आरेख (mathematical influence diagrams) और उपयोगिता फलनों (utility functions) से प्रतिस्थापित करता है ताकि लार्ज लैंग्वेज मॉडल्स को स्पष्ट रूप से अपेक्षित उपयोगिता को अधिकतम करने की ओर निर्देशित किया जा सके, जिससे मूवी अनुशंसा जैसे कार्यों में पारंपरिक प्रॉम्प्टिंग विधियों की तुलना में बेहतर बहु-उद्देश्यीय अनुकूलन प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Ofir Marom

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ofir Marom

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े शाब्दिक अर्थ निकालने वाले (literal-minded) शेफ (AI) को एक बहुत ही नखरेबाज मेहमान के लिए खाना बनाने के लिए काम पर रख रहे हैं। आप चाहते हैं कि व्यंजन स्वादिष्ट (delicious), स्वस्थ (healthy) और सस्ता (cheap) हो।

समस्या: "अस्पष्ट आदेश" (The "Vague Order")

यदि आप सामान्य भाषा में शेफ को कहते हैं, "मेरे लिए कुछ स्वादिष्ट, स्वस्थ और सस्ता बनाओ," तो शेफ को इसका अर्थ समझना पड़ेगा।

  • क्या "सस्ता" का मतलब 5हैया5 है या 50?
  • क्या "स्वस्थ" का मतलब बिना चीनी वाला भोजन है, या बस ढेर सारी सब्जियां?
  • क्या "स्वादिष्ट" का मतलब तीखा या मीठा है?

शेफ गलत अनुमान लगा सकता है। वह $50 का स्टेक बना सकता है (स्वादिष्ट, लेकिन महंगा) या सादे ब्रोकली का एक कटोरा बना सकता है (स्वस्थ और सस्ता, लेकिन स्वादिष्ट नहीं)। यही तब होता है जब हम जटिल AI कार्यों के लिए मानक "प्राकृतिक भाषा" (natural language) का उपयोग करते हैं। निर्देश बहुत अस्पष्ट होते हैं, और AI को प्रतिस्पर्धी लक्ष्यों को कैसे संतुलित किया जाए, इसका अनुमान लगाना पड़ता है।

समाधान: "गणितीय रेसिपी" (The "Mathematical Recipe" - UtilityMax)

यह पेपर AI से बात करने का एक नया तरीका पेश करता है जिसे UtilityMax प्रॉम्प्टिंग कहा जाता है। एक अस्पष्ट आदेश देने के बजाय, आप AI को एक गणितीय सूत्र (mathematical formula) देते हैं।

इसे इस तरह सोचिए: एक साधारण आदेश देने के बजाय "मेरे लिए एक अच्छा भोजन बनाओ," आप शेफ को एक कैलकुलेटर थमाते हैं और कहते हैं:

"आपका लक्ष्य इस संख्या को अधिकतम करना है: (स्वाद स्कोर) × (स्वास्थ्य स्कोर) × (कीमत स्कोर)।"

अब, शेफ केवल अनुमान नहीं लगा सकता। उसे यह करना होगा:

  1. हर संभावित सामग्री को देखना होगा।
  2. प्रत्येक सामग्री के लिए "स्वाद," "स्वास्थ्य," और "कीमत" की गणना करनी होगी।
  3. उन संख्याओं को आपस में गुणा करना होगा।
  4. उस सामग्री को चुनना होगा जो सबसे अधिक कुल संख्या (highest total number) देती है।

यह AI को अनुमान लगाने के बजाय गणना करने के लिए मजबूर करता है। उसे यह स्पष्ट रूप से सोचना होगा कि वह कितनी "स्वास्थ्य" प्राप्त कर रहा है बनाम वह "कीमत" में कितनी बचत कर रहा है, बजाय इसके कि वह केवल उम्मीद करे कि 'वाइब' सही महसूस हो।

यह कैसे काम करता है (द "इन्फ्लुएंस डायग्राम")

यह पेपर एक इन्फ्लुएंस डायग्राम (Influence Diagram) की अवधारणा का उपयोग करता है। एक फ्लोचार्ट की कल्पना करें:

  • निर्णय (The Decision): AI का उत्तर (व्यंजन)।
  • चर (The Variables): विभिन्न लक्ष्य (स्वाद, स्वास्थ्य, कीमत)।
  • उपयोगिता (The Utility): अंतिम स्कोर (परिणाम के रूप में गुणा करना)।

AI को बताया जाता है: "आप निर्णय लेने वाले हैं। आपका काम वह उत्तर खोजना है जो अंतिम 'उपयोगिता' (Utility) संख्या को यथासंभव बड़ा बना सके।"

मूवी प्रयोग (The Movie Experiment)

परीक्षण करने के लिए, शोधकर्ताओं ने AI को फिल्में सुझाने के लिए प्रेरित किया।

  • लक्ष्य: ऐसी फिल्में सुझाना जो कॉमेडी (Comedies) हों, रोमांटिक (Romances) हों, और जिनकी रेटिंग अधिक (High Rating) हो।
  • पुराना तरीका (प्राकृतिक भाषा): "मजेदार, रोमांटिक फिल्में सुझाएं जो अच्छी हों।"
    • परिणाम: AI कभी-कभी एक दुखद ड्रामा (sad drama) की सिफारिश कर देता था क्योंकि उसे लगता था कि "रोमांटिक" होना "मजेदार" होने से अधिक महत्वपूर्ण है, या उसने रेटिंग का गलत अनुमान लगाया।
  • नया तरीका (UtilityMax): AI को गणना करने के लिए कहा गया: (कॉमेडी होने की संभावना) × (रोमांस होने की संभावना) × (अनुमानित रेटिंग)
    • परिणाम: AI तीनों लक्ष्यों को पूरी तरह से हिट करने वाली फिल्में खोजने में बहुत बेहतर हो गया।

परिणाम

उन्होंने उपलब्ध तीन सबसे स्मार्ट AI मॉडल्स (Claude, GPT, और Gemini) पर इसका परीक्षण किया।

  • निष्कर्ष: "गणितीय रेसिपी" (UtilityMax) ने "अस्पष्ट आदेश" (Natural Language) को लगातार मात दी।
  • क्यों? यहाँ तक कि सबसे स्मार्ट AI भी "मध्यम जोखिम" या "बहुत मजेदार" जैसे शब्दों से भ्रमित हो जाते हैं। लेकिन वे गणित में बहुत अच्छे होते हैं। यदि आप उन्हें एक स्पष्ट सूत्र देते हैं, तो वे उसका पूरी तरह से पालन करते हैं।

एक शर्त (The Catch)

यहाँ एक नियम है: AI को संख्याओं का सही ढंग से अनुमान लगाने में सक्षम होना चाहिए।

  • यदि AI यह अनुमान लगाने में बुरा है कि कोई फिल्म कितनी "मजेदार" है, तो गणित काम नहीं करेगा।
  • लेकिन वर्तमान शीर्ष-स्तरीय AI के लिए, वे इन संभावनाओं का अनुमान लगाने में इतने सक्षम हैं कि गणित उन्हें उनके काम में काफी बेहतर बनाता है।

संक्षेप में

UtilityMax प्रॉम्प्टिंग एक इंसान को अस्पष्ट इच्छा देने ("मुझे एक शानदार छुट्टी चाहिए") के बजाय उन्हें एक स्प्रेडशीट देने जैसा है जिसमें एक स्पष्ट सूत्र हो ("अधिकतम करें: धूप के घंटे + समुद्र तट की गुणवत्ता - लागत")। यह AI को यह अनुमान लगाने से रोकता है कि आप क्या चाहते हैं और इसे एक आदर्श उत्तर खोजने के लिए गणित की समस्या हल करने के लिए मजबूर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →