← नवीनतम पेपर
📊 statistics

In-Context Multi-Objective Optimization

यह शोधपत्र TAMO को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-आधारित, पूर्णतः एमोर्टाइज्ड (fully amortized) पॉलिसी है जो कुशल, सार्वभौमिक मल्टी-ऑब्जेक्टिव ब्लैक-बॉक्स ऑप्टिमाइजेशन करने के लिए इन-कॉन्टेक्स्ट लर्निंग और रीइन्फोर्समेंट लर्निंग का लाभ उठाता है, जिसमें प्रति-कार्य सरोगेट फिटिंग या एक्विजिशन फंक्शन इंजीनियरिंग की आवश्यकता नहीं होती है।

मूल लेखक: Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "इन-कॉन्टेक्स्ट मल्टी-ऑब्जेक्टिव ऑप्टिमाइज़ेशन" (TAMO) पेपर का सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए विवरण दिया गया है।

समस्या: "टेस्ट-टेस्ट" की दुविधा (The "Taste-Test" Dilemma)

कल्पना कीजिए कि आप एक शेफ हैं जो एक बेहतरीन नया सैंडविच बनाने की कोशिश कर रहे हैं। आपके पास दो लक्ष्य हैं:

  1. स्वाद: यह स्वादिष्ट होना चाहिए।
  2. लागत: इसे बनाना सस्ता होना चाहिए।

समस्या यह है कि ये दोनों लक्ष्य अक्सर एक-दूसरे से टकराते हैं। एक सैंडविच जिसमें महंगे ट्रफल्स (truffles) हैं, वह अद्भुत स्वाद देता है लेकिन उसकी कीमत बहुत अधिक होती है। एक संडविच जिसमें सस्ती सामग्री है, वह किफायती तो है लेकिन शायद उबाऊ हो सकता है। आप उस "स्वीट स्पॉट" को खोजना चाहते हैं जहाँ सैंडविच स्वादिष्ट भी हो और किफायती भी।

वास्तविक दुनिया में, वैज्ञानिक और इंजीनियर लगातार इसी तरह की समस्या का सामना करते हैं। वे या तो ऐसी दवा डिजाइन कर रहे होते हैं जो प्रभावी हो लेकिन जहरीली न हो, या ऐसा रॉकेट जो तेज़ हो लेकिन ईंधन-कुशल (fuel-efficient) भी हो।

पेंच यह है कि परीक्षण (Testing) महंगा है।

  • आप तुरंत 1,000 सैंडविच का स्वाद नहीं ले सकते। आपको उन्हें एक-एक करके बनाना होगा, जिसमें समय और पैसा लगता है।
  • आप तुरंत मनुष्यों पर 1,000 दवाओं का परीक्षण नहीं कर सकते।

पारंपरिक रूप से, इसे हल करने के लिए विशेषज्ञ मल्टी-ऑब्जेक्टिव बायेसियन ऑप्टिमाइज़ेशन (MOBO) नामक विधि का उपयोग करते हैं। इसे एक बहुत ही स्मार्ट, लेकिन धीमे 'सू-शेफ' (sous-chef) की तरह समझें।

  1. सू-शेफ कुछ सैंडविच चखता है।
  2. वह एक जटिल मानचित्र (एक "सरोगेट मॉडल") बनाता है जो भविष्यवाणी करता है कि अच्छे सैंडविच कहाँ मिल सकते हैं।
  3. वह अगले सैंडविच को बनाने के लिए एक "सबसे अच्छा अनुमान" निकालता है।
  4. रुकावट (The Bottleneck): हर बार जब आप एक नया सैंडविच बनाते हैं, तो सू-शेफ को रुकना पड़ता है, पूरे मानचित्र को फिर से बनाना पड़ता है और सबसे अच्छे अनुमान की दोबारा गणना करनी पड़ती है। यदि आप जल्दबाजी में काम कर रहे हैं (या एक साथ कई चीजें टेस्ट कर रहे हैं), तो यह प्रक्रिया बहुत धीमी हो जाती है। यह एक ऐसी कार चलाने जैसा है जहाँ आपको हर बार गैस पेडल दबाने पर इंजन को फिर से बनाना पड़ता है।

समाधान: TAMO (द "इंस्टेंट इंट्यूशन" शेफ)

लेखकों ने TAMO पेश किया है, जो एक ऐसे मास्टर शेफ की तरह काम करता है जिसके पास "तत्काल अंतर्ज्ञान" (instant intuition) है।

हर एक परीक्षण के बाद मानचित्र को फिर से बनाने के लिए रुकने के बजाय, TAMO को पहले से ही हजारों अन्य सैंडविच रेसिपी (और रॉकेट डिजाइन, और दवा के फार्मूले) पर प्रशिक्षित किया गया है। इसने सामान्य "आकार" को सीख लिया है कि ये समस्याएँ कैसे काम करती हैं।

TAMO कैसे काम करता है:

  1. प्रशिक्षण (The Training): आपके विशिष्ट सैंडविच की समस्या देखने से पहले ही, TAMO को सिंथेटिक समस्याओं के एक विशाल पुस्तकालय पर प्रशिक्षित किया जाता है। यह परीक्षणों के इतिहास (जैसे, "हमने नमक डाला, यह बहुत नमकीन था; हमने चीनी डाली, यह बहुत मीठा था") को देखना और तुरंत अगले सबसे अच्छे कदम का अनुमान लगाना सीख जाता है।
  2. जादुई ट्रिक (In-Context): जब आप इसे अपनी नई समस्या देते हैं, तो इसे कुछ भी "फिर से सीखने" की आवश्यकता नहीं होती। यह बस आपके परीक्षणों के इतिहास को देखता है और एक ही पल में (एक "फॉरवर्ड पास" में) कहता है: "अब तक आपने जो भी आज़माया है, उसके आधार पर, अगला सबसे अच्छा सैंडविच यह है।"
  3. कोई री-ट्रेनिंग नहीं: यदि आप समस्या बदलते हैं (उदाहरण के लिए, अब आप सैंडविच के बजाय एक बर्गर डिजाइन कर रहे हैं, या आपके पास 2 के बजाय 3 लक्ष्य हैं), तो TAMO को रुकने या फिर से प्रशिक्षित होने की आवश्यकता नहीं है। यह चलते-चलते खुद को ढाल लेता है।

मुख्य विशेषताएं

1. "यूनिवर्सल ट्रांसलेटर" (डायमेंशन एग्नोस्टिक)
अधिकांश AI मॉडल विशेषज्ञों की तरह होते हैं जो केवल एक भाषा बोलते हैं। यदि आप सामग्रियों (inputs) की संख्या या लक्ष्यों (outputs) की संख्या बदलते हैं, तो वे टूट जाते हैं।
TAMO एक यूनिवर्सल ट्रांसलेटर की तरह है। चाहे आप 2 सामग्रियों और 2 लक्ष्यों वाला सैंडविच ऑप्टिमाइज़ कर रहे हों, या 100 भागों और 5 लक्ष्यों वाला रॉकेट, TAMO इन सभी को संभाल लेता है। इसे समस्या के आकार से कोई फर्क नहीं पड़ता; यह बस डेटा के पैटर्न को देखता है।

2. "लॉन्ग-टर्म प्लानर" (नॉन-मायोपिक)
पुराने तरीके "मायोपिक" (अल्पदृष्टि वाले) होते हैं, जिसका अर्थ है कि वे केवल एक कदम आगे देखते हैं। वे पूछते हैं, "अभी इस वक्त सबसे अच्छा सैंडविच क्या है?"
TAMO को रीइन्फोर्समेंट लर्निंग (जैसे इनाम देकर कुत्ते को प्रशिक्षित करना) का उपयोग करके प्रशिक्षित किया गया है। इसे न केवल एक अच्छे कदम के लिए, बल्कि पूरी यात्रा के लिए पुरस्कृत किया जाता है। यह ऐसे कदम उठाना सीखता है जो अभी थोड़े खराब लग सकते हैं लेकिन लंबे समय में बहुत बेहतर परिणाम देंगे। यह सिर्फ अगले निवाले की नहीं, बल्कि पूरे मेनू की योजना बनाता है।

3. स्पीड बूस्ट (गति में वृद्धि)
यह सबसे बड़ी जीत है।

  • पुराना तरीका: 100% समय मानचित्र बनाने और गणना करने में खर्च होता है।
  • TAMO: 99% समय बच जाता है। यह पुराने तरीकों की तुलना में 50 से 1,000 गुना तेजी से अगला परीक्षण प्रस्तावित करता है।
  • उपमा: यदि पुराने तरीके को अगला क्या बनाना है यह तय करने में 10 मिनट लगते हैं, तो TAMO एक सेकंड के अंश में निर्णय ले लेता है। इसका मतलब है कि आप उस समय में हजारों प्रयोग कर सकते हैं जितना पहले केवल कुछ ही प्रयोग करने में लगता था।

परिणाम

लेखकों ने TAMO का परीक्षण किया:

  • सिंथेटिक गणितीय समस्याओं पर: जहाँ उन्हें सटीक उत्तर पता था।
  • वास्तविक दुनिया की समस्याओं पर: जैसे तेल सोखने वाली सामग्री (sorbent) के लिए सबसे अच्छा मिश्रण खोजना।

परिणाम:

  • गुणवत्ता (Quality): TAMO ने उन समाधानों को खोजा जो धीमे, पारंपरिक तरीकों के समान (और कभी-कभी उनसे बेहतर) थे।
  • गति (Speed): यह नाटकीय रूप से तेज़ था।
  • लचीलापन (Flexibility): यह बिना किसी री-ट्रेनिंग के तब भी पूरी तरह से काम करता रहा जब लक्ष्यों या सामग्रियों की संख्या बदल गई।

सारांश

TAMO को एक कैलकुलेटर से मानव विशेषज्ञ की ओर बढ़ने के रूप में सोचें।

  • कैलकुलेटर (पुराना तरीका) सटीक है लेकिन धीमा है; हर नए सवाल के लिए इसे नंबरों की गणना करनी पड़ती है।
  • विशेषज्ञ (TAMO) ने अपने जीवन में इतनी सारी समान समस्याएं देखी हैं कि वह किसी स्थिति को देखकर तुरंत जान सकता है कि अगला सबसे अच्छा कदम क्या है, चाहे विशिष्ट विवरण कुछ भी हों।

यह वैज्ञानिकों को जटिल डिजाइनों को बहुत तेज़ी से खोजने की अनुमति देता है, जिससे एक ऐसी प्रक्रिया जो पहले कंप्यूटर के घंटों के समय में बदल जाती थी, अब लगभग तुरंत होने लगती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →