← नवीनतम पेपर
🤖 machine learning

ParetoPilot: Zero-Surrogate Offline Multi-Objective Optimization via Infer-Perturb-Guide Diffusion

ParetoPilot एक नवीन ज़ीरो-सरोगेट डिफ्यूजन फ्रेमवर्क है जो ऑफलाइन मल्टी-ऑब्जेक्टिव ऑप्टिमाइज़ेशन के लिए है, जो जनरेशन को विविध पारेटो-ऑप्टिमल समाधानों की ओर गतिशील रूप से निर्देशित करने के लिए डीनॉइज़िंग प्रक्रिया के भीतर एक इन्फर-पर्टर्ब-गाइड इंजन को समाहित करके बाहरी सरोगेट मॉडल की आवश्यकता को समाप्त करता है।

मूल लेखक: Ruiqing Sun, Sen Yang, Dawei Feng, Bo Ding, Yijie Wang, Huaimin Wang

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiqing Sun, Sen Yang, Dawei Feng, Bo Ding, Yijie Wang, Huaimin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक नई, उत्तम रेसिपी (व्यंजन) बनाने की कोशिश कर रहे हैं। आपके पास एक विशाल, पुरानी कुकबुक (आपका स्टैटिक डेटासेट) है जिसमें हजारों मौजूदा रेसिपी और उनकी रेटिंग्स हैं। लेकिन, आपको नए व्यंजन बनाते समय उन्हें चखने से मना किया गया है (कोई ऑनलाइन इंटरैक्शन नहीं); आप केवल पुरानी किताब ही देख सकते हैं। आपका लक्ष्य रेसिपीज़ का एक नया सेट बनाना है जो "पारेटो-ऑप्टिमल" (Pareto-optimal) हो—यानी, विरोधाभासी लक्ष्यों के बीच सबसे अच्छा संतुलन, जैसे "सबसे स्वादिष्ट" बनाम "सबसे सस्ता" या "सबसे स्वस्थ" बनाम "सबसे तेज़"।

समस्या यह है कि पुरानी किताब में वह परफेक्ट रेसिपी नहीं है जिसकी आप कल्पना कर रहे हैं। आपको अनुमान लगाना होगा कि वह कैसी दिखेगी।

पुराना तरीका: एक त्रुटिपूर्ण सलाहकार को काम पर रखना

पिछले अधिकांश तरीकों ने इसे एक "सलाहकार" (एक सरोगेट मॉडल) को काम पर रखकर हल करने की कोशिश की।

  1. आप इस सलाहकार को प्रशिक्षित करते हैं कि पुरानी किताब के आधार पर कोई नई रेसिपी कितनी अच्छी होगी।
  2. आप इस सलाहकार से अपनी कुकिंग को निर्देशित करने के लिए कहते हैं।

दोष:

  • महंगा: हर नए लक्ष्य के लिए एक नया सलाहकार प्रशिक्षित करना महंगा और धीм है।
  • भ्रामक: यदि आप सलाहकार से किसी अजीब, विचित्र रेसिपी के बारे में पूछते हैं जो पुरानी किताब में मौजूद नहीं है, तो सलाहकार अक्सर एक फर्जी स्कोर बना देता है। वह कह सकता है, "यह अजीब सूप अद्भुत है!" जबकि वास्तव में वह बेकार हो सकता है। इससे आपका समय खराब विचारों पर बर्बाद होता है।
  • गोपनीयता: कभी-कभी, गोपनीयता नियमों के कारण आप सलाहकार को पुरानी किताब दिखा भी नहीं सकते।

नया तरीका: ParetoPilot (एक "स्व-निर्देशित" शेफ)

लेखक ParetoPilot नामक एक विधि का प्रस्ताव देते हैं जिसे किसी सलाहकार की आवश्यकता नहीं है। इसके बजाय, यह एक पूर्व-प्रशिक्षित AI शेफ (एक डिफ्यूजन मॉडल) में पहले से मौजूद "अंतर्ज्ञान" (intuition) का उपयोग करता है।

इस डिफ्यूजन मॉडल को एक ऐसे शेफ के रूप में सोचें जिसने पुरानी कुकबुक को इतनी अच्छी तरह से याद कर लिया है कि वह उससे कोई भी व्यंजन फिर से बना सकता है। आमतौर पर, यह शेफ व्यंजनों को बिल्कुल वैसे ही दोबारा बनाता है जैसे वे थे। ParetoPilot इस शेफ को बिना किसी नए गाइड को देखे, पुरानी रेसिपीज़ में सुधार करना सिखाता है।

यह IPG (Infer-Perturb-Guide) नामक तीन-चरणीय इंजन का उपयोग करके ऐसा करता है:

1. INFER: "ध्रुव तारे" (North Star) को खोजना

कल्पना कीजिए कि शेफ एक धुंधली, शोर वाली रेसिपी पकड़े हुए है।

  • शेफ पूछता है: "यदि मैं इसे बिल्कुल वैसा ही बनाऊं जैसा यह है (unconditional), तो इसका स्वाद कैसा होगा?"
  • फिर, शेफ पूछता है: "यदि मैं इसे थोड़ा बेहतर बनाने के लिए इसमें थोड़ा बदलाव करूं (conditional), तो इसका स्वाद कैसा होगा?"
  • इन दोनों अनुमानों की तुलना करके, शेफ यह समझ जाता है कि व्यंजन को बेहतर बनाने के लिए उसे किस तत्काल दिशा में बढ़ना चाहिए। यह बिल्कुल वैसा ही है जैसे बिना किसी मानचित्र के, हवा को महसूस करके यह जानना कि किस दिशा में नौका विहार करना है।

2. PERTURB: "गुरुत्वाकर्षण और प्रतिकर्षण" का नृत्य

अब शेफ को यह तय करने की आवश्यकता है कि उसे कैसे आगे बढ़ना है। उन्हें दो चीजों की आवश्यकता है:

  • अभिसरण (Convergence - गुरुत्वाकर्षण): एक बल जो सभी नई रेसिपीज़ को "सर्वश्रेष्ठ संभव" क्षेत्र (पारेटो फ्रंट) की ओर खींचता है। कल्पना करें कि एक सौम्य गुरुत्वाकर्षण सभी को उत्कृष्टता के केंद्र की ओर खींच रहा है।
  • विविधता (Diversity - प्रतिकर्षण): एक बल जो रेसिपीज़ को एक-दूसरे से दूर धकेलता है ताकि वे एक जैसी न दिखें। कल्पना करें कि एक "पर्सनल स्पेस" वाला बल रेसिपीज़ को एक-दूसरे से दूर धकेलता है ताकि आपको विकल्पों की एक विस्तृत श्रृंखला मिले, न कि केवल एक ही परफेक्ट डिश।

जादुई ट्रिक: लेखक एक गणितीय चाल (Gram-Schmidt orthogonalization) का उपयोग करते हैं ताकि यह सुनिश्चित हो सके कि ये दोनों बल आपस में लड़ें नहीं। यह "गुरुत्वाकर्षण" और "प्रतिकर्षण" को एक-दूसरे के लंबवत (right angles पर) चलने के लिए कहने जैसा है, ताकि आप बेहतर व्यंजन भी बना सकें और अधिक विविधता भी प्राप्त कर सकें, बिना प्रक्रिया को धीमा किए।

3. GUIDE: जहाज को दिशा देना

अंत में, शेफ इन गणना की गई दिशाओं का उपयोग करके कुकिंग प्रक्रिया को थोड़ा बदलने (nudge करने) के लिए करता है। वे क्लासिफायर-फ्री गाइडेंस (CFG) नामक एक मानक तकनीक का उपयोग करते हैं—इसे एक स्टीयरिंग व्हील की तरह समझें—जो जनरेशन प्रक्रिया को इन नई, बेहतर और विविध रेसिपीज़ की ओर धीरे से मोड़ता है।

यह क्यों एक बड़ी बात है

  • अतिरिक्त प्रशिक्षण की आवश्यकता नहीं: आपको नया सलाहकार प्रशिक्षित करने की आवश्यकता नहीं है। आप बस उस AI का उपयोग करते हैं जो आपके पास पहले से है।
  • कोई फर्जी स्कोर नहीं: क्योंकि आपका AI सीधे अपने मेमोरी से वैध डेटा से रेसिपी जेनरेट कर रहा है, इसलिए यह गलती से "बेतुकी" रेसिपी (जैसे कि एक अणु जो अस्तित्व में नहीं हो सकता या एक टूटा हुआ कंप्यूटर चिप) नहीं बनाएगा और फिर उसे उच्च स्कोर नहीं देगा। यह "वैध पथ" पर बना रहता है।
  • गोपनीयता के अनुकूल: चूंकि इसे नया गाइड प्रशिक्षित करने के लिए मूल डेटा देखने की आवश्यकता नहीं है, इसलिए यह तब भी काम करता है जब डेटा लॉकडाउन (सुरक्षित) हो।

परिणाम

लेखकों ने अणुओं के डिजाइन से लेकर कंप्यूटर चिप्स के अनुकूलन तक 51 अलग-अलग कार्यों पर इसका परीक्षण किया।

  • विजेता: ParetoPilot ने 14 अन्य शीर्ष विधियों को पछाड़ दिया।
  • रहस्य: इसने जटिल, अजीब कार्यों (जैसे रसायन विज्ञान या वास्तुकला) को बहुत बेहतर तरीके से संभाला, जहाँ "सलाहकार" विधियां अक्सर भ्रमित हो जाती थीं और असंभव डिज़ाइन सुझा देती थीं।

संक्षेप में, ParetoPilot एक ऐसा तरीका है जिससे आप एक स्मार्ट AI जो पुराने डेटा को जानता है, उसे अपने आप नए, बेहतर और विविध समाधान आविष्कार करने के लिए सिखा सकते हैं, बिना किसी दूसरे AI की मदद के जो उसे निर्देश दे सके। यह एक शेफ को निर्देशों के पूर्ण मेनू के बजाय एक दिशा-सूचक यंत्र (compass) और एक हल्का सा धक्का देने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →