← नवीनतम पेपर
🤖 AI

A Better Spur Should Start From Each Objective

यह शोध पत्र मल्टी-मार्जिनल प्रेफरेंस ऑप्टिमाइजेशन (MMPO) का प्रस्ताव करता है, जो एक सूक्ष्म-स्तरीय ढांचा है जो डेटा, ग्रेडिएंट और बाधा स्तरों पर हस्तक्षेप करके वास्तविक दुनिया के मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग में स्पार्स रिवार्ड्स और ऑप्टिमाइजेशन संघर्षों को संबोधित करता है ताकि विविध कार्यों में स्थिर, उच्च-प्रदर्शन संरेखण प्राप्त किया जा सके।

मूल लेखक: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल बाज़ार में, एक उत्पाद पृष्ठ (प्रोडक्ट पेज) अक्सर तकनीकी विशिष्टताओं और मार्केटिंग शब्दावली से भरा हुआ टेक्स्ट का एक घना ढेर होता है, जो एक खरीदार को अभिभूत कर सकता है। जटिल जानकारी और मानवीय समझ के बीच की खाई को पाटने के लिए, आर्टिफिशियल इंटेलिजेंस को तेजी से एक दोहरी भूमिका निभाने का काम सौंपा जा रहा है: उत्पाद विवरण में सबसे महत्वपूर्ण शब्दों की पहचान करना और फिर उनके लिए एक संक्षिप्त, स्पष्ट व्याख्या लिखना। यह केवल एक टेक्स्ट-एडिटिंग अभ्यास नहीं है; यह एक संतुलन बनाने का कार्य है। सिस्टम को सख्त ऑफलाइन नियमों को संतुष्ट करना चाहिए, जैसे कि यह सुनिश्चित करना कि निकाले गए शब्द सटीक हैं और उत्पाद की विशेषताओं की पूरी श्रृंखला को कवर करते हैं, जबकि साथ ही ऑनलाइन लक्ष्यों जैसे कि यूजर क्लिक को अधिकतम करना और नापसंदगी (डिस्लाइक्स) को कम करना भी चाहिए। ये लक्ष्य अक्सर विपरीत दिशाओं में खींचते हैं। एक ऐसी विशेषता जो बहुत सारे क्लिक उत्पन्न करती है, वह सटीक होने के लिए बहुत सामान्य हो सकती है, जबकि एक अत्यधिक सटीक तकनीकी शब्द एक साधारण ब्राउज़र के लिए बहुत अस्पष्ट हो सकता है। जब कंप्यूटर प्रोग्राम इन सभी परस्पर विरोधी लक्ष्यों को एक साथ अनुकूलित करने की कोशिश करते हैं, तो वे अक्सर लड़खड़ा जाते हैं, या एक ऐसे लूप में फंस जाते हैं जहाँ एक मीट्रिक में सुधार करने से दूसरा ढह जाता है।

हारबिन इंस्टीट्यूट ऑफ टेक्नोलॉजी, जेडी डॉट कॉम (JD.com) और चीनी विज्ञान अकादमी के शोधकर्ताओं ने इस विशिष्ट समस्या—परस्पर विरोधी लक्ष्यों की समस्या—को हल करने के लिए एक नया तरीका विकसित किया है। वे अपने दृष्टिकोण को 'मल्टी-मार्जिनल प्रेफरेंस ऑप्टिमाइजेशन' (Multi-Marginal Preference Optimization) कहते हैं, जो एक ऐसा सिस्टम है जिसे कंप्यूटर को सभी उद्देश्यों को निर्देशों के एक एकल, अस्त-व्यस्त ढेर के रूप में देखने से रोकने के लिए डिज़ाइन किया गया है। मॉडल को हर चीज़ पर समझौता करते हुए एक एकल "सर्वश्रेष्ठ" उत्तर खोजने के लिए मजबूर करने के बजाय, यह नया ढांचा प्रत्येक लक्ष्य को हाईवे के एक अलग लेन की तरह मानता है। यह पहले डेटा को साफ करता है, वास्तविक उपयोगकर्ता व्यवहार से मिलने वाले शोर भरे और विरल संकेतों को सुचारू बनाता है, जैसे कि क्लिक और लाइक्स, जो यदि सीधे तौर पर लिए जाएं तो भ्रामक हो सकते हैं। इन पुरस्कारों (रिवॉर्ड्स) को कैसे देखा जाए, इसे समायोजित करके, सिस्टम यह सुनिश्चित करता है कि दुर्लभ लेकिन मूल्यवान जानकारी को केवल इसलिए अनदेखा न किया जाए क्योंकि वह सामान्य शब्दों की तुलना में कम बार दिखाई देती है।

मुख्य नवाचार इस बात में निहित है कि सिस्टम स्वयं सीखने की प्रक्रिया को कैसे संभालता है। जब कंप्यूटर अपने प्रदर्शन में सुधार करने की कोशिश करता है, तो वह अपने लक्ष्यों के आधार पर गणितीय अपडेट उत्पन्न करता है। पुराने तरीकों में, ये अपडेट बस एक साथ जोड़ दिए जाते थे, जिससे अक्सर एक लक्ष्य के निर्देश दूसरे के निर्देशों को रद्द या विकृत कर देते थे। नया तरीका इन अपडेट्स को लागू करने से पहले उन्हें अलग करता है। यह पहचानता है कि सीखने के संकेत का कौन सा हिस्सा बुनियादी सटीकता के लिए आवश्यक है और कौन सा हिस्सा उपयोगकर्ता की प्राथमिकताओं के लिए विशिष्ट है, फिर यह प्राथमिकता संकेतों को एक ऐसे स्थान में प्रोजेक्ट करता है जहाँ वे मूल नियमों में हस्तक्षेप न करें। यह मॉडल को उपयोगकर्ताओं के लिए अधिक दिलचस्प बनने में मदद करता है बिना अनजाने में सटीक होने की क्षमता खोए।

इसके अलावा, शोधकर्ताओं ने सिस्टम को उसके प्रशिक्षण के अंतिम चरण में बहुत अधिक आक्रामक होने से रोकने के लिए एक सुरक्षा तंत्र जोड़ा है। जैसे-जैसे मॉडल बेहतर होते हैं, वे कभी-कभी एक लक्ष्य पर इतनी तीव्रता से ध्यान केंद्रित कर देते हैं कि वे अन्य लक्ष्यों की उपेक्षा करने लगते हैं, जिससे समग्र गुणवत्ता में अचानक गिरावट आती है। नया सिस्टम निर्देशों का पालन करने की मॉडल की अपनी क्षमता का उपयोग एक सीमा निर्धारित करने के लिए करता है। यह मॉडल से आदर्श स्थितियों के तहत आदर्श व्यवहार के उदाहरण उत्पन्न करने के लिए कहता है और उन उदाहरणों का उपयोग भविष्य के अपडेट के लिए एक सुरक्षित क्षेत्र (सेफ ज़ोन) को परिभाषित करने के लिए करता है। यदि मॉडल एक दिशा में बहुत अधिक जोर देने की कोशिश करता है, तो यह आंतरिक मार्गदर्शक उसे धीरे से वापस खींच लेता है, यह सुनिश्चित करता है कि प्रगति सभी मीट्रिक्स में स्थिर और संतुलित बनी रहे।

इस दृष्टिकोण के परिणामों का परीक्षण वास्तविक दुनिया के ई-कॉमर्स उत्पादों के एक डेटासेट पर किया गया था, जिसमें 65,232 प्रशिक्षण उत्पाद और 8,879 मूल्यांकन उत्पाद शामिल थे, साथ ही पिछले तीन महीनों में एकत्र किया गया उपयोगकर्ता व्यवहार डेटा भी शामिल था। इसकी तुलना कई अन्य उन्नत तरीकों से की गई और पाया गया कि यह काफी अधिक स्थिर और प्रभावी है। ऑफलाइन परीक्षणों में, इसने 94.11 प्रतिशत का पूर्णता स्कोर और 73.43 प्रतिशत की सटीकता प्राप्त की, जो पिछले तरीकों से बड़े अंतर से बेहतर है। महत्वपूर्ण रूप से, यह 22.82 प्रतिशत की लक्षित कवरेज दर हासिल करने में सफल रहा, जो लगभग पूर्ण है, जबकि अन्य तरीके या तो कम रह गए या लक्ष्य से आगे निकल गए। ये सुधार केवल सैद्धांतिक नहीं थे; जब इसे वास्तविक खरीदारों के साथ एक लाइव ऑनलाइन परीक्षण में तैनात किया गया, तो इस नए तरीके द्वारा संचालित सिस्टम ने पिछले मानक की तुलना में ऑर्डरों की संख्या में 3.14 प्रतिशत और उन ऑर्डरों के कुल मूल्य में 5.07 प्रतिशत की वृद्धि की।

इस ढांचे की सफलता ऑनलाइन शॉपिंग से परे तक फैली हुई है। शोधकर्ताओं ने इसे टूल के उपयोग और कंप्यूटर कोड जनरेशन से जुड़े कार्यों पर भी लागू किया, जहाँ कई बाधाओं को एक साथ पूरा किया जाना आवश्यक है। इन परीक्षणों में, यह विधि लगातार मानक दृष्टिकोणों की तुलना में बेहतर परिणाम देती रही, विशेष रूप से "मोड कोलैप्स" (mode collapse) से बचने में, जहाँ एक मॉडल एक आसान समाधान ढूंढ लेता है और उसे बार-बार दोहराता है। इसके बजाय, नया सिस्टम सख्त नियमों का पालन करते हुए उच्च-गुणवत्ता वाले आउटपुट की एक विविध श्रेणी बनाए रखता है। परस्पर विरोधी लक्ष्यों को अलग करके और उन्हें संतुलित करने के लिए एक संरचित तरीका प्रदान करके, यह कार्य आर्टिफिशियल इंटेलिजेंस को जटिल, वास्तविक दुनिया के वातावरण में अधिक विश्वसनीय बनाने के लिए एक व्यावहारिक समाधान प्रदान करता है, जहाँ कई, प्रतिस्पर्धी उद्देश्य सामान्य बात हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →