← नवीनतम पेपर
💬 NLP

One Model, Multiple Goals: Adaptive Multi-Objective Learning for E-commerce Dialogue Systems

यह शोध पत्र MORE को प्रस्तुत करता है, जो एक अनुकूलन योग्य बहु-उद्देश्यीय सुदृढीकरण शिक्षण (multi-objective reinforcement learning) ढांचा है जो प्रशिक्षण को स्थिर करने के लिए तर्क सटीकता (reasoning accuracy) को एक बाधा के रूप में मानता है और भाषाई स्वाभाविकता को गतिशील रूप से संतुलित करता है, जिससे ByteDance के वास्तविक ई-कॉमर्स संवाद प्रणालियों और MultiWOZ बेंचमार्क पर रूपांतरण दरों और उपयोगकर्ता संतुष्टि में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Mingzhe Li, Jing Xiang, Enguo Zhou, Lang Gao, Tai Li, Qishen Zhang, Xiangliang Zhang, Xiuying Chen

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingzhe Li, Jing Xiang, Enguo Zhou, Lang Gao, Tai Li, Qishen Zhang, Xiangliang Zhang, Xiuying Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त ऑनलाइन स्टोर के लिए एक नया ग्राहक सेवा प्रतिनिधि (customer service representative) नियुक्त कर रहे हैं। आपके पास इस कर्मचारी के लिए दो बहुत अलग, फिर भी समान रूप से महत्वपूर्ण लक्ष्य हैं:

  1. द अकाउंटेंट (The Accountant): उन्हें ग्राहक की फाइल देखने, क्रेडिट लिमिट और ब्याज दरों की गणना करने और 100% तथ्यात्मक रूप से सही उत्तर देने में सक्षम होना चाहिए। यदि वे संख्याओं में गलती करते हैं, तो ग्राहक का पैसा या विश्वास दोनों डूब जाते हैं।
  2. द चैटरबॉक्स (The Chatterbox): उन्हें स्वाभाविक रूप से बात करनी चाहिए, मिलनसार दिखना चाहिए और बातचीत को सुचारू रूप से जारी रखना चाहिए। यदि वे एक उबाऊ रोबोट की तरह व्यवहार करते हैं, तो ग्राहक चिढ़ जाता है और कॉल काट देता है।

समस्या यह है कि ये दोनों लक्ष्य अक्सर आपस में टकराते हैं। एक रोबोट जो गणित में एकदम सटीक है, वह अक्सर एक उबाऊ और कठोर कंप्यूटर जैसा लगता है। वहीं, एक रोबट जो बातचीत करने में बहुत अच्छा है, वह अक्सर संख्याएं बना लेता है या गणित में गलती कर देता है।

यह शोध पत्र एक नई AI प्रणाली पेश करता है जिसे MORE कहा जाता है, जो इस संघर्ष को हल करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "ट्रेनिंग कैंप" बनाम "असली गेम"

लेखकों ने महसूस किया कि AI को प्रशिक्षण के दौरान एक ही समय में एक आदर्श अकाउंटेंट और एक आदर्श चैटरबॉक्स बनाना, एक छात्र को यूनिसाइकिल (एक पहिये वाली साइकिल) चलाते समय करतब दिखाने (juggling) के लिए सिखाने जैसा था। AI भ्रमित हो जाएगा, कभी बहुत रोबोटिक तो कभी बहुत लापरवाह हो जाएगा, और अंततः दोनों में विफल रहेगा।

समाधान: उन्होंने प्रशिक्षण को दो अलग-अलग चरणों में विभाजित किया, जैसे कि एक स्पोर्ट्स टीम के पास "प्रैक्टिस सेशन" और "गेम डे" होता है।

  • प्रैक्टिस सेशन (The Scaffold): प्रशिक्षण के दौरान, AI को ज़ोर-ज़बरदस्ती कठिन गणित और तर्क का काम ज़ोर से (बोलकर) करना पड़ता है। उसे उत्तर देने से पहले ग्राहक की क्रेडिट लिमिट या ब्याज दर के बारे में स्पष्ट रूप से तर्क देना होता है। यह एक छात्र द्वारा गणित के टेस्ट में अपना काम दिखाने जैसा है। यह सुनिश्चित करता है कि AI तथ्यों को पूरी तरह से सीख ले।
  • गेम डे (Inference): जब AI वास्तव में किसी वास्तविक ग्राहक से बात करता है, तो वह अपना "काम दिखाना" बंद कर देता है। वह "सोचने और समझाने" वाले चरण को छोड़ देता है और सीधे अंतिम, स्वाभाविक उत्तर देता है। क्योंकि उसने पहले बहुत कठिन गणित का अभ्यास किया है, इसलिए अब वह बिना रोबोटिक लगे तुरंत सही उत्तर दे सकता है। यह बातचीत को तेज़ और सुचारू बनाता है।

2. "डायनेमिक कोच" (Adaptive Rewards)

आमतौर पर, जब आप किसी AI को प्रशिक्षित करते हैं, तो आप उसे एक निश्चित स्कोरकार्ड देते हैं। उदाहरण के लिए, "50% अंक सही होने के लिए और 50% अंक अच्छे व्यवहार के लिए।" समस्या यह है कि कभी-कभी आपको 90% सही होने की आवश्यकता होती है (जैसे ऋण के बारे में चर्चा करते समय), और कभी-कभी आपको बस 90% मिलनसार होने की आवश्यकता होती है (जैसे नमस्ते कहते समय)। एक निश्चित स्कोरकार्ड काम नहीं करता है।

समाधान: MORE एक डायनेमिक कोच का उपयोग करता है।
कल्पना कीजिए कि एक कोच खेल को वास्तविक समय में देख रहा है।

  • यदि ग्राहक एक जटिल ऋण के बारे में पूछता है, तो कोच चिल्लाता है, "गणित पर ध्यान केंद्रित करो! सटीकता प्राथमिकता है!"
  • यदि ग्राहक केवल किसी उत्पाद के बारे में चैट कर रहा है, तो कोच चिल्लाता है, "मिलनसार होने पर ध्यान केंद्रित करो! स्वाभाविकता प्राथमिकता है!"

यह प्रणाली लगातार बातचीत की विशिष्ट आवश्यकताओं के आधार पर अपने स्वयं के "स्कोरकार्ड" को समायोजित करती है। यह यह पता लगाने के लिए कि उस विशिष्ट क्षण में कौन सा लक्ष्य संघर्ष कर रहा है, एक गणितीय ट्रिक (ग्रेडिएंट फीडबैक) का उपयोग करती है और उसे अधिक ध्यान देती है।

3. परिणाम: वास्तविक दुनिया की सफलता

टीम ने इस प्रणाली का परीक्षण बाइटडांस (ByteDance) के वास्तविक दुनिया के ई-कॉमर्स प्लेटफॉर्म (जैसे डौयिन ऐप) पर किया। उन्होंने इसे केवल कंप्यूटर सिमुलेशन पर नहीं चलाया; उन्होंने इसे 14 दिनों तक वास्तविक लोगों से बात करने दी।

  • व्यावसायिक जीत: इस प्रणाली ने अधिक उत्पाद बेचने में मदद की। इसने प्रोएक्टिव सेल्स (proactive sales) में उन लोगों की संख्या बढ़ा दी जिन्होंने बॉट से बात करने के बाद वास्तव में कुछ खरीदा।
  • मानवीय जीत: ग्राहक खुश थे। उन्हें लगा कि बॉट उन्हें बेहतर समझता है, और बहुत कम लोगों को मानव एजेंट के पास ट्रांसफर करना पड़ा क्योंकि बॉट सवाल को संभालने में असमर्थ था।
  • "ह्यूमन" टेस्ट: एक हेड-टू-हेड टेस्ट में, AI सिस्टम ने मानव एजेंटों द्वारा हासिल की गई बिक्री सफलता का लगभग 60% प्राप्त किया, लेकिन यह एक साथ लाखों लोगों से बात कर सकता है, जबकि इंसान एक समय में केवल एक व्यक्ति से ही बात कर सकते हैं।

सारांश

संक्षेप में, MORE एक स्मार्ट प्रशिक्षण पद्धति है जो AI को एक "दो-तरफा" विशेषज्ञ बनने के लिए सिखाती है: अभ्यास के दौरान एक कठोर तर्कशास्त्री ताकि वह असली गेम के दौरान एक सुचारू, स्वाभाविक बातचीत करने वाला बन सके। यह AI को यह जानने देकर कि उसे तथ्यों पर ध्यान केंद्रित करना है और कब शैली (style) पर, यह सटीक और मिलनसार दोनों होने का प्रबंधन करता है, जो पिछले AI सिस्टम के लिए एक साथ करना कठिन था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →