← नवीनतम पेपर
💬 NLP

CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories

CRMWeaver एक नवीन फ्रेमवर्क है जो शक्तिशाली बिजनेस एजेंट बनाने के लिए सिंथेटिक डेटा जनरेशन और ट्रेनिंग के लिए रिइन्फोर्समेंट लर्निंग का लाभ उठाता है, जिसे इन्फरेंस के दौरान एक साझा मेमोरी मैकेनिज्म के साथ जोड़ा गया है, ताकि जटिल, विषम व्यावसायिक कार्यों को प्रभावी ढंग से संभाल सके और CRMArena-Pro डेटासेट पर प्रतिस्पर्धी प्रदर्शन प्राप्त कर सके।

मूल लेखक: Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

प्रकाशित 2026-07-31
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilong Lai, Yipin Yang, Ting Liang, Jialong Wu, Zhenglin Wang, Jianguo Lin, Keping Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक शानदार, सुपर-स्मार्ट रोबोट सहायक बनाया है। यह कविताएँ लिख सकता है, गणित की समस्याएँ हल कर सकता है और इंसानों की तरह चैट कर सकता है। लेकिन अब, आप इसे एक वास्तविक कार्यालय में काम पर लगाना चाहते हैं। अचानक, रोबोट भ्रमित हो जाता है। वह स्प्रेडशीट, ग्राहक रिकॉर्ड और कंपनी के नियमों के एक विशाल, उलझे हुए जाल को घूर रहा है। उसे समझ नहीं आ रहा कि कौन सी फ़ाइल खोलनी है, सेल्स रिपोर्ट और शिपिंग लॉग के बीच संबंध कैसे जोड़ा जाए, या उस सवाल का जवाब कैसे दिया जाए जिसके लिए एक साथ तीन अलग-अलग डेटाबेस की जाँच करने की आवश्यकता है। यह "बिजनेस एजेंटों" (Business Agents) की चुनौती है। ये AI सिस्टम हैं जिन्हें वास्तविक काम करने के लिए डिज़ाइन किया गया है, जैसे ग्राहकों के सवालों के जवाब देना या बिक्री डेटा का विश्लेषण करना, लेकिन वास्तविक दुनिया अव्यवस्थित है, जटिल संबंधों से भरी है और लगातार बदल रही है।

इन एजेंटों की मदद करने के लिए, वैज्ञानिक कुछ प्रमुख तरकीबों का उपयोग करते हैं। पहला, वे "लार्ज लैंग्वेज मॉडल्स" (LLMs) का उपयोग करते हैं, जो विशाल डिजिटल दिमागों की तरह हैं जिन्हें लगभग उस हर चीज़ पर प्रशिक्षित किया गया है जो इंसानों ने कभी लिखी है। ये दिमाग भाषा समझने में माहिर हैं लेकिन विशिष्ट कार्यों को संभालने के लिए उन्हें विशेष प्रशिक्षण की आवश्यकता होती है। दूसरा, वे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) का उपयोग करते हैं, एक ऐसी विधि जहाँ AI चीज़ों को आज़माकर सीखता है, अच्छे मूव्स के लिए "पॉइंट्स" पाता है, और बुरे मूव्स के लिए पॉइंट्स खो देता है, ठीक वैसे ही जैसे एक वीडियो गेम का पात्र लेवल अप करता है। इसके अलावा, वे "लॉन्ग-टर्म मेमोरी" (Long-term Memory) के साथ प्रयोग कर रहे हैं, जिससे AI को एक नोटबुक दी जाती है ताकि वह अपने पिछले कामों से सीखी गई बातों को लिख सके, ताकि उसे हर बार शून्य से शुरुआत न करनी पड़े। बड़ा सवाल यह है: क्या हम एक ऐसा बिजनेस एजेंट बना सकते हैं जो बिना घर के आकार के सुपरकंप्यूटर की आवश्यकता के, इन उलझे हुए, वास्तविक दुनिया के ऑफिस पहेलियों को संभालने के लिए पर्याप्त स्मार्ट हो?

यहाँ CRMWeaver आता है, जो अलीबाबा और साउथ ईस्ट यूनिवर्सिटी के शोधकर्ताओं का एक नया दृष्टिकोण है जो इस समस्या को एक चतुर तीन-भागों वाले नुस्खे के साथ हल करने की कोशिश करता है। CRMWeaver को एक मास्टर दर्जी के रूप में समझें जो केवल एक रोबोट को सिलना नहीं सिखाता; बल्कि वे उसे एक जटिल पैटर्न पढ़ना, नकली कपड़े पर अभ्यास करना और फिर भविष्य के उपयोग के लिए सफल टांकों की एक "चीट शीट" रखना सिखाते हैं।

सबसे पहले, टीम ने महसूस किया कि AI को जटिल व्यावसायिक डेटा संभालने के लिए सिखाना कठिन है क्योंकि अभ्यास करने के लिए वास्तविक दुनिया के उदाहरणों की कमी है। इसलिए, उन्होंने एक सिंथेटिक डेटा (Synthetic Data) जनरेटर बनाया। एक वीडियो गेम डिजाइनर की कल्पना करें जो खिलाड़ी के अभ्यास के लिए नकली लोगों और नकली समस्याओं के साथ एक नकली शहर बनाता है। शोधकर्ताओं ने AI का उपयोग करके हजारों नकली व्यावसायिक प्रश्न और उत्तर उत्पन्न किए, जो सरल प्रश्नों जैसे "वारंटी कितनी लंबी है?" से लेकर अविश्वसनीय रूप से जटिल प्रश्नों तक विस्तृत थे, जिनमें डेटा की पांच अलग-अलग तालिकाओं (tables) के बीच कूदने की आवश्यकता होती है। इसने AI को सीखने के लिए एक विशाल खेल का मैदान दिया।

इसके बाद, उन्होंने टू-स्टेज ट्रेनिंग (Two-Stage Training) प्रक्रिया का उपयोग किया। पहले चरण में, उन्होंने "सुपरवाइज्ड फाइन-ट्यूनिंग" (SFT) का उपयोग किया। यह एक शिक्षक की तरह है जो छात्र को समस्या को चरण-दर-चरण हल करने का सही तरीका दिखाता है। AI ने टूल्स (जैसे डेटाबेस क्वेरी करने के लिए SQL) का उपयोग करने और किसी समस्या के बारे में सोचने के उच्च-गुणवत्ता वाले उदाहरण देखे। दूसरे चरण में, उन्होंने रीइन्फोर्समेंट लर्निंग की ओर रुख किया। यहाँ, AI को खुद से समस्याएँ हल करने के लिए स्वतंत्र छोड़ दिया गया। यदि उसे सही उत्तर मिला, तो उसे इनाम मिला; यदि उसने गलती की, तो उसने अपनी गलती से सीखा। उन्होंने यह सुनिश्चित करने के लिए DAPO नामक एक विशेष, कुशल विधि का उपयोग किया कि AI तेजी से सीखे और बुरी आदतों में न फँसे। इसने AI को सामान्यीकरण (generalize) करने में मदद की, जिसका अर्थ है कि वह उन नई, अनदेखी समस्याओं को भी संभाल सकता था जिनका उसने विशेष रूप से अभ्यास नहीं किया था।

अंत में, और शायद सबसे महत्वपूर्ण बात, उन्होंने एजेंट को एक शेयर्ड मेमोरी (Shared Memory) सिस्टम दिया। एक वास्तविक कार्यालय में, यदि आप आज एक पेचीदा समस्या हल करते हैं, तो आप इसे एक साझा नोटबुक में लिख सकते हैं ताकि आपके सहकर्मी कल इसका उपयोग कर सकें। CRMWeaver इसे डिजिटल रूप से करता है। जब AI के सामने कोई नया प्रश्न आता है, तो वह अपने "मेमोरी बैंक" की जाँच करता है कि क्या उसने पहले कभी इसी तरह की समस्या हल की है। यदि उसे कोई मिलान मिलता है, तो वह उस समस्या को कैसे हल किया गया था, उसका "गाइडलाइन" या "नुस्खा" निकाल लेता है और नए प्रश्न का उत्तर देने में मदद करने के लिए उसका उपयोग करता है। यह एजेंट को अपनी पिछली सफलताओं और मजबूत मॉडल्स की सफलताओं से सीखने की अनुमति देता है, जिससे वह उन कार्यों को संभालने में बहुत बेहतर हो जाता है जो उसने पहले कभी नहीं देखे।

शोधकर्ताओं ने अपने निर्माण का परीक्षण CRMArena-Pro नामक एक कठिन बेंचमार्क पर किया, जो 25 विभिन्न प्रकार के डेटा ऑब्जेक्ट्स और 19 विभिन्न प्रकार के कार्यों (पॉलिसी अनुपालन की जाँच से लेकर जटिल डेटा क्वेरी चलाने तक) के साथ एक वास्तविक व्यावसायिक वातावरण का अनुकरण करता है। उन्होंने अपने हल्के मॉडल (जो Qwen3-4B नामक 4-बिलियन पैरामीटर मॉडल पर आधारित है) को दुनिया के कुछ सबसे बड़े, सबसे शक्तिशाली AI मॉडल्स के खिलाफ खड़ा किया, जिसमें GPT-4o, Gemini 2.5-Pro और एक विशाल 235-बिलियन पैरामीटर वाला मॉडल शामिल है।

परिणाम प्रभावशाली थे। बहुत छोटे और कम खर्चीले होने के बावजूद, CRMWeaver एजेंट ने इन विशाल मॉडल्स के प्रतिस्पर्धी स्कोर प्राप्त किए, और कुछ मामलों में उनसे बेहतर भी रहा। बिजनेस-टू-बिजनेस (B2B) श्रेणी में, इसने 55.6 का औसत स्कोर किया, और बिजनेस-टू-कंज्यूमर (B2C) में 57.1 का स्कोर किया। यह विशेष रूप से डेटाबेस कार्यों में चमका, B2B में 73.0 और B2C में 72.8 का स्कोर किया, जो परीक्षण किए गए लगभग हर अन्य मॉडल को पीछे छोड़ देता है। उनके एब्लेशन स्टडीज (जहाँ उन्होंने यह देखने के लिए सिस्टम के हिस्सों को हटाया कि क्या होता है) ने दिखाया कि हर हिस्सा मायने रखता था: मेमोरी, रीइन्फोर्समेंट लर्निंग, या प्रारंभिक प्रशिक्षण में से किसी को भी हटाने से स्कोर में काफी गिरावट आई।

हालाँकि, लेखक उनके काम की सीमाओं को नोट करने में सावधानी बरतते हैं। वे स्वीकार करते हैं कि उनका सिस्टम वर्तमान में सिंगल-यूज़र क्वेरीज़ को अच्छी तरह से संभालता है लेकिन जटिल, मल्टी-टर्न बातचीत (जहाँ एक इंसान और AI लंबे समय तक आपस में चैट करते हैं) में पूरी तरह से महारत हासिल नहीं कर पाया है। वे यह भी उल्लेख करते हैं कि इन एजेंटों को प्रशिक्षित करना अभी भी कम्प्यूटेशनल रूप से महंगा है और इसके लिए महत्वपूर्ण हार्डवेयर की आवश्यकता होती है, जो फिलहाल उन्हें छोटे मॉडल्स तक सीमित करता है। लेकिन कुल मिलाकर, CRMWeवीवर (CRMWeaver) यह सुझाव देता है कि स्मार्ट डेटा जनरेशन, कठोर प्रशिक्षण और एक साझा मेमोरी सिस्टम को जोड़कर, हम शक्तिशाली, व्यावहारिक बिजनेस एजेंट बना सकते हैं जिन्हें काम पूरा करने के लिए सुपरकंप्यूटर के आकार के होने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →