← नवीनतम पेपर
💻 computer science

TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness

यह शोध पत्र हार्नेस-अवेयर ट्रेनिंग (HAT) को प्रस्तुत करता है, जो एक तीन-चरणीय ढांचा है जो कॉम्पैक्ट डिजिटल अवतार एजेंटों को बिना पुनरप्रशिक्षण के विकसित होते ई-कॉमर्स हार्नेस के अनुकूल गतिशील रूप से ढलने में सक्षम बनाता है, जिससे बेस मॉडल और बड़े सामान्य LLMs दोनों की तुलना में बेहतर वास्तविक समय प्रदर्शन और सुदृढ़ता प्राप्त होती है।

मूल लेखक: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

ऑनलाइन शॉपिंग की हलचल भरी दुनिया में, एक नए प्रकार के होस्ट का उदय हुआ है: डिजिटल अवतार। ये कंप्यूटर द्वारा निर्मित लोग हैं जो एक कैमरे के सामने खड़े होते हैं, एक साथ हजारों दर्शकों से बात करते हैं, उत्पादों के बारे में सवालों के जवाब देते हैं, और बिक्री करने की कोशिश करते हैं। इसके सफल होने के लिए, अवतार के पीछे काम करने वाले कंप्यूटर का अविश्वसनीय रूप से तेज़ होना आवश्यक है। यदि सोचने और बोलने में बहुत अधिक समय लगता है, तो लाइव स्ट्रीम बाधित महसूस होती है, और दर्शक चले जाते हैं। लेकिन गति केवल आधी लड़ाई है। अवतार को अचानक होने वाले परिवर्तनों को संभालने के लिए पर्याप्त स्मार्ट भी होना चाहिए। एक व्यापारी छूट के नियम को बदलने का निर्णय ले सकता है, एक नया उत्पाद आ सकता है, या कोई सुरक्षा नियम बोलने के तरीके को बदल सकता है। अतीत में, इन समस्याओं को ठीक करने के लिए शो को रोकना, कंप्यूटर के मस्तिष्क को फिर से लिखना और फिर से शुरू करना आवश्यक होता था। इस धीमी प्रक्रिया का अर्थ था कि अवतार अक्सर पुराने नियमों में फंसा रहता था, और एक तेजी से चलते व्यवसाय की बदलती जरूरतों के अनुकूल होने में असमर्थ था।

TaoLive के शोधकर्ताओं ने इस समस्या का समाधान एक ऐसी प्रणाली बनाकर किया है जहाँ अवतार का "मस्तिष्क" और उसकी "नियम पुस्तिका" अलग-अलग हैं। कल्पना कीजिए कि अवतार एक कुशल अभिनेता है। नियम पुस्तिका में पटकथा (स्क्रिप्ट), बिक्री को संभालने के विशिष्ट निर्देश, और उन उपकरणों की सूची होती है जिनका वह उपयोग कर सकता है, जैसे इन्वेंट्री की जांच करना या कीमतें देखना। मस्तिष्क वह अभिनेता है जो पटकथा पढ़ता है और प्रदर्शन करता है। अपने नए दृष्टिकोण में, टीम ने एक लचीली नियम पुस्तिका बनाई जिसे अभिनेता के मस्तिष्क को छुए बिना तुरंत संपादित किया जा सकता है। वे इसे "हार्नेस" (Harness) कहते हैं। जब कोई व्यापारी कीमत या नियम बदलता है, तो टीम बस हार्नेस को अपडेट करती है। इसके बाद अभिनेता तुरंत नए निर्देशों को पढ़ लेता है। हालाँकि, इसने एक पेचीदा चुनौती पैदा की: यदि अभिनेता को केवल एक विशिष्ट संस्करण की पटकथा पर प्रशिक्षित किया गया था, तो पटकथा बदलने पर वह भ्रमित हो जाता। वह नए शब्दों को सीखने के बजाय पुराने शब्दों को रट लेता। इस समस्या को हल करने के लिए, शोधकर्ताओं ने "हार्नेस-अवेयर ट्रेनिंग" नामक एक नई प्रशिक्षण विधि विकसित की। अभिनेता को एक एकल पटकथा रटने के बजाय, उन्होंने उसे एक साथ सैकड़ों अलग-अलग संस्करणों पर प्रशिक्षित किया। उन्होंने प्रशिक्षण प्रक्रिया के दौरान निर्देशों को इधर-उधर किया, उपकरणों के नाम बदले और नियमों के क्रम को बदला। इसने अभिनेता को मजबूर किया कि वह केवल विशिष्ट शब्दों को रटने के बजाय निर्देशों के अर्थ को समझे।

इस दृष्टिकोण के परिणाम आश्चर्यजनक हैं। टीम ने वास्तविक दुनिया के परिदृश्यों में अपने नए अवतार का परीक्षण किया जिसमें लाइव-स्ट्रीमिंग ई-कॉमर्स शामिल था। उन्होंने पाया कि इस नई विधि से प्रशिक्षित अवतार औसत 94.8 प्रतिशत सटीकता के साथ उत्पादों के प्रश्नों का उत्तर दे सकता था और जटिल बातचीत को संभाल सकता था। यह स्कोर उस समय उपलब्ध सबसे शक्तिशाली, सामान्य-उद्देश्य वाले AI मॉडल से भी अधिक था, जिन्होंने समान कार्यों पर लगभग 93.0 प्रतिशत स्कोर किया था। महत्वपूर्ण रूप से, नए अवतार ने अपनी सामान्य निर्देशों का पालन करने की क्षमता नहीं खोई जब उसने ये विशिष्ट बिक्री कौशल सीखे। पुरानी प्रशिक्षण विधियों के कारण अक्सर सामान्य बुद्धिमत्ता में गिरावट आती थी, लेकिन इस नई विधि ने अवतार को तेज और अनुकूलन योग्य बनाए रखा। जब शोधकर्ताओं ने अवतार का परीक्षण एक ऐसी नियम पुस्तिका के विरुद्ध किया जिसे उसने पहले कभी नहीं देखा था, तब भी इसने 94.6 प्रतिशत सटीकता के साथ प्रदर्शन किया, जिससे सिद्ध हुआ कि इसने वास्तव में अनुकूलन करना सीखा है न कि केवल रटना।

गति एक अन्य बड़ी बाधा थी। क्योंकि अवतार एक लाइव दर्शकों से बात करता है, इसलिए उसे वास्तविक समय में प्रतिक्रिया देनी चाहिए। शोधकर्ताओं ने अपने सिस्टम को एक उच्च-प्रदर्शन वाले ग्राफिक्स कार्ड पर तैनात किया। बदलते नियमों को पढ़ने, तथ्यों की जांच करने और भाषण उत्पन्न करने के जटिल कार्य के बावजूद, अवतार ने तेजी से प्रतिक्रिया दी। आधे समय में, पूर्ण उत्तर देने में केवल 3.4 सेकंड लगे। यहाँ तक कि धीमी स्थितियों में भी, 95 प्रतिशत प्रतिक्रियाएं 8.1 सेकंड के भीतर तैयार थीं। यह एक लाइव प्रसारण की सख्त मांगों को पूरा करता है, जहाँ बहुत अधिक प्रतीक्षा करने से शो का प्रवाह टूट जाता है। सिस्टम त्रुटियों के प्रति भी मजबूत साबित हुआ। जब शोधकर्ताओं ने जानबूझकर नियम पुस्तिका या उपकरणों में गलतियाँ डालीं, तो अवतार सफलतापूर्वक सुधार करने और बातचीत को सही ढंग से जारी रखने में सक्षम रहा, जबकि पुराने सिस्टम अक्सर पूरी तरह विफल हो जाते थे।

टीम ने एक लाइव शॉपिंग वातावरण में अपने नए सिस्टम की तुलना उद्योग में उपयोग किए जाने वाले मानक तरीके से करते हुए एक वास्तविक परीक्षण भी किया। सात दिनों की अवधि में, नए सिस्टम ने पुराने सिस्टम की तुलना में प्रति उपयोगकर्ता 5.54 प्रतिशत अधिक बिक्री राजस्व उत्पन्न करने में मदद की। इससे पूर्ण ऑर्डरों की संख्या में भी मामूली लेकिन मापने योग्य वृद्धि हुई। ये सुधार बिना किसी मूल हार्डवेयर में बदलाव या हर बार नियम बदलने पर मॉडल को फिर से प्रशिक्षित करने की आवश्यकता के आए। सिस्टम ने बस जारी किए गए नए निर्देशों के अनुसार खुद को ढाल लिया।

यह कार्य यह प्रदर्शित करता है कि एक ऐसा AI एजेंट बनाना संभव है जो तेज़ और लचीला दोनों हो। बदलते नियमों को सीखने की प्रक्रिया से अलग करके, और मॉडल को उन परिवर्तनों की अपेक्षा करने के लिए प्रशिक्षित करके, शोधकर्ताओं ने एक ऐसा डिजिटल होस्ट बनाया है जो एक व्यवसाय के साथ विकसित हो सकता है। अवतार अब एक स्थिर प्रोग्राम नहीं है जिसे प्रासंगिक रहने के लिए निरंतर सॉफ़्टवेयर अपडेट की आवश्यकता होती है। इसके बजाय, यह एक गतिशील भागीदार है जो एक नई पटकथा पढ़ सकता है और उसका सही ढंग से प्रदर्शन कर सकता है, चाहे वह पटकथा गर्मियों की सेल की हो, नए उत्पाद लॉन्च की हो, या नीति में अचानक बदलाव की। निष्कर्ष बताते हैं कि यदि AI को तेजी से बदलते, वास्तविक दुनिया के वातावरण में वास्तव में उपयोगी होना है, तो इसे केवल उत्तर जानना ही नहीं, बल्कि लगातार बदलते संसार में उत्तर कैसे ढूँढा जाए, यह समझना भी सिखाया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →