← नवीनतम पेपर
🤖 machine learning

CatalogAgent: A Supervisor-mediated Self-Learning System Enabling Context Engineering for GenAI Models

यह शोध पत्र CatalogAgent को प्रस्तुत करता है, जो एक पर्यवेक्षक-मध्यस्थ (supervisor-mediated) स्व-शिक्षण प्रणाली है जो ई-कॉमर्स कैटलॉग संवर्धन के लिए जनरेटर और इवैल्यूएटर LLMs के बीच संघर्षों को हल करती है, जो एक मेमोरी बेस का लाभ उठाकर पर्यवेक्षक के निर्णयों को कॉन्टेक्स्ट-इंजीनियर्ड अंतर्दृष्टि में एकत्रित करती है, जिससे मॉडल की सटीकता को स्वायत्त रूप से 13% से अधिक सुधारा जा सकता है।

मूल लेखक: Zhu Cheng (Xuan), Zhenming Wang (Xuan), Yu (Xuan), Tang, Dan Liu, Bryan Zhang, Athanasios N. Nikolakopoulos, Pranav Souri Itabada, Jing Zhang, Chih-Chi Chou, Peng Gao, Fatemeh Mansoori, Bharat Bojja
प्रकाशित 2026-07-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhu Cheng (Xuan), Zhenming Wang (Xuan), Yu (Xuan), Tang, Dan Liu, Bryan Zhang, Athanasios N. Nikolakopoulos, Pranav Souri Itabada, Jing Zhang, Chih-Chi Chou, Peng Gao, Fatemeh Mansoori, Bharat Bojja, Sarath Chander, Sameer Thombare, Umit Batur, Tarik Arici

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपकी पसंदीदा ऑनलाइन दुकान बहुत ही स्मार्ट, लेकिन थोड़े बिखरे हुए रोबोट सहायकों की एक टीम द्वारा चलाई जा रही है। इन रोबोट्स को टी-शर्ट से लेकर टोस्टर ओवन तक, लाखों उत्पादों को व्यवस्थित करके उन्हें सुंदर डिजिटल शेल्फ में रखने का काम सौंपा गया है। ऐसा करने के लिए, उन्हें "रंग", "सामग्री" या "आकार" जैसे विशिष्ट विवरण भरने की आवश्यकता होती है। यह जेनरेटिव एआई (या GenAI) का काम है, जो कंप्यूटर प्रोग्राम का एक प्रकार है जो नई जानकारी बनाने के लिए टेक्स्ट और छवियों को पढ़ सकता है। लेकिन यहाँ एक पेंच है: ये रोबोट परफेक्ट नहीं हैं। कभी-कभी वे गलत अनुमान लगाते हैं, और कभी-कभी वे सही उत्तर के बारे में आपस में बहस करते हैं। यदि स्टोर इन गलतियों को रखता है, तो ग्राहक भ्रमित हो जाते हैं और विक्रेता निराश हो जाते हैं। इस क्षेत्र के वैज्ञानिकों के लिए बड़ा सवाल यह है: हम इन एआई रोबोट्स को अपने स्वयं के दोषों को पहचानने और बिना हर बार किसी इंसान के हाथ पकड़ने की ज़रूरत के अपने काम में बेहतर होने के लिए कैसे सिखा सकते हैं?

मिलिए कैटलॉग एजेंट (CatalogAgent) से, जो अमेज़न के शोधकर्ताओं द्वारा डिज़ाइन किया गया एक नया सिस्टम है, जो ठीक इसी समस्या को हल करने के लिए एक सुपर-स्मार्ट "बॉस रोबलेट" के रूप में कार्य करता है। इस सिस्टम को एक व्यस्त वेयरहाउस में काम करने वाली तीन-सदस्यीय टीम के रूप में सोचें। सबसे पहले, आपके पास जेनरेटर (Generator) है, एक रोबोट जो किसी उत्पाद के शीर्षक और विवरण को देखता है और अनुमान लगाता है कि उसके गुण क्या हैं (जैसे यह अनुमान लगाना कि शर्ट "कॉटन" की है)। दूसरा, इवैल्यूएटर (Evaluator) है, एक संदेही रोबोट जो जेनरेटर के अनुमान की दोबारा जांच करता है कि क्या वह समझ में आता है। आमतौर पर, वे सहमत होते हैं, और काम पूरा हो जाता है। लेकिन जब वे असहमत होते हैं, या जब कोई मानव विक्रेता कहता है, "हे, यह गलत है!", तो एक तीसरा रोबोट बीच में आता है: सुपरवाइजर (Supervisor)

सुपरवाइजर इस शो का सितारा है। यह आवर्धक लेंस (मैग्नीफाइंग ग्लास) के साथ एक जासूस की तरह है और उपकरणों का एक पुस्तकालय है। जब जेनरेटर और इवैल्यूएटर के बीच लड़ाई होती है, या जब कोई विक्रेता शिकायत करता है, तो सुपरवाइजर जांच करता है। वह केवल विजेता का चुनाव नहीं करता; वह यह पता लगाता है कि गलती क्यों हुई। क्या जेनरेटर ने किसी नकली ब्रांड का नाम बना लिया? क्या इवैल्यूएटर बहुत सख्त था? क्या विक्रेता ने "फिट टाइप" को "इन्सीम लेंथ" के साथ भ्रमित कर दिया? सुपरवाइजर हर एक लड़ाई से सीखे गए सबक को लिख लेता है।

लेकिन यहाँ असली जादू है: सिस्टम इन पाठों को केवल फाइल में सुरक्षित नहीं रखता है। इसके पास एक मेमोरी समराइज़र (Memory Summarizer) है, एक चतुर लाइब्रेरियन जो इन हजारों जासूसी रिपोर्टों को पढ़ता है और पैटर्न ढूंढता है। शायद वह नोटिस करता है कि "सेल फोन केस" के लिए, रोबोट मॉडल के नाम बनाना जारी रखते हैं, या "हैंडबैग्स" के लिए, उन्हें अंदर देखने के लिए हमेशा दूसरी फोटो को देखने की आवश्यकता होती है। समराइज़र इन पैटर्न को नए निर्देशों, या "कॉन्टेक्स्ट इंजीनियरिंग" में बदल देता है, और उन्हें वापस जेनरेटर और इवैल्यूएटर को फीड करता है। यह ऐसा है जैसे रोबोट अपने ही बॉस द्वारा लिखे गए अध्ययन गाइड को पढ़ रहे हों, जिससे उन्हें अपने पिछले गलतियों को दोबारा न दोहराने में मदद मिलती है।

पेपर दिखाता है कि यह सेल्फ-लर्निंग लूप अविश्वसनीय रूप से अच्छा काम करता है। इस पद्धति का उपयोग करके, सिस्टम ने जेनरेटर की सटीकता में 15.24% और इवैल्यूएटर की सटीकता में 13.98% का सुधार किया। हालाँकि, शोधकर्ता इस बात में सावधान थे कि रोबानों को बहुत अधिक आत्मविश्वासी न होने दें। उन्होंने एक सुरक्षा जाल बनाया जिसे रिग्रेशन कंस्ट्रेंट्स (Regression Constraints) कहा जाता है। यह एक गुणवत्ता नियंत्रण जांच की तरह है जो यह सुनिश्चित करता है कि रोबोट अपनी नई गलतियों को ठीक करने में इतने केंद्रित न हो जाएं कि वे उन आसान चीजों को बिगाड़ दें जिन्हें वे पहले से जानते थे। उन्होंने इसे 4.89 मिलियन उत्पाद जोड़ों पर टेस्ट किया और पाया कि जबकि सिस्टम कठिन मामलों को आक्रामक रूप से ठीक कर रहा था, इसने सामान्य आबादी पर अपने प्रदर्शन को स्थिर रखा।

संक्षेप में, कैटलॉग एजेंट यह साबित करता है कि एआई सिस्टम खुद की निगरानी करना सीख सकते हैं। एक स्मार्ट सुपरवाइजर को संघर्षों को सुलझाने और इन संघर्षों को सीखने के क्षणों में बदलने के माध्यम से, सिस्टम एक चक्र बनाता है जहाँ रोबोट हर दिन स्मार्ट होते जाते हैं, और वह भी बिना किसी इंसान के उनके कोड को फिर से लिखे। यह "रोबोट को ठीक करने" से बदलकर "रोबोट को खुद को ठीक करना सिखाने" की ओर एक बदलाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →