AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
AgenticRecTune एक लार्ज लैंग्वेज मॉडल्स द्वारा संचालित मल्टी-एजेंट फ्रेमवर्क है जो विशिष्ट एजेंटों को कॉन्फ़िगरेशन प्रस्तावित करने, फ़िल्टर करने और मान्य करने के लिए समन्वयित करके तथा डोमेन-विशिष्ट अंतर्दृष्टि को कैप्चर करने के लिए एक स्किल रिपॉजिटरी को निरंतर विकसित करके जटिल, बहु-चरणीय अनुशंसा प्रणालियों (रेकमेंडेशन सिस्टम्स) के एंड-टू-एंड अनुकूलन को स्वचालित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विशाल, हाई-स्पीड ट्रेन स्टेशन की कल्पना करें जहाँ हर सेकंड लाखों यात्री (उपयोगकर्ता) आते हैं, जो अपनी मंजिल तक जाने के लिए एकदम सही ट्रेन (कंटेंट) की तलाश में हैं। यह एक विशाल रिकमेंडेशन सिस्टम (सिफारिश प्रणाली) की तरह है, जैसे कि Google Discover को चलाने वाला सिस्टम काम करता है।
पारंपरिक रूप से, इस स्टेशन को प्रबंधित करना एक जटिल ऑर्केस्ट्रा चलाने जैसा था, जिसमें एक कंडक्टर केवल एक समय में एक ही वाद्य यंत्र को ट्यून कर सकता है। यदि वायलिन (रैंकिंग मॉडल) तेज़ होते हैं, तो कंडक्टर को ड्रम (प्री-रैंकिंग मॉडल) और ब्रास (री-रैंकिंग मॉडल) को मैन्युअल रूप से एडजस्ट करना पड़ता है ताकि संगीत का संतुलन बना रहे। यह प्रक्रिया धीमी, महंगी है और इसमें हर बार संगीत बदलने पर एक मानव विशेषज्ञ को सही सेटिंग्स का अनुमान लगाने की आवश्यकता होती है।
यह पेपर AgenticRecTune पेश करता है, जो एक नया "AI ऑर्केस्ट्रा मैनेजर" है जो इस पूरी प्रक्रिया को स्वचालित (automate) करता है। एक इंसान के अनुमान लगाने के बजाय, पाँच विशिष्ट AI एजेंटों की एक टीम पूरे सिस्टम के लिए सही सेटिंग्स खोजने के लिए 24/7 मिलकर काम करती है।
यह टीम कैसे काम करती है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:
1. पाँच एजेंटों की टीम
इस सिस्टम को एक स्टार्टअप कंपनी की तरह समझें जो एक आदर्श उत्पाद लॉन्च करने की कोशिश कर रही है। इसे पाँच विशिष्ट भूमिकाओं की आवश्यकता है:
- द एक्टर (विचार उत्पन्न करने वाला): यह एजेंट एक रचनात्मक विचार मंथन (brainstormer) है। यह वर्तमान स्थिति को देखता है और कहता है, "क्या होगा अगर हम 'विविधता' (diversity) का वॉल्यूम 5% बढ़ा दें?" या "क्या होगा अगर हम 'क्लिक' के वेट को थोड़ा कम कर दें?" यह परीक्षण करने के लिए कई अलग-अलग सेटिंग्स (कॉन्फ़िगरेशन) प्रस्तावित करता है।
- द क्रिटिक (क्वालिटी कंट्रोल मैनेजर): एक्टर के जंगली विचारों के लाइव होने से पहले, क्रिटिक हस्तक्षेप करता है। यह एक सख्त संपादक या सुरक्षा निरीक्षक की तरह कार्य करता है। यह विचारों की जाँच करता है: "क्या यह सुरक्षित है? क्या यह नियमों का पालन करता है? क्या हमने इसे पहले आज़माया था और असफल रहे थे?" यह बुरे विचारों को फ़िल्टर करता है और केवल सबसे अच्छे विचारों को ही आगे बढ़ने देता है।
- द ऑनलाइन एजेंट (फील्ड टेस्टर): एक बार जब क्रिटिक किसी विचार को मंजूरी दे देता है, तो यह एजेंट इसे वास्तविक दुनिया में ले जाता है। यह एक लाइव प्रयोग (A/B टेस्ट) सेटअप करता है जहाँ वास्तविक उपयोगकर्ताओं का एक छोटा समूह नए सेटिंग्स को देखता है। यह पूरे रेस्टोरेंट में परोसने से पहले कुछ ग्राहकों पर एक नया रेसिपी टेस्ट करने जैसा है।
- द इनसाइट एजेंट (डेटा डिटेक्टिव): प्रयोग समाप्त होने के बाद, यह एजेंट परिणामों को देखता है। यह केवल नंबर नहीं देखता; यह पैटर्न (patterns) की तलाश करता है। यह पूछता है, "उपयोगकर्ताओं ने नए सेटिंग को क्यों पसंद किया? क्या यह विविधता के कारण था, या गति के कारण?" यह कच्चे डेटा को सीखों (lessons) में बदल देता है।
- द स्किल एजेंट (लाइब्रेरियन): यह एजेंट डिटेक्टिव से सीखे गए सबक लेता है और उन्हें एक "स्किलबुक" में लिखता है। यह टीम के ज्ञान को अपडेट करता है ताकि अगली बार वे वही गलतियाँ न दोहराएं। यह एक शेफ द्वारा रेसिपी बुक में एक नया गुप्त मसाला लिखने जैसा है ताकि पूरी टीम उससे सीख सके।
2. "स्व-विकसित" (Self-Evolving) स्किलबुक
सबसे शानदार बात यह है कि यह सिस्टम Skillhub का उपयोग करता है। अतीत में, यदि किसी मानव इंजीनियर ने कोई नई ट्रिक सीखी, तो उन्हें एक मैनुअल लिखना पड़ता था और उम्मीद करनी पड़ती थी कि सब उसे पढ़ें।
AgenticRecント में, इनसाइट एजेंट और स्किल एजेंट मिलकर इस स्किलबुक को स्वचालित रूप से अपडेट करते हैं।
- यदि सिस्टम एक सेटिंग आज़माता है और वह विफल हो जाता है, तो स्किलबुक सीखती है: "ऐसा दोबारा न करें।"
- यदि कोई सेटिंग काम करती है, तो स्किलबुक सीखती है: "यह एक अच्छा तरीका है; आइए इसके विभिन्न रूपों (variations) को आज़माएँ।"
- समय के साथ, सिस्टम अपने आप स्मार्ट होता जाता है, बिना किसी मानव के निर्देश लिखे, "डोमेन विशेषज्ञता" की एक लाइब्रेरी बनाता है।
3. यह क्यों महत्वपूर्ण है
पेपर बताता है कि रिकमेंडेशन सिस्टम अविश्वसनीय रूप से जटिल होते हैं। इनके तीन मुख्य चरण होते हैं:
- प्री-रैंकिंग (Pre-ranking): लाखों आइटमों में से कुछ हज़ार को तेज़ी से फ़िल्टर करना।
- रैंकिंग (Ranking): उन कुछ हज़ार को सावधानीपूर्वक स्कोर करना ताकि सबसे अच्छे आइटम मिल सकें।
- री-रैंकिंग (Re-ranking): यह सुनिश्चित करने के लिए अंतिम समायोजन करना कि सूची विविध दिखे और व्यावसायिक नियमों का पालन करे।
एक हिस्से को बदलने से अक्सर दूसरे हिस्से बिगड़ जाते हैं। सही संतुलन (sweet spot) खोजना एक यूनिसाइकिल (एक पहिये वाली साइकिल) पर चलते हुए करतब दिखाने जैसा है। मनुष्य इसमें धीमे होते हैं क्योंकि वे एक समय में केवल एक ही विचार का परीक्षण कर सकते हैं। AgenticRecTune स्वचालित रूप से इन हजारों "करतबों" के प्रयोग चलाता है, वास्तविक दुनिया में विभिन्न संयोजनों को टेस्ट करता है ताकि पता चल सके कि क्या सबसे अच्छा काम करता है।
4. परिणाम
टीम ने इस सिस्टम का परीक्षण Google Discover (एक वास्तविक, लाइव उत्पाद जिसका उपयोग लाखों लोग करते हैं) पर किया। उन्होंने पाया कि:
- AI टीम मानव इंजीनियरों द्वारा मैन्युअल रूप से खोजे जा सकने वाले सेटिंग्स की तुलना में बेहतर सेटिंग्स खोज सकती है।
- इसने प्रतिस्पर्धी लक्ष्यों, जैसे कि उपयोगकर्ताओं के क्लिक बढ़ाने (engagement) और साथ ही उन्हें विषयों की एक विस्तृत श्रृंखला दिखाने (diversity) के बीच सफलतापूर्वक संतुलन बनाया।
- "एक्टर-क्रिटिक" पद्धति (एक विचार जनरेटर और एक क्रिटिक होना) केवल एक एजेंट के अनुमान लगाने की तुलना में बहुत बेहतर काम करती है।
- सिस्टम अपने स्वयं के प्रयोगों से सीखता है, और परीक्षण के हर दौर के साथ बेहतर होता जाता है।
संक्षेप में: AgenticRecTune पाँच AI एजेंटों की एक स्व-सुधार करने वाली टीम है जो एक अत्यंत कुशल, अथक इंजीनियरिंग क्रू की तरह कार्य करती है। यह लगातार प्रयोग करती है, अपनी गलतियों से सीखती है, और अपने स्वयं के नियम पुस्तिका को अपडेट करती है ताकि रिकमेंडेशन सिस्टम को उच्चतम प्रदर्शन पर बनाए रखा जा सके, और वह भी बिना किसी इंसान द्वारा रोज़ाना सेटिंग्स बदलने की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।