Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents
यह शोध पत्र एक स्व-विकसित (self-evolving) अनुशंसा प्रणाली (recommendation system) प्रस्तुत करता है जो गूगल के जेमिनी (Gemini) एलएलएम (LLM) एजेंटों का उपयोग करके एक दोहरी-लूप कार्यप्रवाह (dual-loop workflow) के माध्यम से अनुकूलित मॉडल आर्किटेक्चर और रिवॉर्ड फंक्शन को स्वायत्त रूप से उत्पन्न, मान्य और तैनात करती है, जो पारंपरिक मैनुअल इंजीनियरिंग की तुलना में यूट्यूब (YouTube) के प्रोडक्शन वातावरण में बेहतर विकास गति और प्रदर्शन को सफलतापूर्वक प्रदर्शित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आपका पसंदीदा वीडियो ऐप न केवल यह अनुमान लगाता है कि आप आगे क्या देखना चाहते हैं, बल्कि वास्तव में यह भी सीखता है कि हर एक दिन बेहतर अनुमान कैसे लगाया जाए, और वह भी पूरी तरह से अपने आप। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) का क्षेत्र है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ एक कंप्यूटर प्रोग्राम एक जिज्ञासु खोजकर्ता की तरह कार्य करता है। यह विभिन्न क्रियाओं को आज़माता है (जैसे आपको बिल्ली का वीडियो दिखाना या कुकिंग ट्यूटोरियल दिखाना), देखता है कि क्या होता है (क्या आपने इसे देखा? क्या आपको यह पसंद आया?), और अच्छे विकल्पों के लिए उसे एक "इनाम" (reward) मिलता है। लक्ष्य समय के साथ उस इनाम को अधिकतम करना है। लेकिन यहाँ पेचीदा हिस्सा यह है: यह तय करना कि वह इनाम कैसे दिया जाए, वास्तव में बहुत कठिन है। यह एक कुत्ते को चीज़ें लाना सिखाने जैसा है, लेकिन आप कुत्ते की भाषा नहीं बोल सकते, और कुत्ता आपको हफ्तों बाद बताता है कि वह खुश है। पारंपरिक रूप से, इंसानों को सालों तक नियमों को बदलने, यह अनुमान लगाने में, कि कुत्ता (या उपयोगकर्ता) वास्तव में क्या चाहता है, और कोड को मैन्युअल रूप से फिर से लिखने में बिताने पड़ते हैं। यह शोध पत्र एक साहसिक प्रश्न पूछता है: क्या होगा यदि हम एक ऐसा सिस्टम बना सकें जो बिना किसी इंसान के हाथ थामे, इस बदलाव, प्रयोग और पुनर्गठन को अपने आप कर सके?
गूगल के शोधकर्ता एक समाधान प्रस्तावित करते हैं जिसे वे सेल्फ-इवॉल्विंग रिकमेंडेशन सिस्टम (Self-Evolving Recommendation System) कहते हैं। इसे एक डिजिटल फैक्ट्री के रूप में सोचें जहाँ मशीनें न केवल उत्पाद बनाती हैं; बल्कि वे चलते हुए कारखाने के फर्श को फिर से डिज़ाइन करती हैं, नए उपकरण आविष्कार करती हैं, और निर्देश मैनुअल को फिर से लिखती हैं। इस सिस्टम के केंद्र में एलएलएम एजेंट्स (LLM Agents) हैं—लार्ज लैंग्वेज मॉडल्स (वही तरह के AI जो कहानियाँ लिख सकते हैं या आपसे चैट कर सकते हैं) द्वारा संचालित विशेष कंप्यूटर प्रोग्राम। ये एजेंट्स विशेषज्ञ, अथक मशीन लर्निंग इंजीनियरों की एक टीम की तरह कार्य करते हैं जो कभी सोते नहीं हैं। वे केवल कुछ नंबरों को ही नहीं बदलते; वे कोड को पढ़ते हैं, इस बात के लिए नए विचार लाते हैं कि सिस्टम को कैसे काम करना चाहिए, उन विचारों का परीक्षण करने के लिए कोड लिखते हैं, और फिर परिणामों की जाँच करते हैं।
यह सिस्टम दो व्यक्तियों की रिले रेस की तरह काम करता है जिनकी गति बहुत अलग होती है। पहला धावक ऑफलाइन एजेंट (Offline Agent) है, जो "फास्ट लूप" (Fast Loop) है। यह एजेंट एक अति-सक्रिय विचार मशीन है। यह हर पाँच मिनट में जागता है, डेटा के पहाड़ों को देखता है, और सैकड़ों नए परिकल्पनाएँ (hypotheses) उत्पन्न करता है। यह एक शेफ की तरह है जो सूप चखता है और तुरंत सोचता है, "क्या होगा अगर मैं इसमें एक चुटकी दालचीनी डाल दूँ?" या "क्या होगा अगर मैं चाकू की जगह ब्लेंडर का उपयोग करूँ?" यह इन विचारों को "प्रॉक्सी" मेट्रिक्स का उपयोग करके तेज़ी से परीक्षण करता है—त्वरित, आसानी से मापे जाने वाले संकेत जो यह संकेत देते हैं कि कोई विचार अच्छा है या नहीं। यदि टेस्ट बाउल में सूप का स्वाद अजीब है, तो एजेंट आगे बढ़ जाता है।
दूसरा धावक ऑनलाइन एजेंट (Online Agent) है, जो "स्लो लूप" (Slow Loop) है। यह एक सतर्क रणनीतिकार है। यह फास्ट लूप से सबसे अच्छे विचारों को लेता है और वास्तविक दुनिया में, वास्तविक उपयोगकर्ताओं पर उनका परीक्षण करता है। यह "नॉर्थ स्टार" (North Star) परीक्षण है। क्या नए नुस्खे ने वास्तव में लोगों को खुश किया और उन्हें अधिक समय तक देखने के लिए प्रेरित किया? इसमें समय लगता है—दिन या हफ्तों तक—क्योंकि वास्तविक मानवीय व्यवहार बदलने में धीमा होता है। ऑनलाइन एजेंट यह तय करता है कि कौन से विचार रखने योग्य हैं और किन्हें बाहर फेंक देना चाहिए, यह सुनिश्चित करते हुए कि केवल सबसे आशाजनक बदलाव ही अंतिम मेनू तक पहुँचें।
शोध पत्र पाता है कि यह स्वायत्त टीम आश्चर्यजनक रूप से प्रभावी है। जब उन्होंने इन AI एजेंटों को यूट्यूब के रिकमेंडेशन सिस्टम पर स्वतंत्र छोड़ दिया, तो एजेंटों ने केवल सेटिंग्स को ही नहीं बदला; उन्होंने सॉफ्टवेयर को संरचना देने के बिल्कुल नए तरीके खोज निकाले। उदाहरण के लिए, एजेंटों ने पाया कि मॉडल के "इंजन" को एक प्रकार के गणित से दूसरे प्रकार (Adagrad से RMSprop में) बदलने से वह तेज़ी से सीख सकता है। उन्होंने एक नया "गेटेड पाथ" (gated path) आर्किटेक्चर भी बनाया, जो सूचना के प्रवाह का एक चतुर तरीका है जिसे मनुष्यों ने पहले आज़माया नहीं था। सबसे प्रभावशाली बात यह है कि उन्होंने "रिवॉर्ड" (इनाम) प्रणाली को ही फिर से डिज़ाइन कर दिया। केवल क्लिक गिनने के बजाय, एजेंटों ने यह पता लगाया कि जटिल संकेतों को कैसे जोड़ा जाए—जैसे कि क्या किसी उपयोगकर्ता ने वीडियो साझा किया या उसे लंबे समय तक देखा—ताकि "खुशी" की एक स्मार्ट परिभाषा बनाई जा सके।
परिणाम मापने योग्य और महत्वपूर्ण थे। परीक्षणों में, AI-संचालित परिवर्तनों ने यूट्यूब उपयोगकर्ताओं के लिए प्रमुख मेट्रिक्स में सुधार किया, और समान अवधि में मानव इंजीनियरों द्वारा किए गए कई परिवर्तनों से बेहतर प्रदर्शन किया। सिस्टम ने उस गति से प्रयोग चलाने में सफलता प्राप्त की जो इंसान मैच नहीं कर सकते थे, एक सप्ताह में सैकड़ों विचारों का परीक्षण किया जबकि इंसान केवल कुछ ही कर पाते थे। हालांकि यह शोध पत्र नोट करता है कि AI को अभी भी बड़े नियम निर्धारित करने और अंतिम परिणामों की जाँच करने के लिए मनुष्यों की आवश्यकता है, यह सुझाव देता है कि इन प्रणालियों को बनाने का भविष्य इंजीनियरों की एक ऐसी टीम के रूप में कम और एक माली के रूप में अधिक होगा जो एक ऐसे बगीचे की देखभाल करता है जो खुद को छाँटने वाला, खुद लगाने वाला और हर दिन बेहतर होने वाला बगीचा है। लेखक पुष्टि करते हैं कि यह दृष्टिकोण वास्तविक दुनिया में काम करता है, यह सिद्ध करते हुए कि AI एजेंट वास्तव में विशेषज्ञ इंजीनियर के रूप में कार्य कर सकते हैं, जो ऐसे सुधारों की खोज करते हैं जो केवल संख्यात्मक बदलाव नहीं, बल्कि संरचनात्मक और अर्थपूर्ण (semantic) भी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।