Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation
यह शोध पत्र शेप योर फीड (SYF) को प्रस्तुत करता है, जो एक LLM-आधारित एजेंटिक सिस्टम है जो तीन-स्तरीय आर्किटेक्चर के माध्यम से निष्क्रिय रैंकिंग को वास्तविक समय की, संवादात्मक सह-क्यूरेशन (co-curation) से बदल देता है, जो ऑफलाइन संरेखण सटीकता और बड़े पैमाने पर ऑनलाइन A/B टेस्टिंग दोनों के माध्यम से फीड प्रासंगिकता और उपयोगकर्ता भावना में महत्वपूर्ण सुधार प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका फोन कंटेंट का एक जादुई, अंतहीन बुफे है—वीडियो, पोस्ट और कहानियों का—जिसे एक बहुत ही व्यस्त, अदृश्य शेफ परोस रहा है। वर्षों से, यह शेफ अंधेरे में काम कर रहा है, केवल इस आधार पर अनुमान लगा रहा है कि आपने पहले क्या खाया है। यदि आप एक बिल्ली की तस्वीर पर कुछ देर रुके, तो शेफ मान लेता है कि आपको हजारों और बिल्लियाँ चाहिए। यदि आपने किसी रेसिपी को स्क्रॉल करके छोड़ दिया, तो वे मान लेते हैं कि आपको खाना बनाना पसंद नहीं है। इसे "पैसिव रैंकिंग" (passive ranking) कहा जाता है, और हालांकि यह अनुमान लगाने में अच्छा है, लेकिन यह अक्सर चूक जाता है क्योंकि यह आपकी बात सुन नहीं सकता। इसे नहीं पता कि क्या आप वास्तव में उस बिल्ली को देखना चाहते थे, या आपने बस अपने हाथ से उसे सहने के लिए रुककर स्क्रॉल किया था।
हाल ही में, एक नई तरह की तकनीक आई है जिसे लार्ज लैंग्वेज मॉडेल्स (LLMs) कहा जाता है। इन्हें सुपर-स्मार्ट, बातूनी सहायकों के रूप में समझें जो न केवल यह समझते हैं कि आपने क्या क्लिक किया, बल्कि यह भी कि आप क्या कहते हैं। वे आपकी आवाज़ सुन सकते हैं, आपके टेक्स्ट मैसेज पढ़ सकते हैं, और आपके मूड की बारीकियों को समझ सकते हैं। रिकमेंडेशन सिस्टम बनाने वाले वैज्ञानिकों के लिए बड़ा सवाल यह है: क्या हम इस बातूनी सहायक को रसोई संभालने के लिए सिखा सकते हैं? क्या हम आपको शेफ से यह कहने की अनुमति दे सकते हैं, "दरअसल, आज मैं बिल्लियों से थक गया हूँ; मुझे कुछ अंतरिक्ष संबंधी तथ्य ला कर दो," और शेफ तुरंत मेनू बदल दे? यह "कन्वर्सेशनल रिकमेंडेशन" (conversational recommendation) की चुनौती है—एक ऐसे सिस्टम से जो आपके स्वाद का अनुमान लगाता है, एक ऐसे सिस्टम की ओर बढ़ना जो आपके आदेशों को सुनता है।
"शेप योर फीड" सिस्टम: एक शेफ जो सुनता है
अपने शोध पत्र में, मेटा के शोधकर्ताओं की एक टीम ने शेप योर फीड (SYF) नामक एक नया सिस्टम पेश किया है। उन्होंने एक डिजिटल रसोई बनाई है जहाँ शेफ केवल अनुमान नहीं लगाता; वह सुनता है, सीखता है, और आपके सीधे निर्देशों के आधार पर वास्तविक समय में मेनू को समायोजित करता है। एक निष्क्रिय प्रणाली के बजाय जो आपके "डिस्लाइक" करने का इंतज़ार करती है, SYF एक "एजेंटिक" (agentic) प्रणाली है, जो एक फैंसी शब्द है जिसका अर्थ है कि यह एक बुद्धिमान सहायक की तरह कार्य करता है जो आपकी ओर से कार्रवाई कर सकता है।
शोधकर्ताओं ने पाया कि एक बातूनी एआई और एक पारंपरिक रिकमेंडेशन इंजन को जोड़कर, वे एक ऐसा फीड बना सकते हैं जो बहुत अधिक आपका अपना फीड महसूस होता है। उन्होंने दिखाया कि जब उपयोगकर्ता सिस्टम से बात कर सकते थे या स्मार्ट बटन का उपयोग करके यह बता सकते थे कि वे वास्तव में क्या चाहते हैं, तो सिस्टम उन्हें सही चीजें दिखाने में बहुत बेहतर हो गया।
जादू कैसे होता है: तीन-प्रवाह वाली रसोई (The Three-Flow Kitchen)
SYF सिस्टम एक रसोई में तीन-भागों वाली टीम की तरह काम करता है, जिसमें प्रत्येक का एक विशिष्ट कार्य है:
1. परसेप्शन फ्लो (कान और मस्तिष्क)
यह वह जगह है जहाँ सिस्टम आपको सुनता है। आप टाइप कर सकते हैं "मुझे और कुकिंग वीडियो चाहिए लेकिन मसालेदार खाना नहीं," अपनी आवाज़ का उपयोग करके कह सकते हैं "मुझे राजनीति कम दिखाएं," या एक स्मार्ट बटन दबा सकते हैं जो कहता है "मैं इस विषय से ऊब गया हूँ।" परसेप्शन फ्लो इन उलझे हुए, मानवीय निर्देशों को लेता है और उन्हें एक स्पष्ट, व्यवस्थित "सिमेंटिक प्रोफाइल" (Semantic Profile) में बदल देता है। इसे ऐसे समझें जैसे शेफ आपके बिखरे हुए ऑर्डर के आधार पर एक साफ-सुथरी खरीदारी की सूची लिख रहा है। यह आपके इतिहास को याद रखता है, इसलिए यदि आपने कल कहा था "कोई राजनीति नहीं" और आज "अधिक तकनीक" कहा, तो यह सूची के अनुसार अपडेट हो जाता है। यह चुपचाप कुछ नए "सामग्री" (वीडियो या पोस्ट) भी जुटा लेता है जो आपकी नई सूची से मेल खाते हों, जबकि आप अभी भी बात कर रहे होते हैं।
2. सर्विंग फ्लो (प्लेटिंग और परोसना)
एक बार सूची तैयार हो जाने के बाद, सर्विंग फ्लो कार्यभार संभाल लेता है। यह उस विशाल सामग्री के ढेर को देखता है जिसे सिस्टम आमतौर पर आपको दिखाता है (कैंडिडेट पूल), और फिर उसे छाँटना शुरू करता है। यह शेफ की नई खरीदारी सूची का उपयोग करके निम्नलिखित कार्य करता है:
- जोड़ना (Add): ऐसी ताज़ा चीजें लाना जो आपकी नई रुचियों से मेल खाती हों।
- छंटनी करना (Prune): उन चीजों को बाहर फेंक देना जो आपके नियमों का उल्लंघन करती हैं (जैसे वे राजनीतिक पोस्ट जिन्हें आपने प्रतिबंधित किया है)।
- पुनः क्रमबद्ध करना (Re-rank): प्लेट को इस तरह से व्यवस्थित करना ताकि वे चीजें सबसे ऊपर हों जिनकी आपने मांग की थी।
महत्वपूर्ण बात यह है कि यह बहुत तेज़ी से होता है। सिस्टम केवल अनुमान नहीं लगाता; यह एक स्मार्ट स्कोरिंग पद्धति का उपयोग करता है ताकि यह तय किया जा सके कि आपके नए अनुरोध को क्रम बदलने के लिए वास्तव में कितना प्रभाव डालना चाहिए। यह आपके स्पष्ट आदेशों को सिस्टम के सामान्य ज्ञान के साथ मिला देता है कि आपको क्या पसंद है, जिससे यह सुनिश्चित होता है कि केवल थोड़ा बदलाव करने के लिए आप अपनी पसंदीदा सामग्री पूरी तरह से न खो दें।
3. सेल्फ-इवोल्यूशन फ्लो (टेस्ट-टेस्टर)
यह वह हिस्सा है जो सिस्टम को समय के साथ स्मार्ट बनाता है। एक बार जब सिस्टम आपको भोजन परोस देता है, तो यह देखता है कि आप क्या करते हैं। क्या आपने नया कुकिंग वीडियो देखा? क्या आपने टेक पोस्ट को फेंक दिया? यह "जज" एआई की एक टीम का भी उपयोग करता है जो यह जाँचने के लिए कि सिस्टम के निर्णय अच्छे थे या नहीं, निर्णय लेता है। यदि सिस्टम ने गलती की, तो वह इससे सीखता है। शोधकर्ताओं ने डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) नामक तकनीक का उपयोग किया, जो एक सख्त फूड क्रिटिक के साथ अभ्यास करने जैसा है ताकि वे स्वाद को एकदम सही बना सकें। यह लूप सुनिश्चित करता है कि सिस्टम केवल एक बार आदेशों का पालन नहीं करता, बल्कि हर बार आदेशों का पालन करने में बेहतर होता जाता है।
उन्हें क्या मिला: सबूत पुडिंग में है (The Proof is in the Pudding)
शोधकर्ताओं ने केवल इसे बनाया ही नहीं; उन्होंने यह परीक्षण करने के लिए भी जांचा कि क्या यह वास्तव में काम करता है।
ऑफलाइन टेस्ट (अभ्यास सत्र)
सबसे पहले, उन्होंने अपने "अलाइनमेंट स्कोरिंग" मॉड्यूल का परीक्षण किया—वह हिस्सा जो यह तय करता है कि क्या कोई पोस्ट आपके अनुरोध से मेल खाता है। उन्होंने अपने नए सिस्टम की तुलना पुराने तरीकों से की जो केवल कुछ उदाहरणों के आधार पर अनुमान लगाते थे।
- पुराने "फ्यू-शॉट" (few-shot) तरीके ने लगभग 83.84% निर्णयों को सही ढंग से लिया।
- उनका नया सिस्टम, "जज" एआई के साथ प्रशिक्षण और फिर वास्तविक उपयोगकर्ता डेटा (SFT + DPO) के साथ परिष्कृत होने के बाद, 98.85% निर्णयों को सही ढंग से लेता है।
- इसने यह अविश्वसनीय रूप से तेज़ी से भी किया, वस्तुओं की एक सूची को स्कोर करने में केवल 323 मिलीसेकंड का समय लगा, जो इतना तेज़ है कि आपके फोन को लैग (धीमा) न करे।
ऑनलाइन टेस्ट (असली भोजन)
इसके बाद, उन्होंने अमेरिका और कनाडा में वास्तविक उपयोगकर्ताओं के लिए कई महीनों तक SYF को रोल आउट किया। उन्होंने उपयोगकर्ताओं को दो समूहों में विभाजित किया: एक समूह को पुराना, स्थिर सिस्टम मिला, और दूसरे को नया "शेप योर फीड" सिस्टम मिला।
- उपयोगकर्ताओं को नए नियंत्रण पसंद आए: पुराने, स्थिर बटनों और नए "कॉन्टेक्स्ट-अवेयर फीडबैक पिल्स" (स्मार्ट बटन जो देखने वाली चीज़ के आधार पर बदलते हैं) के बीच चयन करने पर, 76.02% उपयोगकर्ताओं ने नए, स्मार्ट बटनों को चुना।
- ऐसी चीजें कम हुईं जिनसे लोग नफरत करते थे: नए सिस्टम ने सफलतापूर्वक उन पोस्टों की संख्या को कम कर दिया जिन्हें उपयोगकर्ताओं ने खारिज या नापसंद किया। "पोस्ट डिस्मिस" दर 1.70% गिर गई, और "पोस्ट डिसलाइक" दर 2.74% गिर गई। इसका मतलब है कि सिस्टम उन चीजों को फ़िल्टर करने में बेहतर था जिन्हें उपयोगकर्ता नहीं चाहते थे।
- अधिक खोज (Discovery): उपयोगकर्ताओं ने नई रुचियों को अधिक बार एक्सप्लोर करना शुरू किया, जिससे "इंटरेस्ट कंजम्पशन" (रुचि उपभोग) में 0.16% की वृद्धि हुई। यह सुझाव देता है कि सिस्टम केवल चीजें छिपा नहीं रहा था; यह उपयोगकर्ताओं को ऐसी नई चीजें खोजने में मदद कर रहा था जो उन्हें वास्तव में पसंद आईं।
इसका क्या अर्थ है
यह शोध पत्र दिखाता है कि हम उन प्रणालियों से दूर जा सकते हैं जो केवल हमारे पिछले क्लिक के आधार पर हमारे चाहने का अनुमान लगाती हैं। हमारी बातों को समझने और उन पर कार्रवाई करने के लिए एक एआई परत जोड़कर, हम ऐसे फीड बना सकते हैं जो अधिक व्यक्तिगत और कम निराशाजनक महसूस होते हैं। शोधकर्ताओं ने पाया कि यह दृष्टिकोण वास्तविक दुनिया में अच्छी तरह काम करता है, जिससे उपयोगकर्ता खुश होते हैं और उनके द्वारा छोड़ी जाने वाली सामग्री की मात्रा कम हो जाती है।
हालाँकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह प्रणाली इस बात पर निर्भर करती है कि आप बोलें। यदि आप कभी नहीं बताते कि आप क्या चाहते हैं, तो यह पुराने, पैसिव तरीके पर वापस चला जाता है। वे सुझाव देते हैं कि भविष्य के संस्करणों को और भी अधिक सक्रिय होने की आवश्यकता हो सकती है, शायद आपके बोर होने से पहले ही आपसे प्रश्न पूछना, ताकि उन लोगों की मदद मिल सके जो फीडबैक देना पसंद नहीं करते। लेकिन फिलहाल के लिए, शेप योर फीड यह सिद्ध करता है कि सुनने वाला रिकमेंडेशन सिस्टम बेहतर काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।