← नवीनतम पेपर
💬 NLP

Profiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders

यह शोध पत्र CAIRO का प्रस्ताव देता है, जो एक उपयोगकर्ता संदर्भ-जागरूक आइटम प्रोफाइलिंग फ्रेमवर्क है जो विषम मेटाडेटा को व्यवस्थित करता है और LLM-आधारित पुनर्रैंकिंग प्रदर्शन को बढ़ाने के लिए प्रत्येक उपयोगकर्ता-आइटम युग्म के लिए प्रासंगिक जानकारी का गतिशील रूप से चयन करता है।

मूल लेखक: Dojun Hwang, Seunghan Lee, Cheonyoung Park, Sara Yu, SeongKu Kang

प्रकाशित 2026-08-24
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dojun Hwang, Seunghan Lee, Cheonyoung Park, Sara Yu, SeongKu Kang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल युग में, अनुशंसा प्रणाली (रेकमेंडेशन सिस्टम) हमारे ऑनलाइन जीवन के शांत क्यूरेटर के रूप में कार्य करती है, जो सुझाव देती है कि अगला वीडियो कौन सा देखना है, कौन सी किताब पढ़नी है, या कौन सा उत्पाद खरीदना है। वर्षों तक, ये प्रणालियाँ उपयोगकर्ता द्वारा क्लिक किए गए या खरीदे गए डेटा की सरल ट्रैकिंग पर निर्भर थीं, जिसमें वस्तुओं को बिना किसी गहराई के गुमनाम कोड के रूप में माना जाता था। हाल ही में, आर्टिफिशियल इंटेलिजेंस की एक नई पीढ़ी, जिसे लार्ज लैंग्वेज मॉडल्स (LLMs) के रूप में जाना जाता है, ने इस परिदृश्य को बदलना शुरू कर दिया है। इन मॉडल्स के पास मानव ज्ञान का एक विशाल आंतरिक पुस्तकालय और तर्क करने की क्षमता है, जो उन्हें उपयोगकर्ता के इतिहास की बारीकियों और किसी वस्तु के विवरण को उन तरीकों से समझने की अनुमति देती है जो पारंपरिक प्रणालियाँ नहीं कर सकती थीं। हालाँकि, एक महत्वपूर्ण बाधा बनी हुई है: जबकि ये मॉडल लोगों को समझने में बहुत कुशल हैं, वे उन वस्तुओं का वर्णन करने वाली अत्यधिक, अव्यवस्थित और अक्सर असंरचित जानकारी को समझने में संघर्ष करते हैं जो स्वयं वस्तुओं का वर्णन करती हैं। वास्तविक दुनिया के उत्पादों के साथ सैकड़ों विशेषताएं आती हैं, तकनीकी विशिष्टताओं से लेकर अस्पष्ट विवरणों तक, और इस डेटा का बहुत सा हिस्सा लंबे पैराग्राफों में दबा होता है या विभिन्न स्वरूपों में बिखरा होता है। यदि किसी आर्टिफिशियल इंटेलिजेंस को एक साथ बहुत अधिक कच्चा, असंगठित डेटा दिया जाता है, तो वह भ्रमित हो जाता है, ठीक वैसे ही जैसे कोई व्यक्ति रेडियो प्रसारण सुनते समय एक उपन्यास पढ़ने की कोशिश करता है; सिग्नल शोर में खो जाता है।

कोरिया यूनिवर्सिटी और KT कॉर्पोरेशन के शोधकर्ताओं ने इस विशिष्ट समस्या को हल करने के लिए CAIRO नामक एक नई विधि विकसित की है। उनका कार्य अनुशंसा समीकरण के "आइटम पक्ष" पर केंद्रित है, जिसका लक्ष्य आर्टिफिशियल इंटेलिजेंस को यह सिखाना है कि किसी उत्पाद के विवरण को कैसे पढ़ा जाए और केवल उन विवरणों को कैसे निकाला जाए जो किसी विशिष्ट व्यक्ति के लिए एक विशिष्ट क्षण में महत्वपूर्ण हों। आइटम की सभी विशेषताओं को सिस्टम में डालने के बजाय, CAIRO एक कुशल संपादक के रूप में कार्य करता है। यह पहले अराजक कच्चे डेटा को दो अलग-अलग श्रेणियों में व्यवस्थित करता है: वस्तुनिष्ठ तथ्य, जैसे बैटरी का आकार या सामग्री, और व्यक्तिपरक गुण, जो उपयोगकर्ताओं द्वारा अपनी समीक्षाओं में वर्णित अनुभव या भावनाएं हैं, जैसे "निर्बाध एकीकरण" या "जीवंत रंग।" सिस्टम फिर यह तय करने के लिए एक हल्का और कुशल प्रक्रिया उपयोग करता है कि वर्तमान में ब्राउज़ कर रहे व्यक्तिगत उपयोगकर्ता के लिए इनमें से कौन से तथ्य और भावनाएं प्रासंगिक हैं। एक व्यक्ति के लिए, हेडफ़ोन के बारे में सबसे महत्वपूर्ण विवरण 'नॉइज़-कैंसलिंग' तकनीक हो सकता है; दूसरे के लिए, यह स्थायित्व के लिए ब्रांड की प्रतिष्ठा हो सकती है। CAIRO इन अंतरों की पहचान करता है और आइटम के लिए एक संक्षिप्त, कस्टम प्रोफाइल तैयार करता है जो केवल उसी साक्ष्य को उजागर करता है जिसकी उपयोगकर्ता को परवाह है।

शोधकर्ताओं ने वीडियो गेम, खेल उपकरण और इलेक्ट्रॉनिक्स में लाखों इंटरैक्शन वाले विशाल डेटासेट पर इस दृष्टिकोण का परीक्षण किया। उन्होंने पाया कि जब आर्टिफिशियल इंटेलिजेंस को इन सावधानीपूर्वक क्यूरेट किए गए, उपयोगकर्ता-विशिष्ट प्रोफाइल प्राप्त हुए, तो वस्तुओं को सही ढंग से रैंक करने की इसकी क्षमता में काफी सुधार हुआ। वास्तव में, इस प्रणाली ने अन्य तरीकों को लगातार पीछे छोड़ दिया जो या तो आइटम के विवरण को पूरी तरह से अनदेखा करते थे या एक साथ सारी उपलब्ध जानकारी को मॉडल में डालने की कोशिश करते थे। अध्ययन ने स्पष्ट रूप रूप से इस विचार को खारिज कर दिया कि केवल अधिक डेटा जोड़ने से मदद मिलती है; उनके प्रयोगों में, वे तरीके जिन्होंने कच्चे, असंरचित मेटाडेटा को इंजेक्ट किया, वास्तव में बुनियादी शीर्षकों का उपयोग करने वाले तरीकों की तुलना में खराब प्रदर्शन करते थे। CAIRO की सफलता इसकी चयनात्मकता में निहित है। यह केवल एक बार किसी आइटम का सारांश नहीं बनाता और उसी सारांश का उपयोग सभी के लिए नहीं करता है; इसके बजाय, यह सुनने वाले के अनुकूल आइटम की कहानी को ढालता है। संरचित तथ्यों को उपयोगकर्ता की समीक्षाओं से प्राप्त अंतर्दSight के साथ जोड़कर, और फिर उन्हें वर्तमान उपयोगकर्ता की प्राथमिकताओं के लेंस के माध्यम से फ़िल्टर करके, यह प्रणाली आर्टिफिशियल इंटेलिजेंस को क्लटर्ड डेटा डंप के बजाय एक स्पष्ट, केंद्रित नैरेटिव प्रदान करती है।

यह सुनिश्चित करने के लिए कि यह प्रक्रिया केवल एक सैद्धांतिक अभ्यास नहीं थी, टीम ने अपने तरीके की तुलना कई मौजूदा दृष्टिकोणों के साथ की, जिनमें जानकारी खोजने के लिए जटिल, बहु-चरणीय रिट्रीवल सिस्टम भी शामिल थे। उन्होंने पाया कि जबकि वे जटिल सिस्टम प्रासंगिक विवरण खोज सकते थे, वे वास्तविक दुनिया के उपयोग के लिए बहुत धीमे थे, और सुझावों की एक सूची तैयार करने में सैकड़ों सेकंड का समय लेते थे। इसके विपरीत, CAIRO ने एक सेकंड के बहुत छोटे हिस्से में अपना चयन किया, जिससे यह लाइव अनुप्रयोगों के लिए व्यावहारिक बन गया। शोधकर्ताओं ने यह भी परीक्षण किया कि क्या उनका तरीका विभिन्न प्रकार के आर्टिफिशियल इंटेलिजेंस मॉडल्स के साथ काम करता है, जिसमें छोटे, कम शक्तिशाली संस्करणों से लेकर बड़े, अधिक उन्नत मॉडल तक शामिल हैं। परिणामों ने दिखाया कि कस्टम प्रोफाइल ने सभी स्तरों पर प्रदर्शन में सुधार किया, जिससे पता चलता है कि मूल्य प्रस्तुत की गई जानकारी की गुणवत्ता से आता है, न कि केवल उसे पढ़ने वाले मॉडल के आकार से। यहाँ तक कि परीक्षण किए गए सबसे छोटे मॉडल्स के लिए भी, संरचित प्रोफाइल ने उन्हें बेहतर निर्णय लेने में मदद की, जिससे सिद्ध हुआ कि तथ्यों का एक अच्छी तरह से व्यवस्थित प्रस्तुतीकरण सीमित कंप्यूटिंग शक्ति की भरपाई कर सकता है।

इस कार्य के सबसे सम्मोहक पहलुओं में से एक यह है कि यह खरीदारी के मानवीय तत्व को कैसे संभालता है। यह प्रणाली पहचानती है कि एक ही उत्पाद अलग-अलग लोगों के लिए अलग चीजें हो सकता है। वायरलेस ईयरबड्स के एक विशिष्ट उदाहरण में, सिस्टम ने उपयोगकर्ता के इतिहास के आधार पर एक ही आइटम के लिए दो पूरी तरह से अलग प्रोफाइल तैयार किए। एक ऐसे उपयोगकर्ता के लिए जो तकनीकी प्रदर्शन को प्राथमिकता देता था और अक्सर खराब कार्यक्षमता की आलोचना करता था, सिस्टम ने ईयरबड्स की 'एक्टिव नॉइज़ कैंसलेशन' और ड्राइवर विशिष्टताओं को उजागर किया। एक ऐसे उपयोगकर्ता के लिए जो ब्रांड लॉयल्टी और इकोसिस्टम कम्पैटिबिलिटी को महत्व देता था, सिस्टम ने इसके बजाय अन्य उपकरणों के साथ निर्बाध एकीकरण और ब्रांड की प्रतिष्ठा पर ध्यान केंद्रित किया। जब आर्टिफिशियल इंटेलिजेंस को ये अनुकूलित प्रोफाइल दिए गए, तो इसने प्रत्येक उपयोगकर्ता के लिए सही आइटम को बहुत ऊपर रैंक किया। इस अनुकूलन के बिना, सिस्टम यह अंतर करने में संघर्ष करता कि कौन से विवरण महत्वपूर्ण हैं, और अक्सर अप्रासंगिक जानकारी के ढेर के नीचे प्रासंगिक संकेतों को दबा देता था।

शोधकर्ताओं ने यह सुनिश्चित करने के लिए एक रिफाइनमेंट स्टेप (परिष्करण चरण) भी पेश किया कि सिस्टम तथ्य न गढ़े या उपयोगकर्ता के इरादे को गलत न समझे। चूंकि व्यक्तिपरक गुण सीधे स्पेक शीट से नहीं बल्कि समीक्षाओं से निकाले जाते हैं, इसलिए एक छोटा जोखिम है कि सिस्टम समीक्षा के लहजे को गलत पढ़ सकता है। इससे निपटने के लिए, सिस्टम एक डायग्नोस्टिक चेक चलाता है जहाँ वह एक अनुशंसा परिदृश्य का अनुकरण करता है और उन मामलों की पहचान करता है जहाँ इसके प्रारंभिक प्रोफाइल के कारण गलत भविष्यवाणी हुई थी। फिर यह प्रोफाइल को संशोधित करता है, बदलावों को उत्पाद की विशिष्टताओं के ठोस तथ्यों पर आधारित करता है ताकि सटीकता सुनिश्चित हो सके। यह प्रक्रिया एक सुरक्षा जाल के रूप में कार्य करती है, यह सुनिश्चित करती है कि अंतिम प्रोफाइल वास्तविक आइटम के प्रति वफादार रहे और साथ ही उपयोगकर्ता की पसंद की बारीकियों को भी पकड़ सके। अध्ययन इस निष्कर्ष के साथ समाप्त होता है कि अनुशंसा का भविष्य आर्टिफिशियल इंटेलिजेंस को अधिक डेटा खिलाने में नहीं, बल्कि उसे सही डेटा खोजना सिखाने में है। विशाल मेटाडेटा को स्पष्ट, संदर्भ-जागरूक प्रोफाइल में संरचना देकर, CAIRO यह प्रदर्शित करता है कि बेहतर अनुशंसाओं की कुंजी केवल एक आइटम के बारे में सब कुछ जानना नहीं है, बल्कि यह जानना है कि उस व्यक्ति के लिए क्या मायने रखता है जो उसे देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →