← नवीनतम पेपर
💬 NLP

Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization

यह शोध पत्र PURPLE को प्रस्तुत करता है, जो एक कॉन्टेक्स्टुअल बैंडिट फ्रेमवर्क है जो रिट्रीवल-ऑगमेंटेड LLM पर्सनलाइजेशन के लिए यूजर प्रोफाइल्स को अनुकूलित करने हेतु सिमेंटिक रेलेवेंस (semantic relevance) को जनरेशन लाइकलीहुड (generation likelihood) पर प्रशिक्षित प्लैकेट-लूस रैंकिंग मॉडल (Plackett-Luce ranking model) से बदलकर रिकॉर्ड चयन को सीधे रिस्पॉन्स क्वालिटी के साथ संरेखित करता है।

मूल लेखक: Linfeng Du, Ye Yuan, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin, Xue Liu, Haolun Wu

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Linfeng Du, Ye Yuan, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin, Xue Liu, Haolun Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, जानकार सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो दुनिया के बारे में सब कुछ जानता है लेकिन वह आपको नहीं जानता। यदि आप उससे पूछते हैं, "मुझे आज रात क्या देखना चाहिए?", तो वह शीर्ष-रेटेड फिल्मों की एक सामान्य सूची सुझा सकता है। लेकिन अगर उसे पता हो कि आपको 90 के दशक की कॉमेडी पसंद है और हॉरर फिल्में नापसंद हैं, तो वह आपको एकदम सटीक सुझाव दे सकता है।

समस्या यह है कि इस सहायक को आपकी विशिष्ट पसंद सिखाना कठिन है। आप हर बार मन बदलने पर उसके पूरे दिमाग को फिर से प्रशिक्षित (retrain) नहीं कर सकते (यह बहुत महंगा और धीमा है)। इसलिए, इसके बजाय हम उसे आपके पिछले इंटरैक्शन (इतिहास) का एक "चीट शीट" (cheat sheet) देते हैं।

यह पेपर, PURPLE, इस बात का समाधान करता है कि हम इन चीट शीट्स को कैसे बनाते हैं। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "प्रासंगिकता" (Relevance) का मतलब "उपयोगिता" (Helpfulness) नहीं है

कल्पना कीजिए कि आप शुक्रवार की रात के लिए एक सुकून देने वाली फिल्म (relaxing movie) ढूंढ रहे हैं।

  • पुराना तरीका (प्रासंगिकता): सिस्टम आपके इतिहास को देखता है और देखता है कि आपने एक बार "Friday Night Lights" नामक फिल्म देखी थी। वह सोचता है, "'Friday Night' क्वेरी में है! चलो इसे दिखाते हैं!" लेकिन वह एक उच्च-तनाव वाला स्पोर्ट्स ड्रामा है। यह कीवर्ड्स के मामले में प्रासंगिक है, लेकिन आपके लक्ष्य के लिए बेकार (और वास्तव में परेशान करने वाला) है।
  • PURPLE का तरीका (उपयोगिता): सिस्टम गहराई से देखता है। वह देखता है कि आपने पिछले हफ्ते एक सुकून देने वाली कॉमेडी और प्रकृति पर एक डॉक्यूमेंट्री भी देखी थी। भले ही उनमें "Friday" या "Night" जैसे शब्द न हों, लेकिन वे आपके 'तनाव मुक्त होने के इरादे' (intent) को दर्शाते हैं। PURPLE उन विकल्पों को चुनता है।

उपमा (Analogy):
एक हाइक (पदयात्रा) के लिए अपना सर्वाइवल किट तैयार करने के बारे में सोचें।

  • प्रासंगिकता-आधारित सिस्टम केवल उन चीजों को उठा लेते हैं जो आपके अनुरोध के शब्दों से मेल खाती हैं। यदि आप कहते हैं "मुझे पानी चाहिए," तो वे कोला की बोतल उठा सकते हैं क्योंकि उसकी सामग्री सूची में "पानी" (water) है।
  • PURPLE एक अनुभवी गाइड की तरह काम करता है। वह जानता है कि भले ही एक फ्लैशलाइट "पानी" जैसी न दिखती हो, लेकिन वह आपके विशिष्ट हाइक के लिए कोला की तुलना में अधिक उपयोगी है। वह उन चीजों को चुनता है जो वास्तव में आपको जीवित रहने (या इस मामले में, एक अच्छा उत्तर पाने) में मदद करती हैं।

2. जाल: अधिक का मतलब हमेशा बेहतर नहीं होता

पेपर एक दूसरी समस्या की ओर इशारा करता है: "किचन सिंक" (Kitchen Sink) की समस्या।
यदि आप बस आपके इतिहास से 5 सबसे "प्रासंगिक" आइटम उठा लेते हैं, तो वे आपस में टकरा सकते हैं।

  • उदाहरण: आप फैमिली नाइट के लिए एक फिल्म चाहते हैं।
    • आइटम A: एक कॉमेडी जो आपको पसंद है।
    • आइटम B: एक हॉरर फिल्म जो आपको भी पसंद है।
    • आइटम C: बच्चों का एक कार्टून।
  • यदि आप AI को ये तीनों देते हैं, तो वह भ्रमित हो जाएगा। "क्या उन्हें डरावना चाहिए या प्यारा?" परिणाम एक अस्त-व्यस्त, खराब सिफारिश होगी।

उपमा:
कल्पना कीजिए कि आप सूप बनाने वाले एक शेफ हैं।

  • यदि आप बस 5 सबसे लोकप्रिय सामग्रियां (टमाटर, चॉकलेट, नमक, काली मिर्च और आइसक्रीम) डाल देते हैं, तो सूप का स्वाद बहुत खराब होगा।
  • PURPLE एक मास्टर शेफ की तरह काम करता है जो जानता है कि चॉकलेट और नमक आपस में मेल नहीं खाते, लेकिन टमाटर और काली मिर्च एक साथ बेहतरीन काम करते हैं। वह केवल "सबसे अच्छे" सामग्रियां नहीं चुनता; वह उन सबसे अच्छे संयोजनों को चुनता है जो एक साथ अच्छी तरह काम करते हैं।

3. समाधान: "कॉन्टेक्स्टुअल बैंडिट" (Contextual Bandit)

PURPLE यह कैसे सीखता है कि वह इतना स्मार्ट शेफ कैसे बने? यह कॉन्टेक्स्टुअल बैंडिट की अवधारणा का उपयोग करता है।

  • कैसीनो की उपमा: एक कैसीनो की कल्पना करें जिसमें कई स्लॉट मशीनें (आपके इतिहास के रिकॉर्ड) हैं। आप नहीं जानते कि कौन सी मशीन सबसे अच्छा भुगतान करती है।
  • पुराना तरीका: आप बस उस मशीन का लीवर खींचते हैं जो सबसे चमकदार (सबसे प्रासंगिक) दिखती है।
  • PURPLE का तरीका: यह मशीनों के विभिन्न संयोजनों को आजमाता है। यदि रिकॉर्डों का एक विशिष्ट संयोजन एक खुश उपयोगकर्ता (एक शानदार उत्तर) की ओर ले जाता है, तो यह खुद को एक "इनाम" (reward) देता है। यदि संयोजन भ्रमित करने वाला है, तो इसे "दंड" (penalty) मिलता है।

समय के साथ, PURPLE एक रणनीति (policy) सीख जाता है जो कहती है: " 'रिलैक्सिंग मूवी' के बारे में क्वेरी के लिए, मुझे 'कॉमेडी' और 'नेचर डॉक' का लीवर खींचना चाहिए, लेकिन मुझे 'हॉरर' से बचना चाहिए, भले ही वह लोकप्रिय हो।"

4. गुप्त सूत्र: "उत्तर को महसूस करके" सीखना

अधिकांश सिस्टम सफलता का निर्णय इस बात से करते हैं कि उत्तर तथ्यात्मक रूप से सही है या नहीं (जैसे गणित का टेस्ट)। PURPLE कुछ अधिक स्मार्ट करता है।
यह AI से पूछता है: "यदि मैं आपको यह विशिष्ट प्रोफाइल दूँ, तो आपके द्वारा एकदम सही उत्तर उत्पन्न करने की कितनी संभावना है?"

उपमा:

  • पुराना तरीका: लाल पेन से टेस्ट ग्रेड करने वाला एक शिक्षक। "तुम्हें 10 में से 8 मिले। यह एक B है।" (बहुत अस्पष्ट)।
  • PURPLE: अभ्यास सत्र देखते हुए एक कोच। "यदि आप इस तरह दौड़ेंगे, तो आप जीत जाएंगे। यदि आप उस तरह दौड़ेंगे, तो आप लड़खड़ा जाएंगे।" यह प्रशिक्षण के लिए सफलता की संभावना (probability) का उपयोग करता है, जो एक बहुत अधिक समृद्ध और विस्तृत संकेत है।

सारांश

PURPLE एक नया सिस्टम है जो AI सहायकों के लिए "चीट शीट्स" बनाता है। केवल सबसे समान पिछले नोट्स उठाने के बजाय, यह एक स्मार्ट संपादक की तरह कार्य करता है:

  1. यह सतही कीवर्ड मिलान को अनदेखा करता है।
  2. यह आपके इतिहास के पीछे के इरादे (intent) को देखता है।
  3. यह नोट्स को सावधानीपूर्वक चुनता है और व्यवस्थित करता है ताकि वे एक-दूसरे का विरोध न करें।
  4. यह अंतिम परिणाम का अनुकरण करके सीखता है, जिससे यह सुनिश्चित होता है कि AI आपको सबसे अच्छा संभव उत्तर दे।

परिणाम? एक ऐसा AI जो एक सर्च इंजन के बजाय एक ऐसे दोस्त जैसा महसूस होता है जो वास्तव में आपकी पसंद को जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →