Learning to Reason for Multi-Step Retrieval of Personal Context in Personalized Question Answering
यह शोध पत्र PR2 प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो अनुकूलन योग्य नीतियों को सीखने के माध्यम से व्यक्तिगत प्रश्न उत्तर प्रक्रिया को बढ़ाता है ताकि यह गतिशील रूप से निर्धारित किया जा सके कि कब और क्या व्यक्तिगत संदर्भ प्राप्त करना है, जिससे उपयोगकर्ता-विशिष्ट संकेतों के साथ बहु-चरणीय तर्क को एकीकृत किया जा सके और मौजूदा रिट्रीवल-ऑगमेंटेड जनरेशन बेसलाइनों से काफी बेहतर प्रदर्शन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किसी स्मार्ट असिस्टेंट से सलाह मांग रहे हैं, जैसे कि "वजन घटाने का सबसे अच्छा तरीका क्या है?"
यदि आप एक मानक AI से बात करते हैं, तो यह इंटरनेट के आधार पर एक सामान्य उत्तर देता है: "कम खाएं, अधिक चलें।" यह तकनीकी रूप से सही है, लेकिन यह आपको नहीं जानता। यह नहीं जानता कि आपके घुटने में चोट है, आप नाइट-शिफ्ट में काम करते हैं, या आपको दौड़ना पसंद नहीं है।
यदि आप एक पर्सनलाइज्ड (व्यक्तिगत) AI से बात करते हैं, तो इसे वे विवरण पता होने चाहिए और यह कह सकता है, "चूंकि आप रात में काम करते हैं और आपके घुटने में चोट है, इसलिए सुबह तैराकी करने और रविवार को मील-प्रेप (भोजन की तैयारी) करने का प्रयास करें।"
यह पेपर PR2 (पर्सनलाइज्ड रिट्रीवल-ऑगमेंटेड रीजनिंग) नामक एक नई प्रणाली पेश करता है ताकि AI असिस्टेंट वास्तव में आपको "जान" सकें। यह कैसे काम करता है, इसे सरल भाषा में यहाँ समझाया गया है।
समस्या: "आलसी लाइब्रेरियन"
वर्तमान पर्सनलाइज्ड AI सिस्टम एक आलसी लाइब्रेरियन की तरह काम करते हैं। जब आप कोई प्रश्न पूछते हैं, तो वे आपकी व्यक्तिगत शेल्फ से कुछ किताबें जल्दी से उठाते हैं जो आपके प्रश्न से संबंधित दिखती हैं और उन्हें उत्तर में चिपका देते हैं।
- दोष: वे अक्सर गलत किताबें उठाते हैं या बहुत सतही तौर से उठाते हैं। वे वास्तव में यह नहीं सोचते कि आपको क्या चाहिए; वे बस कीवर्ड से मेल खाने वाली पहली चीज़ उठा लेते हैं। इससे ऐसे उत्तर मिलते हैं जो सतह पर तो "पर्सनलाइज्ड" लगते हैं लेकिन उन गहरे, विशिष्ट विवरणों को छोड़ देते हैं जो आपके लिए मायने रखते हैं।
समाधान: "फाइलिंग कैबिनेट वाला जासूस"
लेखक PR2 का प्रस्ताव देते हैं, जो एक विशाल फाइलिंग कैबिनेट (आपका व्यक्तिगत इतिहास) वाले जासूस की तरह कार्य करता है।
केवल फाइलें उठाने के बजाय, जासूस एक सख्त, स्मार्ट प्रक्रिया का पालन करता है:
- पहले सोचें: कैबिनेट खोलने से पहले, जासूस सोचने के लिए रुकता है: "यह व्यक्ति वास्तव में क्या पूछ रहा है? उन्हें एक आदर्श उत्तर देने के लिए मुझे कौन से विशिष्ट विवरण खोजने की आवश्यकता है?"
- रणनीतिक रूप से खोजें: जासूस केवल रैंडम फाइलें नहीं उठाता। वे विशिष्ट खोज प्रश्न (queries) लिखते हैं (जैसे, "उपयोगकर्ता की आहार संबंधी प्रतिबंधों के बारे में दस्तावेज़ खोजें" या "उनके पिछले वर्कआउट लॉग खोजें")।
- पढ़ें और तर्क दें: वे मिले हुए दस्तावेज़ों को पढ़ते हैं, कड़ियों को जोड़ते हैं, और फिर निर्णय लेते हैं: "ठीक है, अब मेरे पास जानकारी है। यह मेरे उत्तर को कैसे बदलता है?"
- यदि आवश्यक हो तो दोहराएं: यदि पहली खोज से पर्याप्त सुराग नहीं मिले, तो वे कुछ और खोजने के लिए वापस जाते हैं।
असली मंत्र: "करके सीखना" (रीइन्फोर्समेंट लर्निंग)
जासूस इसमें इतना कुशल कैसे बनता है? वे केवल एक मैनुअल नहीं पढ़ते; वे अभ्यास करते हैं और ग्रेड प्राप्त करते हैं।
यह सिस्टम GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) नामक एक विधि का उपयोग करता है। एक ट्रेनिंग कैंप की कल्पना करें जहाँ AI एक ही प्रश्न के लिए पाँच अलग-अलग उत्तर तैयार करता है:
- उत्तर A: एक सामान्य उत्तर (कोई व्यक्तिगत जानकारी नहीं)।
- उत्तर B: एक पर्सनलाइज्ड उत्तर जिसने गलत फाइलें उठाईं।
- उत्तर C: एक पर्सनलाइज्ड उत्तर जिसने गहराई से सोचा और सही फाइलें खोजीं।
एक "जज" (एक सुपर-स्मार्ट AI) उन सभी को ग्रेड देता है।
- यदि उत्तर C, उत्तर A की तुलना में बहुत बेहतर है, तो सिस्टम सीखता है: "बहुत बढ़िया काम! विशिष्ट जानकारी खोजना सार्थक था।"
- यदि उत्तर B, उत्तर A से भी बदतर है (क्योंकि वह गलत जानकारी से भ्रमित हो गया), तो सिस्टम सीखता है: "रुकिए! उस विशिष्ट जानकारी को खोजने से चीजें और खराब हो गईं। अगली बार, बस एक सामान्य उत्तर दें।"
यह AI को सिखाता है कि उसे आपके इतिहास में कब गहराई तक जाना है और कब खुदाई बंद कर देनी है। यह AI को परेशान करने वाला या अप्रासंगिक होने से रोकता है।
परिणाम: एक स्मार्ट असिस्टेंट
शोधकर्ताओं ने LaMP-QA (जो जीवनशैली, कला और संस्कृति जैसे विषयों को कवर करता है) नामक एक बेंचमार्क का उपयोग करके तीन अलग-अलग AI मॉडल पर इसका परीक्षण किया।
- परिणाम: PR2 ने लगातार अन्य सभी तरीकों को पछाड़ दिया। इसने पर्सनलाइज्ड उत्तरों की गुणवत्ता में लगभग 9% से 12% का सुधार किया।
- प्रमाण: एक टेस्ट केस में, जब "पोस्टडॉक पब्लिकेशन एक्सपेक्टेशन्स" के बारे में पूछा गया, तो PR2 सिस्टम ने महसूस किया कि उसे उपयोगकर्ता के विशिष्ट क्षेत्र (गणित) और संस्थान को जानने की आवश्यकता है। उसने उपयोगकर्ता के इतिहास की खोज की, गणित की पृष्ठभूमि के बारे में एक नोट पाया, और गणित प्रकाशनों के बारे में एक अनुकूलित उत्तर दिया, जबकि अन्य सिस्टम सामान्य सलाह दे रहे थे।
संक्षेप में
PR2 आपके AI को एक कीवर्ड-मैचिंग रोबोट से बदलकर एक विचारशील सलाहकार में अपग्रेड करने जैसा है। यह केवल आपके इतिहास को देखता नहीं है; यह तर्क करता है कि आपके इतिहास के कौन से हिस्से मायने रखते हैं, बुद्धिमानी से उन्हें खोजता है, और केवल तभी उनका उपयोग करता है जब वे वास्तव में उत्तर को बेहतर बनाते हैं। यह एक ऐसे रोबोट के बीच का अंतर है जो कहता है "यहाँ एक डाइट प्लान है" और एक के बीच जो कहता है, "यहाँ एक डाइट प्लान है जो आपके विशिष्ट शेड्यूल और चोटों के अनुकूल है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।