Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning
यह शोध पत्र AlignXada का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) मेटा-लर्निंग फ्रेमवर्क है जो सार्वभौमिक उपयोगकर्ता वरीयता सारांशों को संक्षिप्त, कार्य-विशिष्ट निरूपणों में अनुकूलित करने के लिए मौखिक सुदृढीकरण शिक्षण (verbal reinforcement learning) का उपयोग करता है, जिससे विविध कार्यों में LLM वैयक्तिकरण प्रदर्शन में सुधार होता है और साथ ही संदर्भ लंबाई (context length) को महत्वपूर्ण रूप से कम किया जाता है तथा RAG दृष्टिकोणों से बेहतर प्रदर्शन किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को अपना व्यक्तिगत सहायक बनने के लिए सिखाने की कोशिश कर रहे हैं। आप नहीं चाहते कि रोबोट केवल एक सामान्य विश्वकोश (encyclopedia) बनकर रह जाए; आप चाहते हैं कि वह आपको जाने। शायद आप जानते हैं कि आपको तीखा खाना पसंद नहीं है, 90 के दशक का रॉक संगीत बहुत पसंद है, और एक बार फुटबॉल खेलते समय आपका पैर टूट गया था। आर्टिफिशियल इंटेलिजेंस की दुनिया में, आपकी "कौन हैं आप" वाली इस जानकारी के संग्रह को यूजर प्रोफाइल (user profile) कहा जाता है।
लंबे समय तक, वैज्ञानिकों ने इस जानकारी को रोबोट के दिमाग में स्थायी रूप से भरने की कोशिश की, या उन्होंने हर बार सवाल पूछने पर रोबोट को आपके पिछले संवादों की एक विशाल, कभी न खत्म होने वाली सूची खिलाने की कोशिश की। लेकिन एक समस्या है: रोबोट की एक सीमित "वर्किंग मेमोरी" (जिसे कॉन्टेक्स्ट कैपेसिटी कहा जाता है) होती है। यदि आप उसे आपके जीवन की 10,000 शब्दों की जीवनी दे देते हैं सिर्फ यह पूछने के लिए कि, "देखने के लिए कोई अच्छी फिल्म क्या है?", तो रोबोट अभिभूत (overwhelmed) हो जाएगा। वह इस बात से विचलित हो सकता है कि आपको कभी एक विशिष्ट प्रकार का पनीर पसंद था, और वह भूल सकता है कि वास्तव में आपको हॉरर फिल्में पसंद नहीं हैं। यह एक सुई को घास के ढेर में खोजने जैसा है, लेकिन घास का ढेर इतना बड़ा है कि वह आपको गिरा देता है।
यह शोध पत्र ठीक इसी उलझन को सुलझाता है। शोधकर्ताओं ने पूछा: "यदि हमारे पास पहले से ही किसी व्यक्ति की एक विशाल, आदर्श जीवनी है, तो हम उसे उस विशिष्ट प्रश्न के लिए आवश्यक छोटे, सटीक सूचना के टुकड़ों में कितनी जल्दी सिकोड़ सकते हैं जो अभी पूछा गया है?" वे यह तरीका खोजना चाहते थे जिससे रोबकोट की मेमोरी लचीली बन सके, जो काम की चीज़ों को रखे और शोर (noise) को हटा दे, और इसके लिए हर बार रोबोट के दिमाग को फिर से प्रशिक्षित (retrain) करने की आवश्यकता न पड़े।
इस पेपर के लेखक, जो Ant International और Northeastern University के साथ मिलकर काम कर रहे हैं, एक चतुर नया तरीका प्रस्तावित करते हैं जिसे AlignXada कहा जाता है। इसे एक जादुвिक, अत्यधिक व्यवस्थित लाइब्रेरियन के रूप में समझें जो केवल किताबें ही नहीं लाता, बल्कि आपके किताब खोलने से पहले ही उसके 'विषय-सूची' (table of contents) को फिर से लिख देता है।
यहाँ समस्या क्या है जिसे वे हल कर रहे हैं: कल्पना कीजिए कि आपके पास किसी व्यक्ति का एक "यूनिवर्सल प्रोफाइल" है। यह एक विशाल दस्तावेज़ है, शायद 7,000 अक्षरों का, जिसमें उनके राजनीतिक विचार और पारिवारिक इतिहास से लेकर बेकिंग के प्रति उनके प्रेम और घुटने की पुरानी चोट तक सब कुछ शामिल है। अब, कल्पना कीजिए कि इस व्यक्ति ने एक सरल प्रश्न पूछा है: "बिना पैरों को चोट पहुँचाए सक्रिय रहने के कुछ अच्छे तरीके क्या हैं?"
यदि आप पूरे 7,000 अक्षरों के प्रोफाइल को AI को खिलाते हैं, तो वह भ्रमित हो सकता है। वह "सामुदायिक-उन्मुख दृष्टिकोण" और "राजनीतिक वकालत" और "बेकिंग" देखता है, और वह गलती से भारी योग क्लास या सामुदायिक बेकिंग प्रतियोगिता का सुझाव दे सकता है, जिससे वह "घुटने की पुरानी चोट" के उस छोटे से सुराग को पूरी तरह से मिस कर सकता है जो वास्तव में उत्तर का सबसे महत्वपूर्ण हिस्सा है। AI शोर से विचलित हो जाता है।
AlignXada इस समस्या को ठीक करने के लिए एक स्मार्ट संपादक (editor) की तरह काम करता है। AI को पूरी बिखरी हुई जीवनी देने के बजाय, AlignXada उस विशाल प्रोफाइल को तुरंत एक छोटे, 600 अक्षरों के नोट में फिर से लिख देता है जिसमें केवल पैर की चोट और सक्रिय रहने से संबंधित तथ्य होते हैं। यह राजनीति और बेकिंग को हटा देता है।
यह कैसे सीखता है? शोधकर्ताओं ने AI के दिमाग को बदलकर इसे नहीं सिखाया (जो कठिन और महंगा है)। इसके बजाय, उन्होंने वर्बल रीइन्फोर्समेंट लर्निंग (Verbal Reinforcement Learning) नामक एक विधि का उपयोग किया।
कल्पना कीजिए कि आप एक कुत्ते को 'फेच' (चीज लाना) सिखा रहे हैं। आप कुत्ते की मांसपेशियों को फिर से नहीं बनाते; आप उसे सही काम करने पर एक ट्रीट देते हैं और गलत करने पर प्यार से "ना" कहते हैं। इस पेपर में, "कुत्ता" एक पॉलिसी (साधारण अंग्रेजी में लिखे गए निर्देशों का एक सेट) है जो AI को प्रोफाइल को एडिट करने का निर्देश देती है।
- सिस्टम निर्देशों का एक सेट आज़माता है (जैसे, "स्वास्थ्य संबंधी जानकारी रखें, राजनीति को हटा दें")।
- यह इसे कुछ अभ्यास प्रश्नों पर टेस्ट करता है।
- यदि AI सही उत्तर देता है, तो सिस्टम कहता है, "बहुत बढ़िया! ऐसा ही करते रहें।" यदि वह विफल होता है, तो सिस्टम कहता, "ओह, आपने घुटने की चोट वाला सुराग छोड़ दिया; अगली बार इसे रखने की कोशिश करें।"
- सिस्टम इस प्रक्रिया को बार-बार दोहराता है, अंग्रेजी के निर्देशों को बार-बार थोड़ा बदलकर, जब तक कि वह उस विशिष्ट प्रकार के प्रश्न के लिए प्रोफाइल को सारांशित करने का सही नुस्खा न ढूंढ ले।
इसके परिणाम काफी प्रभावशाली हैं। टीम ने 13 अलग-अलग कार्यों (जैसे ईमेल लिखना, आइटम रैंक करना, या प्रश्न पूछना) का उपयोग करके तीन अलग-अलग AI मॉडल पर इसका परीक्षण किया। 39 में से 33 परीक्षण मामलों में, AlignXada ने AI को अधिक स्मार्ट और सटीक बनाया।
जादू यहाँ है: इन बेहतर उत्तरों को प्राप्त करने के लिए, सिस्टम को AI को अधिक जानकारी खिलाने की आवश्यकता नहीं थी। वास्तव में, इसने इसके विपरीत किया। रिफाइंड प्रोफाइल मूल टेक्स्ट का केवल 22.8% हिस्सा उपयोग करते थे। उन्होंने लगभग 80% शब्दों को फेंक दिया, फिर भी AI ने बेहतर प्रदर्शन किया। यह ऐसा है जैसे यह महसूस करना कि आपको ट्रिविया प्रश्न का उत्तर देने के लिए पूरे विश्वकोश की आवश्यकता नहीं है; आपको बस वह एक पन्ना चाहिए जिसमें सही तथ्य हो।
पेपर ने यह भी जांचा कि कहीं AI अपनी ओर से कुछ मनगढ़ंत बातें तो नहीं बना रहा है। उन्होंने पाया कि संक्षिप्त प्रोफाइल में मौजूद 97.5% तथ्य वास्तव में मूल लंबी जीवनी द्वारा समर्थित थे। सिस्टम नए गुणों के बारे में कल्पना (hallucinating) नहीं कर रहा था; यह केवल एक बहुत ही कुशल संपादक बन रहा था।
दिलचस्प बात यह है कि पेपर यह भी सुझाव देता है कि यह दृष्टिकोण वर्तमान लोकप्रिय विधि RAG (Retrieval-Augmented Generation) से बेहतर है, जो डेटाबेस से प्रासंगिक अंश खोजने की कोशिश करती है। 39 में से 36 मामलों में, AlignXada का "पूरी कहानी को फिर से लिखने" वाला दृष्टिकोण RAG के "एक अंश खोजने" वाले दृष्टिकोण से बेहतर रहा। शोधकर्ताओं का सुझाव है कि ऐसा इसलिए है क्योंकि RAG अक्सर ऐसे टुकड़े उठा लेता है जो प्रासंगिक दिखते हैं लेकिन बड़े चित्र (bigger picture) को मिस कर जाते हैं, जबकि AlignXada पूरी कहानी को पुनर्गठित करता है ताकि सबसे महत्वपूर्ण सुराग उभर कर सामने आ सकें।
संक्षेप में, यह पेपर सुझाव देता है कि व्यक्तिगत AI सहायकों के लिए वास्तव में उपयोगी होने के लिए, उन्हें आपकी पूरी जीवन यात्रा को अपनी मेमोरी में नहीं डाल देना चाहिए। इसके बजाय, उन्हें एक स्मार्ट, अनुकूलन योग्य संपादक की आवश्यकता है जो उस इतिहास को हाथ के हाथ एक छोटे, सटीक नोट में सारांशित कर सके जो वर्तमान प्रश्न के लिए विशेष रूप से तैयार किया गया हो। और सबसे अच्छी बात? यह बिना AI के दिमाग को फिर से प्रशिक्षित किए किया जाता है, जो इसे व्यक्तिगत एजेंटों के भविष्य के लिए एक व्यावहारिक उपकरण बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।