← नवीनतम पेपर
💬 NLP

Rethinking Personalization in Large Language Models at the Token Level

यह शोध पत्र PerContrast और PerCE लॉस को प्रस्तुत करता है, जो एक टोकन-स्तरीय प्रशिक्षण प्रतिमान (paradigm) है जो उपयोगकर्ता-विशिष्ट टोकन की पहचान करने और उन्हें अनुकूल रूप से अधिक भार (upweight) देने के लिए कारणत्मक हस्तक्षेप (causal intervention) का उपयोग करता है, जिससे न्यूनतम कम्प्यूटेशनल लागत के साथ बड़े भाषा मॉडलों के वैयक्तिकरण प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जाता है।

मूल लेखक: Chenheng Zhang, Yijun Lu, Lizhe Fang, Chunyuan Zheng, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Yisen Wang, Zhouchen Lin

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenheng Zhang, Yijun Lu, Lizhe Fang, Chunyuan Zheng, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Yisen Wang, Zhouchen Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, सर्वज्ञानी लाइब्रेरियन (Large Language Model, या LLM) है। यह लाइब्रेरियन निबंध लिख सकता है, सवालों के जवाब दे सकता है और किसी भी अन्य व्यक्ति से बेहतर चुटकुले सुना सकता है। लेकिन एक पेंच है: अभी यह लाइब्रेरियन सब कुछ एक सामान्य, "एक ही आकार सबके लिए" (one-size-fits-all) वाली शैली में लिखता है।

यदि आप एक बिल्ली के बारे में कहानी मांगते हैं, तो लाइब्रेरियन इसे एक समाचार रिपोर्ट, एक परी कथा, या एक वैज्ञानिक शोध पत्र की तरह लिख सकता है, लेकिन वह आपकी विशिष्ट पसंद को नहीं जान पाएगा। क्या आपको मज़ेदार बिल्लियाँ पसंद हैं? उदास बिल्लियाँ? या टोपी पहनने वाली बिल्लियाँ?

यह शोध पत्र, "Rethinking Personalization in Large Language Models at the Token Level," इस लाइब्रेरियन को "सबके लिए" लिखना छोड़कर विशेष रूप से आपके लिए लिखना सिखाने के बारे में है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ सरल उपमाओं का उपयोग करते हुए।

1. समस्या: "औसत" छात्र

वर्तमान में, जब हम इन AI मॉडलों को प्रशिक्षित करते हैं, तो हम वाक्य में प्रत्येक शब्द (या "टोकन") को समान रूप से महत्वपूर्ण मानते हैं। यह एक शिक्षक की तरह है जो एक छात्र के निबंध को ग्रेड दे रहा है और हर एक शब्द को समान ध्यान दे रहा है।

लेकिन वैयक्तिकरण (personalization) में, ऐसा नहीं होता है।

  • "बोरिंग" शब्द: "the," "is," "and," या "to" जैसे शब्द आमतौर पर सबके लिए एक जैसे होते हैं। वे वाक्य को जोड़ने वाले गोंद की तरह हैं।
  • "व्यक्तिगत" शब्द: "मुझे तीखा खाना पसंद है," "मैं शांत पुस्तकालय पसंद करता हूँ," या "मुझे जल्दी उठना पसंद नहीं है" जैसे शब्द जादुмयी सामग्री हैं। ये वे शब्द हैं जो इस अहसास को पैदा करते हैं कि उत्तर आपके द्वारा दिया गया है।

यह शोध पत्र तर्क देता है कि वर्तमान AI प्रशिक्षण एक ऐसे शेफ की तरह है जो पूरे बर्तन को एक ही तीव्रता के साथ चलाता है, चाहे वह सादा पानी हो या कीमती मसाले। उन्हें मसालों पर अधिक गर्मी केंद्रित करने की आवश्यकता है!

2. समाधान: "क्या होगा अगर?" वाला जासूस (PerContrast)

शोधकर्ताओं को यह पता लगाने के तरीके की आवश्यकता थी कि कौन से शब्द "मसाले" (व्यक्तिगत) हैं और कौन से केवल "पानी" (सामान्य) हैं। उन्होंने PerContrast नामक एक विधि विकसित की।

PerContrast को एक "समय-यात्रा करने वाले जासूस" (Time-Travel Detective) के रूप में सोचें।

  • परिदृश्य A: जासूस AI से पूछता है, "एक बिल्ली के बारे में कहानी लिखें, यह जानते हुए कि उपयोगकर्ता को तीखा भोजन पसंद है।"
  • परिदृश्य B: जासूस AI से पूछता है, "एक बिल्ली के बारे में कहानी लिखें, लेकिन यह भूलकर कि उपयोगकर्ता को तीखा भोजन पसंद है।"

जासूस फिर दोनों कहानियों की शब्द-दर-शब्द तुलना करता है।

  • यदि AI दोनों संस्करणों में "The cat sat on the mat" लिखता है, तो वह शब्द सामान्य (generic) है। उसे उपयोगकर्ता की परवाह नहीं है।
  • यदि AI परिदृश्य A में "The cat ate a jalapeño" लिखता है, लेकिन परिदृश्य B में "The cat ate a mouse" लिखता है, तो "jalapeño" शब्द एक उच्च-मूल्य वाला व्यक्तिगत टोकन (high-value personal token) है।

हर एक शब्द के लिए इस "क्या होगा अगर?" तुलना को करके, AI ठीक से सीख जाता है कि कौन से शब्द उपयोगकर्ता के व्यक्तित्व पर निर्भर करते हैं।

3. प्रशिक्षण: "स्पॉटलाइट" विधि (PerCE)

एक बार जब AI जान जाता है कि कौन से शब्द "मसाले" हैं, तो शोधकर्ताओं ने PerCE नामक एक नया प्रशिक्षण नियम बनाया।

कल्पित करें कि प्रशिक्षण प्रक्रिया एक मंच पर स्पॉटलाइट है।

  • पुराना तरीका (मानक प्रशिक्षण): स्पॉटलाइट पूरे मंच पर समान रूप से चमकती है। अभिनेता (AI) पूरे स्क्रिप्ट को समान रूप से याद करने की कोशिश करता है।
  • नया तरीका (PerCE): स्पॉटलाइट स्मार्ट है। यह स्क्रिप्ट के उबाऊ हिस्सों पर मंद रहती है लेकिन व्यक्तिगत हिस्सों (जैसे "jalapeño" वाले शब्दों) पर तेजी से चमकती है।

AI को उन व्यक्तिगत शब्दों को सही ढंग से लिखने के लिए अतिरिक्त क्रेडिट मिलता है। यह एक शिक्षक की तरह है जो कहता है, "आपने व्याकरण सही लिखा, लेकिन यदि आपने इस एक वाक्य में छात्र की अनूठी आवाज़ को पकड़ लिया, तो आपको A+ मिलेगा!"

4. परिणाम: एक गिरगिट जैसा AI (A Chameleon AI)

शोधकर्ताओं ने इसका परीक्षण कई अलग-अलग AI मॉडलों पर किया। परिणाम प्रभावशाली थे:

  • बेहतर वैयक्तिकरण: AI विशिष्ट उपयोगकर्ताओं की नकल करने में बहुत बेहतर हो गया। यह केवल स्मार्ट नहीं लगा; यह बिल्कुल उनके जैसा लगा।
  • क्रॉस-टास्क जादू: भले ही AI को बुक रिव्यू लिखने के लिए प्रशिक्षित किया गया था, फिर भी वह बेहतर ईमेल लिखने या मैत्रीपूर्ण तरीके से चैट करने के लिए उन "वैयक्तिकरण कौशल" का उपयोग कर सकता था। उसने केवल विशिष्ट कार्य नहीं, बल्कि व्यक्तिगत होने का कौशल सीखा।
  • सस्ता और तेज़: सबसे अच्छी बात? इसके लिए सुपरकंप्यूटर या करोड़ों डॉलर की आवश्यकता नहीं थी। भारी सुधार प्राप्त करने के लिए इसने केवल थोड़ा सा अतिरिक्त सोचने का समय (जैसे कि दूसरे ड्राफ्ट की जाँच करना) जोड़ा।

बड़ी तस्वीर

सरल शब्दों में, यह शोध पत्र AI को एक सामान्य रोबोट बनने के बजाय एक गिरगिट (chameleon) बनना सिखाता है। हर दीवार को एक ही रंग से पेंट करने के बजाय, यह कमरे (उपयोगकर्ता) को देखना और उस विशिष्ट व्यक्ति के लिए नीला, लाल या हरा का सही शेड पेंट करना सीखता है।

उन्होंने यह AI को यह पूछना सिखाकर किया, "क्या मैं यह शब्द लिखता यदि मुझे नहीं पता होता कि मैं किससे बात कर रहा हूँ?" यदि उत्तर "नहीं" है, तो उस शब्द को प्रशिक्षण के दौरान एक विशेष स्पॉटलाइट मिलती है।

निष्कर्ष: AI को वास्तव में व्यक्तिगत बनाने के लिए, हमें इसे अधिक तथ्य सिखाने की आवश्यकता नहीं है; हमें बस इसे उन विशिष्ट शब्दों पर अधिक ध्यान देना सिखाने की आवश्यकता है जो आपके लिए मायने रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →