← नवीनतम पेपर
💻 computer science

POPI: Personalizing LLMs via Optimized Natural Language Preference Inference

POPI एक उपयोगकर्ता-स्तरीय वैयक्तिकरण ढांचा है जो विविध भाषा मॉडलों में बेहतर वैयक्तिकरण गुणवत्ता और काफी कम संदर्भ ओवरहेड दोनों को सक्षम करने के लिए, विषम उपयोगकर्ता संकेतों को पुन: प्रयोज्य प्राथमिकता सारांशों में निकालने हेतु एक प्राकृतिक भाषा इंटरफ़ेस का उपयोग करता है।

मूल लेखक: Yizhuo Chen, Xin Liu, Ruijie Wang, Zheng Li, Pei Chen, Changlong Yu, Qingyu Yin, Priyanka Nigam, Meng Jiang, Bing Yin

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yizhuo Chen, Xin Liu, Ruijie Wang, Zheng Li, Pei Chen, Changlong Yu, Qingyu Yin, Priyanka Nigam, Meng Jiang, Bing Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "POPI: Optimized Natural Language Preference Inference के माध्यम से LLMs का वैयक्तिकरण (Personalization)" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: एक ही आकार सबके लिए सही नहीं होता (One Size Doesn't Fit All)

कल्पना कीजिए कि आप एक विशाल, हाई-टेक रेस्टोरेंट (एक Large Language Model या LLM) में कदम रखते हैं। वहाँ का शेफ अविश्वसनीय रूप से प्रतिभाशाली है और लगभग सब कुछ बना सकता है। हालाँकि, शेफ "औसत" व्यक्ति के लिए खाना बनाता है। यदि आपको अपना स्टेक अच्छी तरह पका हुआ (well-done) और मसालेदार पसंद है, लेकिन शेफ हमेशा उसे हल्का और कम मसालेदार परोसता है क्योंकि अधिकांश ग्राहकों को वही पसंद है, तो आप खुश नहीं होंगे।

वर्तमान में, शेफ को विशेष रूप से आपके लिए खाना बनाने के लिए तैयार करना एक दुस्वप्न (nightmare) है। आपको अपने लिए एक नया शेफ किराए पर लेना होगा, या हर बार ऑर्डर करते समय शेफ को अपनी विशिष्ट पसंद सिखाने में घंटों बिताने होंगे। यह बहुत महंगा और धीमा है।

समाधान: POPI (व्यक्तिगत सोमेलियर - Personal Sommelier)

लेखक POPI पेश करते हैं, जो एक नया तरीका है जिससे AI मॉडल ऐसे व्यवहार कर सकते हैं जैसे वे आपको जानते हों, बिना नया शेफ किराए पर लिए या पूरी रसोई को फिर से प्रशिक्षित (retrain) किए।

POPI को एक व्यक्तिगत सोमेलियर (वाइन विशेषज्ञ) के रूप में सोचें जो आपके और शेफ के बीच काम करता है।

  1. आप (उपयोगकर्ता): आप सोमेलियर को अपनी पसंद के कुछ संकेत देते हैं। शायद आपने कुछ समीक्षाएँ लिखी हैं, AI के साथ पहले चैट की है, या बस उसे बताया है, "मुझे छोटे, मज़ेदार उत्तर पसंद हैं।"
  2. सोमेलियर (इन्फरेंस मॉडल): आपकी पसंद के नोट्स का ढेर शेफ को सौंपने के बजाय, सोमेलियर उन्हें पढ़ता है और एक छोटे कार्ड पर एक संक्षिप्त, प्राकृतिक भाषा का सारांश लिखता है।
    • उदाहरण: शेफ को आपके चैट इतिहास के 50 पन्ने देने के बजाय, सोमेलियर लिखेगा: "यह उपयोगकर्ता उन उत्तरों को पसंद करता है जो उत्साहजनक हों, जिनमें तकनीकी शब्दों का प्रयोग न हो, और जो तीन वाक्यों से कम के हों।"
  3. शेफ (जेनरेटर): शेफ उस छोटे कार्ड को लेता है, आपके ऑर्डर (प्रॉम्प्ट) को देखता है, और उन निर्देशों के अनुसार बिल्कुल सटीक भोजन तैयार करता है।

यह कैसे काम करता है: "अनुकूलन" (Optimization) का जादू

पेपर का दावा है कि पिछले तरीके आपके पसंदीदा कार्यों की एक अव्यवस्थित सूची शेफ को देने जैसे थे। POPI विशेष है क्योंकि यह सोमेलियर को प्रशिक्षित करता है ताकि वह एक परफेक्ट सारांश कार्ड लिख सके।

  • प्रशिक्षण प्रक्रिया (The Training Process): सोमेलियर और शेफ मिलकर अभ्यास करते हैं। सोमेलियर अलग-अलग सारांश लिखने की कोशिश करता है। यदि शेफ सारांश के आधार पर एक बेहतरीन भोजन बनाता है, तो सोमेलियर को एक "पुरस्कार" (reward) मिलता है। यदि शेफ खराब भोजन बनाता है, तो सोमेलियर अगली बार बेहतर सारांश लिखना सीखता है।
  • परिणाम: सोमेलियर आपके जटिल इतिहास को एक छोटे, अत्यधिक प्रभावी नोट में संकुचित (compress) करना सीख जाता है। यह नोट इतना अच्छा होता है कि यह शेफ की जेब में समा जाए (जगह बचाना) और उसे ठीक से बता सके कि क्या करना है।

यह गेम-चेंजर क्यों है?

पेपर इस दृष्टिकोण की तीन मुख्य शक्तियों को रेखांकित करता है:

1. "यूनिवर्सल अडैप्टर" (जेनरेटर ट्रांसफ़रेबिलिटी)
चूँकि सोमेलियर प्राकृतिक भाषा (अंग्रेजी) में लिखता है, इसलिए शेफ को कोई गुप्त कोड जानने की आवश्यकता नहीं है।

  • उपमा: कल्पना कीजिए कि आपके पास एक सोमेलियर है जो अंग्रेजी में नोट लिखता है। आप वही नोट एक फ्रांसीसी शेफ, जापानी शेफ, या रोबोट शेफ को दे सकते हैं। जब तक वे अंग्रेजी पढ़ सकते हैं, वे आपके लिए खाना बना सकते हैं।
  • वास्तविक दुनिया का दावा: लेखकों ने इसे एक अलग AI से दूसरे अलग, फ्रीज़्ड (frozen) कमर्शियल AI मॉडल (जैसे GPT-4o या Claude) के साथ उपयोग करके टेस्ट किया। यह बिना नए मॉडल को फिर से प्रशिक्षित किए काम कर गया।

2. जगह बचाना (कॉन्टेक्स्ट ओवरहेड)
आमतौर पर, AI को व्यक्तिगत बनाने के लिए, आपको हर बार अपनी पूरी हिस्ट्री चैट में पेस्ट करनी पड़ती है। यह एक 5 मिनट के इंटरव्यू के लिए 500 पन्नों की जीवनी साथ ले जाने जैसा है।

  • POPI का दावा: सोमेलियर उस 500 पन्नों की जीवनी को 50 शब्दों के नोट में बदल देता है। पेपर का दावा है कि यह "कॉन्टेक्स्ट ओवरहेड" (AI द्वारा पढ़े जाने वाले टेक्स्ट की मात्रा) को 10 गुना तक कम कर देता है।

3. यह "ब्लैक बॉक्स" मॉडल पर भी काम करता है
आपको इसे इस्तेमाल करने के लिए रसोई का मालिक होने की ज़रूरत नहीं है। भले ही शेफ एक "ब्लैक बॉक्स" हो (एक कमर्शियल API जिसे आप बदल या रिट्रेन नहीं कर सकते), आप फिर भी अपने सोमेलियर के नोट का उपयोग करके व्यक्तिगत परिणाम प्राप्त कर सकते हैं।

पेपर ने वास्तव में क्या साबित किया

लेखकों ने इस सिस्टम का परीक्षण चार अलग-अलग "रसोइयों" (benchmarks) पर किया:

  • रिव्यू राइटिंग (समीक्षा लेखन): AI को आपकी विशिष्ट शैली में मूवी रिव्यू लिखने के लिए बनाना।
  • विज्ञान समझाना (Explaining Science): AI को जटिल विषयों को सही स्तर पर समझाने के लिए प्रेरित करना (जैसे, एक बच्चे के लिए बनाम एक विशेषज्ञ के लिए)।
  • रोलप्ले (Roleplay): AI को किसी विशिष्ट चरित्र की तरह व्यवहार करने के लिए प्रेरित करना।
  • फोरम चर्चा (Forum Discussions): AI को ऐसे कमेंट लिखने के लिए कहना जो किसी विशिष्ट व्यक्ति की तरह लगें।

परिणाम:

  • POPI ने कच्चे इतिहास (raw history) को पेस्ट करने की तुलना में AI के उत्तरों को उपयोगकर्ता की प्राथमिकताओं के साथ बहुत अधिक संरेखित (aligned) बनाया।
  • इसने बहुत कम टेक्स्ट (जगह) का उपयोग करते हुए यह किया।
  • "सोमेलियर के नोट्स" तब भी काम कर गए जब AI शेफ को किसी दूसरे ब्रांड या आकार के मॉडल में बदल दिया गया।

यह क्या दावा नहीं करता है

  • यह दावा नहीं करता कि यह गोपनीयता (privacy) के मुद्दों को हल करता है (सारांश बनाने के लिए इसे अभी भी आपके डेटा की आवश्यकता होती है)।
  • यह दावा नहीं करता कि AI आपको हमेशा याद रखेगा जब तक कि आप शुरुआती संकेत प्रदान नहीं करते।
  • यह दावा नहीं करता कि यह उन प्राथमिकताओं के लिए काम करेगा जो हर सेकंड बहुत तेज़ी से बदलती हैं (यह मानकर चलता है कि आपकी मूल प्राथमिकताएँ अपेक्षाकृत स्थिर हैं)।

सारांश

POPI एक स्मार्ट असिस्टेंट को नियुक्त करने जैसा है जो आपकी बिखरी हुई डायरी को पढ़ता है, आपके व्यक्तित्व का एक परफेक्ट "चीट शीट" लिखता है, और वह चीट शीट किसी भी AI को सौंप देता है जिसे आप उपयोग करना चाहते हैं। यह AI को ऐसा महसूस कराता है जैसे वह आपको जानता है, कंप्यूटर मेमोरी की भारी बचत करता है, और यह काम करता है भले ही आप किसी दूसरी AI कंपनी पर स्विच कर लें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →