← नवीनतम पेपर
💬 NLP

Know You Before You Speak: User-State Modeling for LLM Personalization in Multi-Turn Conversation

यह शोध पत्र PUMA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो फ्री एनर्जी प्रिंसिपल (Free Energy Principle) पर आधारित है और जो लेटेंट यूजर स्टेट्स (latent user states) को मॉडल करके और आंशिक दृश्यता (partial observability) के तहत निर्णय लेने के माध्यम से संवाद क्रियाओं का चयन करके LLM वैयक्तिकरण को बढ़ाता है, जिससे यह निष्क्रिय मेमोरी रिट्रीवल (passive memory retrieval) से हटकर बहु-चरण वार्तालापों में उपयोगकर्ता के विकास के सक्रिय प्रबंधन की ओर स्थानांतरित हो जाता है।

मूल लेखक: Jiani Luo, Xiaoyan Zhao, Yang Zhang, Shuyi Miao, Bingbing Xu, Stefan Konigorski, Tat-Seng Chua

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiani Luo, Xiaoyan Zhao, Yang Zhang, Shuyi Miao, Bingbing Xu, Stefan Konigorski, Tat-Seng Chua

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त से बात कर रहे हैं जो धूम्रपान छोड़ना चाह रहा है। आप उनकी मदद करना चाहते हैं, लेकिन आप केवल वही दोहराना नहीं चाहते जो उन्होंने पाँच मिनट पहले कहा था। आप यह समझना चाहते हैं कि वे ऐसा क्यों कह रहे हैं, वे गहराई में कैसा महसूस कर रहे हैं, और आपका अगला वाक्य क्या होना चाहिए जो उन्हें धीरे से एक स्वस्थ विकल्प की ओर ले जाए।

अधिकांश वर्तमान AI चैटबॉट्स फोटोग्राफर की तरह हैं। वे आपके द्वारा कही गई हर बात का एक स्नैपशॉट लेते हैं (उनका इतिहास) और आपको फिर से दिखाने के लिए सबसे अच्छी फोटो खोजने की कोशिश करते हैं। वे तथ्यों को याद रखने में बहुत अच्छे हैं ("आपने कहा था कि आपको निकोटीन का स्वाद पसंद नहीं है"), लेकिन वे आपके छिपे हुए मूड का अनुमान लगाने या यह अनुमान लगाने में खराब हैं कि यदि वे कुछ विशिष्ट कहते हैं तो आपका मूड कैसे बदल जाएगा।

आपने जो पेपर साझा किया है वह PUMA (Prospective User-state Modeling for Action selection) नामक एक नई प्रणाली पेश करता है। PUMA को एक फोटोग्राफर के रूप में नहीं, बल्कि एक कुशल जासूस या शतरंज के खिलाड़ी के रूप में सोचें।

PUMA कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "छिपी हुई अवस्था" (जासूस की अंतर्दृष्टि)

जब कोई उपयोगकर्ता कहता है, "मैं दो सप्ताह से यह नई दवा ले रहा हूँ," तो एक सामान्य बॉट केवल यह कह सकता है, "यह अच्छा है।"
लेकिन PUMA पूछता है: उपयोगकर्ता वास्तव में अभी क्या महसूस कर रहा है?

  • क्या वे दुष्प्रभावों को लेकर चिंतित हैं?
  • क्या वे अपनी प्रगति पर गर्व महसूस कर रहे हैं?
  • क्या वे गुप्त रूप से दवा छोड़ने के बारे में सोच रहे हैं?

PUMA मानता है कि उपयोगकर्ता के भीतर एक "छिपी हुई अवस्था" (Hidden State) होती है जिसे हम सीधे नहीं देख सकते। यह ऐसा है जैसे उपयोगकर्ता ने धुंधला चश्मा पहना हो। PUMA यह अनुमान लगाकर उस धुंध को साफ करने की कोशिश करता है कि उसके पीछे क्या है, जो उपयोगकर्ता जो कहता है और पिछले प्रश्नों पर उनकी प्रतिक्रिया के आधार पर होता है।

2. "विश्व मॉडल" (शतरंज के खिलाड़ी की रणनीति)

अधिकांश बॉट केवल वर्तमान चाल पर प्रतिक्रिया देते हैं। PUMA शतरंज खेलता है। इसके पास एक मानसिक मानचित्र है जिसे विश्व मॉडल (World Model) कहा जाता है।

  • सामान्य बॉट: "उपयोगकर्ता ने X कहा, इसलिए मैं Y कहूँगा।"
  • PUMA: "यदि मैं Y कहता हूँ, तो उपयोगकर्ता चिंतित (State A) महसूस कर सकता है। यदि मैं Z कहता हूँ, तो वे आशावादी (State B) महसूस कर सकते हैं। कौन सा रास्ता सबसे अच्छे परिणाम की ओर ले जाता है?"

PUMA भविष्य का अनुकरण करता है। यह पूछता है, "यदि मैं इस विशिष्ट प्रकार की प्रतिक्रिया चुनता हूँ, तो अगले टर्न में उपयोगकर्ता की छिपी हुई अवस्था कैसे बदलेगी?" यह केवल अतीत को नहीं देखता; यह बातचीत के भविष्य के प्रक्षेपवक्र (future trajectory) को देखता है।

3. "मुक्त ऊर्जा" (एक दिशा-सूचक यंत्र)

पेपर एक जटिल गणितीय अवधारणा का उपयोग करता है जिसे फ्री एनर्जी प्रिंसिपल (Free Energy Principle) कहा जाता है, लेकिन आप इसे एक दो-तरफा दिशा-सूचक यंत्र (compass) के रूप में देख सकते हैं जो AI के निर्णयों को निर्देशित करता है। जब भी AI को यह चुनने की आवश्यकता होती है कि क्या कहना है, तो यह दो दिशाओं की जाँच करता है:

  • दिशा A: "मैं भ्रमित हूँ, मुझे सीखने दें!" (Epistemic Value)
    यदि AI उपयोगकर्ता की अवस्था के बारे में अनिश्चित है (जैसे, "क्या वे क्रोधित हैं या बस थके हुए हैं?"), तो दिशा-सूचक यंत्र भ्रम को दूर करने के लिए प्रश्न पूछने की ओर संकेत करता है। यह उपयोगकर्ता के बारे में सीखने को प्राथमिकता देता है।
  • दिशा B: "चलिए लक्ष्य तक पहुँचते हैं!" (Pragmatic Value)
    यदि AI जानता है कि उपयोगकर्ता बदलाव के लिए तैयार है, तो दिशा-सूचक यंत्र सलाह देने या प्रोत्साहन देने की ओर संकेत करता है ताकि उन्हें उनके लक्ष्य तक पहुँचने में मदद मिल सके। यह कार्रवाई को प्राथमिकता देता है।

PUMA इन दोनों को संतुलित करता है। यह केवल सवाल हमेशा नहीं पूछता (सीखना), और न ही बिना सोचे-समझे सलाह देता है (कार्य करना)। यह इस आधार पर स्विच करता है कि उपयोगकर्ता को अभी किसकी आवश्यकता है।

4. प्रयोग: प्रशिक्षण ले रहा एक स्वास्थ्य कोच

शोधकर्ताओं ने PUMA का परीक्षण एक विशिष्ट सेटिंग में किया: स्वास्थ्य के लिए मोटिवेशनल इंटरव्यूइंग (जैसे लोगों को धूम्रपान छोड़ने या मधुमेह प्रबंधित करने में मदद करना)।

  • उन्होंने एक "सिम्युलेटर" (वास्तविक डेटा से बना एक नकली रोगी) का उपयोग उपयोगकर्ता की भूमिका निभाने के लिए किया।
  • उन्होंने PUMA की तुलना अन्य AI परामर्शदाताओं से की जो केवल पिछले तथ्यों को याद रखते हैं या सरल नियमों का पालन करते हैं।

परिणाम:

  • बेहतर परिणाम: PUMA "मैं बदलाव नहीं चाहता" की अवस्था से "मैं एक योजना बनाने के लिए तैयार हूँ" की अवस्था तक "नकली रोगी" को मार्गदर्शन देने में बहुत बेहतर था।
  • बेहतर अनुमान: PUMA उपयोगकर्ता के शब्दों में व्यक्त करने से पहले ही यह अनुमान लगाने में अधिक सटीक था कि वे क्या महसूस कर रहे हैं।
  • दक्षता: इसने अन्य बॉट्स की तुलना में कम बातचीत के दौरों में लक्ष्य प्राप्त किया।

मुख्य निष्कर्ष

पेपर का दावा है कि एक बातचीत को वास्तव में व्यक्तिगत और सहायक होने के लिए, एक AI को केवल पुराने तथ्यों को पुनः प्राप्त करने वाला पुस्तकालय नहीं होना चाहिए। इसे एक नेविगेटर होना चाहिए जो:

  1. आपकी छिपी हुई भावनाओं का अनुमान लगाता है।
  2. भविष्यवाणी करता है कि उसके कहने से आपकी भावनाएँ कैसे बदलेंगी।
  3. यह चुनने के लिए अपने अगले शब्दों का चयन करता है कि उसे आपके बारे में और सीखना है या आपकी मदद करनी है, जो भी उस क्षण में सबसे अधिक आवश्यक हो।

लेखक इसे "निष्क्रिय स्मृति पुनर्प्राप्ति" (passive memory retrieval) से "सक्रिय, अवस्था-जागरूक निर्णय लेने" (active, state-aware decision-making) की ओर बढ़ने के रूप में देखते हैं। संक्षेप में: PUMA केवल यह याद नहीं रखता कि आपने क्या कहा; यह समझता है कि बातचीत में आप क्या बन रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →