← नवीनतम पेपर
💬 NLP

CoPA: Benchmarking Personalized Question Answering with Data-Informed Cognitive Factors

यह शोध पत्र CoPA को प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जिसमें 1,985 उपयोगकर्ता प्रोफाइल और कम्युनिटी-इंडिविजुअल प्रेफरेंस डायवर्जेंस (CIPD) से प्राप्त छह डेटा-संचालित संज्ञानात्मक कारक शामिल हैं, ताकि पारंपरिक लेक्सिकल समानता मेट्रिक्स से परे व्यक्तिगत प्रश्नोत्तर (पर्सनलाइज्ड क्वेश्चन अनसरिंग) का अधिक व्यापक और विभेदक मूल्यांकन प्रदान किया जा सके।

मूल लेखक: Hang Su, Zequn Liu, Chen Hu, Xuesong Lu, Yingce Xia, Zhen Liu

प्रकाशित 2026-04-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hang Su, Zequn Liu, Chen Hu, Xuesong Lu, Yingce Xia, Zhen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक कक्षा के सामने खड़े हैं। आपके पास 30 छात्र हैं, लेकिन वे सभी बहुत अलग हैं। एक छात्र 5 साल का बच्चा है जिसे गुरुत्वाकर्षण को समझने के लिए सेब की एक कहानी चाहिए। दूसरा एक भौतिकी (physics) का पीएचडी शोधकर्ता है जिसे जटिल गणितीय सूत्रों की आवश्यकता है। तीसरा एक थका हुआ माता-पिता है जो नल की लीकेज ठीक करने के लिए बस एक त्वरित, व्यावहारिक सुझाव चाहता है।

यदि आप तीनों को बिल्कुल एक जैसा उत्तर देते हैं, तो आप वास्तव में पढ़ा नहीं रहे हैं; आप केवल प्रसारण (broadcasting) कर रहे हैं। आप "सही" हो सकते हैं, लेकिन आप व्यक्तिगत (personalized) नहीं हैं।

यह शोध पत्र, CoPA, कंप्यूटरों (विशेष रूप से लार्ज लैंग्वेज मॉडल्स या LLMs) को उस आदर्श, अनुकूलन योग्य शिक्षक के रूप में प्रशिक्षित करने के बारे में है। यह इसे सरल तरीके से समझाने का तरीका है।

1. समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल

वर्तमान में, जब हम यह परीक्षण करते हैं कि क्या कोई कंप्यूटर व्यक्तिगत उत्तर देने में अच्छा है, तो हम बहुत ही साधारण उपकरणों का उपयोग करते हैं।

  • "शब्द गणना" परीक्षण: क्या उत्तर में वही शब्द हैं जो एक नमूना उत्तर में हैं? (जैसे यह देखना कि क्या दो निबंधों में समान शब्दावली है, यह अनदेखा करते हुए कि क्या उनका लहजा सही है)।
  • "मानवीय अनुमान" परीक्षण: हम एक इंसान या दूसरे AI से पूछते हैं, "क्या यह सही लग रहा है?" लेकिन अक्सर, वे अस्पष्ट नियमों के आधार पर केवल अनुमान लगाते हैं।

लेखकों ने महसूस किया कि ये विधियाँ मुख्य बात को चूक जाती हैं। वे एक शेफ को केवल इसलिए आंकने के समान हैं कि क्या उसने नमक का उपयोग किया है, बिना यह चखे कि क्या वह व्यंजन वास्तव में भोजन करने वाले के विशिष्ट आहार या मूड के अनुकूल है।

2. खोज: "समुदाय बनाम आप" का रहस्य

यह पता लगाने के लिए कि वास्तविक वैयक्तिकरण (personalization) क्या होता है, लेखकों ने StackExchange (एक विशाल ऑनलाइन Q&A साइट, जो मंचों के एक विशाल पुस्तकालय की तरह है) का अध्ययन किया।

उन्होंने एक दिलचस्प घटना देखी जिसे वे CIPD (कम्युनिटी-इंडिविजुअल प्रेफरेंस डायवर्जेंस) कहते हैं।

  • परिदृश्य: एक उपयोगकर्ता एक प्रश्न पूछता है। समुदाय सबसे "सर्वश्रेष्ठ" उत्तर पर वोट करता है (वह उत्तर जिसे सबसे अधिक अपवोट मिले हों)। लेकिन प्रश्न पूछने वाला व्यक्ति एक अलग उत्तर चुनता है जिसे "स्वीकृत" (accepted) माना जाता है।
  • उपमा: कल्पना कीजिए कि भोजन समीक्षकों का एक समूह वोट देता है कि एक तीखा, जटिल व्यंजन "सर्वश्रेष्ठ" है। लेकिन जिसने इसे ऑर्डर किया था, वह एक सरल, हल्का सूप चुनता है। क्यों? शायद वे डाइट पर हैं, शायद वे बीमार हैं, या शायद उन्हें तीखा पसंद नहीं है।
  • अंतर्दृष्टि: "सामुदायिक सर्वश्रेष्ठ" हमेशा "व्यक्तिगत सर्वश्रेष्ठ" नहीं होता है। इन हजारों विसंगतियों का अध्ययन करके, लेखकों ने महसूस किया कि लोग जो चुनते हैं, उसके पीछे छिपे हुए कारण होते हैं।

3. समाधान: "छह गुप्त सामग्रियां"

लेखकों ने इन "समुदाय बनाम आप" के हजारों विरोधाभासों को पढ़ने के लिए AI का उपयोग किया और पूछा: "इस विशिष्ट व्यक्ति ने इस विशिष्ट उत्तर को क्यों चुना?"

उन्होंने उन उत्तरों को छह संज्ञानात्मक कारकों (वैयक्तिकरण की गुप्त सामग्री) में संकुचित किया:

  1. संज्ञानात्मक विश्वास (Cognitive Trust): क्या उपयोगकर्ता स्रोत पर भरोसा करता है? (जैसे, "मैं केवल नासा के उत्तरों पर विश्वास करता हूँ, रैंडम ब्लॉग्स पर नहीं।")
  2. स्थितिजन्य एंकरिंग (Situational Anchoring): क्या उत्तर अभी मेरी विशिष्ट स्थिति के लिए प्रासंगिक है? (जैसे, "मैं बिना किसी औजार के होटल के कमरे में हूँ, इसलिए मुझे ड्रिल खरीदने के लिए न कहें।")
  3. स्कीमा निरंतरता (Schema Consistency): क्या उत्तर उस ज्ञान के साथ फिट बैठता है जो मैं पहले से जानता हूँ? (जैसे, "क्वांटम भौतिकी को बिल्लियों के रूपकों का उपयोग करके न समझाएं; मैं बुनियादी बातें पहले से जानता हूँ।")
  4. संज्ञानात्मक भार प्रबंधन (Cognitive Load Management): क्या उत्तर बहुत कठिन या बहुत आसान है? (जैसे, "मैं थका हुआ हूँ; मुझे केवल बुलेट पॉइंट्स दें, 10 पन्नों का निबंध नहीं।")
  5. मेटाकॉग्निटिव स्कैफोल्डिंग (Metacognitive Scaffolding): क्या उत्तर मुझे अपने आप सोचने में मदद करता है? (जैसे, "मुझे केवल उत्तर न दें; मुझे दिखाएं कि अगले प्रश्न को कैसे हल किया जाए।")
  6. भावात्मक और प्रेरणादायक अनुनाद (Affective & Motivational Resonance): क्या उत्तर मेरे मूड से मेल खाता है? (जैसे, "मैं निराश हूँ; उत्साहजनक बनें, रोबोटिक नहीं।")

4. बेंचमार्क: "CoPA" परीक्षण

इन छह सामग्रियों का उपयोग करके, उन्होंने CoPA (कम्युनिटी-इंडिविजुअल प्रेफरेंस एलाइनमेंट) नामक एक नया परीक्षण बनाया।

केवल यह पूछने के बजाय कि "क्या यह उत्तर अच्छा है?", CoPA पूछता है:

  • "क्या यह उत्तर उपयोगकर्ता के विश्वास स्तर से मेल खाता है?"
  • "क्या यह उनकी स्थिति के अनुकूल है?"
  • "क्या उनके लिए जटिलता सही है?"

उन्होंने इसका परीक्षण 1,985 विभिन्न "उपयोगकर्ता प्रोफाइल" (विभिन्न इतिहास और प्राथमिकताओं वाले वास्तविक लोगों के डिजिटल अवतार) पर किया।

5. परिणाम: यह क्यों मायने रखता है

जब उन्होंने लोकप्रिय AI मॉडलों का इस नए CoPA मानक के विरुद्ध परीक्षण किया, तो उन्होंने पाया:

  • जेनेरिक AI (सभी को एक जैसा उत्तर देने वाला) विशिष्ट उपयोगकर्ता आवश्यकताओं से मेल खाने में बुरी तरह विफल रहा।
  • पर्सनलाइज्ड AI (उपयोगकर्ता के इतिहास का उपयोग करके एक प्रोफाइल बनाने वाला) बहुत बेहतर प्रदर्शन कर रहा था।
  • "प्रोफाइल" दृष्टिकोण विजेता था। यह ऐसा है जैसे AI एक "यूजर आईडी कार्ड" बनाता है जो सारांशित करता है कि उपयोगकर्ता क्या पसंद करता है, वह कैसे सोचता है, और उसे क्या चाहिए, और फिर उस कार्ड का उपयोग करके एकदम सटीक उत्तर तैयार करता है।

बड़ी तस्वीर

पुराने तरीके के AI को एक वेंडिंग मशीन के रूप में सोचें: आप एक बटन दबाते हैं, और यह हर बार आपको एक ही स्नैक देता है।

यह शोध पत्र एक नया तरीका प्रस्तावित करता है: एक पर्सनल शेफ
शेफ आपके पिछले ऑर्डर्स को देखता है, जानता है कि आपको धनिया पसंद नहीं है, जानता है कि आप जल्दी में हैं, और जानता है कि आप तीखा खाना पसंद करते हैं। फिर, शेफ विशेष रूप से आपके लिए भोजन बनाता है, न कि औसत ग्राहक के लिए।

CoPA वह नया मेनू और नया टेस्ट-टेस्ट है जो यह साबित करता है कि शेफ वास्तव में आपके लिए खाना बना रहा है, न कि केवल भीड़ के लिए। यह हमें "क्या AI स्मार्ट है?" से "क्या AI मुझे समझता है?" की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →