← नवीनतम पेपर
💬 NLP

User eXperience Perception Insights Dataset (UXPID): Synthetic User Feedback from Public Industrial Forums

यह शोध पत्र UXPID प्रस्तुत करता है, जो औद्योगिक मंचों (industrial forums) से 7,130 गुमनाम उपयोगकर्ता फीडबैक शाखाओं का एक सिंथेटिक डेटासेट है, जिसे गोपनीयता और लाइसेंसिंग बाधाओं को संबोधित करते हुए UX विश्लेषण, आवश्यकताओं के निष्कर्षण (requirements extraction) और AI-संचालित फीडबैक प्रोसेसिंग में अनुसंधान का समर्थन करने के लिए LLMs द्वारा एनोटेट किया गया है।

मूल लेखक: Mikhail Kulyabin, Jan Joosten, Choro Ulan uulu, Nuno Miguel Martins Pacheco, Fabian Ries, Filippos Petridis, Jan Bosch, Helena Holmström Olsson

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mikhail Kulyabin, Jan Joosten, Choro Ulan uulu, Nuno Miguel Martins Pacheco, Fabian Ries, Filippos Petridis, Jan Bosch, Helena Holmström Olsson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल जहाज के कप्तान हैं, लेकिन समुद्र में चलने के बजाय, आप औद्योगिक सॉफ्टवेयर और हार्डवेयर की जटिल दुनिया में नेविगेशन कर रहे हैं। आपका क्रू (उपयोगकर्ता) लगातार एक विशाल, अराजक बुलेटिन बोर्ड के माध्यम से आपको नोट्स, शिकायतें और विचार भेजता रहता है। कुछ नोट्स नैपकिन पर लिखे होते हैं, कुछ शोर के बीच चिल्लाकर कहे जाते हैं, और कई तो एक गुप्त कोड में लिखे होते हैं जिसे केवल लिखने वाले ही समझ सकते हैं।

यह पेपर एक नए टूल UXPID (User eXperience Perception Insights Dataset) का परिचय देता है ताकि आपके जैसे कप्तानों को उस अराजकता को समझने में मदद मिल सके।

यह इसकी कहानी है कि उन्होंने इसे कैसे बनाया, इसके अंदर क्या है, और यह क्यों महत्वपूर्ण है, जिसे सरल भाषा में समझाया गया है:

1. समस्या: कमरे में "शोर" (The "Noise" in the Room)

वर्षों से, कंपनियों के पास सूचनाओं का एक खजाना रहा है: सार्वजनिक मंचों (forums) पर उपयोगकर्ताओं की हजारों टिप्पणियाँ। लेकिन वह सोना मिट्टी के नीचे दबा हुआ है।

  • अव्यवस्था: टिप्पणियाँ असंरचित, बिखरी हुई और अस्त-व्यस्त हैं।
  • गोपनीयता की दीवार: आप सीधे वास्तविक नोट्स नहीं ले सकते क्योंकि उनमें निजी नाम, कंपनी के रहस्य और विशिष्ट उत्पाद कोड शामिल हैं। यह एक डायरी को पढ़ने जैसा है जो एक तिजोरी में बंद है।
  • नक्शे की कमी: विश्लेषण करने वाले मौजूदा उपकरण बिना चुंबक के घास के ढेर में सुई खोजने के समान हैं। वे अक्सर समस्या की गंभीरता (क्या यह एक मामूली खरोंच है या पतवार में छेद?) या विशिष्ट विषय (क्या यह इंजन के बारे में है या नेविगेशन सिस्टम के बारे में?) को पहचानने में चूक जाते हैं।

2. समाधान: "सिंथेटिक दर्पण" (The "Synthetic Mirror")

शोधकर्ताओं ने UXPID बनाया है, जो उस अस्त-व्यस्त बुलेटिन बोर्ड के एक परफेक्टली पॉलिश किए गए, गुमनाम दर्पण की तरह है।

  • उन्होंने इसे कैसे बनाया: उन्होंने एक औद्योगिक स्वचालन (industrial automation) फोरम से 7,130 वास्तविक बातचीत थ्रेड्स लिए।
  • जादुई ट्रिक (AI): उन्होंने एक बहुत ही स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग एक "अनुवादक" और "गोपनीयता रक्षक" के रूप में किया।
    • चरण 1: AI ने वास्तविक, बिखरे हुए कमेंट्स को पढ़ा और उनका अर्थ निकाला: "उपयोगकर्ता क्रोधित है," "उत्पाद खराब है," "उन्हें एक नए फीचर की आवश्यकता है।"
    • चरण 2: AI ने उन कमेंट्स को फिर से लिखा। इसने अर्थ को बिल्कुल वैसा ही रखा लेकिन सभी रहस्यों को बदल दिया। "Siemens के John Smith" के बजाय, इसने "[User Name] [Company Name] से" लिखा। "Product X version 2.1" के बजाय, इसने "[Product Name] [Version No]" लिखा।
  • परिणाम: आपको एक ऐसा डेटासेट मिलता है जो बिल्कुल वास्तविक जीवन जैसा महसूस होता है लेकिन किसी के साथ भी साझा करने के लिए सुरक्षित है। यह एक स्वादिष्ट भोजन परोसने जैसा है जहाँ सामग्री असली है, लेकिन शेफ ने एलर्जी पैदा करने वाले तत्वों को हटा दिया है।

3. बॉक्स के अंदर क्या है?

डेटासेट केवल टेक्स्ट का ढेर नहीं है; यह एक संरचित लाइब्रेरी है। प्रत्येक बातचीत थ्रेड के साथ एक "टैग्ड सारांश" आता है जिसमें शामिल हैं:

  • "पेन पॉइंट्स" (Pain Points): उपयोगकर्ता किस बात से परेशान है?
  • "गेन पॉइंट्स" (Gain Points): उन्हें क्या पसंद है?
  • "गंभीरता" (Severity): क्या यह एक मामूली परेशानी है या एक गंभीर आपात स्थिति?
  • "सेंटिमेंट" (Sentiment): क्या वे खुश हैं, दुखी हैं, या तटस्थ हैं?
  • "विषय" (Topics): यह किस श्रेणी में आता है?

इसे एक अराजक शोर-शराबे वाली बहस को एक व्यवस्थित फाइलिंग कैबिनेट में बदलने के रूप में सोचें जहाँ हर शिकायत को रंग-कोडित टैग के साथ लेबल किया गया है।

4. क्या यह काम कर गया? (टेस्ट ड्राइव)

शोधकर्ताओं ने केवल बॉक्स नहीं बनाया; उन्होंने परीक्षण किया कि क्या यह वास्तव में कंप्यूटरों को सीखने में मदद करता है। उन्होंने इस नए डेटासेट का उपयोग करके दो अलग-अलग प्रकार के "छात्रों" (कंप्यूटर मॉडल) को सिखाया:

  1. पुराना छात्र: एक पारंपरिक तरीका जो कीवर्ड्स (जैसे "broken" शब्द कितनी बार आया) को गिनता है।
  2. नया छात्र: एक आधुनिक AI (DistilBERT) जो संदर्भ और बारीकियों को समझता है।

परिणाम:

  • नया छात्र बहुत तेज़ी से और बेहतर तरीके से सीख गया। वह उच्च सटीकता के साथ बातचीत के विषय और उपयोगकर्ता के मूड का सही अनुमान लगा सका।
  • पुराना छात्र संघर्ष करता रहा, अक्सर गलत अनुमान लगाता या भ्रमित हो जाता था।
  • मुख्य निष्कर्ष: नया AI शब्दों के पीछे के अर्थ को समझने में इतना अच्छा था कि वह तब भी उपयोगकर्ता की इच्छा का अनुमान लगा सकता था जब शब्द थोड़े अलग थे।

5. "फिडेलिटी" चेक: क्या हमने आत्मा खो दी? (The "Fidelity" Check)

एक बड़ी चिंता यह थी: "जब हमने नाम और नंबर बदले, तो क्या हमने टेक्स्ट का अहसास बदल दिया?"

  • उन्होंने मूल बिखरे हुए नोट्स और साफ-सुथरे सिंथेटिक नोट्स की तुलना की।
  • फैसला: बातचीत की संरचना बिल्कुल वैसी ही रही। पूछे गए प्रश्नों की संख्या और जवाबों की लंबाई समान थी।
  • एक छोटा बदलाव: सिंथेटिक टेक्स्ट थोड़ा अधिक "औपचारिक" हो गया। AI ने गोपनीयता की रक्षा के लिए कुछ चिल्लाने वाले अंदाज़ (विस्मयादिबोधक चिह्न) और बड़े अक्षरों (all-caps) में चिल्लाने को हटा दिया। इसका मतलब है कि यदि आप इस पर कंप्यूटर को प्रशिक्षित करते हैं, तो यह वास्तविक जीवन में "चिल्लाने" के प्रति थोड़ा कम संवेदनशील हो सकता है, लेकिन मूल संदेश बरकरार रहता है।

सारांश

संक्षेप में, यह पेपर कंप्यूटरों के लिए एक सुरक्षित, उच्च-गुणवत्ता वाला प्रशिक्षण मैनुअल प्रस्तुत करता है। यह शोधकर्ताओं और कंपनियों को AI को ग्राहक फीडबैक सुनने, यह समझने कि वे कितने क्रोधित या खुश हैं, और उन्हें क्या चाहिए—यह सिखाने की अनुमति देता है—बिना किसी वास्तविक व्यक्ति के निजी नाम या कंपनी के गुप्त डेटा को देखे। यह लोगों की आवाजों की एक अराजक भीड़ को एक स्पष्ट, कार्रवाई योग्य संकेत में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →