← नवीनतम पेपर
💬 NLP

CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis

यह शोध पत्र CNSocialDepress को प्रस्तुत करता है, जो एक व्यापक चीनी सोशल मीडिया डेटासेट है जिसमें 44,178 पोस्ट और विशेषज्ञों द्वारा एनोटेट किए गए मनोवैज्ञानिक गुण शामिल हैं जो पारंपरिक बाइनरी वर्गीकरण से परे सूक्ष्म, व्याख्या योग्य अवसाद जोखिम पहचान और संरचित विश्लेषण को सक्षम करते हैं।

मूल लेखक: Jinyuan Xu, Tian Lan, Xintao Yu, Xue He, Hezhi Zhang, Ying Wang, Pierre Magistry, Mathieu Valette, Lei Li

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinyuan Xu, Tian Lan, Xintao Yu, Xue He, Hezhi Zhang, Ying Wang, Pierre Magistry, Mathieu Valette, Lei Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि आपका एक दोस्त उदास क्यों महसूस कर रहा है। आप उनसे सीधे पूछ सकते हैं, लेकिन कभी-कभी लोग अपनी बात कहने में बहुत शर्मीले होते हैं, या शायद उन्हें खुद भी पता नहीं होता कि क्या गलत है। इसके बजाय, आप उनके बिखरे हुए सुरागों को जोड़ने के लिए उनकी डायरी, उनके टेक्स्ट संदेश या उनकी सोशल मीडिया पोस्ट को देख सकते हैं।

यह शोध पत्र एक नए टूल का परिचय देता है जिसे CNSocialDepress कहा जाता है, जो चीनी सोशल मीडिया पर डिप्रेशन (अवसाद) को समझने के लिए एक विशाल, सुपर-व्यवस्थित "डिजली डायरी" की तरह है।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया और यह क्यों महत्वपूर्ण है, जिसे सरल भागों में विभाजित किया गया है:

1. समस्या: उदासी का "ब्लैक बॉक्स"

लंबे समय से, डिप्रेशन का पता लगाने की कोशिश करने वाले कंप्यूटर एक ऐसे डॉक्टर की तरह थे जो केवल पूछता है, "क्या आप दुखी हैं? हाँ या ना?"

  • सीमा: अधिकांश मौजूदा उपकरण केवल एक बाइनरी उत्तर (हाँ/नहीं) देते हैं। वे यह नहीं बताते कि क्यों
  • अंतराल: चीनी सोशल मीडिया के लिए कोई अच्छा "शब्दकोश" या "गाइडबुक" नहीं था जो डिप्रेशन की बारीकियों को समझा सके। अधिकांश डेटा या तो बहुत छोटा था, या बहुत क्लिनिकल (जैसे अस्पताल के रिकॉर्ड), या बिना किसी गहराई के केवल एक साधारण "हाँ/नहीं" लेबल वाला था।

2. समाधान: एक "छह-बिंदु स्वास्थ्य जांच"

शोधकर्ताओं ने एक नया डेटासेट (डेटा का संग्रह) बनाया जिसे CNSocialDepress कहा जाता है। केवल यह कहने के बजाय कि "यह व्यक्ति डिप्रेशन से ग्रस्त है," उन्होंने इसे एक विस्तृत स्वास्थ्य जांच की तरह छह विशिष्ट आयामों में विभाजित किया:

  1. आंतरिक भावना: क्या व्यक्ति आत्म-मूल्य खोने, अपराधबोध या आत्महत्या के विचारों के बारे में बात कर रहा है? ("हृदय" आयाम)।
  2. चिकित्सीय संकेत: क्या वे डॉक्टरों, अस्पतालों या विशिष्ट दवाओं का उल्लेख कर रहे हैं? ("प्रिस्क्रिप्शन" आयाम)।
  3. शरीर के संकेत: क्या वे नींद न आने, भूख कम लगने या थकान महसूस करने के बारे में बात कर रहे हैं? ("शारीरिक" आयाम)।
  4. मूड: क्या वे उदासी, अकेलापन या चिंता व्यक्त कर रहे हैं? ("भावना" आयाम)।
  5. ट्रिगर्स (कारण): क्या कुछ बुरा हुआ? जैसे ब्रेकअप, पारिवारिक झगड़ा, या स्कूल का तनाव? ("कारण" आयाम)।
  6. भाषा: क्या वे विशिष्ट शब्दों का उपयोग कर रहे हैं जैसे "मैं नहीं कर सकता," "मैं ही क्यों?", या "मैं नहीं चाहता"? ("बोलने का तरीका" आयाम)।

जादुई तत्व: उन्होंने कंप्यूटर को केवल अनुमान लगाने के लिए नहीं छोड़ा। उन्होंने इन छह आयामों को टैग करने के लिए हजारों पोस्ट को पढ़ने और मैन्युअल रूप से चिह्नित करने के लिए वास्तविक मनोवैज्ञानिकों को काम पर रखा। यह इस डेटा को "गोल्ड स्टैंडर्ड" बनाता है—यह सटीक और भरोसेमंद है।

3. चुनौती: बहुत अधिक काम!

हर एक पोस्ट को पढ़ने के लिए मनोवैज्ञानिकों को काम पर रखना महंगा और धीमा है। यह एक विशाल पुस्तकालय को हाथ से साफ करने की कोशिश करने जैसा है; इसमें बहुत समय लगता है।

  • नवाचार: टीम ने एक ऑटोमेटेड पाइपलाइन बनाई। इसे एक "रोबोट प्रशिक्षु" (Robot Apprentice) के रूप में समझें।
    • पहले, उन्होंने रोबोट को "गोल्ड स्टैंडर्ड" डेटा (मनोवैज्ञानिकों के वास्तविक कार्य) का उपयोग करके सिखाया।
    • फिर, रोबोट ने नए पोस्ट को पढ़ना और उन्हें उन्हीं छह आयामों के साथ टैग करना सीखा।
    • अंत में, एक दूसरे, और भी स्मार्ट रोबोट (एक विशाल AI मॉडल) ने पहले रोबोट के काम की दोबारा जांच की ताकि यह सुनिश्चित हो सके कि उसने कोई गलती नहीं की है।

इससे उन्हें एक विशाल डेटासेट (जिसे "सिल्वर" सेट कहा जाता है) बनाने में मदद मिली जो लगभग उतना ही अच्छा है जितना कि मानव-निर्मित डेटा, लेकिन इसे बहुत तेज़ी से बनाया गया।

4. परिणाम: एक बेहतर "जासूस"

उन्होंने इस नए डेटासेट और "रोबोट प्रशिक्षु" का अन्य AI मॉडलों के विरुद्ध परीक्षण किया।

  • परीक्षण: उन्होंने AI को उपयोगकर्ता की पोस्ट पढ़ने और एक सारांश लिखने के लिए कहा: "क्या यह व्यक्ति डिप्रेशन से ग्रस्त है? यदि हाँ, तो क्यों? लक्षण क्या हैं?"
  • विजेता: उनके नए डेटासेट पर प्रशिक्षित AI अन्य मॉडलों की तुलना में बहुत बेहतर था क्योंकि यह समझा सका कि उसे क्यों लगा कि कोई व्यक्ति डिप्रेशन से ग्रस्त है। इसने केवल अनुमान नहीं लगाया; यह विशेष रूप से "नींद की गोलियों" या "पारिवारिक झगड़ों" के बारे में वाक्यों की ओर इशारा कर सकता था और समझा सकता था कि वे बड़ी तस्वीर में कैसे फिट होते हैं।

5. यह क्यों मायने रखता है (बड़ी तस्वीर)

कल्पना कीजिए कि भविष्य में एक मानसिक स्वास्थ्य ऐप केवल यह नहीं कहेगा कि "आप उदास लग रहे हैं।" इसके बजाय, यह कह सकता है:

"हमने देखा है कि आप हाल ही में अनिद्रा और अपराधबोध के बारे में बहुत बात कर रहे हैं, और आपने पारिवारिक तनाव का भी उल्लेख किया है। यह पैटर्न बताता है कि आप डिप्रेशन के जोखिम में हो सकते हैं। यहाँ कुछ संसाधन दिए गए हैं जो आपकी मदद कर सकते हैं।"

यह डेटासेट उस भविष्य की ओर एक कदम है। यह कंप्यूटर को चीनी संस्कृति में उदासी की भाषा को समझने में मदद करता है, न कि केवल एक सांख्यिकी के रूप में, बल्कि एक जटिल मानवीय अनुभव के रूप में। यह कच्चे सोशल मीडिया डेटा और वास्तविक, कार्रवाई योग्य मानसिक स्वास्थ्य अंतर्दृष्टि के बीच के अंतर को पाटता है।

संक्षेप में: उन्होंने उच्च गुणवत्ता वाला, विशेषज्ञ-चिह्नित चीनी सोशल मीडिया पोस्ट का एक पुस्तकालय बनाया, AI को एक मनोवैज्ञानिक की तरह इसे पढ़ना सिखाया, और यह सिद्ध किया कि यह हमें डिप्रेशन का पता लगाने और समझने में पहले की तुलना में बहुत बेहतर तरीके से मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →