LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
यह अध्ययन प्रदर्शित करता है कि GPT-5.4 सर्वेक्षण डेटा के आगमनात्मक विषयगत विश्लेषण (inductive content analysis) में मानवीय प्रदर्शन के करीब पहुँच सकता है, जो मानवीय आंतरिक निरंतरता (human internal consistency) के तुलनीय कोडिंग और थीम जनरेशन सहमति स्तर प्राप्त करता है, जिससे गुणात्मक अनुसंधान के लिए एक स्केलेबल सहायता उपकरण के रूप में इसकी क्षमता की पुष्टि होती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
गुणात्मक अनुसंधान (क्वालिटेटिव रिसर्च) शब्दों के अर्थ को समझने की एक कला है। जब वैज्ञानिकों, समाजशास्त्रियों या नीति निर्माताओं को लोगों के विचारों, भावनाओं और अनुभवों को समझने की आवश्यकता होती है, तो वे अक्सर खुले प्रश्न पूछते हैं। किसी बॉक्स में टिक लगाने के बजाय, एक व्यक्ति अपने जीवन, अपने संघर्षों या अपनी आशाओं के बारे में एक अनुच्छेद लिखता है। हजारों ऐसे अनुच्छेदों को उपयोगी ज्ञान में बदलने के लिए, शोधकर्ताओं को प्रत्येक एक को पढ़ना होगा, दोहराए जाने वाले विचारों को खोजना होगा, और उन्हें श्रेणियों में समूहबद्ध करना होगा। यह प्रक्रिया, जिसे 'कंटेंट एनालिसिस' (विषय-वस्तु विश्लेषण) कहा जाता है, मानव व्यवहार को समझने की रीढ़ है, लेकिन यह अविश्वसनीय रूप से धीमी और श्रमसाध्य है। दशकों तक, इसे करने का एकमात्र तरीका मानवीय मस्तिष्क था, जो पंक्ति दर पंक्ति पढ़ता था। अब, एक नए प्रकार के उपकरण ने कमरे में प्रवेश किया है: लार्ज लैंग्वेज मॉडल्स (बड़े भाषा मॉडल)। ये कृत्रिम बुद्धिमत्ता (AI) प्रणालियाँ हैं जिन्हें पाठ की विशाल मात्रा पर प्रशिक्षित किया गया है जो भाषा को पढ़, समझ और सारांशित कर सकती हैं। वैज्ञानिक समुदाय के लिए बड़ा सवाल केवल यह नहीं है कि क्या ये मशीनें पढ़ सकती हैं, बल्कि यह है कि क्या वे एक मानव शोधकर्ता की तरह सोच सकती हैं जब कार्य के लिए बिना किसी पूर्व-लिखित नियम पुस्तिका के छिपे हुए पैटर्न खोजने की आवश्यकता हो।
यूरोप के विभिन्न विश्वविद्यालयों के शोधकर्ताओं की एक टीम इस प्रश्न का उत्तर देने के लिए एक प्रत्यक्ष तुलना के साथ आगे बढ़ी। उन्होंने यूरोप भर के 2,800 पीएचडी छात्रों के एक सर्वेक्षण से एक वास्तविक डेटासेट लिया, जहाँ अध्ययन के आधार के रूप में 1,800 प्रतिक्रियाओं में से 10% को यादृच्छिक रूप से चुना गया था। इस नमूने से, छह विशिष्ट खुले प्रश्नों के कुल 903 उत्तरों का गहन विश्लेषण किया गया। प्रयोग के एक पक्ष में, पांच मानव शोधकर्ताओं ने इन उत्तरों को पढ़ा और क्या कहलाता है जिसे 'इंडक्टिव कंटेंट एनालिसिस' (आगमनात्मक विषय-वस्तु विश्लेषण) कहा जाता है, उसे निष्पादित किया। इसका अर्थ यह है कि उन्होंने उत्तरों को जबरदस्ती किसी श्रेणियों की सूची में डालने के लिए शुरुआत नहीं की। इसके बजाय, उन्होंने पाठ को पढ़ा, मुख्य विचारों की पहचान की, उन विचारों के लिए अपने स्वयं के लेबल बनाए, और फिर उन लेबलों को व्यापक विषयों (थीम्स) में समूहित किया। यह एक रचनात्मक और व्याख्यात्मक प्रक्रिया है, जो यह तय करने के लिए मानवीय निर्णय पर निर्भर करती है कि क्या महत्वपूर्ण है। दूसरे पक्ष में, शोधकर्ताओं ने उसी पाठ पर उसी कार्य को करने के लिए एक परिष्कृत भाषा मॉडल का उपयोग किया। मशीन को उत्तरों को पढ़ने, मुख्य विचारों को खोजने और विषयों में समूहबद्ध करने के निर्देश दिए गए थे, और वह भी बिना यह बताए कि उसे पहले से क्या खोजना है।
शोधकर्ताओं ने फिर दो परिणामों के सेट की तुलना की ताकि यह देखा जा सके कि मशीन मनुष्यों से कितनी निकटता से मेल खाती है। उन्होंने पूर्ण मिलान की तलाश नहीं की, क्योंकि अलग-अलग विशेषज्ञ भी अक्सर किसी विशिष्ट वाक्य को लेबल करने के तरीके पर असहमत होते हैं। इसके बजाय, उन्होंने समूहों के समग्र संरेखण (अलाइनमेंट) को मापा। परिणामों ने दिखाया कि संरेखण का स्तर मध्यम था। जब शोधकर्ताओं और मशीन द्वारा पाठ के लिए बनाए गए विशिष्ट लेबलों को देखा गया, तो वे 61 प्रतिशत बार सहमत थे। जब उन व्यापक विषयों को देखा गया जिन्हें उन्होंने उन लेबलों से बनाया था, तो सहमति थोड़ी कम, 54 प्रतिशत थी। इसे समझने के लिए, शोधकर्ताओं ने यह भी जांचा कि पांच मानव विशेषज्ञों के बीच आपस में कितनी सहमति थी। मनुष्य लेबलों और विषयों पर 68 प्रतिशत बार एक-दूसरे से सहमत थे। इसका अर्थ है कि मानव और मशीन के बीच का अंतर बहुत बड़ा नहीं था; मशीन लगभग उतनी ही निरंतरता के साथ कार्य करती थी जितनी एक मानव विशेषज्ञ दूसरे मानव विशेषज्ञ के साथ करता है।
हालाँकि, यह कहानी सभी विषयों के लिए एक समान नहीं है। मनुष्यों और मशीन के बीच सहमति विषयों के आधार पर काफी भिन्न थी। वित्तीय स्थितियों से संबंधित प्रश्नों के लिए, मशीन को अधिक संघर्ष करना पड़ा, जिससे मानव शोधकर्ताओं के साथ कम संरेखण दिखा। व्यक्तिगत अनुभवों या सामान्य फीडबैक के बारे में प्रश्नों के लिए, संरेखण बहुत मजबूत था। अध्ययन सुझाव देता है कि मशीन की विश्वसनीयता डेटा की प्रकृति और पाठ की स्पष्टता पर बहुत अधिक निर्भर करती है। जब पाठ अस्पष्ट था या मशीन के अपने समूह बनाने के तर्क में कमी थी, तो मनुष्यों के साथ सहमति गिर गई। शोधकर्ताओं ने पाया कि जब भी मशीन अपने आप में असंगत थी, वह मनुष्यों के साथ भी असंगत थी, और यही बात मानव टीम के लिए भी सत्य थी। यह इंगित करता है कि विशिष्ट विषय की कठिनाई इस बात में बड़ी भूमिका निभाती है कि यह उपकरण कितनी अच्छी तरह काम करता है।
अध्ययन में भाग लेने वाले मानव कोडर्स से भी मशीन के काम के बारे में उनकी धारणा पूछी गई थी। उन्होंने रिपोर्ट किया कि मशीन का वर्गीकरण उनके अपने विचारों को दर्शाता था और वे भविष्य के डेटा का विश्लेषण करने में मदद के लिए इस उपकरण पर भरोसा करेंगे। शोधकर्ताओं ने निष्कर्ष निकाला कि ये कृत्रिम बुद्धिमत्ता सिस्टम पूरी तरह से मानवीय निर्णय को बदलने के लिए तैयार नहीं हैं, विशेष रूप रूप से सिद्धांत बनाने के जटिल, उच्च-स्तरीय कार्य के लिए। हालांकि, निष्कर्ष बताते हैं कि ये उपकरण पाठ को छाँटने के शुरुआती, श्रम-साध्य चरणों को संभालने के लिए अत्यधिक प्रभावी हैं। वे हजारों प्रतिक्रियाओं को पढ़ने और प्रारंभिक पैटर्न खोजने का भारी काम कर सकते हैं, जिससे मानव शोधकर्ता उन पैटर्न की गहरी व्याख्या और सत्यापन पर ध्यान केंद्रित कर सकें। अध्ययन यह दावा नहीं करता है कि मशीन पूर्ण है या इसने पाठ विश्लेषण की समस्या को हल कर दिया है, लेकिन यह सुझाव देता है कि यह उन शोधकर्ताओं के लिए एक शक्तिशाली, स्केलेबल साथी है जिन्हें मानव कहानियों के बड़े आयतन का अर्थ निकालने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।