← नवीनतम पेपर
💻 computer science

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

यह अध्ययन खुले-अंत वाले सर्वेक्षण प्रतिक्रियाओं के विश्लेषण के लिए बड़े भाषा मॉडलों (LLMs) की पारंपरिक मशीन लर्निंग से तुलना करता है, जिसमें यह पाया गया है कि जहाँ LLMs जटिल विषयों और भावनाओं को समझने में बेहतर वर्गीकरण सटीकता प्राप्त करते हैं, वहीं वे अपने तर्क में निरंतरता और व्याख्यात्मकता के संबंध में महत्वपूर्ण समझौते प्रस्तुत करते हैं।

मूल लेखक: Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

प्रकाशित 2026-07-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास हजारों छात्रों के पत्रों का एक विशाल डिब्बा है, जो उनके अपने बिखरे हुए, भावनात्मक हस्तलेखन (handwriting) में लिखे गए हैं। कुछ खुश हैं, कुछ गुस्से में हैं, कुछ व्यंग्यात्मक (sarcastic) हैं, और कुछ बस उलझन में हैं। आपका काम? उन सभी को पढ़ना और उन्हें छह भावनाओं के डिब्बों में छाँटना: खुशी (Joy), आश्चर्य (Surprise), प्रेम (Love), क्रोध (Anger), उदासी (Sadness), और भय (Fear)।

लंबे समय तक, शोधकर्ताओं ने इन कार्यों को करने के लिए "पुराने स्कूल" के कंप्यूटर प्रोग्रामों का उपयोग किया। इन प्रोग्रामों को एक बहुत ही सख्त लाइब्रेरियन की तरह समझें जो केवल विशिष्ट शब्दों को गिनना जानता है। यदि लाइब्रेरियन को "great" शब्द दिखता है, तो वे उस पर "Joy" का स्टिकर लगा देते हैं। यदि उन्हें "bad" दिखता है, तो वे "Sad" का स्टिकर लगा देते हैं। यह तेज़ है, और आप देख सकते हैं कि लाइब्रेरियन ने वह चुनाव क्यों किया। लेकिन यहाँ समस्या यह है कि ये लाइब्रेरियन आसानी से मूर्ख बन जाते हैं। वे व्यंग्य को, एक 'धन्यवाद' के पीछे छिपी थकान को, या उन सूक्ष्म संकेतों को मिस कर देते हैं जिनसे पता चलता है कि एक छात्र वास्तव में क्रोधित है, भले ही उसने विनम्र शब्दों का उपयोग किया हो।

इस अध्ययन में, शोधकर्ताओं ने एक नई टीम के सहायकों का परीक्षण करने का निर्णय लिया: लार्ज लैंग्वेज मॉडल्स (LLMs)। आप इन रोबोट्स को सुपर-स्मार्ट, अच्छी तरह से पढ़े-लिखे रोबोट मान सकते हैं जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। सख्त लाइब्रेरियन के विपरीत, ये रोबोट केवल शब्दों को नहीं गिनते; वे वाक्य के भाव (vibe) और संदर्भ (context) को समझने की कोशिश करते हैं।

बड़ा मुकाबला (The Big Showdown)

शोधकर्ताओं ने इन दो टीमों को 2019 और 2021 के वास्तविक छात्र सर्वेक्षण डेटा (2021 से 293 पत्र और 2019 से 142 पत्र) का उपयोग करके एक-दूसरे के विरुद्ध खड़ा किया। उन्होंने रोबोट्स को कुछ भी नया नहीं सिखाया; उन्होंने बस एक सरल निर्देश का उपयोग करके पत्रों को छाँटने के लिए कहा, जिसे "जीरो-शॉट" प्रॉम्प्टिंग कहा जाता है।

पुराने लाइब्रेरियन ने क्या किया
पारंपरिक कंप्यूटर मॉडल (जैसे सपोर्ट वेक्टर क्लासिफायर और रैंडम फॉरेस्ट) विशिष्ट उदाहरणों पर प्रशिक्षित होने पर पत्रों को छाँटने में ठीक-ठाक थे। उन्होंने अपने अभ्यास परीक्षणों पर लगभग 90% सटीकता प्राप्त की। लेकिन जब वे वास्तविक, बिखरे हुए छात्र पत्रों का सामना कर रहे थे, तो वे थोड़ा अजीब व्यवहार करने लगे।

  • 2019 के बैच में, एक मॉडल ने तय किया कि 99.3% पत्र "Joy" थे। इसने मूल रूप से अन्य सभी भावनाओं को अनदेखा कर दिया!
  • 2021 के बैच में, मॉडल आपस में बुरी तरह असहमत थे। एक ने सोचा कि एक पत्र "Love" है, जबकि दूसरे ने उसे "Sadness" समझा।
  • शोधकर्ताओं ने पाया कि ये पुराने मॉडल विशिष्ट शब्दों (जैसे "great" या "good") के प्रति बहुत संवेदनशील थे और मानवीय भाषा के पेचीदा पक्ष को संभालने में असमर्थ थे। वे भंगुर (brittle) थे, जिसका अर्थ है कि यदि डेटा थोड़ा भी बदल जाता, तो उनकी छंटनी बिगड़ जाती।

नए रोबोट्स ने क्या किया
LLMs की टीम (जिसमें GPT-4-Turbo, Claude 3.5, Meta का LLaMA 3, और Perplexity Sonar Pro शामिल हैं) ने कुछ अलग किया। उन्होंने केवल शब्दों को नहीं गिना; उन्होंने भावना को समझने की कोशिश की।

  • वे एक-दूसरे से सहमत थे: जब चार अलग-अलग रोबोटों ने पत्रों के एक ही ढेर को देखा, तो उन्होंने ज्यादातर एक ही तरह से पत्रों को छाँटा। उदाहरण के लिए, 2021 के डेटा में, चारों रोबोट "Anger" (46 पत्र) की संख्या पर बिल्कुल सहमत थे।
  • उन्होंने बारीकियों को संभाला: वे जटिल भावनाओं को पहचानने में बहुत बेहतर थे, जैसे कि जब कोई छात्र व्यंग्य कर रहा हो, या जब उनका "धन्यवाद" वास्तव में थकान से भरा हो।
  • आंकड़े: हालांकि पेपर रोबोट्स के लिए कोई एकल "सटीकता स्कोर" नहीं देता है (क्योंकि तुलना करने के लिए कोई मानव उत्तर कुंजी नहीं है), उनकी निरंतरता बताती है कि वे इस तरह के बिखरे हुए, वास्तविक दुनिया के डेटा के लिए पुराने मॉडलों की तुलना में बहुत अधिक विश्वसनीय हैं।

चुनौती (The Catch)
रोबोट जादुई जीव नहीं हैं। शोधकर्ता कुछ बातें बताते हैं जिन पर ध्यान देना आवश्यक है:

  • "Love" ग्लिच: चारों रोबोट "Joy" की तुलना में अधिक पत्रों को "Love" के रूप में छाँटते दिखे। शोधकर्ताओं को संदेह है कि ऐसा इसलिए है क्योंकि रोबोटों ने सोशल मीडिया से सीखा है, जहाँ लोग कहते हैं "मुझे यह क्लास बहुत पसंद है!" (I love this class!) जिसका अर्थ है "मुझे यह बहुत अच्छी लगती है," न कि उनके गहरे रोमांटिक भावनाएं हैं।
  • ब्लैक बॉक्स: पुराने लाइब्रेरियन के विपरीत, आप हमेशा यह नहीं देख सकते कि रोबोट ने कोई चुनाव क्यों किया। उनके काम का ऑडिट करना कठिन है।
  • लागत और अपडेट: इन रोबोट्स को चलाना महंगा है, और जो कंपनियाँ इन्हें बनाती हैं वे उन्हें अक्सर अपडेट करती रहती हैं। यदि आप अगले वर्ष वही प्रॉम्प्ट चलाते हैं, तो रोबट थोड़ा अलग उत्तर दे सकता है क्योंकि वह एक "नया संस्करण" है।

निर्णय (The Verdict)
अध्ययन बताता है कि यदि आप हजारों खुले-अंत वाले (open-ended) छात्र प्रतिक्रियाओं का विश्लेषण करना चाहते हैं, तो नए AI रोबोट बेहतर उपकरण हैं। वे भाषा के जटिल, मानवीय पक्ष को समझने में बहुत बेहतर हैं और विभिन्न समूहों के छात्रों के बीच अधिक सुसंगत हैं।

हालाँकि, शोधकर्ता यह नहीं कहते कि यह एक "हल की गई" समस्या है। वे सुझाव देते हैं कि उच्च-दांव वाले निर्णयों (जैसे स्कूल की नीतियों को बदलना) के लिए, सबसे अच्छा दृष्टिकोण एक टीम वर्क है: रोबोट को पत्रों को छाँटने के लिए भारी काम करने दें, लेकिन यह सुनिश्चित करने के लिए कि रोबोट व्यंग्य या पूर्वाग्रह से धोखा न खा जाए, मनुष्यों द्वारा काम की जाँच की जानी चाहिए। यह छात्रों को सुनने का एक शक्तिशाली नया तरीका है, लेकिन इसमें अभी भी मानव नियंत्रण की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →