← नवीनतम पेपर
💬 NLP

Automated Coding of Communications in Collaborative Problem-solving Tasks Using ChatGPT

यह अध्ययन प्रदर्शित करता है कि ChatGPT सहयोगात्मक समस्या-समाधान आकलन के लिए संचार डेटा की कोडिंग को प्रभावी ढंग से स्वचालित कर सकता है, हालांकि इसका प्रदर्शन मॉडल, फ्रेमवर्क और कार्य के आधार पर भिन्न होता है, जिसमें नए तर्क-केंद्रित मॉडल अनिवार्य रूप से दूसरों से बेहतर प्रदर्शन नहीं करते हैं और प्रॉम्प्ट शोधन (prompt refinement) असंगत सुधार प्रदान करता है।

मूल लेखक: Jiangang Hao, Wenju Cui, Patrick Kyllonen, Emily Kerzabi, Lei Liu, Michael Flor

प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiangang Hao, Wenju Cui, Patrick Kyllonen, Emily Kerzabi, Lei Liu, Michael Flor

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक क्लास प्रोजेक्ट को ग्रेड करने की कोशिश कर रहे हैं, जहाँ छात्र जोड़ी में काम करके एक रहस्य को सुलझाते हैं। छात्र ज़ोर से बात नहीं कर सकते; उन्हें अपने विचार चैट बॉक्स में टाइप करने होते हैं। यह समझने के लिए कि वे कितनी अच्छी तरह सहयोग कर रहे हैं, आपको उनके हर एक संदेश को पढ़ना होगा और उन्हें "विचार साझा करना," "एक तर्क देना," या "बस नमस्ते कहना" जैसे श्रेणियों में छाँटना होगा।

यदि आपके पास 10 छात्र हैं, तो इसमें कुछ घंटे लगते हैं। यदि आपके पास 10,000 छात्र हैं, तो इसमें वर्षों लग जाएंगे। यह वह "अवरोध" (bottleneck) है जिसके बारे में पेपर बात करता है: इन चैट्स को हाथ से ग्रेड करना बड़े परीक्षणों के लिए बहुत धीमा और महंगा है।

शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या हम अपने लिए ग्रेडिंग करने के लिए एक सुपर-स्मार्ट AI (ChatGPT) को काम पर रख सकते हैं?

यहाँ उनके प्रयोग का विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. प्रयोग: AI इंटर्न बनाम मानव विशेषज्ञ

शोधकर्ताओं ने AI के साथ एक नए इंटर्न जैसा व्यवहार किया। उन्होंने AI को एक "नियम पुस्तिका" (कोडिंग फ्रेमवर्क) और पांच अलग-अलग टीम कार्यों के चैट लॉग्स का ढेर दिया (कुछ विज्ञान की पहेलियाँ थीं, कुछ बातचीत के खेल थे)। उन्होंने AI से संदेशों को उसी तरह छाँटने के लिए कहा जैसे एक मानव विशेषज्ञ करता।

उन्होंने AI के चार अलग-अलग संस्करणों का परीक्षण किया:

  • द स्टैंडर्ड वर्कर (मानक कार्यकर्ता): GPT-4 और GPT-4o (विश्वसनीय, सर्वव्यापी कार्यकर्ता)।
  • द "थिंकर" मॉडल्स (विचारक मॉडल): GPT-o1-mini और GPT-o3-mini (नए मॉडल जिन्हें जवाब देने से पहले अधिक "सोचने" के लिए डिज़ाइन किया गया है, जैसे कि एक छात्र जो एक जटिल गणित की समस्या को हल करने के लिए रुकता है)।

बड़ा आश्चर्य: "थिंकर" मॉडल बेहतर नहीं प्रदर्शन कर सके। वास्तव में, मानक, विश्वसनीय कार्यकर्ता (GPT-4o) इस विशिष्ट कार्य के लिए सबसे अच्छा था। यह एक पुस्तकालय को व्यवस्थित करने के लिए एक प्रतिभाशाली दार्शनिक को काम पर रखने जैसा है; वे डेवी डेसिमल सिस्टम (Dewey Decimal System) पर बहुत अधिक विचार कर सकते हैं, जबकि एक सामान्य लाइब्रेरियन बस इसे तेज़ी से और अधिक सटीकता से कर देता है।

2. परिणाम: जब AI चमकता है और कब लड़खड़ाता है

AI को हर बार पूर्ण स्कोर नहीं मिला, लेकिन इसने दो विशिष्ट परिदृश्यों में आश्चर्यजनक रूप से अच्छा प्रदर्शन किया:

  • "सामान्य ज्ञान" वाले कार्य (AI जीतता है): जब कार्य बजट पर बातचीत करने या अपार्टमेंट चुनने जैसे सामान्य कौशल के बारे में थे, तो AI मानव विशेषज्ञों के लगभग उतना ही अच्छा था। वह "जानकारी साझा करने" और "मदद माँगने" के बीच अंतर करने में सक्षम था।
  • "विज्ञान" वाले कार्य (AI संघर्ष करता है): जब कार्यों में जटिल वैज्ञानिक शब्द शामिल थे (जैसे "संघनन" या "ज्वालामुखी भूकंपीय गतिविधि"), तो AI भ्रमित हो गया।
    • उदाहरण: एक बुद्धिमान अनुवादक से दो डॉक्टरों के बीच हृदय सर्जरी पर चर्चा करने वाली बातचीत का अनुवाद करने के लिए कहें। भले ही अनुवादक अंग्रेजी पूरी तरह से जानता हो, फिर भी वह एक विशिष्ट चिकित्सा शब्द की बारीकी को मिस कर सकता है। AI विज्ञान के कार्यों की "जार्गन" (तकनीकी शब्दावली) के साथ संघर्ष कर रहा था।

3. कार्यकर्ता से अधिक नियम पुस्तिका मायने रखती है

शोधकर्ताओं ने पाया कि नियम पुस्तिका की गुणवत्ता AI की बुद्धिमत्ता से अधिक महत्वपूर्ण थी।

  • नियम पुस्तिका A (सैद्धांतिक): यह एक नियम पुस्तिका थी जो शुद्ध सिद्धांत के आधार पर विद्वानों द्वारा लिखी गई थी। यह अमूर्त और पालन करने में कठिन थी। AI इसके साथ संघर्ष कर रहा था।
  • नियम पुस्तिका B (व्यावहारिक): यह नियम पुस्तिका वास्तविक डेटा और उदाहरणों का उपयोग करके बनाई गई थी। यह स्पष्ट और ठोस थी। AI ने इसमें महारत हासिल की।

उदाहरण: यदि आप एक रोबोट को एक नियम पुस्तिका देते हैं जो कहती है "दयालु बनो," तो वह भ्रमित हो सकता है। लेकिन यदि आप उसे एक ऐसी नियम पुस्तिका देते हैं जो कहती है "यदि कोई 'नमस्ते' कहता है, तो 'हाय' कहें," तो यह पूरी तरह से काम करती है। AI को स्पष्ट, व्यावहारिक निर्देशों की आवश्यकता होती है, न कि अमूर्त सिद्धांतों की।

4. क्या हम AI को उसकी गलतियाँ दिखाकर सुधार सकते हैं?

शोधकर्ताओं ने एक "सुधार" रणनीति का परीक्षण किया। उन्होंने उन संदेशों को लिया जिन्हें AI ने गलत समझा था, उन्हें AI को दिखाया, और कहा, "हे, आपने यहाँ गलती की; यह सही उत्तर है। फिर से प्रयास करें।"

  • कार्य 1 (संघनन/Condensation): इससे कोई मदद नहीं मिली। यह एक छात्र को एक गलत उत्तर दिखाकर सिखाने जैसा था; वे अन्य प्रश्नों के बारे में बस भ्रमित हो गए।
  • कार्य 2 (ज्वालामुखी/Volcano): इससे मदद मिली! AI के स्कोर में सुधार हुआ। यह एक छात्र को उस विषय पर एक विशिष्ट अभ्यास क्विज़ देने जैसा है जिसे उसने मिस किया था; उसने इससे सीखा।

निचोड़: AI एक "को-पायलट" है, पायलट नहीं

पेपर यह निष्कर्ष निकालता है कि ChatGPT सहयोगी चैट्स को ग्रेड करने की प्रक्रिया को तेज करने के लिए एक शानदार उपकरण है, लेकिन यह पूरी तरह से मनुष्यों को बदलने के लिए तैयार नहीं है।

  • इसे इस तरह सोचें: यदि आप 1,000 निबंधों को ग्रेड कर रहे हैं, तो आप हर एक शब्द खुद नहीं पढ़ना चाहते। आप AI को पहले पढ़ने देते हैं और फिर उन्हें "अच्छा," "ठीक," और "सुधार की आवश्यकता" में वर्गीकृत करने देते हैं। फिर, एक मानव विशेषज्ञ केवल कठिन वाले हिस्सों की दोबारा जाँच करता है।
  • सावधानी: आपको इस बात पर ध्यान देना होगा कि आप AI से कैसे पूछते हैं। आपको एक स्पष्ट, व्यावहारिक नियम पुस्तिका की आवश्यकता है, और आपको यह मान लेना चाहिए कि नवीनतम, सबसे महंगी AI मॉडल स्वतः ही सबसे अच्छा नहीं होगा।

संक्षेप में: अब हम AI का उपयोग यह समझने के लिए कर सकते हैं कि लोग एक साथ कैसे काम करते हैं, जिसका अर्थ है कि हम बिना बहुत अधिक खर्च किए "21वीं सदी के कौशल" का बड़े पैमाने पर परीक्षण कर सकते हैं। लेकिन हमें अभी भी स्टीयरिंग व्हील थामे रखने के लिए मानव विशेषज्ञों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →