← नवीनतम पेपर
💬 NLP

Using Human-LLM Disagreement to Improve Checklist-Based Quality Appraisal

यह शोध पत्र यह प्रदर्शित करता है कि चेकलिस्ट-आधारित गुणवत्ता मूल्यांकन पर मानव-LLM के बीच असहमति का विश्लेषण अस्पष्ट मानदंडों की पहचान कर सकता है, और इन मदों को संशोधित करना अध्ययनों की सापेक्ष रैंकिंग को संरक्षित करते हुए सहमति में महत्वपूर्ण सुधार करता है, जिससे अधिक विश्वसनीय LLM-सहायता प्राप्त अनुसंधान संश्लेषण वर्कफ़्लो को समर्थन मिलता है।

मूल लेखक: Timo van der Kuil (Methodology and Statistics Utrecht University), Bruno Messina Coimbra (Methodology and Statistics Utrecht University), Mirjam van Zuiden (Clinical Psychology Utrecht University), Ro
प्रकाशित 2026-08-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Timo van der Kuil (Methodology and Statistics Utrecht University), Bruno Messina Coimbra (Methodology and Statistics Utrecht University), Mirjam van Zuiden (Clinical Psychology Utrecht University), Robert A. Bagheri (Methodology and Statistics Utrecht University), Rens van de Schoot (Methodology and Statistics Utrecht University), Klaas Dieleman (Methodology and Statistics Utrecht University), Berend Greijn (Methodology and Statistics Utrecht University), Stefan Houkes (Methodology and Statistics Utrecht University), Sebastiaan Rodenhuis (Methodology and Statistics Utrecht University), Elizabeth M. Grandfield (Methodology and Statistics Utrecht University)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हर साल, विज्ञान की दुनिया नए शोध की बाढ़ ला देती है, जिससे उन लोगों के लिए एक चुनौती पैदा हो जाती है जो इसका अर्थ निकालने की कोशिश करते हैं। जब वैज्ञानिक किसी विषय की पूरी तस्वीर को समझना चाहते हैं, तो वे एक व्यवस्थित समीक्षा (सिस्टमैटिक रिव्यू) करते हैं, एक ऐसी प्रक्रिया जिसमें किसी विषय पर मौजूद हर प्रासंगिक अध्ययन को इकट्ठा करना और यह जांचना शामिल है कि प्रत्येक अध्ययन कितनी अच्छी तरह किया गया था। यह गुणवत्ता जांच महत्वपूर्ण है क्योंकि यह विश्वसनीय निष्कर्षों को त्रुटिपूर्ण निष्कर्षों से अलग करती है, लेकिन यह अविश्वसनीय रूप से धीमी और मानसिक रूप से थका देने वाली भी है। विशेषज्ञों को घने विवरणों को पढ़ना पड़ता है और यह तय करना पड़ता है कि क्या शोधकर्ताओं ने नियमों का पालन किया है, एक ऐसा कार्य जिसमें एक अध्ययन में एक घंटा लग सकता है और थकान होने पर इसमें गलतियों की संभावना रहती है। हाल ही में, बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) के रूप में शक्तिशाली कंप्यूटर प्रोग्राम इस काम के लिए संभावित सहायकों के रूप में उभरे हैं। ये प्रोग्राम टेक्स्ट को पढ़ और समझ सकते हैं, जिससे एक आशाजनक विचार सामने आया है: क्या एक कंप्यूटर अध्ययन की गुणवत्ता की जांच करने के इस उबाऊ काम को अपने हाथ में ले सकता है? हालांकि, केवल एक चेकलिस्ट कंप्यूटर को सौंप देना पर्याप्त नहीं है। यदि चेकलिस्ट के प्रश्न अस्पष्ट या भ्रमित करने वाले हैं, तो एक स्मार्ट कंप्यूटर भी सही उत्तर देने के लिए संघर्ष करेगा, ठीक वैसे ही जैसे एक इंसान करता है।

शोधकर्ताओं की एक टीम ने इस विचार का परीक्षण करने और, अधिक महत्वपूर्ण रूप से, यह देखने के लिए कि वे कंप्यूटर और मानव विशेषज्ञों के बीच बेहतर तालमेल कैसे बना सकते हैं, हाथ बढ़ाया। उन्होंने 'ग्रोल्ट्स' (GRoLTS) नामक नियमों के एक विशिष्ट सेट पर ध्यान केंद्रित किया, जिसका उपयोग उन अध्ययनों को आंकने के लिए किया जाता है जो समय के साथ लोगों के समूहों में होने वाले परिवर्तनों को ट्रैक करते हैं। शोधकर्ताओं ने पहले कई अलग-अलग कंप्यूटर मॉडलों से ट्रैमा (आघात) के वास्तविक अध्ययनों के संग्रह पर इन नियमों को लागू करने के लिए कहा, जबकि मानव विशेषज्ञों ने पहले ही उन्हीं अध्ययनों को ग्रेड दिया था। उन्होंने पाया कि कंप्यूटर पूर्ण नहीं थे; वे कुछ प्रश्नों पर मनुष्यों के साथ सहमत थे लेकिन अन्य पर अक्सर असहमत थे। ये असहमति यादृच्छिक (रैंडम) नहीं थीं। वे तब सबसे अधिक हुईं जब चेकलिस्ट का कोई आइटम इस तरह से लिखा गया था जिससे कई व्याख्याएं संभव थीं, जैसे कि यह पूछना कि क्या कुछ चीज़ "सभी" मॉडलों के लिए की गई थी जबकि अध्ययन ने केवल कुछ पर ही रिपोर्ट दी थी, या ऐसे व्यापक शब्दों का उपयोग करना जिन्हें स्पष्ट रूप से पकड़ना कठिन हो। कंप्यूटर अक्सर एक साक्ष्य पाता और "हाँ" कहता, जबकि मानव विशेषज्ञ, एक सख्त मानक की तलाश में, "नहीं" कहता।

इन त्रुटियों को केवल स्वीकार करने के बजाय, शोधकर्ताओं ने चेकलिस्ट को स्वयं ठीक करने के लिए इन असहमतियों का उपयोग एक मानचित्र (मैप) के रूप में किया। उन्होंने भ्रमित करने वाले प्रश्नों को लिया और उन्हें अधिक स्पष्ट और विशिष्ट बनाने के लिए फिर से लिखा। उन्होंने जटिल प्रश्नों को, जो एक साथ दो चीजें पूछते थे, अलग-अलग सरल प्रश्नों में तोड़ दिया। उन्होंने "यदि-तो" वाले परिदृश्यों को हटा दिया जिनमें अनुमान लगाने की आवश्यकता थी और अस्पष्ट शब्दों को हटाने के स्थान पर उन ठोस उदाहरणों को रखा कि क्या देखना है। एक बार जब उन्होंने अपना बेहतर, दूसरा संस्करण तैयार कर लिया, तो उन्होंने कंप्यूटरों और मानव विशेषज्ञों से अध्ययनों को फिर से ग्रेड करने के लिए कहा। परिणामों ने एक स्पष्ट सुधार दिखाया। कंप्यूटर और मनुष्य नए संस्करण पर बहुत अधिक सहमत हुए। वह भ्रम जिसने कंप्यूटर को लड़खड़ाने पर मजबूर किया था, काफी हद तक समाप्त हो गया था। इससे भी महत्वपूर्ण बात यह है कि शोधकर्ताओं ने पाया कि कंप्यूटर अभी भी अध्ययनों को सर्वश्रेष्ठ से निम्नतम क्रम में छांटने में बहुत अच्छे थे, भले ही उन्होंने व्यक्तिगत प्रश्नों पर कुछ छोटी गलतियाँ की हों। इसका मतलब है कि एक कंप्यूटर शोधकर्ताओं को यह प्राथमिकता देने में विश्वसनीय रूप से मदद कर सकता है कि उन्हें पहले किन अध्ययनों को देखना चाहिए, जब तक कि वे जिन नियमों का पालन कर रहे हैं वे स्पष्ट रूप से लिखे गए हों।

यह अध्ययन सुझाव देता है कि वैज्ञानिक समीक्षा के लिए कृत्रिम बुद्धिमत्ता (AI) को उपयोगी बनाने की कुंजी केवल एक स्मार्ट कंप्यूटर प्रोग्राम चुनना नहीं है, बल्कि उसके उत्तर देने के लिए बेहतर प्रश्न डिजाइन करना है। जब नियम संदिग्ध होते हैं, तो मानव और मशीन दोनों संघर्ष करते हैं, लेकिन जब नियम सटीक होते हैं, तो मशीनें विश्वसनीय साथी बन जाती हैं। शोधकर्ता यह नहीं पा सके कि कंप्यूटर पूरी तरह से मानव विशेषज्ञों की जगह ले सकते हैं, क्योंकि कुछ कठिन प्रश्नों के लिए अभी भी मानवीय निर्णय की आवश्यकता थी। इसके बजाय, उन्होंने दिखाया कि कंप्यूटर और मानव के बीच असहमति का विश्लेषण करके, वे अपने उपकरणों की कमजोरियों को पहचान सकते थे और उन्हें ठीक कर सकते थे। यह दृष्टिकोण एक बेमेल स्थिति को सुधार के एक उपकरण में बदल देता है, जो यह सुझाव देता है कि वैज्ञानिक समीक्षा का भविष्य एक ऐसी साझेदारी में निहित है जहाँ कंप्यूटर स्पष्ट कार्यों को संभालते हैं और मनुष्य जटिल कार्यों पर ध्यान केंद्रित करते हैं, जो ऐसे चेकलिस्ट द्वारा निर्देशित होते हैं जो दोनों को समझने के लिए डिज़ाइन किए गए हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →