Evaluating AI Text Detection Accuracy: A Structured Review of False Positives, False Negatives, and Implications for Academic Integrity Policy in Gulf Region Universities
एआई टेक्स्ट डिटेक्शन टूल्स की यह संरचित समीक्षा यह प्रकट करती है कि उनकी उच्च फाल्स पॉजिटिव दरें, विशेष रूप से खाड़ी विश्वविद्यालयों के गैर-नेटिव अंग्रेजी और अरबी-अंग्रेजी द्विभाषी छात्रों के लिए, उन्हें अनुशासनात्मक प्रवर्तन के लिए अविश्वसनीय बनाती हैं और तत्काल नीतिगत सुधार को आवश्यक बनाती हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक विश्वविद्यालय में, लिखित निबंध सीखने का एक आधार बना हुआ है, जो छात्रों को अपनी समझ और आवाज़ प्रदर्शित करने का एक तरीका है। दशकों तक, इस प्रणाली के लिए प्राथमिक खतरा साहित्यिक चोरी (plagiarism) था, जहाँ एक छात्र किसी दूसरे के काम की नकल करता था। आज, एक नई चुनौती उभर कर आई है: आर्टिफिशियल इंटेलिजेंस। ये कंप्यूटर प्रोग्राम अब लगभग किसी भी विषय पर कुछ ही सेकंडों में धाराप्रवाह, व्याकरण की दृष्टि से सही निबंध लिख सकते हैं। इसके जवाब में, विश्वविद्यालयों ने डिजिटल उपकरणों को अपनाने की जल्दबाजी की है जो गेटकीपर के रूप में कार्य करने के लिए डिज़ाइन किए गए हैं, जो छात्र द्वारा जमा किए गए टेक्स्ट को स्कैन करके यह संकेत देते हैं कि क्या वह किसी मशीन द्वारा तैयार किया गया है। ये उपकरण भाषा के सांख्यिकीय पैटर्न का विश्लेषण करके काम करते हैं, और उन सूक्ष्म निशानों (fingerprints) की तलाश करते हैं जो मानव लेखन और कंप्यूटर-जनित टेक्स्ट के बीच अंतर स्पष्ट करते हैं। दांव बहुत ऊंचे हैं। यदि कोई उपकरण गलती करता है और एक ईमानदार छात्र पर कदाचार का आरोप लगाता है, तो उस छात्र को फेल होने, निलंबन या यहाँ तक कि निष्कासन का सामना करना पड़ सकता है। यदि यह उल्लंघनकर्ता को पकड़ने में विफल रहता है, तो डिग्री का मूल्य सभी के लिए कम हो जाता है। शिक्षाविदों के सामने प्रश्न यह है कि क्या ये डिजिटल गेटकीपर इतने विश्वसनीय हैं कि ऐसे जीवन बदलने वाले निर्णय ले सकें।
साक्ष्यों की एक हालिया समीक्षा, जो विशेष रूप से खाड़ी सहयोग परिषद (GCC) क्षेत्र के विश्वविद्यालयों पर केंद्रित है, यह सुझाव देती है कि वर्तमान तकनीक इस काम के लिए बिल्कुल तैयार नहीं है। शोधकर्ता, जो बहरीन विश्वविद्यालय के एक कंप्यूटर इंजीनियरिंग विद्वान हैं, ने पांच सबसे व्यापक रूप से उपयोग किए जाने वाले AI डिटेक्शन प्लेटफॉर्म के प्रदर्शन का परीक्षण किया। इस समीक्षा ने 2022 के अंत और 2026 की शुरुआत के बीच आयोजित स्वतंत्र अध्ययनों के निष्कर्षों को संकलित किया, जो इन उपकरणों के तीव्र उदय और विकास के काल को कवर करता है। केंद्रीय खोज अत्यंत स्पष्ट है: सबसे बड़े स्वतंत्र परीक्षणों में, एक भी डिटेक्शन टूल 80 प्रतिशत की सटीकता दर प्राप्त नहीं कर सका। इसका अर्थ यह है कि सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियाँ भी हर पांच में से एक से अधिक मामलों में टेक्स्ट की उत्पत्ति की सही पहचान करने में विफल रहीं। इसके अलावा, समीक्षा में पाया गया कि ये उपकरण सभी छात्रों के प्रति समान रूप से निष्पक्ष नहीं हैं। ऐसा प्रतीत होता है कि वे गैर-अंग्रेजी भाषी बोलने वालों के लेखन को AI-जनित टेक्स्ट समझने की गलती करने की अधिक संभावना रखते हैं। यह खाड़ी विश्वविद्यालयों के लिए एक गंभीर मुद्दा है, जहाँ अधिकांश छात्र अरबी भाषी हैं जो अपना शैक्षणिक कार्य अंग्रेजी में द्वितीय या तृतीय भाषा के रूप में लिखते हैं।
समीक्षा इन उपकरणों के कार्य करने के तरीके में एक विशिष्ट और खतरनाक दोष को उजागर करती है। वे अक्सर "परप्लेक्सिटी" (perplexity) को मापने पर निर्भर करते हैं, जो अनिवार्य रूप से इस बात का आकलन करता है कि लेखन कितना अनुमानित (predictable) है। कंप्यूटर प्रोग्राम अक्सर सबसे सामान्य, अपेक्षित शब्दों को चुनते हैं, जिससे उनका लेखन अत्यधिक अनुमानित और कम परप्लेक्सिटी वाला हो जाता है। इसके विपरीत, मानव लेखक अक्सर आश्चर्यजनक या रचनात्मक विकल्प चुनते हैं। हालाँकि, समीक्षा बताती है कि गैर-अंग्रेजी भाषी भी सरल, अधिक अनुमानित शब्दावली और वाक्य संरचनाओं का उपयोग करते हैं क्योंकि वे अभी भाषा सीख रहे होते हैं। फलस्वरूप, ये उपकरण दूसरे भाषा के शिक्षार्थी की स्वाभाविक सीमाओं को कंप्यूटर के सांख्यिकीय हस्ताक्षर के रूप में गलत समझ लेते हैं। गैर-अंग्रेजी भाषियों के निबंधों से जुड़े एक व्यापक रूप से उद्धृत अध्ययन में, डिटेक्टरों ने औसतन 61.2 प्रतिशत वास्तविक मानव लेखन को गलती से AI-जनित के रूप में चिह्नित किया। इसके विपरीत, मूल अंग्रेजी भाषियों द्वारा लिखे गए निबंधों को शायद ही कभी चिह्नित किया गया। जबकि इस पूर्वाग्रह की पुष्टि कुछ भाषाओं में की गई है, समीक्षा बताती है कि अभी तक किसी भी अध्ययन ने विशेष रूप से अरबी-अंग्रेजी द्विभाषी लेखकों पर इन उपकरणों का परीक्षण नहीं किया है, जिससे खाड़ी के विश्वविद्यालयों को ऐसे डेटा के आधार पर अनुशासनात्मक निर्णय लेने पड़ रहे हैं जो उनके छात्र समूह पर लागू नहीं होता है।
इन त्रुटियों के परिणाम समान रूप से वितरित नहीं होते हैं। समीक्षा एक "डिटेक्शन पैराडॉक्स" (पहचान का विरोधाभास) का वर्णन करती है जहाँ ये उपकरण कम परिष्कृत उपयोगकर्ताओं को पकड़ने की अधिक संभावना रखते हैं। एक छात्र जो बिना बदलाव के AI टेक्स्ट को सीधे कॉपी और पेस्ट करता है, उसे पकड़ना आसान है। हालाँकि, एक छात्र जो निबंध का मसौदा तैयार करने के लिए AI का उपयोग करता है और फिर इसे मानवीय बनाने के लिए सावधानीपूर्वक पुनर्गठित (rewrite) करता है, वह आसानी से पहचान से बच सकता है। जब टेक्स्ट को संशोधित किया जाता है, तो इन उपकरणों की सटीकता तेजी से गिर जाती है; एक प्रमुख मूल्यांकन में, दूसरे कंप्यूटर प्रोग्राम द्वारा पैराफ्रेज (paraphrase) किए जाने के बाद AI-जनित टेक्स्ट को पकड़ने की क्षमता घटकर केवल 26 प्रतिशत रह गई। यह एक ऐसी प्रणाली बनाता है जो उन ईमानदार छात्रों को दंडित करती है जिनके पास अपनी लेखन शैली को छिपाने का तकनीकी कौशल नहीं है, जबकि परिष्कृत उल्लंघनकर्ताओं को बिना पकड़े जाने देता है। समीक्षा यह भी नोट करती है कि तकनीक अस्थिर है। जैसे-जैसे टेक्स्ट उत्पन्न करने वाले आर्टिफिशियल इंटेलिजेंस प्रोग्राम बेहतर होते जाते हैं, उन्हें पकड़ने के लिए डिज़ाइन किए गए उपकरण कम सटीक होते जाते हैं, जिससे एक ऐसा लक्ष्य बनता है जिसका पीछा संस्थान विश्वसनीयता से नहीं कर सकते।
इन निष्कर्षों को देखते हुए, यह पत्र तर्क देता है कि AI डिटेक्शन स्कोर को शैक्षणिक कदाचार के प्राथमिक साक्ष्य के रूप में उपयोग करना अनुचित है, विशेष रूप से खाड़ी क्षेत्र में। लेखक विश्वविद्यालयों के लिए एक नया ढांचा प्रस्तावित करता है जो इन त्रुटिपूर्ण स्कोर पर निर्भर रहने से दूर जाता है। उच्च संभाव्यता स्कोर (probability score) को कदाचार के प्रमाण के रूप में मानने के बजाय, समीक्षा का सुझाव है कि ऐसे स्कोर केवल एक मानव-नेतृत्व वाली जांच को ट्रिगर करने चाहिए। इस जांच में छात्र के काम के पूरे पोर्टफोलियो को देखा जाएगा, उनके लेखन की तुलना व्यक्तिगत रूप से दी गई परीक्षा के पेपरों से की जाएगी, और उनकी प्रक्रिया को समझने के लिए छात्र के साथ बातचीत की जाएगी। समीक्षा मूल्यांकन के पूर्ण पुनर्गठन का भी आह्वान करती है, जो आसानी से AI द्वारा जनरेट किए जा सकने वाले निबंधों से हटकर उन कार्यों की ओर बढ़े जो व्यक्तिगत अनुभव, मौखिक रक्षा (oral defense) और कक्षा में लेखन की मांग करते हैं। जब तक स्वतंत्र अध्ययन यह सिद्ध नहीं कर देते कि ये उपकरण अरबी-अंग्रेजी द्विभाषी छात्रों के लिए सटीक रूप से काम करते हैं, तब तक समीक्षा का निष्कर्ष है कि विश्वविद्यालयों को इन उपकरणों को अविश्वसनीय मानना चाहिए और स्वचालित संदेह के बजाय निष्पक्ष, मानव-केंद्रित प्रक्रियाओं को प्राथमिकता देनी चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।