A Multi-Layered Plagiarism and AI-Generated Content Detection Framework Integrating BERT-BiLSTM-Attention Encoding with Stylometric Analysis
यह शोध पत्र एक व्यापक, बहु-स्तरीय ढांचे का प्रस्ताव करता है जो सटीक मिलान, पैराफ्रेज किए गए साहित्यिक चोरी (plagiarism), मोज़ेक कॉपी करने और एआई-जनित सामग्री का मजबूती से पता लगाने के साथ-साथ दस्तावेजों के भीतर असंगत लेखकत्व की पहचान करने के लिए BERT-BiLSTM-Attention एन्कोडिंग, सिमेंटिक एम्बेडिंग, n-ग्राम फिंगरप्रिंटिंग और शैली संबंधी विश्लेषण को एकीकृत करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अकादमिक जगत के शांत कोनों में, एक मौलिक विश्वास की परीक्षा ली जा रही है। सदियों से, विद्वत्ता की अखंडता इस सरल धारणा पर टिकी रही है कि एक लेखक के शब्द उसके अपने होते हैं, जो लेखक और पाठक के बीच एक अनुबंध है। लेकिन वह अनुबंध एक साथ दो दिशाओं से दबाव झेल रहा है। एक ओर, बिना श्रेय दिए किसी और के विचारों को चुराने की पुरानी लालसा है, कभी शब्दों को ज्यों का त्यों कॉपी करके, तो कभी चोरी को छिपाने के लिए वाक्यों को पुनर्व्यवस्थित करके और पर्यायवाची शब्दों को बदलकर। दूसरी ओर, एक नई शक्ति उभर कर आई है: आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता)। ये शक्तिशाली कंप्यूटर प्रोग्राम अब ऐसे पैराग्राफ लिख सकते हैं जो उल्लेखनीय रूप से मानवीय लगते हैं, जिससे यह बताना मुश्किल हो जाता है कि इंसान के विचार कहाँ समाप्त होते हैं और मशीन के कहाँ शुरू होते हैं। शिक्षकों और संपादकों के लिए चुनौती अब केवल कॉपी किए गए टेक्स्ट को खोजना नहीं रह गई है; बल्कि यह पहचानना है कि क्या कोई छात्र लिखने में संघर्ष कर रहा है, या वह कदाचार कर रहा है, या वह केवल एक ऐसे उपकरण का उपयोग कर रहा है जो उसके लिए लिख रहा है।
इस चुनौती से निपटने के लिए, केरल के गवर्नमेंट कॉलेज चित्तूर के एक शोधकर्ता विनीश वी ने एक नए प्रकार के डिजिटल निरीक्षक का निर्माण किया है। यह प्रणाली बेईमानी को खोजने के लिए किसी एक ही तरकीब पर निर्भर नहीं रहती। इसके बजाय, यह एक बहु-स्तरीय छलनी की तरह कार्य करती है, जिसे एक साथ लेखन की विभिन्न समस्याओं को पकड़ने के लिए डिज़ाइन किया गया है। इस नए उपकरण का मूल एक परिष्कृत टेक्स्ट-रीडिंग पद्धति है जो केवल वर्तनी को नहीं, बल्कि अर्थ को समझती है। यह एक डीप लर्निंग आर्किटेक्चर का उपयोग करता है जो तीन शक्तिशाली तकनीकों को जोड़ता है: एक प्रणाली जो प्रत्येक शब्द के संदर्भ को समझती है, एक मेमोरी नेटवर्क जो यह ट्रैक करता है कि वाक्य एक से दूसरे तक कैसे प्रवाहित होते हैं, और एक अटेंशन मैकेनिज्म जो यह सीखता है कि वाक्य के कौन से हिस्से सबसे महत्वपूर्ण हैं। इन विधियों को मिलाकर, प्रणाली प्रत्येक वाक्य के लिए एक अनूठा डिजिटल फिंगरप्रिंट बनाती है, जो केवल उसकी सतही उपस्थिति के बजाय लेखन की गहरी संरचना को पकड़ती है।
यह प्रणाली अकादमिक अखंडता की रक्षा के लिए चार विशिष्ट कार्य करती है। पहला, यह सटीक प्रतियों (exact copies) की तलाश करती है, जो ज्ञात स्रोतों से मेल खाते हों या लगभग समान हों। दूसरा, यह पैराफ्रेसिंग (paraphrasing) को खोजती है, जहाँ अर्थ वही रहता है लेकिन शब्द बदल दिए जाते हैं। ऐसा करने के लिए, यह वाक्यों के "सिमेंटिक" (अर्थ संबंधी) अर्थ की तुलना करती है—अनिवार्य रूप से यह पूछती है कि क्या दो वाक्य एक ही बात कहते हैं भले ही वे अलग शब्दों का उपयोग करते हों। तीसरा, यह मोज़ेक साहित्यिक चोरी (mosaic plagiarism) का पता लगाती है, जो लेखन का एक जटिल रूप है जहाँ एक लेखक विभिन्न स्रोतों से छोटे वाक्यांशों को जोड़कर उधार लिए गए विचारों का एक 'पैचवर्क' तैयार करता है। अंत में, और शायद सबसे आवश्यक रूप से, यह उस टेक्स्ट को चिह्नित करती है जो आर्टिफिशियल इंटेलिजेंस द्वारा उत्पन्न प्रतीत होता है। पुराने टूल्स के विपरीत, जिन्हें हर बार नया AI मॉडल आने पर फिर से प्रशिक्षित करने की आवश्यकता हो सकती है, यह प्रणाली मशीन-लिखित टेक्स्ट को पहचानने के लिए बारह सांख्यिकीय संकेतों का उपयोग करती है। यह उन पैटर्न को देखती है जैसे कि वाक्यों की लंबाई कितनी विविध है, लेखक 'however' या 'moreover' जैसे संक्रमण शब्दों का कितनी बार उपयोग करता है, और शब्दावली कितनी विविध है। इसने सीखा है कि मानवीय लेखन अधिक अप्रत्याशित और विविध होता है, जबकि मशीन लेखन अक्सर एक सुचारू, अधिक एकसमान लय का पालन करता है।
इस नए ढांचे के वास्तव में काम करने की पुष्टि करने के लिए, शोधकर्ता ने केवल सिद्धांत पर भरोसा नहीं किया। उन्होंने सिंथेटिक दस्तावेजों का उपयोग करके एक कठोर परीक्षण आधार बनाया—जो कंप्यूटर-जनित टेक्स्ट हैं जिनमें ज्ञात रहस्य छिपे हैं। उन्होंने ऐसी कहानियाँ बनाईं जो पूरी तरह से मौलिक थीं, कुछ जो सटीक प्रतियाँ थीं, कुछ जिन्हें पुनर्गठित किया गया था, और कुछ जो स्पष्ट रूप से AI द्वारा लिखी गई थीं। उन्होंने यहाँ तक कि ऐसे दस्तावेज़ भी बनाए जिनमें इन सभी प्रकारों का मिश्रण था ताकि यह देखा जा सके कि क्या सिस्टम इस उलझन को सुलझा सकता है। परिणाम स्पष्ट थे। सिस्टम ने सटीक प्रतियों की सफलतापूर्वक पहचान की, पैराफ्रेज किए गए अनुभागों को पकड़ा, और पैचवर्क लेखन का पता लगाया। AI-जनित टेक्स्ट का सामना करते समय, इसने प्रशिक्षण के आधार पर लेखन को मशीन-निर्मित के रूप में सही ढंग से चिह्नित किया। महत्वपूर्ण रूप से, सिस्टम ने वास्तविक दुनिया के दस्तावेजों की जटिल वास्तविकता को संभालने की क्षमता भी सिद्ध की। इसने छोटे टेक्स्ट, लंबे टेक्स्ट और यहाँ तक कि अजीब प्रतीकों या संख्याओं वाले टेक्स्ट को भी बिना क्रैश हुए प्रोसेस किया। इसने दिखाया कि यह एक ही टेस्ट को दो बार चला सकता है और बिल्कुल वही परिणाम दे सकता है, जो गंभीर अकादमिक जांचों में उपयोग किए जाने वाले किसी भी उपकरण के लिए एक अनिवार्य गुण है।
इस ढांचे की सबसे दिलचस्प क्षमताओं में से एक यह नोटिस करने की क्षमता है कि क्या कोई एकल दस्तावेज़ एक से अधिक व्यक्ति द्वारा लिखा गया प्रतीत होता है। प्रत्येक वाक्य की लेखन शैली का विश्लेषण करके, सिस्टम उन्हें समूहों (clusters) में विभाजित कर सकता है। यदि कोई दस्तावेज़ एक मानवीय शैली से शुरू होता है, मशीन जैसी शैली में बदल जाता है, और फिर वापस बदल जाता है, तो सिस्टम इन परिवर्तनों को चिह्नित करता है। यह एक प्रशिक्षक को न केवल यह देखने की अनुमति देता है कि कोई पेपर संदिग्ध है, बल्कि यह भी कि विसंगति ठीक कहाँ है। परीक्षण ने दिखाया कि सिस्टम शैली के इन बदलावों की पहचान कर सकता है, जिससे एक विस्तृत विवरण मिलता है कि दस्तावेज़ के कौन से हिस्से मूल थे, कौन से कॉपी किए गए थे, और कौन से कंप्यूटर द्वारा उत्पन्न किए गए हो सकते थे।
अध्ययन इस निष्कर्ष पर पहुँचता है कि यह बहु-स्तरीय दृष्टिकोण एक मजबूत मार्ग प्रदान करता है। लेखन शैली के गहन सिमेंटिक समझ और सांख्यिकीय विश्लेषण को जोड़कर, यह प्रणाली अखंडता का एक सुरक्षा जाल बनाती है जो बेईमानी के कई रूपों को पकड़ लेती है। यह दावा नहीं करता कि यह पूर्ण है; शोधकर्ता नोट करते हैं कि परीक्षण सिंथेटिक डेटा पर किए गए थे और यह टूल वर्तमान में केवल अंग्रेजी टेक्स्ट के साथ काम करता है। हालाँकि, परिणाम बताते हैं कि यह ढांचा एक ऐसे भविष्य की ओर एक महत्वपूर्ण कदम है जहाँ अकादमिक अखंडता को बनाए रखा जा सकता है, भले ही लेखन उपकरण कितने भी शक्तिशाली क्यों न हो जाएं। यह किसी लेखन के टुकड़े को देखने और उसके वास्तविक मूल को समझने का एक तरीका प्रदान करता है, जो मानवीय आवाज को मशीन से और ईमानदार प्रयास को उधार लिए गए प्रयास से अलग करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।