← नवीनतम पेपर
💻 computer science

Benchmarking Stylometric Metrics for AI Authorship Verification: A Glass-Box Forensic Framework Across Language Models

यह शोध पत्र एक पारदर्शी "ग्लास-बॉक्स" फॉरेंसिक ढांचे का प्रस्ताव करता है जो चालीस व्याख्यात्मक शैलीमितीय (stylometric) मापदंडों का उपयोग करके यह प्रदर्शित करता है कि, शाब्दिक अभिसरण (lexical convergence) के बावजूद, विविध डेटासेट में मानव और एआई-जनित पाठ के बीच सूचना-सैद्धांतिक पूर्वानुमेयता, संरचनात्मक गुणों और प्राकृतिक परिवर्तनशीलता में स्पष्ट और बढ़ते अंतर बने रहते हैं, जो लेखकत्व सत्यापन के लिए एक सुदृढ़ आधार प्रदान करते हैं।

मूल लेखक: Abhay Srivastava, Lovish Bhatia, V.S. Pandey, Ajay K. Sharma

प्रकाशित 2026-09-23✓ Author reviewed ⓘ
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhay Srivastava, Lovish Bhatia, V.S. Pandey, Ajay K. Sharma

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा के शांत कोनों में, प्रत्येक लेखक एक अद्वितीय छाप छोड़ जाता है। यही 'स्टाइलोमेट्री' (stylometry) का मूल विचार है, एक ऐसा क्षेत्र जिसने लंबे समय से इस बात का अध्ययन किया है कि लोग न केवल यह कि वे क्या कहते हैं, बल्कि यह भी कि वे उसे कैसे कहते हैं। मनुष्यों में अनजाने में कुछ आदतें होती हैं: उनके वाक्यों की लंबाई, उनके विराम चिह्नों की लय, उनके द्वारा चुने गए शब्दों की विविधता, और उनके विचारों को संरचित करने का तरीका। दशकों तक, भाषाविदों ने गुमनाम पत्रों या विवादित ऐतिहासिक ग्रंथों के लेखकों की पहचान करने के लिए इन सूक्ष्म पैटर्न का उपयोग किया है। आज, एक नई चुनौती उभर कर आई है। शक्तिशाली कृत्रिम बुद्धिमत्ता (AI) प्रणालियाँ अब ऐसा पाठ उत्पन्न कर सकती हैं जो उल्लेखनीय रूप से मानवीय लगता है, जिससे एक व्यक्ति की आवाज़ और मशीन के आउटपुट के बीच की रेखा धुंधली हो जाती है। यह क्षमता स्कूलों, अदालतों और समाचार कक्षों के लिए गंभीर प्रश्न खड़े करती है: जब कोई लेखन सामने आता है, तो हम कैसे जान सकते हैं कि इसे किसी इंसान ने लिखा है या कंप्यूटर द्वारा उत्पन्न किया गया है? इसमें शैक्षणिक अखंडता, बौद्धिक संपदा और गलत सूचनाओं के प्रसार जैसे उच्च जोखिम शामिल हैं।

नेशनल इंस्टीट्यूट ऑफ टेक्नोलॉजी दिल्ली के शोधकर्ताओं की एक टीम ने इस समस्या के लिए एक नया दृष्टिकोण अपनाया है। केवल यह अनुमान लगाने वाले जटिल, अपारदर्शी कंप्यूटर प्रोग्रामों पर निर्भर रहने के बजाय, जो यह बताते हैं कि पाठ वास्तविक है या नकली, उन्होंने मानव और मशीन लेखन के बीच विशिष्ट अंतरों को मापने के लिए एक पारदर्शी, चरण-दर-चरण ढांचा तैयार किया। उन्होंने इसे "ग्लास-बॉक्स" (glass-box) विधि कहा, जिसका अर्थ है कि विश्लेषण का प्रत्येक चरण दृश्यमान और समझने योग्य है, उन "ब्लैक-बॉक्स" प्रणालियों के विपरीत जो अपने तर्क को छिपा देती हैं। शोधकर्ताओं ने पाठ के दो विशाल संग्रहों का परीक्षण किया: एक जिसमें नियंत्रित शैक्षणिक निबंध थे और दूसरा जिसमें इंटरनेट से प्राप्त विविध, वास्तविक दुनिया के लेखन को शामिल किया गया था, जिसमें नवीनतम, सबसे उन्नत 'रीजनिंग मॉडल्स' (reasoning models) की सामग्री भी शामिल थी। लेखन की चालीस अलग-अलग विशेषताओं को मापने के बाद, उन्होंने पाया कि जबकि कृत्रिम बुद्धिमत्ता मानव शब्दावली की नकल करने में बेहतर हो रही है, वह साथ ही साथ अपनी संरचना में अधिक कठोर और पूर्वानुमेय (predictable) होती जा रही है।

शोधकर्ताओं ने अपने चालीस मापन उपकरणों का परीक्षण सबसे पहले केवल मानव लेखन पर किया ताकि उपकरण विश्वसनीय हों। उन्होंने मानव-लिखित ग्रंथों को दो समूहों में विभाजित किया और यह जांचा कि क्या उपकरण उनके बीच कोई अंतर पा सकते हैं। परिणाम यह था कि उपकरणों ने लगभग कोई अंतर नहीं पाया, जिससे यह सिद्ध हुआ कि मानव लेखन विषय या विशिष्ट लेखक के बावजूद एक सुसंगत, प्राकृतिक आकार बनाए रखता है। इसने एक स्थिर आधार रेखा (baseline) स्थापित की। जब उन्होंने फिर से इन समान उपकरणों को मानव लेखन की तुलना कृत्रिम बुद्धिमत्ता द्वारा उत्पन्न पाठ से करने के लिए लागू किया, तो स्पष्ट पैटर्न उभर कर आए। नियंत्रित शैक्षणिक परिवेश में, सबसे बड़े अंतर शब्दों के समग्र वितरण और पाठ की पूर्वानुमेयता में दिखाई दिए। मशीन-जनित पाठ मानव लेखन की तुलना में सांख्यिकीय रूप से अधिक पूर्वानुमेय था, और उपयोग किए गए शब्दों की विविधता भी भिन्न थी।

हालाँकि, कहानी तब और जटिल हो गई जब शोधकर्ताओं ने नवीनतम 'रीजनिंग मॉडल्स' वाले नए, अधिक विविध डेटासेट को देखा। ये वे प्रणालियाँ हैं जिन्हें उत्तर देने से पहले समस्याओं को चरण-दर-चरण सोचने के लिए डिज़ाइन किया गया है। यहाँ, शोधकर्ताओं ने एक विरोधाभास पाया। कृत्रिम बुद्धिमत्ता मानव भाषा की सांख्यिकीय अनिश्चितता की नकल करने में बहुत बेहतर हो गई थी, जिससे शब्दों के "आश्चर्यजनक" होने के अंतर को कम कर दिया गया। फिर भी, अन्य क्षेत्रों में, यह अंतर वास्तव में बढ़ गया। मशीन लेखन संरचनात्मक रूप से अधिक एकसमान और दोहराव वाला हो गया। जहाँ मनुष्य लय और प्रभाव पैदा करने के लिए वाक्यों की लंबाई और संरचना में स्वाभाविक रूप से बदलाव करते हैं, वहीं नए मॉडल एक रोबोटिक निरंतरता के साथ पाठ उत्पन्न करते हैं। यह विशेष रूप से नवीनतम 'रीजनिंग मॉडल्स' के लिए सच था, जो बहुत लंबे पाठ और एक बहुत ही स्थिर, अपरिवर्तित वाक्य संरचना के साथ लिखने की प्रवृत्ति रखते थे।

सबसे आश्चर्यजनक निष्कर्षों में से एक विराम चिह्नों से संबंधित था। इंटरनेट के अनियंत्रित वातावरण में, मानव लेखक जटिल विचारों और भावनाओं को व्यक्त करने के लिए विराम चिह्नों की एक विस्तृत श्रृंखला का उपयोग करते हैं, जिसमें अर्धविराम (semicolon), विस्मयादिबोधक चिह्न और प्रश्नवाचक चिह्न शामिल हैं। हालाँकि, कृत्रिम बुद्धिमत्ता मॉडल इन चिह्नों से काफी हद तक बचते हैं। वे पूर्णविराम और अल्पविराम (comma) तक सीमित रहते हैं, जिससे एक सुरक्षित, अधिक तटस्थ स्वर बनता है। शोधकर्ताओं ने इसका पता लगाया कि यह इन मॉडलों को सहायक और हानिरहित होने के लिए प्रशिक्षित करने के तरीके के कारण है, जो अनजाने में प्राकृतिक मानवीय भाषण में पाई जाने वाली भावनात्मक और संरचनात्मक विविधता को छीन लेता है। मशीनें केवल सही नहीं लिख रही थीं; वे बहुत अधिक 'परफेक्ट' लिख रही थीं, जिनमें मानवीय अभिव्यक्ति की विशेषता बताने वाले प्राकृतिक "शोर" (noise) और त्रुटियों का अभाव था।

अध्ययन ने यह भी रेखांकित किया कि ये मॉडल 'वैरिएंस' (variance/विचलन) को कैसे संभालते हैं। मानव लेखन में उतार-चढ़ाव होता है; एक लेखक एक बहुत लंबे, जटिल वाक्य के बाद एक छोटा, प्रभावशाली वाक्य उपयोग कर सकता है। यह भिन्नता एक जीवित आवाज़ का संकेत है। कृत्रिम बुद्धिमत्ता, रचनात्मक होने की कोशिश करने के बावजूद, इन उतार-चढ़ावों को सपाट करने की प्रवृत्ति रखती है। यह ऐसा पाठ उत्पन्न करती है जहाँ वाक्य की लंबाई और शब्द चयन एक संकीर्ण, सुसंगत सीमा के भीतर रहते हैं। शोधकर्ताओं ने पाया कि यह प्राकृतिक भिन्नता का अभाव, विशिष्ट शब्दों के चुनाव की तुलना में मशीन लेखकत्व का एक अधिक मजबूत संकेतक था। वास्तव में, जैसे-जैसे मॉडल अधिक उन्नत हुए, उनकी मानव शब्दावली की नकल करने की क्षमता में सुधार हुआ, लेकिन उनकी मानवीय संरचनात्मक विविधता की नकल करने में अक्षमता और भी स्पष्ट हो गई।

शोधकर्ताओं ने निष्कर्ष निकाला कि नकली पाठ का पता लगाने के पुराने तरीके, जो अक्सर सरल शब्द गणना या बुनियादी शब्दावली जाँच पर केंद्रित थे, अब पर्याप्त नहीं हैं। मशीनों ने सही शब्द उपयोग करना सीख लिया है। पहचान का नया मोर्चा लेखन की संरचना और लय को देखने में निहित है। मशीन के सबसे विश्वसनीय संकेत वह नहीं है जो वह कहता है, बल्कि वह है कि वह कैसे कहता है: दोहराव वाले वाक्य पैटर्न, जटिल विराम चिह्नों का अभाव, और विचारों के प्रवाह में प्राकृतिक भिन्नता की कमी। अध्ययन सुझाव देता है कि कृत्रिम पाठ की पहचान करने वाले भविष्य के उपकरणों को इन गहरे संरचनात्मक निशानों पर ध्यान केंद्रित करना चाहिए। जैसे-जैसे कृत्रिम बुद्धिमत्ता विकसित होती रहेगी, यह अंततः मानव जैसी शब्दावली के साथ लिखना सीख सकती है, लेकिन यह मानव मस्तिष्क के काम करने के अपूर्ण, विविध और लयबद्ध अराजक (chaos) स्वरूप की नकल करने के लिए संघर्ष करती रहेगी। उन्हें अलग करने की कुंजी उस प्राकृतिक, मानवीय 'शोर' को सुनने में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →