← नवीनतम पेपर
💬 NLP

CHiPS: Character Histograms and Positional Signals for Lightweight Authorship Attribution in Romanian Texts

यह शोध पत्र CHiPS को प्रस्तुत करता है, जो रोमानियाई ग्रंथों के लिए एक हल्का और पारदर्शी वर्ण-स्तर (character-level) का लेखक निर्धारण (authorship attribution) तरीका है, जो टोकनाइज़ेशन, वाक्य रचना विश्लेषण, या बड़े भाषा मॉडलों पर निर्भर रहने के बजाय वर्ण हिस्टोग्राम (character histograms) और स्थितिगत स्पेक्ट्रल संकेतों (positional spectral signals) का उपयोग करके उच्च सटीकता प्राप्त करता है, साथ ही सख्त लीकेज नियंत्रण के तहत प्रतिबंधित फीचर सेट की प्रभावशीलता को प्रदर्शित करता है।

मूल लेखक: Sanda-Maria Avram, George C. Ţurcaş

प्रकाशित 2026-07-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sanda-Maria Avram, George C. Ţurcaş

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन उंगलियों के निशान या पैरों के निशान खोजने के बजाय, आप कंप्यूटर की अदृश्य "लिखावट" को देख रहे हैं। यह क्षेत्र, जिसे लेखक निर्धारण (authorship attribution) कहा जाता है, इस बारे में है कि जब नाम गायब हो या विवादित हो, तो किसी विशिष्ट पाठ (text) को लिखने वाले का पता कैसे लगाया जाए। यह कुछ ऐसा ही है जैसे यह अनुमान लगाने की कोशिश करना कि स्कूल की डायरी में गुमनाम नोट किसने लिखा है, सिर्फ यह देखकर कि वे कॉमा का उपयोग कैसे करते हैं, स्पेस कहाँ रखते हैं, और वे किन अक्षरों को पसंद करते हैं या किनसे नफरत करते हैं। जबकि आधुनिक कंप्यूटर शब्दों के अर्थ को पढ़ने में माहिर हैं (जैसे किसी मजाक या दुख भरी कहानी को समझना), यह शोध पत्र एक सरल, अधिक मौलिक प्रश्न पूछता है: क्या हम केवल अक्षरों और प्रतीकों के साथ उनकी छोटी, अचेतन आदतों के आधार पर एक लेखक की पहचान कर सकते हैं? इसे शब्दों के अर्थ के बजाय एक गाने की लय सुनने जैसा समझें; भले ही आप शब्द बदल दें, ताल गायक को उजागर कर सकती है। यह महत्वपूर्ण है क्योंकि कभी-कभी हमें यह जानने की आवश्यकता होती है कि किसी ने क्या लिखा है, बिना उन जटिल, भारी-भरकम कंप्यूटर दिमागों पर निर्भर हुए जो बहुत जटिल या समझने में कठिन हो सकते हैं।

इस अध्ययन के पीछे के शोधकर्ताओं, सांडा-मारिया अव्रम और जॉर्ज सी. टुरकास ने इस पहेली को हल करने के लिए CHiPS (जिसका अर्थ है Character Histograms and Positional Signals) नामक एक नया जासूसी उपकरण बनाने का निर्णय लिया, जो रोमानियाई भाषा में लिखे गए ग्रंथों के लिए है। उनका लक्ष्य सबसे शक्तिशाली, अति-जटिल AI बनाना नहीं था, बल्कि एक "हल्का" (lightweight) और पारदर्शी तरीका बनाना था जिसे कोई भी देख सके। वे यह देखना चाहते थे कि किसी लेखक की पहचान उनके पात्रों (characters) के सरल वितरण और उन पात्रों के प्रकट होने के लय (rhythm) में कितनी छिपी हुई है, बिना किसी फैंसी वर्ड-सेगमेंटिंग टूल्स या विशाल प्री-ट्रेन्ड लैंग्वेज मॉडल्स का उपयोग किए।

यहाँ उनका तरीका काम करता है, एक मजेदार उपमा का उपयोग करते हुए: कल्पना कीजिए कि प्रत्येक लेखक की एक अद्वितीय "शैली वाली उंगली का निशान" (style fingerprint) होती है। CHiPS इस फिंगरप्रिंट को दो अलग-अलग तरीकों से देखता है।

सबसे पहले, CH-SVM वाला हिस्सा है, जो एक आवृत्ति काउंटर (frequency counter) की तरह कार्य करता है। यह केवल यह गिनता है कि लेखक विशिष्ट पात्रों का कितनी बार उपयोग करता है, जैसे कि अक्षर 'a', एक कॉमा, या एक स्पेस। इसे शब्दों के क्रम की परवाह नहीं है या इस बात की भी नहीं कि अक्षर एक-दूसरे के बगल में हैं या नहीं; यह बस कुल मिश्रण को देखता है। यह एक ऐसे बेकर की तरह है जो एक विशिष्ट शेफ को केवल आटे, चीनी और नमक के सटीक अनुपात से पहचान सकता है, चाहे वह कोई भी केक बना रहा हो।

दूसfrist, FFT12-LR वाला हिस्सा है, जो एक लय डिटेक्टर (rhythm detector) की तरह कार्य करता है। केवल गिनने के बजाय, यह देखता है कि विशिष्ट पात्र पाठ में कहाँ दिखाई देते हैं। यह पाठ को एक संगीतमय स्कोर की तरह मानता है, विराम चिह्नों या बड़े अक्षरों (capital letters) के प्रकट होने को एक सिग्नल वेव में बदल देता है। फिर यह गणित (विशेष रूप से फूरियर विश्लेषण, जो ध्वनि तरंग को उसके संगीत नोट्स में तोड़ने जैसा है) का उपयोग करके अंतराल और लय में पैटर्न खोजने के लिए करता है। यह यह नोटिस करने जैसा है कि एक विशिष्ट लेखक हमेशा हर 15 शब्दों के बाद ठीक एक कॉमा लगाता है, या वे पैराग्राफ के अंत में विस्मयादिबोधक चिह्नों (exclamation marks) का उपयोग विस्फोटों के रूप में करते हैं।

शोधकर्ताओं ने इन दोनों जासूसों को एक टीम में मिलाया जिसे CHiPS-F कहा गया। उन्होंने इस टीम का परीक्षण रोमानियाई ग्रंथों के एक लॉक किए गए डेटासेट ROST पर किया, जिसमें 10 अलग-अलग लेखकों द्वारा लिखी गई 400 फाइलें शामिल थीं। यह सुनिश्चित करने के लिए कि परीक्षण निष्पक्ष हो और कंप्यूटर एक ही कहानी के हिस्सों को याद करके "चीटिंग" न करे, उन्होंने एक ही कहानी के सभी अंशों को या तो प्रशिक्षण समूह (training group) में या परीक्षण समूह (test group) में रखा, उन्हें कभी अलग नहीं किया।

परिणाम काफी दिलचस्प थे। जब उन्होंने एक मानक, शक्तिशाली कंप्यूटर पद्धति को चलाया जो अक्षरों की छोटी कड़ियों (जैसे "th" या "ing") को देखती है, तो उसने एक परफेक्ट स्कोर प्राप्त किया, यानी हर एक टेस्ट फाइल के लेखक की सही पहचान की। हालाँकि, CHiPS टीम, जो केवल एकल-चरित्र गणनाओं और लय संकेतों तक सीमित थी, फिर भी अविश्वसनीय रूप से अच्छा प्रदर्शन करती रही। CHiPS-F टीम ने 58 में से 54 टेस्ट फाइलों को सही ढंग से पहचाना, जिससे 0.9310 (या 93.1%) की सटीकता प्राप्त हुई।

शोध पत्र स्पष्ट रूप से कहता है कि CHiPS सबसे अच्छा संभव क्लासिफायर नहीं है; अक्षरों की कड़ियों को देखने वाली मानक पद्धति अधिक मजबूत थी। इसके बजाय, शोध पत्र का मुख्य निष्कर्ष यह है कि सख्त सीमाओं के साथ भी—शब्दों के अर्थ को अनदेखा करते हुए और एक से अधिक वर्णों के संयोजन को नजरअंदाज करते हुए—एक लेखक की शैली उनके पात्रों की आदतों और लयबद्ध संकेतों में अभी भी बहुत स्पष्ट है। "लय" वाले हिस्से ने उन कुछ गलतियों को ठीक करने में मदद की जो "गिनती" वाले हिस्से ने की थीं, यह साबित करते हुए कि आप अपना विराम चिह्न कहाँ लगाते हैं, यह उतना ही महत्वपूर्ण है जितना कि आप उसका उपयोग कितनी बार करते हैं।

उन्होंने एक "री-रैंकर" (re-ranker) टूल (CHiPS-R) भी आजमाया जो शीर्ष पांच अनुमानों को देखता है और सही एक को चुनने की कोशिश करता है यदि मुख्य टूल करीब था लेकिन गलत था। साफ की गई कहानियों के एक दूसरे, बड़े डेटासेट पर, इस अतिरिक्त चरण ने स्कोर को 0.8919 सटीकता तक सुधारने में मदद की। हालाँकि, मुख्य लॉक किए गए टेस्ट पर, इस अतिरिक्त चरण से परिणामों में सुधार नहीं हुआ, जो बताता है कि हालांकि यह कुछ स्थितियों में मदद कर सकता है, लेकिन यह हर चीज़ के लिए जादुई समाधान नहीं है।

अंत में, लेखक निष्कर्ष निकालते हैं कि CHiPS एक मूल्यवान, पारदर्शी उपकरण है। यह सिद्ध करता है कि आपको किसी लेखक के डिजिटल फिंगरप्रिंट को खोजने के लिए एक विशाल, जटिल न्यूरल नेटवर्क की आवश्यकता नहीं है; कभी-कभी, केवल इस बात को देखना कि एक व्यक्ति कैसे टाइप करता है और विराम चिह्न लगाता है, उन्हें पकड़ने के लिए पर्याप्त होता है। यह एक स्पष्ट, जांच योग्य तरीका प्रदान करता है जिससे लेखक निर्धारण को समझा जा सके, जो "ब्लैक बॉक्स" AI पर निर्भर नहीं है, जिससे यह भविष्य के अध्ययनों के लिए, विशेष रूप से उन भाषाओं में जहाँ जटिल उपकरण उपलब्ध नहीं हो सकते, एक उपयोगी आधार रेखा (baseline) बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →