← नवीनतम पेपर
💬 NLP

Explainable Disentangled Representation Learning for Generalizable Authorship Attribution in the Era of Generative AI

यह शोध पत्र 'एक्सप्लेनेबल ऑथरशिप वेरिएशनल ऑटोएन्कोडर' (EAVAE) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो वास्तुशिल्प पृथक्करण और एक अद्वितीय डिस्क्रिमिनेटर के माध्यम से शैली को विषय-वस्तु से स्पष्ट रूप से विसंयोजित करके, जो साथ ही साथ प्रतिनिधित्व युग्मों को मान्य करता है और प्राकृतिक भाषा की व्याख्याएँ उत्पन्न करता है, सुदृढ़ और सामान्यीकरण योग्य लेखकत्व निर्धारण और एआई-जनित पाठ का पता लगाने में सक्षम है।

मूल लेखक: Hieu Man, Van-Cuong Pham, Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hieu Man, Van-Cuong Pham, Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं: यह टेक्स्ट किसने लिखा है?

अतीत में, जासूस विशिष्ट "संकेतों" (tells) की तलाश करते थे—शायद लेखक हमेशा बड़े शब्दों का उपयोग करता था, या हमेशा वाक्य "However" से शुरू करता था। लेकिन आज, AI के उदय के साथ, खेल बदल गया है। AI इन संकेतों की पूरी तरह से नकल कर सकता है, और यह किसी भी चीज़ के बारे में लिख सकता है।

इस रहस्य को सुलझाने की कोशिश करने वाले वर्तमान कंप्यूटर प्रोग्रामों के लिए सबसे बड़ी समस्या यह है कि वे भ्रमित हो जाते हैं। वे अक्सर लेखक के विषय (topic) को उसके शैली (style) के रूप में समझ लेते हैं।

समस्या: "डिटेक्टिव फिक्शन" का जाल

कल्पना कीजिए कि आप यह पहचानने की कोशिश कर रहे हैं कि एक कहानी आर्थर कॉनन डॉयल (जिन्होंने शरलॉक होम्स लिखा था) ने लिखी है या अगाथा क्रिस्टी (जिन्होंने हरक्यूल पोयरोट लिखा था) ने।

  • खराब AI: यह एक जासूस द्वारा हत्या सुलझाने की कहानी पढ़ता है। यह तुरंत चिल्ला उठता है, "यह कॉनन डॉयल है!" क्यों? क्योंकि इसने सीखा कि "डिटेक्टिव फिक्शन" = "कॉनन डॉयल"। इसने वास्तव में यह नहीं देखा कि वाक्य कैसे बनाए गए थे; इसने केवल विषय के आधार पर अनुमान लगाया। यदि अगाथा क्रिस्टी ने एक जासूस के बारे में कहानी लिखी होती, तो खराब AI गलत अनुमान लगा लेता।
  • लक्ष्य: हमें एक ऐसा AI चाहिए जो विषय (जासूसों) को अनदेखा करे और केवल आवाज़ (लेखक की अनूठी लय, शब्द चयन और वाक्य संरचना) पर ध्यान केंद्रित करे।

समाधान: EAVAE (एक "स्टाइल-सेपरेटिंग" मशीन)

इस पेपर के लेखकों ने EAVAE (एक्सप्लेनेबल ऑथरशिप वेरिएशनल ऑटोएनकोडर) नामक एक नया सिस्टम बनाया है। इसे एक उच्च-तकनीकी रसोई के रूप में सोचें जिसमें दो अलग-अलग शेफ और एक बहुत ही सख्त मैनेजर है।

1. दो शेफ (आर्किटेक्चरल सेपरेशन)

एक शेफ द्वारा सब कुछ करने के बजाय, EAVAE में दो विशेषज्ञ शेफ अगल-बगल काम करते हैं:

  • शेफ स्टाइल: इस शेफ को केवल इस बात से मतलब है कि खाना कैसे पकाया गया है। "क्या यह मसालेदार है? क्या यह सॉस वाला है? क्या इसकी प्लेटिंग शानदार है?" वे इस बात को अनदेखा करते हैं कि खाना क्या है।
  • शेफ कंटेंट: इस शेफ को केवल इस बात से मतलब है कि खाना क्या है। "क्या यह एक बर्गर है? क्या यह एक सलाद है?" वे इस बात को अनदेखा करते हैं कि इसे कैसे पकाया गया है।

इन दोनों शेफ को अलग-अलग कमरों में काम करने के लिए मजबूर करके, सिस्टम यह सुनिश्चित करता है कि "स्टाइल" वाला शेफ "कंटेंट" वाले शेफ से विचलित न हो। यह "डिटेक्टिव फिक्शन" के जाल को हल करता है।

2. सख्त मैनेजर (एक व्याख्यात्मक डिस्क्रिमिनेटर)

यहाँ जादू वाला हिस्सा है। आमतौर पर, ये सिस्टम केवल कहते हैं "हाँ, यह कॉनन डॉयल है" या "नहीं, यह नहीं है।" लेकिन EAVAE में एक मैनेजर है जो एक सख्त शिक्षक की तरह काम करता है।

जब दो शेफ अपना काम मैनेजर को भेजते हैं, तो मैनेजर केवल उत्तर की जाँच नहीं करता। मैनेजर को एक नोट लिखना होता है जिसमें स्पष्ट किया गया हो कि क्यों।

  • उदाहरण नोट: "मैं जानता हूँ कि यह कॉनन डॉयल है, इसलिए नहीं कि यह एक जासूस के बारे में है, बल्कि इसलिए क्योंकि लेखक छोटे, प्रभावशाली वाक्यों और कोहरे के बारे में विशिष्ट रूपकों का उपयोग करता है।"

यह सिस्टम को ईमानदार होने के लिए मजबूर करता है। यदि यह विषय (जासूसों) का उपयोग करके लेखक का अनुमान लगाने की कोशिश में धोखाधड़ी करता है, तो मैनेजर उसे पकड़ लेता है क्योंकि स्पष्टीकरण का कोई अर्थ नहीं निकलता। यह सिस्टम को व्याख्यात्मक (Explainable) बनाता है—हम वास्तव में देख सकते हैं कि इसने निर्णय क्यों लिया।

3. ट्रेनिंग कैंप (दो-चरणीय सीखना)

सिस्टम दो चरणों में सीखता है:

  1. बूट कैंप (प्री-ट्रेनिंग): सिस्टम हजारों लेखकों की लाखों किताबें और लेख पढ़ता है। यह हर किसी की बुनियादी "आवाज़" सीखता है, जैसे कि वर्णमाला याद करने वाला एक छात्र।
  2. विशेष ड्रिल (फाइन-ट्यूनिंग): अब, सिस्टम "दो शेफ" वाली दिनचर्या का अभ्यास करता है। यह एक टेक्स्ट लेता है, उसे "स्टाइल" और "कंटेंट" में विभाजित करता है, और उन दो हिस्सों से मूल टेक्स्ट को फिर से बनाने की कोशिश करता है। यदि यह केवल "स्टाइल" और "कंटेंट" के संकेतों का उपयोग करके टेक्स्ट को पूरी तरह से फिर से बना सकता है, तो यह जानता है कि इसने उन्हें सफलतापूर्वक अलग कर दिया है।

यह क्यों मायने रखता है?

यह केवल नकल करने वालों को पकड़ने के बारे में नहीं है। इसके दो बड़े वास्तविक दुनिया के उपयोग हैं:

  1. असली लेखक को खोजना: यदि कोई आपके लेखन को चुराता है या आपके सामान्य काम से बिल्कुल अलग विषय पर खुद को लेखक के रूप में पेश करने की कोशिश करता है, तो EAVAE अंतर को पहचान सकता है।
  2. AI को पकड़ना: जैसे-जैसे AI लिखने में बेहतर होता जा रहा है, यह बताना मुश्किल हो जाता है कि कोई टेक्स्ट मानव ने लिखा है या मशीन ने। EAVAE इस मामले में बेहतरीन है क्योंकि यह उन सूक्ष्म "मानवीय शैली" के निशानों को खोजता है जिन्हें AI अक्सर मिस कर देता है या खराब तरीके से नकल करता है। यह तब भी काम करता है जब इसने उस विशिष्ट AI को पहले नहीं देखा हो ("फ्यू-शॉट" लर्निंग क्षमता)।

निचोड़

वर्तमान AI एक ऐसे छात्र की तरह है जो उत्तर रट लेता है लेकिन अवधारणाओं को नहीं समझता। EAVAE एक ऐसे छात्र की तरह है जो अवधारणाओं को समझता है। यह "क्या" (विषय) को "कैसे" (शैली) से अलग करता है, और यह साधारण अंग्रेजी में अपने तर्क को समझा भी सकता है। यह इसे धोखा देना बहुत कठिन बनाता है, और बौद्धिक संपदा की रक्षा करने और नकली समाचारों को पकड़ने के लिए बहुत अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →