← नवीनतम पेपर
💬 NLP

NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution

यह शोध पत्र NOTAI.AI को प्रस्तुत करता है, जो एक व्याख्यात्मक ढांचा (explainable framework) है जो मशीन-जनित टेक्स्ट का पता लगाने के लिए एक XGBoost क्लासिफायर के भीतर कर्वेचर-आधारित संकेतों (curvature-based signals), न्यूरल और स्टाइलोमेट्रिक विशेषताओं को संयोजित करता है, और अपने निर्णयों के लिए संरचित, प्राकृतिक-भाषा तर्क उत्पन्न करने के लिए SHAP और एक LLM लेयर का उपयोग करता है।

मूल लेखक: Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh, Salima Lamsiyah

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh, Salima Lamsiyah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं: क्या यह कहानी एक इंसान ने लिखी है, या एक रोबोट (AI) ने?

अतीत में, रोबोटों को पहचानना आसान था क्योंकि वे बहुत औपचारिक लगते थे या व्याकरण की अजीब गलतियाँ करते थे। लेकिन आज का AI एक कुशल जालसाज की तरह है; यह इतना सहज और स्वाभाविक रूप से लिखता है कि विशेषज्ञ भी धोखा खा जाते हैं।

यह शोध पत्र NOTAI.AI पेश करता है, जो इन AI जालसाजों को पकड़ने के लिए बनाया गया एक नया "सुपर-डिटेक्टिव" टूल है। लेकिन पुराने टूल्स के विपरीत, जो केवल एक संदिग्ध "हाँ/नहीं" स्कोर देते हैं, NOTAI.AI एक पारदर्शी जासूस की तरह काम करता है जो आपको ठीक से बताता है कि उसे क्यों लगता है कि टेक्स्ट नकली है, और इसके लिए वह सरल भाषा का उपयोग करता है जिसे कोई भी समझ सके।

यह कैसे काम करता है, यहाँ कुछ रोजमर्रा के उपमाओं (analogies) के साथ समझाया गया है:

1. जासूस की तीन आँखें

अधिकांश डिटेक्टर एक ही दृष्टिकोण से टेक्स्ट को देखते हैं। NOTAI.AI एक ही टेक्स्ट को अलग-अलग कोणों से देखने के लिए तीन अलग-अलग चश्मे पहनता है। यह अंतिम निर्णय लेने के लिए इन तीन दृश्यों को जोड़ता है:

  • "स्मूथनेस" का चश्मा (Curvature - वक्रता):
    कल्पना कीजिए कि एक इंसान का कहानी लिखना जंगल में चलने जैसा है। आप किसी पत्थर से टकरा सकते हैं, किसी जड़ से लड़खड़ा सकते हैं, या अचानक मुड़ सकते हैं। यह थोड़ा ऊबड़-खाबड़ और अप्रत्याशित होता है।
    इसके विपरीत, AI एक पूरी तरह से पक्की सड़क पर चलते रोबोट की तरह है। यह हर बार सबसे सीधा, "सबसे सुगम" रास्ता चुनता है।

    • चाल: NOTAI.AI मापता है कि टेक्स्ट कितना "ऊबड़-खाबड़" है। यदि टेक्स्ट बहुत अधिक सुगम और अनुमानित है (एक हाईवे की तरह), तो उसे रोबोट पर संदेह होता है। यदि इसमें प्राकृतिक उतार-चढ़ाव और अनियमितताएं हैं, तो उसे इंसान पर संदेह होता है।
  • "शब्दावली" का चश्मा (Stylometrics - शैलीमिति):
    यह लेखन के "फिंगरप्रिंट" को देखता है।

    • पुनरावृत्ति (Repetition): इंसान ऊब जाते हैं और अलग-अलग शब्दों का उपयोग करते हैं। AI कभी-कभी एक लूप में फंस जाता है, और एक ही वाक्यांश या वाक्य संरचना को दोहराता रहता है।
    • शब्दों का चयन (Word Choice): इंसान दुर्लभ, अजीब शब्दों (जैसे "hapax legomena" – ऐसे शब्द जो आप केवल एक बार देखते हैं) का उपयोग कर सकते हैं। AI अक्सर सबसे सामान्य, सुरक्षित शब्दों तक ही सीमित रहता है।
    • विराम चिह्न (Punctuation): कितने कॉमा या पूर्ण विराम हैं? इंसानों की एक अनूठी लय होती है; AI का लय अक्सर रोबोटिक और एकसमान होता है।
  • "मस्तिष्क" का चश्मा (Neural Signals - तंत्रिका संकेत):
    यह एक सुपर-स्मार्ट AI (जिसे ModernBERT कहा जाता है) है जिसने लाखों किताबें पढ़ी हैं। यह एक साहित्यिक आलोचक की तरह कार्य करता है। यह पूछता है, "क्या यह वाक्य ऐसा महसूस होता है जैसा कि कोई इंसान कहेगा, या यह ऐसा लगता है जैसे कोई कंप्यूटर इसे जनरेट कर रहा है?" यह गहरे पैटर्न के आधार पर एक "अंतर्ज्ञान" (gut feeling) स्कोर देता है।

2. "सुपर-ब्रेन" (The Meta-Classifier)

एक बार जब तीनों चश्मे सुराग इकट्ठा कर लेते हैं, तो वे नोट्स को एक मुख्य जासूस (एक एल्गोरिदम जिसे XGBoost कहा जाता है) को सौंप देते हैं।

  • मुख्य जासूस केवल एक सुराग को नहीं सुनता। वह उन सभी को एक साथ तौलता है।
  • उदाहरण: "टेक्स्ट बहुत सुगम है (AI सुराग), लेकिन इसमें एक बहुत ही दुर्लभ शब्द का उपयोग किया गया है (मानव सुराग)। चलिए विराम चिह्न देखते हैं... आह, विराम चिह्न बहुत सटीक हैं। मुझे 96% यकीन है कि यह AI है।"

3. "अनुवादक" (Explainability - व्याख्यात्मकता)

यह सबसे महत्वपूर्ण हिस्सा है। पुराने डिटेक्टर केवल कहेंगे, "95% संभावना: AI।" यदि आप एक शिक्षक या पत्रकार हैं जो यह साबित करने की कोशिश कर रहे हैं, तो यह मददगार नहीं है।

NOTAI.AI के पास एक अनुवादक (एक LLM) है जो गणित को एक कहानी में बदल देता है।

  • इसके बजाय: "Feature 4 के लिए SHAP मान 0.45 है।"
  • यह कहता है: "हमें लगता है कि यह AI है क्योंकि टेक्स्ट असामान्य रूप से सुगम है, एक हाईवे की तरह, और यह 'in conclusion' वाक्यांश को तीन बार दोहराता है, जो कि एक सामान्य रोबोटिक आदत है।"

यह एक संरचित रिपोर्ट देता है जिसमें एक सारांश और शीर्ष 3 कारण होते हैं, जो सरल अंग्रेजी (और स्पष्ट भाषा) में लिखे जाते हैं।

4. "प्लेग्राउंड" (Interactive Demo - इंटरैक्टिव डेमो)

लेखकों ने एक वेबसाइट बनाई है जहाँ आप इस टूल के साथ खेल सकते हैं।

  • "क्या होगा अगर" का खेल: आप विशिष्ट सुरागों को बंद कर सकते हैं। उदाहरण के लिए, आप जासूस से कह सकते हैं, "स्मूथनेस टेस्ट को अनदेखा करें, बस शब्दावली को देखें।"
  • परिणाम: आप देख सकते हैं कि कैसे जासूस वास्तविक समय में अपना निर्णय बदलता है। इससे आपको समझने में मदद मिलती है कि कौन से सुराग सबसे अधिक मायने रखते हैं।

यह क्यों महत्वपूर्ण है?

एक ऐसी दुनिया में जहाँ AI निबंध, समाचार लेख और ईमेल लिख सकता है जो बिल्कुल सटीक दिखते हैं, हमें ऐसे टूल्स की आवश्यकता है जो केवल अनुमान न लगाएं, बल्कि व्याख्या भी करें।

  • शिक्षकों के लिए: यह छात्रों पर अनुचित आरोप लगाए बिना AI निबंधों को पहचानने में मदद करता है।
  • पत्रकारों के लिए: यह सत्यापित करने में मदद करता है कि समाचार कहानी किसी इंसान द्वारा लिखी गई थी या बॉट फार्म द्वारा।
  • सभी के लिए: यह विश्वास पैदा करता है। आपको केवल उत्तर नहीं बताया जाता; आपको सबूत दिखाए जाते हैं।

संक्षेप में: NOTAI.AI एक ऐसे जासूस की तरह है जो न केवल उंगली उठाता है; बल्कि वह आपको एक आवर्धक लेंस (magnifying glass) थमाता है, विशिष्ट पदचिह्नों और उंगलियों के निशान की ओर इशारा करता है, और पूरी कहानी को इस तरह समझाता है जो पूरी तरह से समझ में आए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →