← नवीनतम पेपर
📊 statistics

Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text

यह शोध पत्र "लर्न-टू-डिस्टेंस" (Learn-to-Distance) पेश करता है, जो एक नवीन रीराइट-आधारित (rewrite-based) डिटेक्शन एल्गोरिदम है, जो विभिन्न मॉडलों में एलएलएम-जनित (LLM-generated) सामग्री की पहचान करने में मौजूदा बेसलाइन से बेहतर प्रदर्शन करने के लिए मूल और पुनर्गठित (rewritten) पाठ के बीच की दूरी को अनुकूल रूप से सीखता है।

मूल लेखक: Hongyi Zhou, Jin Zhu, Kai Ye, Ying Yang, Erhan Xu, Chengchun Shi

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongyi Zhou, Jin Zhu, Kai Ye, Ying Yang, Erhan Xu, Chengchun Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ कोई भी एक सुपर-स्मार्ट कंप्यूटर दिमाग (एक AI) का उपयोग करके तुरंत एक बेहतरीन निबंध, एक प्रभावशाली समाचार लेख, या एक दिल छू लेने वाला पत्र लिख सकता है। यह आज के लार्ज लैंग्वेज मॉडल्स (LLMs) की वास्तविकता है। लेकिन एक समस्या है: हमें कैसे पता चलेगा कि कोई लेख इंसान ने लिखा है या रोबोट ने?

यह शोध पत्र, जिसका शीर्षक "लर्न-टू-डिस्टेंस" (L2D) है, इस रहस्य को सुलझाने का एक चतुर नया तरीका प्रस्तावित करता है। एक "रोबोट के फिंगरप्रिंट" को खोजने के बजाय, यह "रीराइट एंड कंपेयर" (दोबारा लिखें और तुलना करें) के खेल का उपयोग करता है।

यहाँ उनके विचार का विवरण दिया गया है, जिसे सरल उपमाओं के साथ समझाया गया है।

1. पुराना तरीका: "फिक्स्ड रूलर" (एक स्थिर पैमाना)

कल्पना कीजिए कि आप यह बताने की कोशिश कर रहे हैं कि एक ड्राइंग एक मानव कलाकार द्वारा बनाई गई है या एक रोबोट द्वारा।

  • पुरानी विधि: आप उस ड्राइंग को लेते हैं, रोबोट को उसे कॉपी करने के लिए कहते हैं, और फिर मूल और कॉपी के बीच के अंतर को एक कठोर, अपरिवर्तनीय पैमाने (जैसे एक मानक टेप मेजर) का उपयोग करके मापते हैं।
  • समस्या: एक मानक पैमाना कुछ चीजों के लिए ठीक काम करता है, लेकिन यह जटिल आकृतियों को मापने में बहुत अच्छा नहीं है। यदि रोबोट नकल करने में बहुत अच्छा है, तो पैमाना कह सकता है, "हे, ये एक जैसे दिखते हैं!" भले ही वे न हों। इसके अलावा, यदि रोबट अपनी शैली बदल देता है (जैसे अलग रंग में ड्राइंग करना), तो पैमाना भ्रमित हो जाता है।

2. नया विचार: "स्मार्ट, स्ट्रेची टेप मेजर" (एक स्मार्ट, लचीला टेप मेजर)

इस पेपर के लेखकों ने महसूस किया कि एक उबाऊ, निश्चित पैमाने का उपयोग करने के बजाय, हमें एक कस्टम, लचीला टेप मेजर बनाना चाहिए जो ठीक से अंतर पहचानना सीख सके।

L2D का तरीका इस प्रकार काम करता है:

चरण 1: "इको चैंबर" टेस्ट

कल्पना कीजिए कि आपके पास एक टेक्स्ट है। आप AI को इसे फिर से लिखने के लिए कहते हैं (जैसे किसी छात्र को एक पैराग्राफ को पैराफ्रेस करने के लिए कहना)।

  • यदि टेक्स्ट इंसान द्वारा लिखा गया है: AI को इसे फिर से लिखने के लिए "अनुमान" लगाना होगा। चूंकि AI मूल लेखक नहीं था, इसलिए इसका पुनर्लेखन (rewrite) मूल से थोड़ा "अलग" या दूर महसूस होगा। यह अंतर (gap) चौड़ा है।
  • यदि टेक्स्ट AI द्वारा लिखा गया है: AI अपने ही काम को फिर से लिख रहा है। वह जानता है कि वह कैसे सोचता है, इसलिए पुनर्लेखन मूल के बहुत करीब महसूस होगा। यह अंतर (gap) संकीर्ण है।

चरण 2: "गैप" को सीखना

L2D का जादू यह है कि यह उस अंतर को मापने के लिए केवल एक मानक पैमाने का उपयोग नहीं करता है। यह विशेष रूप से इस काम के लिए एक विशेष "स्मार्ट टेप मेजर" (एक गणितीय फलन) को प्रशिक्षित करता है।

  • यह मानव लेखन और AI लेखन के हजारों उदाहरणों को देखता है।
  • यह सीखता है: "हे, जब कोई इंसान यह लिखता है, तो अंतर आमतौर पर बहुत बड़ा होता है। जब AI इसे लिखता है, तो अंतर बहुत छोटा होता है।"
  • यह उस अंतर को जितना संभव हो सके उतना स्पष्ट बनाने के लिए अपनी "लचीलेपन" (stretchiness) को एडजस्ट करता है।

3. यह बेहतर क्यों है? ("गिरगिट" की उपमा)

AI मॉडल गिरगिट की तरह होते हैं। वे आपकी मांग के अनुसार अपनी शैली बदल सकते हैं।

  • पुराने डिटेक्टर: यदि आप AI को एक कविता लिखने के लिए कहते हैं, तो एक पुराना तरीका इस्तेमाल करने वाला जासूस कह सकता है, "यह एक कविता की तरह दिखती है, इसलिए यह मानव है!" क्योंकि डिटेक्टर को समाचार लेखों पर प्रशिक्षित किया गया था। यह शैली परिवर्तन से धोखा खा जाता है।
  • L2D (नया तरीका): क्योंकि L2D शैली के बजाय दूरी (गैप) को सीखता है, इसलिए इसे इस बात से फर्क नहीं पड़ता कि AI कविता लिख रहा है, कोड स्क्रिप्ट लिख रहा है, या किराने की सूची बना रहा है। यह बस पूछता है: "क्या AI का पुनर्लेखन ऐसा महसूस होता है जैसे वह उसी मस्तिष्क से आया हो जिससे मूल आया था?"
    • यदि उत्तर हाँ है (छोटा गैप) → तो यह संभवतः AI है।
    • यदि उत्तर नहीं है (बड़ा गैप) → तो यह संभवतः मानव है।

4. परिणाम: सर्वश्रेष्ठ को पछाड़ना

लेखकों ने अपने "स्मार्ट टेप मेजर" का परीक्षण 12 अन्य शीर्ष जासूसों (मौजूदा AI डिटेक्टरों) के विरुद्ध 24 अलग-अलग प्रकार के लेखन (मेडिकल रिपोर्ट से लेकर स्पोर्ट्स न्यूज़ तक) और 7 अलग-अलग AI मॉडल्स (जैसे GPT-4, Claude, और Gemini) पर किया।

  • स्कोर: लगभग हर टेस्ट में, L2D जीत गया।
  • सुधार: यह अगले सबसे अच्छे तरीके से 54% से 75% बेहतर था।
  • "एडवर्सरियल" (Adversarial) टेस्ट: उन्होंने डिटेक्टरों को चकमा देने के लिए भी प्रयास किया, जिसमें AI को अपने ही टेक्स्ट को फिर से लिखने के लिए कहा गया ताकि वह अपने निशान मिटा सके (जैसे कोई जासूस अपनी आवाज़ बदलकर)। L2D अभी भी सबसे मजबूत था; इसे आसानी से बेवकूफ नहीं बनाया जा सका।

सारांश

AI टेक्स्ट का पता लगाने को एक नकली हीरा खोजने जैसा समझें।

  • पुराना तरीका: आप एक मानक आवर्धक लेंस (magnifying glass) का उपयोग करते हैं। कभी-कभी यह काम करता है, कभी-कभी नकली हीरा बहुत अच्छा होता है।
  • L2D तरीका: आप एक कस्टम स्कैनर बनाते हैं जो यह सीखता है कि असली हीरे की तुलना में नकली हीरा प्रकाश को बिल्कुल कैसे परावर्तित करता है, चाहे प्रकाश कैसे भी बदल जाए।

निष्कर्ष: कंप्यूटर को एक टेक्स्ट और उसके पुनर्लेखन के बीच की "दूरी को मापना सिखाकर", हम AI-जनरेटेड कंटेंट को बहुत अधिक सटीकता से पहचान सकते हैं, भले ही AI अपनी शैली को छिपाने या बदलने की कोशिश करे। यह हमारी सूचना प्रणाली को ईमानदार बनाए रखने का एक स्मार्ट और अधिक अनुकूलनीय तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →