← नवीनतम पेपर
💬 NLP

On the Salience of Low-Probability Tokens for AI-Generated Text Detection: A Multiscale Uncertainty Perspective

यह शोध पत्र "अनसर्टेनिटी" (Uncertainty) को प्रस्तुत करता है, जो एक मल्टीस्केल डिटेक्शन विधि है जो बॉयलरप्लेट प्रभुत्व को कम करने के लिए कम-संभाव्यता वाले टोकन पर ध्यान केंद्रित करके और स्थानीय औसत (local averaging) एवं वैश्विक रेनी एंट्रॉपी (Rényi entropy) विश्लेषण के माध्यम से भंगुरता (brittleness) को कम करके एआई-जनित टेक्स्ट की पहचान में सुधार करती है, जिससे विविध डेटासेट और मॉडलों में उत्कृष्ट प्रभावशीलता और मजबूती प्राप्त होती है।

मूल लेखक: Yikai Guo, Bin Wang, Xilai Fan, Wenjun Ke, Haoran Luo

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yikai Guo, Bin Wang, Xilai Fan, Wenjun Ke, Haoran Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: "AI बनाम मानव" का धुंधलापन

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ AI ऐसी कहानियाँ, ईमेल और समाचार लेख लिख सकता है जो सुनने में बिल्कुल वैसा ही लगता है जैसे किसी इंसान ने लिखे हों। यह रचनात्मकता के लिए तो बहुत अच्छा है, लेकिन यह एक समस्या पैदा करता है: हम अंतर कैसे पहचानें?

यदि हम उनमें अंतर नहीं कर पाते हैं, तो बुरे तत्व गलत सूचना फैला सकते हैं, छात्र नकल कर सकते हैं, और इंटरनेट नकली सामग्री से भर सकता है।

वर्तमान उपकरण टेक्स्ट को पहचानने के लिए शब्दों के "सांख्यिकीय फिंगरप्रिंट" (statistical fingerprint) को देखने की कोशिश करते हैं। हालाँकि, यह शोध पत्र तर्क देता है कि इन उपकरणों में दो प्रमुख कमियां हैं:

  1. "बॉयलरप्लेट" (Boilerplate) की समस्या: AI और इंसान दोनों ही सामान्य वाक्यांशों का उपयोग करते हैं जैसे "निष्कर्षतः" (In conclusion), "परिणाम दर्शाते हैं" (The results show), या "हम प्रस्ताव देते हैं" (We propose)। वर्तमान डिटेक्टर इन उबाऊ, सामान्य शब्दों से विचलित हो जाते हैं। यह भीड़ में किसी चोर को उसके जूतों को देखकर खोजने जैसा है; चूँकि सभी जूते पहनते हैं, इसलिए आप जूते देखकर चोर की पहचान नहीं कर सकते। सामान्य शब्द असली सुरागों को दबा देते हैं।
  2. "भंगुरता" (Brittle) की समस्या: वर्तमान उपकरण अक्सर निर्णय लेने के लिए एक एकल संख्या (स्कोर) पर निर्भर करते हैं। यदि कोई वाक्य को थोड़ा सा बदल दे या AI की सेटिंग्स में बदलाव कर दे, तो वह एकल संख्या बहुत अधिक ऊपर-नीचे हो सकती है, जिससे डिटेक्टर "मानव" और "AI" के बीच झूलने लगता है। यह एक तराजू जैसा है जो एक पंख रखने पर ही पलट जाता है।

समाधान: "अनिश्चितता" (Uncertainty)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे अनिश्चितता (Uncertainty) (और एक अधिक मजबूत संस्करण Uncertainty++) कहा जाता है। पूरे टेक्स्ट को समान रूप से देखने के बजाय, वे दो विशिष्ट चीजों पर ध्यान केंद्रित करते हैं: दुर्लभ शब्द और विकल्पों का आकार

उपमा 1: "सरप्राइज पार्टी" (कम संभावना वाले टोकन)

कल्पना कीजिए कि आप एक पार्टी में हैं।

  • उच्च-संभावना वाले टोकन (सामान्य शब्द): हर कोई कहता है "नमस्ते," "आप कैसे हैं?" या "मौसम अच्छा है।" ये अनुमानित हैं। इंसान और AI दोनों ही हमेशा इनका उपयोग करते हैं।
  • कम-संभावना वाले टोकन (दुर्लभ शब्द): अचानक, कोई कुछ अजीब और अप्रत्याशित कहता है, जैसे "टोस्टर ओपेरा गा रहा है।"

शोध पत्र की मुख्य खोज यह है कि जब बात इन "सरप्राइज" पलों की आती है, तो AI इंसानों की तुलना में बहुत अधिक अनुमानित (predictable) होता है।

  • जब एक इंसान लिखता है, तो वह एक अनूठा, कम-संभावना वाला शब्द चुनकर जोखिम ले सकता है।
  • जब एक AI लिखता है, भले ही वह रचनात्मक होने की कोशिश करे, वह "सुरक्षित" विकल्पों पर ही टिके रहने की कोशिश करता है। यदि वह कोई दुर्लभ शब्द चुनता भी है, तो वह आमतौर पर इसलिए होता है क्योंकि गणित ने उसे वहां पहुँचाया है, जिससे वह शब्द "अजीब" या मानव के चुनाव की तुलना में सांख्यिकीय रूप से अलग महसूस होता है।

विधि: नया डिटेक्टर उबाऊ "नमस्ते" और "आप कैसे हैं" वाले हिस्सों को अनदेखा कर देता है। यह केवल अजीब, दुर्लभ शब्दों (विकल्पों के निचले 15%) पर ज़ूम करता है। शोर को अनदेखा करके, यह सिग्नल को बहुत स्पष्ट रूप से पाता है।

उपमा 2: "मौसम का पूर्वानुमान" (ग्लोबल अनसर्टेन्टी)

वर्तमान डिटेक्टर चुने गए विशिष्ट शब्द (point estimate) को देखते हैं।

  • पुराना तरीका: "AI ने 'बिल्ली' शब्द चुना। इसकी संभावना 90% है। स्कोर: उच्च।"
  • नया तरीका: शोध पत्र पूछता है, "AI ने अन्य सभी विकल्पों के बारे में क्या सोचा था?"

मौसम के पूर्वानुमान की कल्पना करें।

  • पुराना तरीका: मौसम विज्ञानी कहता है, "बारिश होगी।" (एक एकल भविष्यवाणी)। यदि आप पूर्वानुमान को थोड़ा सा बदलते हैं, तो पूरा निर्णय बदल जाता है।
  • नया तरीका (Rényi Entropy): मौसम विज्ञानी पूरे आकाश को देखता है। "बारिश की 40% संभावना है, धूप की 30%, बादलों की 20%, और बर्फबारी की 10%।" पूर्वानुमान का यह "आकार" (shape) बहुत कठिन है जिसे धोखा दिया जा सके। भले ही आप "बारिश" शब्द को "बूंदाबांदी" में बदल दें, आकाश का समग्र आकार (अनिश्चितता) स्थिर रहता है।

शोध पत्र Rényi entropy नामक एक गणितीय उपकरण का उपयोग करता है ताकि हर क्षण AI के मस्तिष्क के इस "आकार" को मापा जा सके। यह इसे उन लोगों के खिलाफ मजबूत बनाता है जो पुनर्गठन (rephrasing) या सेटिंग्स बदलकर इसे धोखा देने की कोशिश करते हैं।

यह मिलकर कैसे काम करता है

Uncertainty डिटेक्टर इन दोनों विचारों को जोड़ता है:

  1. लोकल चेक (Local Check): यह दुर्लभ, आश्चर्यजनक शब्दों को देखता है कि क्या वे मानव लेखन की तुलना में "अलग" महसूस होते हैं।
  2. ग्लोबल चेक (Global Check): यह AI के विकल्पों के "आकार" को देखता है ताकि यह सुनिश्चित हो सके कि निर्णय छोटे बदलावों से आसानी से न टूट जाए।

उन्होंने Uncertainty++ भी बनाया है, जो थोड़ा अलग स्थितियों के साथ कई बार परीक्षण करने जैसा है ताकि एक स्थिर औसत प्राप्त किया जा सके, जिससे यह सुनिश्चित हो सके कि परिणाम किसी मामूली गड़बड़ी के कारण न बदले।

परिणाम

लेखकों ने इसका परीक्षण 16 अलग-अलग AI मॉडल्स (नवीनतम मॉडल्स सहित) और 7 अलग-अलग प्रकार के लेखन (समाचार से लेकर Reddit कमेंट्स तक) पर किया।

  • बेहतर सटीकता: इसने पिछले सभी सर्वश्रेष्ठ तरीकों को पीछे छोड़ दिया।
  • धोखा देना कठिन: यह तब भी सटीक रहा जब टेक्स्ट को दोबारा लिखा गया या AI की सेटिंग्स बदली गईं।
  • तेज़: यह भारी कंप्यूटिंग पावर की आवश्यकता के बिना कुशलतापूर्वक काम करता है।

सारांश

पुराने डिटेक्टरों को एक सुरक्षा गार्ड की तरह समझें जो सभी के आईडी कार्ड (सामान्य शब्द) की जांच करता है। नया Uncertainty डिटेक्टर एक जासूस की तरह है जो आईडी कार्ड को अनदेखा करता है और इसके बजाय यह देखता है कि मुश्किल सवाल पूछे जाने पर लोग कैसे प्रतिक्रिया देते हैं (दुर्लभ शब्द) और वे कुल मिलाकर कितने घबराए हुए दिखते हैं (विकल्पों का आकार)। यह AI के लिए बच निकलना बहुत कठिन बना देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →