← नवीनतम पेपर
💻 computer science

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

यह शोध पत्र ASCII आर्ट और ओवरलैपिंग ऑडियो का उपयोग करके नवीन CAPTCHA विधियों का प्रस्ताव और मूल्यांकन करता है, यह प्रदर्शित करते हुए कि वर्तमान अत्याधुनिक लार्ज लैंग्वेज मॉडल्स इन कार्यों को प्रभावी ढंग से हल करने में विफल रहते हैं, जिससे मनुष्यों को बॉट्स से अलग करने के लिए एक आशाजनक लेकिन संभावित रूप से अस्थायी समाधान मिलता है।

मूल लेखक: Choon-Hou Rafael Chong

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Choon-Hou Rafael Chong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरी पार्टी है। सालों तक, बाउंसरों (वेबसाइट मालिकों) ने शरारती तत्वों (बॉट्स) को बाहर रखने के लिए एक सरल तरकीब का इस्तेमाल किया: उन्होंने मेहमानों से एक पहेली सुलझाने को कहा, जैसे "इस टेढ़ी-मेढ़ी लिखावट को पढ़ें" या "सभी ट्रैफिक लाइटों पर क्लिक करें।" यह CAPTCHA था।

लेकिन हाल ही में, शरारती तत्वों ने एक बड़ा अपग्रेड हासिल किया है। उन्होंने सुपर-स्मार्ट AI सहायकों (लार्ज लैंग्वेज मॉडल्स) को काम पर रखा है जो किसी भी इंसान से कहीं अधिक तेज़ी से टेढ़ी-मेढ़ी लिखावट पढ़ सकते हैं और ट्रैफिक लाइटों को पहचान सकते हैं। पुराने बाउंसर वाले तरीके अब काम नहीं कर रहे हैं; AI मेहमान अब आसानी से अंदर आ रहे हैं।

यह शोध पत्र नए, अधिक कठिन बाउंसर ट्रिक्स डिजाइन करने के बारे में है जो उन चीजों पर आधारित हैं जिनमें इंसान लाखों वर्षों से माहिर रहे हैं, लेकिन AI अभी भी उनमें उलझ जाता है या उन्हें हल करना बहुत महंगा पड़ता है।

यहाँ वे दो नए ट्रिक्स दिए गए हैं जिनका परीक्षण लेखकों ने किया है:

1. "ASCII आर्ट" पहेली (विजुअल ट्रिक)

पुराना तरीका: एक शब्द की तस्वीर दिखाना जिसके ऊपर रेखाएं खींची गई हों।
नया तरीका: एक शब्द दिखाना जो छोटे कंप्यूटर प्रतीकों (जैसे |, _, +, और #) से बना हो, जिन्हें अक्षरों के रूप में व्यवस्थित किया गया हो। यह एक ऐसी तस्वीर की तरह है जो टेक्स्ट से बनी है।

  • उपमा: कल्पना कीजिए कि एक इंसान बादल को देख रहा है। भले ही वह सिर्फ एक सफेद आकार है, हमारा मस्तिष्क तुरंत कहता है, "यह एक ड्रैगन जैसा दिखता है!" हम पैटर्न देखने और खाली जगहों को भरने के लिए बने हैं।
  • AI के लिए समस्या: AI मॉडल उन रोबोट की तरह हैं जो केवल सामग्री की सूची देखते हैं। यदि आप उन्हें टेक्स्ट से बना एक बादल दिखाते हैं, तो वे भ्रमित हो जाते हैं। वे प्रतीकों (|, +, #) को एक "ड्रैगन" के बजाय प्रतीकों की एक अव्यवस्थित सूची के रूप में देखते हैं। वे प्रतीकों को शब्दों के रूप में पढ़ने की कोशिश करते हैं, न कि एक चित्र के रूप में।
  • परिणाम: लेखकों ने दुनिया के सबसे स्मार्ट AI मॉडलों (जैसे GPT-5 और Gemini 3) का परीक्षण किया। जब उन्होंने इन मॉडलों को ASCII आर्ट दिखाया, तो AI मॉडल्स का स्कोर 0% सही रहा। वे एक अक्षर भी सही नहीं पहचान सके। जबकि एक इंसान इसे पलक झपकते ही हल कर सकता था।

2. "कॉकटेल पार्टी" पहेली (ऑडियो ट्रिक)

पुराना तरीका: बॉट को एक स्पष्ट आवाज़ सुनने और जो वह सुनता है उसे टाइप करने के लिए कहना।
नया तरीका: एक ऐसी रिकॉर्डिंग चलाना जहाँ दो लोग एक साथ बात कर रहे हों, या जहाँ बैकग्राउंड में शोर हो (जैसे एक व्यस्त कैफे), और बॉट से केवल एक आवाज़ के आधार पर एक विशिष्ट प्रश्न का उत्तर देने को कहना।

  • उपमा: इसे "कॉकटेल पार्टी इफेक्ट" कहा जाता है। कल्पना कीजिए कि आप एक शोर भरी पार्टी में हैं। आप अपने दोस्त की आवाज़ पर ध्यान केंद्रित कर सकते हैं और संगीत या अन्य बातचीत को अनदेखा कर सकते हैं। इंसान स्वाभाविक रूप से ऐसा करते हैं।
  • AI के लिए समस्या: AI आमतौर पर सब कुछ सुनने के लिए प्रशिक्षित होता है। यदि आप इसे शोर वाली रिकॉर्डिंग सुनाते हैं, तो यह सुनी गई हर आवाज़ को लिखने की कोशिश करता है, जिससे यह भ्रमित हो जाता है। इसे शोर को "अनदेखा" करने और केवल एक आवाज़ पर ध्यान केंद्रित करने में कठिनाई होती है।
  • परिणाम: AI मॉडल्स ने तब ठीक प्रदर्शन किया जब ऑडियो स्पष्ट था, लेकिन जैसे ही लेखकों ने शोर या ओवरलैपिंग आवाज़ें जोड़ीं, AI का प्रदर्शन गिर गया। वे अंदाजे लगाने लगे, जबकि इंसान अभी भी उत्तर स्पष्ट रूप से सुन पा रहे थे।

"बहुत महंगा" रणनीति

लेखक एक तीसरे बचाव की ओर भी इशारा करते हैं: लागत (Cost)।

भले ही AI अंततः इन पहेलियों को हल करना सीख जाए, लेकिन यह बहुत महंगा हो सकता है।

  • उपमा: एक टोल बूथ की कल्पना करें। यदि एक इंसान को टोल चुकाने में 1 सेकंड लगता है, तो यह ठीक है। लेकिन यदि एक रोबोट को पहेली सुलझाने में 100 सेकंड की कंप्यूटर पावर लगती है, और उस रोबोट को यह लाखों बार करना पड़ता है, तो उसके पास पैसा (या बिजली) बहुत जल्दी खत्म हो जाएगा।
  • लक्ष्य: लक्ष्य केवल पहेली को AI के लिए "असंभव" बनाना नहीं है, बल्कि इसे इतना महंगा बनाना है कि यह करने लायक न रहे। यह बॉट हमले की "अर्थशास्त्र" (economics) को तोड़ देता है।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि:

  1. ASCII आर्ट वर्तमान में एक बहुत मजबूत ढाल है। AI इसमें बहुत बुरा है, लेकिन इंसान इसे आसानी से हल कर लेते हैं।
  2. शोर भरा ऑडियो (Noisy Audio) भी एक अच्छा ढाल है, हालांकि इसे बनाना कठिन है और यह कुछ लोगों के लिए कष्टदायक हो सकता है।
  3. भविवीष्य: हम हमेशा AI के लिए "असंभव" पहेलियाँ बनाने पर निर्भर नहीं रह सकते, क्योंकि AI लगातार स्मार्ट होता जा रहा है। इसके बजाय, हमें ऐसी पहेलियों पर निर्भर रहना चाहिए जो इंसानों के लिए सस्ती हों लेकिन बड़े पैमाने पर हल करने के लिए रोबोट्स के लिए बहुत महंगी हों।

संक्षेप में, लेखकों ने पाया है कि एक ऐसा तरीका ढूँढने का जो बाउंसर को ऐसा सवाल पूछने की अनुमति देता है जिसका जवाब देने के लिए AI बहुत "मूर्ख" (या बहुत "अमीर" होने के कारण असमर्थ) है, जबकि मानव अतिथि बस मुस्कुराता है और अंदर चला जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →