← नवीनतम पेपर
💻 computer science

Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?

यह शोध पत्र मल्टी-मोडल डेटा का उपयोग करके प्राचीन रोमन सिक्कों पर सेमेंटिक तत्वों की स्वचालित पहचान के लिए विजन ट्रांसफॉर्मर (ViT) के पहले अनुप्रयोग को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि ViT मॉडल सटीकता में पारंपरिक CNNs से बेहतर प्रदर्शन करते हैं।

मूल लेखक: David Reid, Ognjen Arandjelovic

प्रकाशित 2026-01-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Reid, Ognjen Arandjelovic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास प्राचीन रोमन सिक्कों का एक विशाल, धूल भरा पुस्तकालय है। कुछ चमकदार हैं, कुछ घिस चुके हैं, और कई मिट्टी से ढके हुए हैं। सदियों तक, केवल कुछ विशेषज्ञ ही दशकों के प्रशिक्षण के बाद किसी सिक्के को देख पाते थे, उस पर बनी छोटी तस्वीरों को गौर से देखते थे और कह पाते थे, "आह, इसमें एक घोड़ा है," या "इसमें एक ढाल है।"

यह शोध पत्र कंप्यूटर को वही काम करने के लिए सिखाने के बारे में है, लेकिन एक ट्विस्ट के साथ: शोधकर्ता यह देखना चाहते थे कि क्या एक नया प्रकार का कंप्यूटर मस्तिष्क जिसे विज़न ट्रांसफॉर्मर (ViT) कहा जाता है, पुराने मानक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) की तुलना में बेहतर है।

यहाँ उनके प्रयोग की कहानी है, जिसे सरल शब्दों में समझाया गया है।

समस्या: 1,00,000 सिक्कों का पुस्तकालय

शोधकर्ताओं ने एक ऑनलाइन नीलामी साइट से ली गई 1,00,000 सिक्कों की छवियों और उनके विवरणों का एक विशाल संग्रह से शुरुआत की। इसे पहेली के टुकड़ों के एक बड़े ढेर की तरह समझें।

  • चुनौती: प्राचीन सिक्के पेचीदा होते हैं। वे अक्सर खरोंच वाले होते हैं, उनकी तस्वीरें शैलीबद्ध (यथार्थवादी नहीं) होती हैं, और एक ही प्रकार का सिक्का उस सांचे (डाई) के आधार पर थोड़ा अलग दिख सकता है जिसका उपयोग उसे बनाने के लिए किया गया था।
  • लक्ष्य: केवल एक सिक्के को दूसरे से मिलाने (जैसे कि "जुड़वां ढूंढने वाला" खेल) के बजाय, वे चाहते थे कि कंप्यूटर चित्रों के अर्थ को समझे। क्या कंप्यूटर एक "कॉर्नुकोपिया" (भरपूर का सींग) को पहचान सकता है? क्या वह बता सकता है कि कोई आकृति "खड़ी" है या "बैठी" है?

मुकाबले: पुराना गार्ड बनाम नया खिलाड़ी

इसे हल करने के लिए, उन्होंने दो अलग-अलग कंप्यूटर आर्किटेक्चर को एक-दूसरे के विरुद्ध खड़ा किया:

  1. CNN (द "लोकल डिटेक्टिव" - स्थानीय जासूस):
    एक जासूस की कल्पना करें जो एक तस्वीर को एक-एक करके छोटे हिस्सों की जांच करके देखता है। वे ऊपर-बाएँ कोने को देखते हैं, फिर ऊपर-दाएँ कोने को, फिर बीच को। वे स्थानीय पैटर्न, जैसे कि एक विशिष्ट वक्र या रेखा को पहचानने में बहुत अच्छे हैं। हालाँकि, उन्हें कभी-कभी 'टनल विजन' हो सकता है, यानी वे एक छोटे से स्थान पर बहुत अधिक ध्यान केंद्रित कर सकते हैं और बड़ी तस्वीर को मिस कर सकते हैं।

  2. ViT (द "ग्लोबल ऑब्जर्वर" - वैश्विक पर्यवेक्षक):
    विज़न ट्रांसफॉर्मर नया खिलाड़ी है। चित्रों को एक-एक करके देखने के बजाय, एक ऐसे जासूस की कल्पना करें जो एक ही बार में पूरी तस्वीर को देखता है, और तुरंत समझ जाता है कि ऊपर-बाएँ कोने का नीचे-दाएँ कोने से क्या संबंध है। यह छवि को एक वाक्य की तरह मानता है, जहाँ हर हिस्सा दूसरे हिस्से से जुड़ा होता है। यह इसे उन "लॉन्ग-रेंज" कनेक्शनों को देखने की अनुमति देता है जिन्हें स्थानीय जासूस मिस कर सकता है।

प्रयोग: दिमागों को प्रशिक्षित करना

शोधकर्ताओं को पहले अपने डेटा को साफ करना पड़ा। मूल तस्वीरों में अक्सर सिक्के के दोनों पक्ष (सामने और पीछे) या ढेर में रखे कई सिक्के दिखाए जाते थे। उन्होंने एक प्रोग्राम लिखा जो केवल सिक्के के पिछले हिस्से (रिवर्स) को काट देता है, जिसमें आमतौर पर सबसे दिलचस्प चित्र होते हैं।

फिर उन्होंने इन साफ की गई छवियों को दोनों प्रकार के कंप्यूटरों में डाला।

  • CNN को एक समय में एक विशिष्ट अवधारणा (जैसे, "सभी बाज खोजो") पर प्रशिक्षित किया गया था।
  • ViT एक मल्टीटास्कर था; इसने एक ही मॉडल में सभी अवधारणाओं (बाज, ढाल, घोड़े, आदि) को एक साथ सीखना सीखा।

परिणाम: कौन जीता?

प्रशिक्षण पूरा होने के बाद, उन्होंने उन सिक्कों पर कंप्यूटरों का परीक्षण किया जिन्हें उन्होंने पहले कभी नहीं देखा था।

  • विजेता: विज़न ट्रांसफॉर्मर (ViT) आम तौर पर जीता। यह सीमेटिक तत्वों (चित्रों) की पहचान करने में CNN की तुलना में अधिक सटीक था।
  • गति: CNN को प्रशिक्षित करना बहुत तेज़ था (एक स्प्रिंटर की तरह), जबकि ViT को बहुत अधिक समय लगा (एक मैराथन धावक की तरह), लेकिन इसने सटीकता के मामले में बेहतर फिनिशिंग टाइम के साथ अंत किया।
  • "क्यों": शोधकर्ताओं ने पाया कि ViT सिक्कों की अस्त-व्यस्त, घिसी-पिटी प्रकृति को संभालने में बेहतर था। जब चित्र उम्मीद के मुताबिक थोड़ा अलग होता था, तो यह उतना भ्रमित नहीं होता था।

"एक्स-रे विजन" (सेलियंसी मैप्स)

यह समझने के लिए कि कंप्यूटर कैसे सोच रहे थे, शोधकर्ताओं ने "सेलियंसी मैपिंग" नामक टूल का उपयोग किया। यह छवि पर एक्स-रे डालने जैसा है ताकि यह देखा जा सके कि कंप्यूटर निर्णय लेने के लिए किस हिस्से को देख रहा था।

  • CNN का एक्स-रे: CNN एक विशिष्ट, छोटे स्थान पर ध्यान केंद्रित करने की प्रवृत्ति रखता था। उदाहरण के लिए, बाज को देखते समय, वे लगभग हमेशा सिक्के के निचले-दाएँ कोने को देखते थे, जहाँ अक्सर बाज के पंख दिखाई देते हैं। यह एक ऐसे छात्र की तरह था जिसने रट लिया था कि "बाज हमेशा निचले दाएं कोने में होते हैं" बजाय इसके कि वास्तव में पक्षी को पहचाना जाए।
  • ViT का एक्स-रे: ViT का फोकस बहुत अधिक बिखरा हुआ और विविध था। कभी-कभी यह बाज के पंखों को देखता था, कभी पृष्ठभूमि को, तो कभी पास के टेक्स्ट को। यह अनुमान लगाना कठिन था कि यह वास्तव में कहाँ देख रहा था, लेकिन इससे पता चलता है कि यह वास्तव में पूरे दृश्य को "समझ" रहा था, न कि केवल एक स्थान को याद कर रहा था।

पकड़: शोर वाले लेबल (Noisy Labels)

शोध पत्र इस प्रयोग में एक प्रमुख कमी को स्वीकार करता है: उन्होंने कंप्यूटर को जो "उत्तर" दिए थे वे अस्त-व्यस्त थे।
कंप्यूटरों को नीलामी साइट के टेक्स्ट विवरणों का उपयोग करके प्रशिक्षित किया गया था। लेकिन ये विवरण अक्सर सिक्के के दोनों पक्षों के बारे में बात करते थे।

  • उदाहरण: एक विवरण कह सकता है, "सामने: सम्राट का सिर। पीछे: एक खड़ा हुआ घोड़ा।"
  • गलती: कंप्यूटर को केवल पिछला हिस्सा (घोड़ा) दिखाया गया, लेकिन लेबल में "खड़ा हुआ" (Standing) लिखा था। हालाँकि, कभी-कभी विवरण में "खड़ा हुआ" इसलिए कहा गया क्योंकि वह सिक्के के सामने के हिस्से के बारे में था, भले ही पीछे के हिस्से में कोई खड़ी आकृति न हो।
  • परिणाम: कंप्यूटर कभी-कभी गलत संकेतों से सीख रहे थे। शोधकर्ताओं ने उल्लेख किया कि इस "शोर" ने दोनों मॉडलों के प्रदर्शन को बाधित किया होगा, विशेष रूप से "खड़े होने" या "बैठने" जैसी अवधारणाओं के लिए।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि विज़न ट्रांसफॉर्मर प्राचीन सिक्कों के अध्ययन के लिए एक आशाजनक नया उपकरण हैं। वे सटीकता में पुराने CNN मॉडलों से बेहतर रहे, जिससे पता चलता है कि "ग्लोबल ऑब्जर्वर" दृष्टिकोण प्राचीन इतिहास की जटिल और अस्त-व्यस्त दुनिया के लिए बेहतर है।

हालाँकि, शोधकर्ता चेतावनी देते हैं कि और भी बेहतर परिणाम प्राप्त करने के लिए, हमें स्वच्छ डेटा की आवश्यकता है। यदि हम कंप्यूटर को यह सिखा सकें कि सिक्के के "पिछले हिस्से" को देखते समय "सिक्के के सामने वाले हिस्से" के टेक्स्ट को कैसे अनदेखा किया जाए, तो ये डिजिटल इतिहासकार और भी शक्तिशाली बन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →