Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
यह शोध पत्र मल्टी-मोडल डेटा का उपयोग करके प्राचीन रोमन सिक्कों पर सेमेंटिक तत्वों की स्वचालित पहचान के लिए विजन ट्रांसफॉर्मर (ViT) के पहले अनुप्रयोग को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि ViT मॉडल सटीकता में पारंपरिक CNNs से बेहतर प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास प्राचीन रोमन सिक्कों का एक विशाल, धूल भरा पुस्तकालय है। कुछ चमकदार हैं, कुछ घिस चुके हैं, और कई मिट्टी से ढके हुए हैं। सदियों तक, केवल कुछ विशेषज्ञ ही दशकों के प्रशिक्षण के बाद किसी सिक्के को देख पाते थे, उस पर बनी छोटी तस्वीरों को गौर से देखते थे और कह पाते थे, "आह, इसमें एक घोड़ा है," या "इसमें एक ढाल है।"
यह शोध पत्र कंप्यूटर को वही काम करने के लिए सिखाने के बारे में है, लेकिन एक ट्विस्ट के साथ: शोधकर्ता यह देखना चाहते थे कि क्या एक नया प्रकार का कंप्यूटर मस्तिष्क जिसे विज़न ट्रांसफॉर्मर (ViT) कहा जाता है, पुराने मानक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) की तुलना में बेहतर है।
यहाँ उनके प्रयोग की कहानी है, जिसे सरल शब्दों में समझाया गया है।
समस्या: 1,00,000 सिक्कों का पुस्तकालय
शोधकर्ताओं ने एक ऑनलाइन नीलामी साइट से ली गई 1,00,000 सिक्कों की छवियों और उनके विवरणों का एक विशाल संग्रह से शुरुआत की। इसे पहेली के टुकड़ों के एक बड़े ढेर की तरह समझें।
- चुनौती: प्राचीन सिक्के पेचीदा होते हैं। वे अक्सर खरोंच वाले होते हैं, उनकी तस्वीरें शैलीबद्ध (यथार्थवादी नहीं) होती हैं, और एक ही प्रकार का सिक्का उस सांचे (डाई) के आधार पर थोड़ा अलग दिख सकता है जिसका उपयोग उसे बनाने के लिए किया गया था।
- लक्ष्य: केवल एक सिक्के को दूसरे से मिलाने (जैसे कि "जुड़वां ढूंढने वाला" खेल) के बजाय, वे चाहते थे कि कंप्यूटर चित्रों के अर्थ को समझे। क्या कंप्यूटर एक "कॉर्नुकोपिया" (भरपूर का सींग) को पहचान सकता है? क्या वह बता सकता है कि कोई आकृति "खड़ी" है या "बैठी" है?
मुकाबले: पुराना गार्ड बनाम नया खिलाड़ी
इसे हल करने के लिए, उन्होंने दो अलग-अलग कंप्यूटर आर्किटेक्चर को एक-दूसरे के विरुद्ध खड़ा किया:
CNN (द "लोकल डिटेक्टिव" - स्थानीय जासूस):
एक जासूस की कल्पना करें जो एक तस्वीर को एक-एक करके छोटे हिस्सों की जांच करके देखता है। वे ऊपर-बाएँ कोने को देखते हैं, फिर ऊपर-दाएँ कोने को, फिर बीच को। वे स्थानीय पैटर्न, जैसे कि एक विशिष्ट वक्र या रेखा को पहचानने में बहुत अच्छे हैं। हालाँकि, उन्हें कभी-कभी 'टनल विजन' हो सकता है, यानी वे एक छोटे से स्थान पर बहुत अधिक ध्यान केंद्रित कर सकते हैं और बड़ी तस्वीर को मिस कर सकते हैं।ViT (द "ग्लोबल ऑब्जर्वर" - वैश्विक पर्यवेक्षक):
विज़न ट्रांसफॉर्मर नया खिलाड़ी है। चित्रों को एक-एक करके देखने के बजाय, एक ऐसे जासूस की कल्पना करें जो एक ही बार में पूरी तस्वीर को देखता है, और तुरंत समझ जाता है कि ऊपर-बाएँ कोने का नीचे-दाएँ कोने से क्या संबंध है। यह छवि को एक वाक्य की तरह मानता है, जहाँ हर हिस्सा दूसरे हिस्से से जुड़ा होता है। यह इसे उन "लॉन्ग-रेंज" कनेक्शनों को देखने की अनुमति देता है जिन्हें स्थानीय जासूस मिस कर सकता है।
प्रयोग: दिमागों को प्रशिक्षित करना
शोधकर्ताओं को पहले अपने डेटा को साफ करना पड़ा। मूल तस्वीरों में अक्सर सिक्के के दोनों पक्ष (सामने और पीछे) या ढेर में रखे कई सिक्के दिखाए जाते थे। उन्होंने एक प्रोग्राम लिखा जो केवल सिक्के के पिछले हिस्से (रिवर्स) को काट देता है, जिसमें आमतौर पर सबसे दिलचस्प चित्र होते हैं।
फिर उन्होंने इन साफ की गई छवियों को दोनों प्रकार के कंप्यूटरों में डाला।
- CNN को एक समय में एक विशिष्ट अवधारणा (जैसे, "सभी बाज खोजो") पर प्रशिक्षित किया गया था।
- ViT एक मल्टीटास्कर था; इसने एक ही मॉडल में सभी अवधारणाओं (बाज, ढाल, घोड़े, आदि) को एक साथ सीखना सीखा।
परिणाम: कौन जीता?
प्रशिक्षण पूरा होने के बाद, उन्होंने उन सिक्कों पर कंप्यूटरों का परीक्षण किया जिन्हें उन्होंने पहले कभी नहीं देखा था।
- विजेता: विज़न ट्रांसफॉर्मर (ViT) आम तौर पर जीता। यह सीमेटिक तत्वों (चित्रों) की पहचान करने में CNN की तुलना में अधिक सटीक था।
- गति: CNN को प्रशिक्षित करना बहुत तेज़ था (एक स्प्रिंटर की तरह), जबकि ViT को बहुत अधिक समय लगा (एक मैराथन धावक की तरह), लेकिन इसने सटीकता के मामले में बेहतर फिनिशिंग टाइम के साथ अंत किया।
- "क्यों": शोधकर्ताओं ने पाया कि ViT सिक्कों की अस्त-व्यस्त, घिसी-पिटी प्रकृति को संभालने में बेहतर था। जब चित्र उम्मीद के मुताबिक थोड़ा अलग होता था, तो यह उतना भ्रमित नहीं होता था।
"एक्स-रे विजन" (सेलियंसी मैप्स)
यह समझने के लिए कि कंप्यूटर कैसे सोच रहे थे, शोधकर्ताओं ने "सेलियंसी मैपिंग" नामक टूल का उपयोग किया। यह छवि पर एक्स-रे डालने जैसा है ताकि यह देखा जा सके कि कंप्यूटर निर्णय लेने के लिए किस हिस्से को देख रहा था।
- CNN का एक्स-रे: CNN एक विशिष्ट, छोटे स्थान पर ध्यान केंद्रित करने की प्रवृत्ति रखता था। उदाहरण के लिए, बाज को देखते समय, वे लगभग हमेशा सिक्के के निचले-दाएँ कोने को देखते थे, जहाँ अक्सर बाज के पंख दिखाई देते हैं। यह एक ऐसे छात्र की तरह था जिसने रट लिया था कि "बाज हमेशा निचले दाएं कोने में होते हैं" बजाय इसके कि वास्तव में पक्षी को पहचाना जाए।
- ViT का एक्स-रे: ViT का फोकस बहुत अधिक बिखरा हुआ और विविध था। कभी-कभी यह बाज के पंखों को देखता था, कभी पृष्ठभूमि को, तो कभी पास के टेक्स्ट को। यह अनुमान लगाना कठिन था कि यह वास्तव में कहाँ देख रहा था, लेकिन इससे पता चलता है कि यह वास्तव में पूरे दृश्य को "समझ" रहा था, न कि केवल एक स्थान को याद कर रहा था।
पकड़: शोर वाले लेबल (Noisy Labels)
शोध पत्र इस प्रयोग में एक प्रमुख कमी को स्वीकार करता है: उन्होंने कंप्यूटर को जो "उत्तर" दिए थे वे अस्त-व्यस्त थे।
कंप्यूटरों को नीलामी साइट के टेक्स्ट विवरणों का उपयोग करके प्रशिक्षित किया गया था। लेकिन ये विवरण अक्सर सिक्के के दोनों पक्षों के बारे में बात करते थे।
- उदाहरण: एक विवरण कह सकता है, "सामने: सम्राट का सिर। पीछे: एक खड़ा हुआ घोड़ा।"
- गलती: कंप्यूटर को केवल पिछला हिस्सा (घोड़ा) दिखाया गया, लेकिन लेबल में "खड़ा हुआ" (Standing) लिखा था। हालाँकि, कभी-कभी विवरण में "खड़ा हुआ" इसलिए कहा गया क्योंकि वह सिक्के के सामने के हिस्से के बारे में था, भले ही पीछे के हिस्से में कोई खड़ी आकृति न हो।
- परिणाम: कंप्यूटर कभी-कभी गलत संकेतों से सीख रहे थे। शोधकर्ताओं ने उल्लेख किया कि इस "शोर" ने दोनों मॉडलों के प्रदर्शन को बाधित किया होगा, विशेष रूप से "खड़े होने" या "बैठने" जैसी अवधारणाओं के लिए।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि विज़न ट्रांसफॉर्मर प्राचीन सिक्कों के अध्ययन के लिए एक आशाजनक नया उपकरण हैं। वे सटीकता में पुराने CNN मॉडलों से बेहतर रहे, जिससे पता चलता है कि "ग्लोबल ऑब्जर्वर" दृष्टिकोण प्राचीन इतिहास की जटिल और अस्त-व्यस्त दुनिया के लिए बेहतर है।
हालाँकि, शोधकर्ता चेतावनी देते हैं कि और भी बेहतर परिणाम प्राप्त करने के लिए, हमें स्वच्छ डेटा की आवश्यकता है। यदि हम कंप्यूटर को यह सिखा सकें कि सिक्के के "पिछले हिस्से" को देखते समय "सिक्के के सामने वाले हिस्से" के टेक्स्ट को कैसे अनदेखा किया जाए, तो ये डिजिटल इतिहासकार और भी शक्तिशाली बन सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।