Seeing and Knowing in the Wild: Open-domain Visual Entity Recognition with Large-scale Knowledge Graphs via Contrastive Learning
यह शोध पत्र KnowCoL का प्रस्ताव करता है, जो एक ज्ञान-निर्देशित कंट्रास्टिव लर्निंग फ्रेमवर्क है जो ओपन-डोमेन विजुअल एंटिटी रिकग्निशन, विशेष रूप से दुर्लभ और अनदेखी संस्थाओं के लिए अत्याधुनिक प्रदर्शन प्राप्त करने हेतु विजुअल इनपुट्स को विकीडेटा-आधारित टेक्स्टुअल और स्ट्रक्चर्ड नॉलेज के साथ एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अनंत पुस्तकालय में घूम रहे हैं जहाँ किताबें केवल अलमारियों पर ही नहीं, बल्कि हवा में तैर रही हैं। इस पुस्तकालय में दुनिया की हर एक चीज़ मौजूद है: हर विशिष्ट पेड़, हर प्रसिद्ध इमारत, हर दुर्लभ कीट और हर मशहूर हस्ती।
अब, कल्पना कीजिए कि आप एक ऐसे लाइब्रेरियन हैं जिसने पहले कभी कोई किताब नहीं देखी है। कोई आपको एक अजीब, नीले रंग की तितली की फोटो थमाता है और पूछता है, "यह क्या है?"
पुराने दिनों में, लाइब्रेरियन (AI मॉडल्स) को केवल 1,000 सामान्य जानवरों की एक छोटी, निश्चित सूची पर प्रशिक्षित किया जाता था। यदि आप उन्हें एक नीली तितली दिखाते, तो वे या तो कहते, "मुझे नहीं पता," या फिर "तितली" (जो बहुत अस्पष्ट है) या "पतंगा" (जो गलत है) होने का अनुमान लगाते। वे वास्तविक दुनिया की अनंत विविधता को संभालने में सक्षम नहीं थे।
यह पेपर KnowCoL नामक एक नए प्रकार के लाइब्रेरियन का परिचय देता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "नाम का खेल" बनाम "अर्थ का खेल"
पिछले AI मॉडल्स "नाम मिलान" (Name Matching) का खेल खेलने की कोशिश करते थे।
- पुराना तरीका: AI "मरकरी" (ग्रह) की एक तस्वीर और "मरकरी" (तरल धातु) की एक तस्वीर देखता है। दोनों का नाम एक ही है। AI भ्रमित हो जाता है क्योंकि वह केवल टेक्स्ट लेबल देखता है। यह 100 "जॉन स्मिथ" नाम के लोगों की भीड़ में बिना कुछ जाने किसी एक "जॉन स्मिथ" को खोजने जैसा है।
- नया तरीका (KnowCoL): केवल नामों को मिलाने के बजाय, KnowCoL "अर्थ का खेल" (Meaning Game) खेलता है। यह केवल यह नहीं पूछता कि "इसे क्या कहा जाता है?" बल्कि यह पूछता है कि "यह क्या है?" यह समझता है कि एक मरकरी अंतरिक्ष में चट्टान का एक विशाल गोला है, और दूसरा थर्मामीटर में एक चमकदार तरल धातु है।
2. गुप्त हथियार: "सुपर-कनेक्टेड मैप"
अर्थ का खेल खेलने के लिए, KnowCoL Wikidata नामक एक विशाल, डिजिटल मानचित्र का उपयोग करता है।
- Wikidata को तथ्यों के एक विशाल, परस्पर जुड़े हुए जाल के रूप में सोचें। यह जानता है कि "बिग बेन" "वेस्टमिंस्टर पैलेस" का हिस्सा है, जो "लंदन" में है, जो "इंग्लैंड" में है।
- पुराने AI मॉडल्स बिग बेन की तस्वीर को अलग-थलग देखते थे।
- KnowCoL उस तस्वीर को देखता है और तुरंत इसे इस वेब से जोड़ देता है। यह दृश्य संकेतों को देखता है और कहता है, "आह, यह घड़ी का टॉवर एक विशिष्ट इमारत से जुड़ा है, जो एक विशिष्ट शहर से जुड़ा है। इसलिए, यह सिर्फ 'एक घड़ी का टॉवर' नहीं है; यह Q41255 (बिग बेन) है।"
3. प्रशिक्षण: "जुड़ाव से सीखना" (कंट्रास्टिव लर्निंग)
यह AI यह सब कैसे सीखता है? लेखक इसके लिए कंट्रास्टिव लर्निंग (Contrastive Learning) नामक तकनीक का उपयोग करते हैं।
कल्पना कीजिए कि आप एक बच्चे को कुत्ते पहचानना सिखा रहे हैं।
- पुराना तरीका: आप उन्हें एक तस्वीर दिखाते हैं और कहते हैं, "यह एक कुत्ता है।" आप ऐसा 1,000 अलग-अलग कुत्तों के लिए करते हैं।
- KnowCoL का तरीका: आप बच्चे को एक गोल्डन रिट्रीवर की तस्वीर और एक चिहुआहुआ की तस्वीर दिखाते हैं। आप कहते हैं, "ये दोनों कुत्ते हैं, लेकिन ये अलग हैं।" फिर आप एक बिल्ली की तस्वीर दिखाते हैं और कहते, "यह कुत्ता नहीं है।"
- AI यह लाखों वस्तुओं के साथ करता है। यह चीजों को समान (जैसे एक विशिष्ट कार की फोटो और उसका विवरण) के करीब लाने और चीजों को अलग (जैसे एक कार की फोटो और केले का विवरण) को दूर धकेलने के लिए सीखता है।
4. "फ्यूजन" का जादू
पेपर एक "फ्यूज़र" (Fuser) मॉड्यूल का वर्णन करता है। इसे एक अनुवादक (Translator) के रूप में सोचें जो एक साथ दो भाषाएँ बोलता है:
- दृश्य भाषा (Visual Language): जो कैमरा देखता है (रंग, आकार, बनावट)।
- वैचारिक भाषा (Conceptual Language): जो विश्वकोश कहता है (तथ्य, संबंध, इतिहास)।
फ्यूज़र एक फोटो और एक प्रश्न (जैसे, "यह पहिया क्या है?") को लेता है और उन्हें AI के मस्तिष्क में एक एकल "विचार" में अनुवादित करता है। फिर यह इस "विचार" की तुलना Wikidata के विशाल मानचित्र से करता है ताकि सही मिलान पाया जा सके।
5. परिणाम: "छोटा जीनियस"
इस पेपर का सबसे प्रभावशाली हिस्सा परिणाम है।
- इस समस्या को हल करने वाले अन्य AI मॉडल्स "विशाल दानवों" (Giant Ogres) की तरह हैं: वे बहुत बड़े, भारी हैं और उन्हें चलाने के लिए भारी मात्रा में ऊर्जा (कंप्यूटर) की आवश्यकता होती है।
- KnowCoL एक "छोटे, तेज जासूस" (Small, Sharp Detective) की तरह है।
- यह अपने सबसे बड़े प्रतिस्पर्धियों से 35 गुना छोटा है।
- फिर भी, यह उन चीजों को पहचानने में 10.5% बेहतर है जिन्हें इसने पहले कभी नहीं देखा (Zero-Shot learning)।
क्यों? क्योंकि इसने केवल तस्वीरें याद नहीं कीं; इसने दुनिया की संरचना को सीखा। यह जानता है कि यदि यह एक "फेरिस व्हील" देखता है, तो इसकी संभावना है कि यह एक "पर्यटक आकर्षण" (Tourist Attraction) है, जो इसे सही उत्तर का अनुमान लगाने में मदद करता है भले ही इसने उस विशिष्ट पहिये को पहले कभी न देखा हो।
सारांश
KnowCoL एक नया AI है जो केवल चित्रों को "देखता" नहीं है; यह उन्हें मानव ज्ञान के एक विशाल, संरचित मानचित्र से जोड़कर उन्हें "समझता" है। यह एक कंप्यूटर को एक ऐसा मस्तिष्क देने जैसा है जो फोटो देखते समय विश्वकोश पढ़ सकता है, जिससे यह अविश्वसनीय सटीकता के साथ अस्पष्ट, दुर्लभ या अनदेखी चीजों की पहचान कर सकता है, और यह सब एक मानक कंप्यूटर पर चलने के लिए पर्याप्त छोटा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।