← नवीनतम पेपर
🤖 machine learning

Seeing and Knowing in the Wild: Open-domain Visual Entity Recognition with Large-scale Knowledge Graphs via Contrastive Learning

यह शोध पत्र KnowCoL का प्रस्ताव करता है, जो एक ज्ञान-निर्देशित कंट्रास्टिव लर्निंग फ्रेमवर्क है जो ओपन-डोमेन विजुअल एंटिटी रिकग्निशन, विशेष रूप से दुर्लभ और अनदेखी संस्थाओं के लिए अत्याधुनिक प्रदर्शन प्राप्त करने हेतु विजुअल इनपुट्स को विकीडेटा-आधारित टेक्स्टुअल और स्ट्रक्चर्ड नॉलेज के साथ एकीकृत करता है।

मूल लेखक: Hongkuan Zhou, Lavdim Halilaj, Sebastian Monka, Stefan Schmid, Yuqicheng Zhu, Jingcheng Wu, Nadeem Nazer, Steffen Staab

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongkuan Zhou, Lavdim Halilaj, Sebastian Monka, Stefan Schmid, Yuqicheng Zhu, Jingcheng Wu, Nadeem Nazer, Steffen Staab

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अनंत पुस्तकालय में घूम रहे हैं जहाँ किताबें केवल अलमारियों पर ही नहीं, बल्कि हवा में तैर रही हैं। इस पुस्तकालय में दुनिया की हर एक चीज़ मौजूद है: हर विशिष्ट पेड़, हर प्रसिद्ध इमारत, हर दुर्लभ कीट और हर मशहूर हस्ती।

अब, कल्पना कीजिए कि आप एक ऐसे लाइब्रेरियन हैं जिसने पहले कभी कोई किताब नहीं देखी है। कोई आपको एक अजीब, नीले रंग की तितली की फोटो थमाता है और पूछता है, "यह क्या है?"

पुराने दिनों में, लाइब्रेरियन (AI मॉडल्स) को केवल 1,000 सामान्य जानवरों की एक छोटी, निश्चित सूची पर प्रशिक्षित किया जाता था। यदि आप उन्हें एक नीली तितली दिखाते, तो वे या तो कहते, "मुझे नहीं पता," या फिर "तितली" (जो बहुत अस्पष्ट है) या "पतंगा" (जो गलत है) होने का अनुमान लगाते। वे वास्तविक दुनिया की अनंत विविधता को संभालने में सक्षम नहीं थे।

यह पेपर KnowCoL नामक एक नए प्रकार के लाइब्रेरियन का परिचय देता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "नाम का खेल" बनाम "अर्थ का खेल"

पिछले AI मॉडल्स "नाम मिलान" (Name Matching) का खेल खेलने की कोशिश करते थे।

  • पुराना तरीका: AI "मरकरी" (ग्रह) की एक तस्वीर और "मरकरी" (तरल धातु) की एक तस्वीर देखता है। दोनों का नाम एक ही है। AI भ्रमित हो जाता है क्योंकि वह केवल टेक्स्ट लेबल देखता है। यह 100 "जॉन स्मिथ" नाम के लोगों की भीड़ में बिना कुछ जाने किसी एक "जॉन स्मिथ" को खोजने जैसा है।
  • नया तरीका (KnowCoL): केवल नामों को मिलाने के बजाय, KnowCoL "अर्थ का खेल" (Meaning Game) खेलता है। यह केवल यह नहीं पूछता कि "इसे क्या कहा जाता है?" बल्कि यह पूछता है कि "यह क्या है?" यह समझता है कि एक मरकरी अंतरिक्ष में चट्टान का एक विशाल गोला है, और दूसरा थर्मामीटर में एक चमकदार तरल धातु है।

2. गुप्त हथियार: "सुपर-कनेक्टेड मैप"

अर्थ का खेल खेलने के लिए, KnowCoL Wikidata नामक एक विशाल, डिजिटल मानचित्र का उपयोग करता है।

  • Wikidata को तथ्यों के एक विशाल, परस्पर जुड़े हुए जाल के रूप में सोचें। यह जानता है कि "बिग बेन" "वेस्टमिंस्टर पैलेस" का हिस्सा है, जो "लंदन" में है, जो "इंग्लैंड" में है।
  • पुराने AI मॉडल्स बिग बेन की तस्वीर को अलग-थलग देखते थे।
  • KnowCoL उस तस्वीर को देखता है और तुरंत इसे इस वेब से जोड़ देता है। यह दृश्य संकेतों को देखता है और कहता है, "आह, यह घड़ी का टॉवर एक विशिष्ट इमारत से जुड़ा है, जो एक विशिष्ट शहर से जुड़ा है। इसलिए, यह सिर्फ 'एक घड़ी का टॉवर' नहीं है; यह Q41255 (बिग बेन) है।"

3. प्रशिक्षण: "जुड़ाव से सीखना" (कंट्रास्टिव लर्निंग)

यह AI यह सब कैसे सीखता है? लेखक इसके लिए कंट्रास्टिव लर्निंग (Contrastive Learning) नामक तकनीक का उपयोग करते हैं।

कल्पना कीजिए कि आप एक बच्चे को कुत्ते पहचानना सिखा रहे हैं।

  • पुराना तरीका: आप उन्हें एक तस्वीर दिखाते हैं और कहते हैं, "यह एक कुत्ता है।" आप ऐसा 1,000 अलग-अलग कुत्तों के लिए करते हैं।
  • KnowCoL का तरीका: आप बच्चे को एक गोल्डन रिट्रीवर की तस्वीर और एक चिहुआहुआ की तस्वीर दिखाते हैं। आप कहते हैं, "ये दोनों कुत्ते हैं, लेकिन ये अलग हैं।" फिर आप एक बिल्ली की तस्वीर दिखाते हैं और कहते, "यह कुत्ता नहीं है।"
  • AI यह लाखों वस्तुओं के साथ करता है। यह चीजों को समान (जैसे एक विशिष्ट कार की फोटो और उसका विवरण) के करीब लाने और चीजों को अलग (जैसे एक कार की फोटो और केले का विवरण) को दूर धकेलने के लिए सीखता है।

4. "फ्यूजन" का जादू

पेपर एक "फ्यूज़र" (Fuser) मॉड्यूल का वर्णन करता है। इसे एक अनुवादक (Translator) के रूप में सोचें जो एक साथ दो भाषाएँ बोलता है:

  1. दृश्य भाषा (Visual Language): जो कैमरा देखता है (रंग, आकार, बनावट)।
  2. वैचारिक भाषा (Conceptual Language): जो विश्वकोश कहता है (तथ्य, संबंध, इतिहास)।

फ्यूज़र एक फोटो और एक प्रश्न (जैसे, "यह पहिया क्या है?") को लेता है और उन्हें AI के मस्तिष्क में एक एकल "विचार" में अनुवादित करता है। फिर यह इस "विचार" की तुलना Wikidata के विशाल मानचित्र से करता है ताकि सही मिलान पाया जा सके।

5. परिणाम: "छोटा जीनियस"

इस पेपर का सबसे प्रभावशाली हिस्सा परिणाम है।

  • इस समस्या को हल करने वाले अन्य AI मॉडल्स "विशाल दानवों" (Giant Ogres) की तरह हैं: वे बहुत बड़े, भारी हैं और उन्हें चलाने के लिए भारी मात्रा में ऊर्जा (कंप्यूटर) की आवश्यकता होती है।
  • KnowCoL एक "छोटे, तेज जासूस" (Small, Sharp Detective) की तरह है।
    • यह अपने सबसे बड़े प्रतिस्पर्धियों से 35 गुना छोटा है।
    • फिर भी, यह उन चीजों को पहचानने में 10.5% बेहतर है जिन्हें इसने पहले कभी नहीं देखा (Zero-Shot learning)।

क्यों? क्योंकि इसने केवल तस्वीरें याद नहीं कीं; इसने दुनिया की संरचना को सीखा। यह जानता है कि यदि यह एक "फेरिस व्हील" देखता है, तो इसकी संभावना है कि यह एक "पर्यटक आकर्षण" (Tourist Attraction) है, जो इसे सही उत्तर का अनुमान लगाने में मदद करता है भले ही इसने उस विशिष्ट पहिये को पहले कभी न देखा हो।

सारांश

KnowCoL एक नया AI है जो केवल चित्रों को "देखता" नहीं है; यह उन्हें मानव ज्ञान के एक विशाल, संरचित मानचित्र से जोड़कर उन्हें "समझता" है। यह एक कंप्यूटर को एक ऐसा मस्तिष्क देने जैसा है जो फोटो देखते समय विश्वकोश पढ़ सकता है, जिससे यह अविश्वसनीय सटीकता के साथ अस्पष्ट, दुर्लभ या अनदेखी चीजों की पहचान कर सकता है, और यह सब एक मानक कंप्यूटर पर चलने के लिए पर्याप्त छोटा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →