← नवीनतम पेपर
🤖 AI

VIRTUE: Visual-Interactive Text-Image Universal Embedder

यह शोधपत्र VIRTUE को प्रस्तुत करता है, जो एक नवीन विजुअल-इंटरैक्टिव टेक्स्ट-इमेज यूनिवर्सल एंबेडर है जो क्षेत्र-विशिष्ट उपयोगकर्ता प्रॉम्प्ट्स की अनुमति देने के लिए सेगमेंटेशन क्षमताओं को एकीकृत करता है, जिससे मानक मल्टीमॉडल बेंचमार्क और एक नए बड़े पैमाने के विजुअल-इंटरैक्टिव रिट्रीवल टास्क दोनों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अस्त-व्यस्त गोदाम में किसी विशिष्ट वस्तु की तलाश कर रहे हैं।

पुराना तरीका (पारंपरिक AI):
आप एक रोबोट को बताते हैं, "मेरे लिए एक लाल टूलबॉक्स ढूँढो।" रोबोट पूरे गोदाम को स्कैन करता है, हर लाल टूलबॉक्स को ढूँढ निकालता है और आपको उनका एक ढेर थमा देता है। लेकिन रुकिए, वास्तव में आप उस लाल टूलबॉक्स को चाहते थे जो टूटी हुई सीढ़ी के बगल में रखा है, न कि उसे जो शेल्फ पर है। रोबोट को समझ नहीं आता कि आपका क्या मतलब है क्योंकि वह केवल पूरी तस्वीर को देखता है, उन विशिष्ट विवरणों को नहीं जिनकी आपको परवाह है। यह बिल्कुल वैसा ही है जैसे भीड़ में किसी व्यक्ति को खोजने के लिए सिर्फ यह कहना कि "मैं नीली शर्ट वाले आदमी को ढूँढ रहा हूँ," बिना यह बताए कि कौन सा।

नया तरीका (VIRTUE):
यहाँ आता है VIRTUE (विजुअल-इंटरैक्टिव टेक्स्ट-इमेज यूनिवर्सल एम्बेडर)। VIRTUE को एक सुपर-स्मार्ट सहायक के रूप में समझें जो न केवल आपकी बातों को सुनता है बल्कि आपके उंगली दिखाने (इशारे करने) को भी समझता है।

यदि आप कहते हैं, "लाल टूलबॉक्स ढूँढो," और आप उस बॉक्स को खींचते हैं जो सीढ़ी के पास है, तो VIRTUE तुरंत समझ जाता है: "आह, आप सिर्फ एक लाल टूलबॉक्स नहीं चाहते; आप इस विशिष्ट स्थान पर, इस विशिष्ट संदर्भ में स्थित टूलबॉक्स को चाहते हैं।"

यहाँ बताया गया है कि VIRTUE कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "अंधी" खोज

वर्तमान AI मॉडल उन लोगों की तरह हैं जिन्होंने आँखों पर पट्टी बाँध रखी है और केवल विवरण सुन सकते हैं। वे एक सामान्य विवरण (जैसे "एक कुत्ता") को तस्वीर से मिलाने में माहिर हैं। लेकिन यदि आप उनसे पूछते हैं, "वह कुत्ता ढूँढो जो कालीन पर सो रहा है," और तस्वीर में तीन कुत्ते हैं (एक कालीन पर, एक सोफे पर, और एक बाहर), तो AI भ्रमित हो जाता है। वह "कुत्ता" और "कालीन" तो देखता है, लेकिन उन्हें स्थानिक रूप से (spatially) जोड़ नहीं पाता।

2. समाधान: "पॉइंट-एंड-क्लिक" की महाशक्ति

VIRTUE विशेष है क्योंकि यह दो शक्तिशाली कौशलों को जोड़ता है:

  • द विजनरी (VLM - द विजनरी): यह वह हिस्सा है जो छवि की पूरी कहानी को समझता है (ग्लोबल कॉन्टेक्स्ट/वैश्विक संदर्भ)। यह जानता है कि वहाँ एक पार्क है, पेड़ हैं और धूप वाला दिन है।
  • द सर्जन (सेगमेंटेशन मॉडल - द सर्जन): यह नया हिस्सा है। यह एक सर्जन की तरह है जो ज़ूम करके एक विशिष्ट अंग को अलग कर सकता है। VIRTUE के मामले में, यह आपके द्वारा दिखाए गए स्थान (एक बिंदु, एक बॉक्स, या एक मास्क) के आधार पर एक विशिष्ट वस्तु (जैसे एक कुत्ता) को अलग करता है।

जादुई ट्रिक:
VIRTUE इन दोनों को आपस में जोड़ देता है। यह "पूरी तस्वीर" वाले दृश्य और "ज़ूम-इन" किए गए दृश्य को लेता है और उन्हें एक एकल, पूर्ण समझ में मिला देता है।

  • उपमा: कल्पना कीजिए कि आप अपने मित्र को एक पेंटिंग का वर्णन कर रहे हैं। पुराना AI कहता है, "यह एक बगीचे की पेंटिंग है।" VIRTUE कहता है, "यह एक बगीचे की पेंटिंग है, और विशेष रूप से, कोने में इस लाल फूल को देखें जिसे कलाकार ने हाइलाइट किया है।"

3. नया परीक्षण: "SCaR" चुनौती

यह साबित करने के लिए कि VIRTUE वास्तव में स्मार्ट है, शोधकर्ताओं ने एक नया परीक्षण बनाया जिसे SCaR (सेगमेंटेशन-एंड-सीन कैप्शन रिट्रीवल) कहा जाता है।

इसे "स्पॉट द डिफरेंस" (अंतर पहचानें) खेल की तरह समझें, लेकिन यह बहुत कठिन है।

  • सेटअप: आप AI को मेज पर रखे कांटे (fork) वाली रसोई की एक तस्वीर दिखाते हैं। आप कांटे के चारों ओर एक बॉक्स बनाते हैं।
  • कार्य: AI को 10 विकल्पों में से सही वाक्य चुनना होता है।
  • ट्रिकी हिस्सा: विकल्प बहुत मिलते-जुलते हैं।
    • विकल्प A: "एक पिकनिक ब्लैंकेट पर कांटा।" (गलत दृश्य)
    • विकल्प B: "मेज पर एक चम्मच।" (गलत वस्तु)
    • विकल्प C: "मेज पर एक कांटा।" (सही!)
    • विकल्प D: "नैपकिन के नीचे एक कांटा।" (गलत संबंध)

पुराने AI अक्सर गलत चुन लेते हैं क्योंकि वे "कांटे" या "मेज" के सामान्य विचार से विचलित हो जाते हैं। हालाँकि, VIRTUE उस बॉक्स को देखता है जिसे आपने खींचा है, वह ठीक से देखता है कि कांटा कहाँ है, और समझ जाता है, "ओह, यह निश्चित रूप से मेज पर है, न कि ब्लैंकेट पर।"

4. यह क्यों महत्वपूर्ण है

  • बेहतर सर्च इंजन: कल्पना कीजिए कि शहर के ढेरों नीली कारों में से "फायर हाइड्रेंट के पास खड़ी नीली कार" को खोजना। VIRTUE ठीक वही ढूँढेगा जिसका आप अर्थ निकाल रहे हैं।
  • चलते-चलते गलतियाँ सुधारना: यदि कोई AI गलत उत्तर देता है (जैसे, "वह एक माइक्रोफ़ोन है"), तो आप बस उस वस्तु के चारों ओर एक बॉक्स बना सकते हैं और कह सकते हैं, "नहीं, यहाँ देखो," और वह तुरंत खुद को सुधार कर "यह एक सिगरेट है" कर लेगा। पूरे रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; बस इशारा करें और सुधारें।
  • संदर्भ (Context) को समझना: यह AI को यह समझने में मदद करता है कि एक "कुत्ता" अलग होता है जब वह "रसोई" में हो या "पार्क" में, भले ही कुत्ता एक जैसा ही क्यों न दिखे।

सारांश

VIRTUE एक ऐसे AI की तरह है जिसे चश्मा पहना दिया गया है जो उसे एक साथ जंगल (पूरा दृश्य) और पेड़ों (आपके द्वारा इंगित की गई विशिष्ट वस्तुएं) दोनों को देखने की अनुमति देता है। यह इस अंतर को पाटता है कि हम क्या कहते हैं और हम क्या दिखाते हैं, जिससे AI जटिल दुनिया में हमारी विशिष्ट आवश्यकताओं को समझने में बहुत बेहतर हो जाता है।

शोधकर्ताओं ने इसे 36 अलग-अलग चुनौतियों और एक नए 1-मिलियन-सैंपल टेस्ट पर परखा, और VIRTUE लगभग हर बार जीत गया, जिससे यह साबित हुआ कि AI को यह दिखाना कि हम किस ओर इशारा कर रहे हैं, एक बहुत बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →