← नवीनतम पेपर
🤖 AI

Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding

यह शोध पत्र CAFT को प्रस्तुत करता है, जो 30 मिलियन इमेज-टेक्स्ट युग्मों पर प्रशिक्षित एक विजन-लैंग्वेज मॉडल है जो स्थानीय टेक्स्ट क्षेत्रों को इमेज विवरणों के साथ संरेखित करने के लिए एक पदानुक्रमित पार्ट-टू-व्होल (part-to-whole) लर्निंग सिद्धांत का उपयोग करता है, जिससे बिना किसी स्पष्ट रीजन-लेवल सुपरविजन के लॉन्ग-टेक्स्ट रिट्रीवल बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Byeongju Woo, Zilin Wang, Byeonghyun Pak, Sangwoo Mo, Stella X. Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप फोन पर अपने दोस्त को एक व्यस्त शहर की सड़क का वर्णन करने की कोशिश कर रहे हैं। आप कह सकते हैं, "वहाँ एक लाल रंग की डबल-डेकर बस है, एक झंडे वाला पत्थर का भवन है, और एक छोटी लाल कार पास से गुजर रही है।"

पुराने AI मॉडल (जैसे प्रसिद्ध CLIP) उन दोस्तों की तरह हैं जो केवल आपकी पहली बात सुनते हैं। यदि आप "लाल बस" का उल्लेख करते हैं, तो वे तुरंत एक लाल बस की कल्पना कर लेते हैं और बाकी सब कुछ अनदेखा कर देते हैं। वे गलत तस्वीर चुन सकते हैं क्योंकि उन्होंने उसमें एक लाल बस देखी थी, भले ही उस तस्वीर में पत्थर का भवन या लाल कार गायब हो। वे सबसे शोर वाले, सबसे स्पष्ट सुराग से विचलित हो जाते हैं।

यह पेपर एक नया मॉडल पेश करता है जिसे CAFT (फॉरेस्ट्स एंड ट्रीज़ का क्रॉस-डोमेन अलाइनमेंट) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग यहाँ दिया गया है:

मुख्य विचार: "फॉरेस्ट्स एंड ट्रीज़" (जंगल और पेड़)

लेखकों का मानना है कि किसी जटिल तस्वीर को वास्तव में समझने के लिए, आपको केवल एक बार में पूरी चीज़ को नहीं देखना चाहिए। इसके बजाय, आपको पूरे दृश्य (फॉरेस्ट) को समझने से पहले व्यक्तिगत विवरणों (ट्रीज़) को समझना होगा।

  • समस्या: पुराने मॉडल एक साथ "पूरे जंगल" (पूरी छवि) को "पूरी कहानी" (पूरा कैप्शन) से मिलाने की कोशिश करते हैं। वे अक्सर उन छोटे विवरणों को मिस कर देते हैं जो एक तस्वीर को अद्वितीय बनाते हैं।
  • समाधान: CAFT AI को पहले व्यक्तिगत "पेड़ों" (लाल कार, पत्थर का भवन, बस) को पहचानने और उन्हें कहानी के विशिष्ट हिस्सों से जोड़ने के लिए मजबूर करता है। केवल सभी पेड़ों को मिलाने के बाद ही वह पूरे जंगल को समझने के लिए पीछे हटता है।

CAFT कैसे काम करता है: दो चरणों वाला नृत्य

1. इमेज साइड: तस्वीर को टुकड़ों में तोड़ना
एक हाई-रिज़ॉल्यूशन फोटो को देखने की कल्पना करें। इसे एक विशाल ग्रिड के रूप में देखने के बजाय, CAFT इसे स्वाभाविक रूप से फिट होने वाले छोटे, अर्थपूर्ण टुकड़ों में तोड़ देता है, जैसे पहेली के टुकड़े।

  • यह सूक्ष्म विवरणों (जैसे ईंट की बनावट) से शुरू होता है।
  • यह उन्हें थोड़े बड़े टुकड़ों (जैसे एक पूरी खिड़की) में समूहित करता है।
  • अंत में, यह उन्हें बड़े खंडों (जैसे पूरा भवन) में समूहित करता है।
    इसे "फाइन-टू-कोर्स" (Fine-to-Coarse) दृष्टिकोण कहा जाता है। यह एक अकेले पत्ते से देखते हुए धीरे-धीरे पूरे पेड़ तक ज़ूम आउट करने जैसा है।

2. टेक्स्ट साइड: कहानी को वाक्यों में तोड़ना
लंबे कैप्शन निर्देशों के एक पैराग्राफ की तरह होते हैं। CAFT पूरे पैराग्राफ को एक साथ नहीं पढ़ता है।

  • यह लंबी कहानी को छोटे वाक्यों या "चंक्स" (जैसे "लाल बस", "पत्थर का भवन", "लाल कार") में विभाजित करता है।
  • यह प्रत्येक चंक का व्यक्तिगत रूप से विश्लेषण करता है ताकि समझ सके कि वह क्या वर्णित करता है।
  • फिर, यह पूरी समझ बनाने के लिए इन छोटी समझों को वापस जोड़ देता है।

3. मैच-अप: बिंदुओं को जोड़ना
यही जादुधिक हिस्सा है। CAFT एक "डबल-चेक" प्रणाली करता है:

  • लेवल 1 (द ट्रीज़): यह छोटे टेक्स्ट चंक्स (जैसे "लाल कार") को सीधे छवि के विशिष्ट हिस्सों (तस्वीर में लाल कार) से मिलाता है। यह सुनिश्चित करता है कि AI को पता हो कि कार बिल्कुल कहाँ है।
  • लेवल 2 (द फॉरेस्ट): एक बार जब सभी छोटे हिस्से मिल जाते हैं, तो यह पूरी कहानी को पूरी छवि से मिलाता है ताकि यह सुनिश्चित हो सके कि बड़ी तस्वीर समझ में आ रही है।

यह क्यों मायने रखता है

इस पेपर ने इस मॉडल का परीक्षण 3 करोड़ (30 मिलियन) इमेज-और-स्टोरी पेयर्स पर किया। परिणामों ने दिखाया कि जब लंबी, विस्तृत व्याख्या दी जाती है, तो CAFT बिल्कुल सही तस्वीर खोजने में बहुत बेहतर है।

  • CAFT के बिना: यदि आप "लाल बस, एक पत्थर का भवन और एक लाल कार" वाली तस्वीर मांगते हैं, तो AI केवल एक लाल बस वाली तस्वीर चुन सकता है क्योंकि वह सबसे स्पष्ट चीज़ है।
  • CAFT के साथ: क्योंकि इसने "पत्थर के भवन" और "लाल कार" को छवि के विशिष्ट स्थानों से मिलाने के लिए सीखा है, इसलिए यह जानता है कि केवल एक बस वाली तस्वीर गलत उत्तर है। यह वह एक तस्वीर ढूंढ लेता है जिसमें सभी विवरण मौजूद हैं।

"ज़ीरो-शॉट" सरप्राइज़

पेपर में यह भी पाया गया कि एक दिलचस्प साइड इफेक्ट है। क्योंकि CAFT ने टेक्स्ट को छवि के विशिष्ट हिस्सों से जोड़ने में महारत हासिल कर ली है, इसलिए यह एक "स्पॉटर" (पहचानने वाला) के रूप में भी कार्य कर सकता है। यदि आप इसे किसी ऐसी तस्वीर में "लाल कार" ढूंढने के लिए कहते हैं जिसे उसने पहले कभी नहीं देखा है, तो यह बिना किसी स्पष्ट निर्देश के भी उसके चारों ओर एक बॉक्स बना सकता है, भले ही इसे बॉक्स बनाना नहीं सिखाया गया था। इसने यह केवल छवि के पीछे की कहानी को समझने की कोशिश करके सीखा है।

सारांश

CAFT को एक ऐसे जासूस के रूप में सोचें जो केवल अपराध स्थल पर एक नज़र नहीं डालता है। इसके बजाय, वह अंतिम रिपोर्ट लिखने (फॉरेस्ट) से पहले हर उंगली के निशान, हर जूते के निशान और सबूत के हर टुकड़े (ट्रीज़) की सावधानीपूर्वक व्यक्तिगत रूप से जांच करता है। यह सावधानीपूर्ण, चरण-दर-चरण दृष्टिकोण उसे उन जटिल रहस्यों को सुलझाने की अनुमति देता है जिन्हें अन्य जासूस चूक जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →