← नवीनतम पेपर
💻 computer science

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

यह शोध पत्र SCLARO पेश करता है, जो विविध परिदृश्यों में ग्राउंडेड ऑब्जेक्ट, रिलेशन और एक्शन जानकारी के साथ एनोटेट की गई 615,805 छवियों वाला एक बड़े पैमाने का डेटासेट है, और ScenarioCLIP का प्रस्ताव करता है, जो एक त्रि-स्तरीय बेंचमार्किंग मॉडल है और जो संयुक्त दृश्य समझ (joint scene understanding) और आउट-ऑफ-डोमेन सामान्यीकरण (out-of-domain generalization) में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Advik Sinha, Saurabh Atreya, Aashutosh A V, Sk Aziz Ali, Abhijit Das

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Advik Sinha, Saurabh Atreya, Aashutosh A V, Sk Aziz Ali, Abhijit Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक तस्वीर समझना सिखाने की कोशिश कर रहे हैं।

वर्तमान के अधिकांश रोबोट एक कैमरे वाले पर्यटकों की तरह हैं: वे आपको बता सकते हैं, "यह एक महिला के ब्रोकली खाने की तस्वीर है।" वे बड़ी तस्वीर (big picture) को सही पकड़ लेते हैं। लेकिन वे बारीकियों के साथ संघर्ष करते हैं। उन्हें शायद यह समझ नहीं आता कि कौन सी महिला चम्मच पकड़े हुए है, या यह कि ब्रोकली वास्तव में एक कटोरे के अंदर है, या वह कटोरा एक चूल्हे पर रखा है। वे दृश्य को आपस में जुड़ी एक कहानी के बजाय वस्तुओं के एक धुंधले समूह के रूप में देखते हैं।

यह शोध पत्र इस समस्या के समाधान पेश करता है, जिसमें दो मुख्य भाग शामिल हैं: एक विशाल नया पाठ्यपुस्तक (डेटासेट) और एक नया छात्र (AI मॉडल) जिसे इससे सीखने के लिए डिज़ाइन किया गया है।

1. पाठ्यपुस्तक: SCLARO

लेखकों ने SCLARO (Scene-Contextual Localisation of Actions, Relations & Objects) नामक एक विशाल पुस्तकालय बनाया है। इसे रोजमर्रा की जिंदगी की 6,1,5,000 से अधिक तस्वीरों के संग्रह के रूप में सोचें—रसोई, सड़कें, पार्क और ड्राइविंग दृश्य।

यह पाठ्यपुस्तक किस तरह विशेष है, इसका कारण इसका एनोटेशन (लेबलिंग) है। केवल नीचे एक वाक्य लिखने के बजाय, लेखकों ने प्रत्येक छवि को समझ के तीन विशिष्ट स्तरों में विभाजित किया है:

  • बड़ी कहानी (Global Action): "एक महिला ब्रोकली खा रही है।"
  • पात्रों की टोली (Objects): "महिला," "ब्रोकली," "कटोरा," "चम्मच," "चूल्हा।"
  • संबंध (Relations): यही असली जादू है। यह पुस्तक केवल वस्तुओं को सूचीबद्ध नहीं करती है; यह विशिष्ट अंतःक्रियाओं के चारों ओर छोटे "स्पॉटलाइट" बॉक्स बनाती है।
    • यह स्पष्ट रूप से उजागर करता है कि महिला कहाँ चम्मच पकड़े हुए है।
    • यह उजागर करता है कि ब्रोकली कहाँ कटोरे के अंदर रखी है।
    • यह उजागर करता है कि कटोरा कहाँ चूल्हे पर है।

लेखकों ने छवियों को पढ़ने, वस्तुओं की पहचान करने और फिर इन "स्पॉटलाइट" बॉक्स को बनाने के लिए AI सहायकों की एक टीम का उपयोग किया ताकि यह दिखाया जा सके कि क्रिया ठीक कहाँ हो रही है। उन्होंने इस विशाल पुस्तकालय को बनाने के लिए पांच अलग-अलग सार्वजनिक स्रोतों के डेटा को संयोजित किया।

2. छात्र: ScenarioCLIP

यह साबित करने के लिए कि यह पाठ्यपुस्तक उपयोगी है, लेखकों ने ScenarioCLIP नामक एक नया AI मॉडल बनाया है।

कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।

  • पुराने छात्र (जैसे PyramidCLIP): ये मॉडल एक ही "मस्तिष्क" का उपयोग करके पूरी तस्वीर, वस्तुओं और संबंधों को एक साथ सीखने की कोशिश करते हैं। यह एक ही कान से एक सिम्फनी, एक सोलो वायलिन और एक ड्रम सोलो को एक साथ सुनने जैसा है। वे सामान्य माहौल तो समझ जाते हैं, लेकिन वे विशिष्ट नोट्स को छोड़ देते हैं।
  • नया छात्र (ScenarioCLIP): इस मॉडल के पास तीन विशेष कान (एनकोडर्स) हैं:
    1. एक कान पूरी दृश्य (बड़ी कहानी) को सुनता है।
    2. एक कान केवल व्यक्तिगत वस्तुओं (पात्रों) पर ध्यान केंद्रित करता है।
    3. एक कान केवल अंतःक्रियाओं (संबंधों) पर ध्यान केंद्रित करता है।

यह सुनिश्चित करने के लिए कि ये तीन कान भ्रमित न हों या एक-दूसरे का खंडन न करें, मॉडल एक "शिक्षक" प्रणाली (जिसे Knowledge Distillation कहा जाता है) का उपयोग करता है। कल्पना कीजिए कि एक बुद्धिमान शिक्षक धीरे-धीरे छात्र का मार्गदर्शन करता है, कहता है, "हे, जो विवरण तुम चम्मच में देख रहे हो, वह उस कहानी से मेल खाना चाहिए जो तुम महिला के बारे में बता रहे हो।" यह छात्र की समझ को सभी स्तरों पर सुसंगत बनाए रखता है।

3. परिणाम: क्या छात्र पास हुआ?

लेखकों ने विभिन्न चुनौतियों का उपयोग करके पुराने मॉडलों के मुकाबले इस नए छात्र का परीक्षण किया:

  • सही तस्वीर ढूँढना (Zero-Shot Retrieval): यदि आप AI से पूछते हैं, "मुझे एक महिला की तस्वीर दिखाओ जिसने चम्मच पकड़ा हुआ है," तो ScenarioCLIP पुराने मॉडलों की तुलना में सटीक मिलान खोजने में बहुत बेहतर है। इसने विशिष्ट वस्तुओं और संबंधों को पहचानने में महत्वपूर्ण सुधार किया।
  • बारीकियों को पहचानना (Object Detection): जब वस्तुओं के चारों ओर बॉक्स बनाने के लिए कहा गया, तो नया मॉडल थोड़ा अधिक सटीक था।
  • कहानी को समझना (Scene Graph Classification): जब संबंधों (जैसे, "ब्रोकली क्या कर रही है?") को समझाने के लिए कहा गया, तो नया मॉडल बिंदुओं को जोड़ने में बेहतर था।
  • "वास्तविक दुनिया" का परीक्षण (Generalization): लेखकों ने मॉडल का परीक्षण उन तस्वीरों पर किया जिन्हें उसने पहले कभी नहीं देखा था (MS-COCO जैसे विभिन्न डेटासेट से)। भले ही इसे SCLARO पाठ्यपुस्तक पर प्रशिक्षित किया गया था, फिर भी इसने सामान्य छवियों को संभालने का कौशल नहीं खोया। वास्तव में, इसने पुराने मॉडलों से बेहतर प्रदर्शन किया, जिससे सिद्ध हुआ कि विशिष्ट संबंधों को सीखना वास्तव में इसे दुनिया को बेहतर ढंग से समझने में मदद करता है, न कि खराब।

निचोड़

यह शोध पत्र तर्क देता है कि दृश्य को वास्तव में समझने के लिए, एक AI को केवल "पूरी तस्वीर" को देखना बंद करना होगा और चीजों के बीच के विशिष्ट संबंधों पर ध्यान देना शुरू करना होगा।

एक विशाल डेटासेट बनाकर जो इन संबंधों को उजागर करता है (SCLARO) और एक मॉडल बनाकर जो उन्हें अलग-अलग लेकिन एक साथ सीखता है (ScenarioCLIP), लेखकों ने दिखाया है कि AI "वहाँ क्या है" को पहचानने से आगे बढ़कर "चीजें एक-दूसरे से कैसे संबंधित हैं" को समझने की ओर बढ़ सकता है।

सीमाओं पर नोट: लेखक स्वीकार करते हैं कि चूंकि उन्होंने पाठ्यपुस्तक बनाने के लिए रोबोटों का उपयोग किया है, इसलिए कुछ गलतियाँ (जैसे एक रोबोट का बादल को टोपी समझना) हो सकती हैं। साथ ही, कुछ दुर्लभ संबंध ढूंढना कठिन है क्योंकि वे तस्वीरों में अक्सर दिखाई नहीं देते हैं। लेकिन कुल मिलाकर, यह प्रणाली पहले की तुलना में बेहतर काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →