← नवीनतम पेपर
💻 computer science

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में विजुअल नॉलेज अंडरस्टैंडिंग के मूल्यांकन के लिए एक व्यापक बेंचमार्क, VKnowU पेश करता है, और VideoKnow+ प्रस्तावित करता है, जो एक सुदृढीकरण लर्निंग-आधारित मॉडल है जो संरचित विजुअल नॉलेज को स्पष्ट रूप से शामिल करके इस बेंचमार्क और अन्य वीडियो अंडरस्टैंडिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान रोबोट मित्र है जो वीडियो देख सकता है और उनके बारे में सवालों के जवाब दे सकता है। लंबे समय से, यह रोबोट चीजों को पहचानने में बहुत माहिर रहा है। यदि आप इसे एक गेंद का पीछा करते हुए कुत्ते का वीडियो दिखाते हैं, तो यह आपको बता सकता है, "वह एक कुत्ता है," "वह एक गेंद है," और "कुत्ता दौड़ रहा है।"

लेकिन एक समस्या है: यह दुनिया को उस तरह से नहीं समझता जैसे इंसान समझते हैं। इसे सहज रूप से यह पता नहीं है कि यदि आप एक गेंद गिराते हैं, तो वह नीचे गिरेगी (गुरुत्वाकर्षण), या कांच का कप नाजुक होता है और गिरने पर टूट सकता है, या किसी व्यक्ति का चेहरा उतरना (frowning) शायद इस बात का संकेत है कि वह परेशान है। यह पिक्सेल को देखता है, लेकिन उनके पीछे के "कॉमन सेंस" (सामान्य ज्ञान) को मिस कर देता है।

यह शोध पत्र इस नए तरीके को पेश करता है जिससे रोबोट को इस गायब "कॉमन सेंस" को परखने और सिखाने में मदद मिलती है, जिसे लेखक विजुअल नॉलेज (दृश्य ज्ञान) कहते हैं।

समस्या: रोबोट "कॉमन सेंस" के प्रति "अंधा" है

लेखकों ने एक विशाल परीक्षण बनाया जिसे VKnowU (विजुअल नॉलेज अंडरस्टैंडिंग) कहा जाता है। इसे रोबोटों के लिए एक अंतिम परीक्षा की तरह समझें, लेकिन गणित या इतिहास के बजाय, प्रश्न इस बारे में हैं कि दुनिया कैसे काम करती है और लोग कैसे सोचते हैं।

इस परीक्षण को दो मुख्य विषयों में बांटा गया है:

  1. वर्ल्ड-सेंट्रिक (भौतिक विज्ञान की कक्षा): क्या रोबलेट जानता है कि एक भारी बक्सा उठाने में एक पंख की तुलना में अधिक कठिन होता है? क्या उसे पता है कि एक सिक्का जमीन पर गिरेगा?
  2. ह्यूमन-सेंट्रिक (मनोविज्ञान की कक्षा): क्या वह समझता है कि एक लड़का जो एक बिखरे हुए कमरे को देख रहा है, वह शायद और अधिक गंदगी फैलाने की योजना बना रहा है? क्या उसे पता है कि यदि वयस्क अंदर आते हैं, तो वे हैरान हो सकते हैं?

परिणाम: जब उन्होंने यह टेस्ट सबसे स्मार्ट उपलब्ध रोबोटों (जैसे गूगल, ओपनएआई और ओपन-सोर्स टीमों के रोबोट) को दिया, तो रोबोटों का स्कोर बहुत खराब रहा। वे विशेष रूप से "फिजिक्स क्लास" में खराब प्रदर्शन कर रहे थे। वे दृश्य का वर्णन तो पूरी तरह से कर सकते थे लेकिन यह अनुमान लगाने में विफल रहे कि आगे क्या होगा या वस्तुओं की सामग्री क्या है। वे "देख" तो रहे थे लेकिन "समझ" नहीं रहे थे।

समाधान: रोबोट को "देखना, सोचना, उत्तर देना" सिखाना

इसे ठीक करने के लिए, लेखकों ने एक नई प्रशिक्षण पद्धति बनाई जिसे VideoKnow+ कहा जाता है। उन्होंने महसूस किया कि रोबलेट अपने भाषा प्रशिक्षण के आधार पर उत्तरों का अनुमान लगाने की कोशिश कर रहे थे (जैसे बिना चित्र देखे किसी पहेली का उत्तर गेस करना)।

उन्होंने रोबोट के लिए एक नया नियम पेश किया: "देखना, सोचना, उत्तर देना" (See, Think, Answer)।

  • देखना (See): उत्तर देने से पहले, रोबोट को वीडियो में दिखने वाली सटीक चीजों का वर्णन करना चाहिए, जिसमें दृश्य संकेतों (visual clues) पर ध्यान केंद्रित किया गया हो।
  • सोचना (Think): फिर, वह उन दृश्य संकेतों का उपयोग करके तर्क करता है।
  • उत्तर देना (Answer): अंत में, वह उत्तर देता है।

उन्होंने एक विशेष "रिवॉर्ड सिस्टम" (पुरस्कार प्रणाली) भी बनाई। कल्पना कीजिए कि एक शिक्षक रोबोट को ग्रेड दे रहा है। यदि रोबोट केवल शब्दों का उपयोग करके उत्तर का अनुमान लगाने की कोशिश करता है, तो शिक्षक उसे कम स्कोर देता है। लेकिन यदि रोबोट एक ऐसा विवरण लिखता है जो यह साबित करता है कि उसने दृश्य साक्ष्य देखा है (जैसे "बक्सा लकड़ी का है, इसलिए यह भारी है"), तो शिक्षक उसे उच्च स्कोर देता है। यह रोबोट को वास्तव में वीडियो पर ध्यान केंद्रित करने के लिए मजबूर करता है, न कि केवल अपने आंतरिक डेटाबेस के तथ्यों पर।

परिणाम

इस नई पद्धति के साथ प्रशिक्षण लेने और वीडियो के एक विशाल नए डेटासेट (जिसे VKnowQA कहा जाता है) के बाद, रोबोट बहुत बेहतर हो गया।

  • इसने "विजुअल नॉलेज" परीक्षण में अपने स्कोर में काफी सुधार किया।
  • यह अन्य सामान्य वीडियो परीक्षणों में भी बेहतर हुआ, जिससे यह सिद्ध हुआ कि दुनिया को समझने से इसे कई क्षेत्रों में मदद मिलती है।

बड़ी तस्वीर (The Big Picture)

यह शोध पत्र तर्क देता है कि रोबोट को वास्तव में बुद्धिमान बनने के लिए, उन्हें केवल "पैटर्न मैचर" (वस्तुओं को पहचानना) बनना बंद करना होगा और "दुनिया को समझने वाले" बनना होगा। ठीक वैसे ही जैसे एक मानव बच्चा दुनिया को देखकर सीखता है कि आग गर्म होती है और कांच टूटने योग्य होता है, रोबोटों को इन "विजुअल सत्यों" को सीखने की आवश्यकता है ताकि वे केवल एक छवि देखने और उसमें जो हो रहा है उसे वास्तव में समझने के बीच के अंतर को पाट सकें।

संक्षेप में: इस शोध पत्र ने एक परीक्षण बनाया यह दिखाने के लिए कि रोबोट कॉमन सेंस में कमजोर हैं, और फिर एक नई प्रशिक्षण पद्धति बनाई जो उन्हें अनुमान लगाने से पहले सबूत देखने के लिए मजबूर करती है, जिससे वे बहुत अधिक स्मार्ट और विश्वसनीय बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →