VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs
यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में विजुअल नॉलेज अंडरस्टैंडिंग के मूल्यांकन के लिए एक व्यापक बेंचमार्क, VKnowU पेश करता है, और VideoKnow+ प्रस्तावित करता है, जो एक सुदृढीकरण लर्निंग-आधारित मॉडल है जो संरचित विजुअल नॉलेज को स्पष्ट रूप से शामिल करके इस बेंचमार्क और अन्य वीडियो अंडरस्टैंडिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान रोबोट मित्र है जो वीडियो देख सकता है और उनके बारे में सवालों के जवाब दे सकता है। लंबे समय से, यह रोबोट चीजों को पहचानने में बहुत माहिर रहा है। यदि आप इसे एक गेंद का पीछा करते हुए कुत्ते का वीडियो दिखाते हैं, तो यह आपको बता सकता है, "वह एक कुत्ता है," "वह एक गेंद है," और "कुत्ता दौड़ रहा है।"
लेकिन एक समस्या है: यह दुनिया को उस तरह से नहीं समझता जैसे इंसान समझते हैं। इसे सहज रूप से यह पता नहीं है कि यदि आप एक गेंद गिराते हैं, तो वह नीचे गिरेगी (गुरुत्वाकर्षण), या कांच का कप नाजुक होता है और गिरने पर टूट सकता है, या किसी व्यक्ति का चेहरा उतरना (frowning) शायद इस बात का संकेत है कि वह परेशान है। यह पिक्सेल को देखता है, लेकिन उनके पीछे के "कॉमन सेंस" (सामान्य ज्ञान) को मिस कर देता है।
यह शोध पत्र इस नए तरीके को पेश करता है जिससे रोबोट को इस गायब "कॉमन सेंस" को परखने और सिखाने में मदद मिलती है, जिसे लेखक विजुअल नॉलेज (दृश्य ज्ञान) कहते हैं।
समस्या: रोबोट "कॉमन सेंस" के प्रति "अंधा" है
लेखकों ने एक विशाल परीक्षण बनाया जिसे VKnowU (विजुअल नॉलेज अंडरस्टैंडिंग) कहा जाता है। इसे रोबोटों के लिए एक अंतिम परीक्षा की तरह समझें, लेकिन गणित या इतिहास के बजाय, प्रश्न इस बारे में हैं कि दुनिया कैसे काम करती है और लोग कैसे सोचते हैं।
इस परीक्षण को दो मुख्य विषयों में बांटा गया है:
- वर्ल्ड-सेंट्रिक (भौतिक विज्ञान की कक्षा): क्या रोबलेट जानता है कि एक भारी बक्सा उठाने में एक पंख की तुलना में अधिक कठिन होता है? क्या उसे पता है कि एक सिक्का जमीन पर गिरेगा?
- ह्यूमन-सेंट्रिक (मनोविज्ञान की कक्षा): क्या वह समझता है कि एक लड़का जो एक बिखरे हुए कमरे को देख रहा है, वह शायद और अधिक गंदगी फैलाने की योजना बना रहा है? क्या उसे पता है कि यदि वयस्क अंदर आते हैं, तो वे हैरान हो सकते हैं?
परिणाम: जब उन्होंने यह टेस्ट सबसे स्मार्ट उपलब्ध रोबोटों (जैसे गूगल, ओपनएआई और ओपन-सोर्स टीमों के रोबोट) को दिया, तो रोबोटों का स्कोर बहुत खराब रहा। वे विशेष रूप से "फिजिक्स क्लास" में खराब प्रदर्शन कर रहे थे। वे दृश्य का वर्णन तो पूरी तरह से कर सकते थे लेकिन यह अनुमान लगाने में विफल रहे कि आगे क्या होगा या वस्तुओं की सामग्री क्या है। वे "देख" तो रहे थे लेकिन "समझ" नहीं रहे थे।
समाधान: रोबोट को "देखना, सोचना, उत्तर देना" सिखाना
इसे ठीक करने के लिए, लेखकों ने एक नई प्रशिक्षण पद्धति बनाई जिसे VideoKnow+ कहा जाता है। उन्होंने महसूस किया कि रोबलेट अपने भाषा प्रशिक्षण के आधार पर उत्तरों का अनुमान लगाने की कोशिश कर रहे थे (जैसे बिना चित्र देखे किसी पहेली का उत्तर गेस करना)।
उन्होंने रोबोट के लिए एक नया नियम पेश किया: "देखना, सोचना, उत्तर देना" (See, Think, Answer)।
- देखना (See): उत्तर देने से पहले, रोबोट को वीडियो में दिखने वाली सटीक चीजों का वर्णन करना चाहिए, जिसमें दृश्य संकेतों (visual clues) पर ध्यान केंद्रित किया गया हो।
- सोचना (Think): फिर, वह उन दृश्य संकेतों का उपयोग करके तर्क करता है।
- उत्तर देना (Answer): अंत में, वह उत्तर देता है।
उन्होंने एक विशेष "रिवॉर्ड सिस्टम" (पुरस्कार प्रणाली) भी बनाई। कल्पना कीजिए कि एक शिक्षक रोबोट को ग्रेड दे रहा है। यदि रोबोट केवल शब्दों का उपयोग करके उत्तर का अनुमान लगाने की कोशिश करता है, तो शिक्षक उसे कम स्कोर देता है। लेकिन यदि रोबोट एक ऐसा विवरण लिखता है जो यह साबित करता है कि उसने दृश्य साक्ष्य देखा है (जैसे "बक्सा लकड़ी का है, इसलिए यह भारी है"), तो शिक्षक उसे उच्च स्कोर देता है। यह रोबोट को वास्तव में वीडियो पर ध्यान केंद्रित करने के लिए मजबूर करता है, न कि केवल अपने आंतरिक डेटाबेस के तथ्यों पर।
परिणाम
इस नई पद्धति के साथ प्रशिक्षण लेने और वीडियो के एक विशाल नए डेटासेट (जिसे VKnowQA कहा जाता है) के बाद, रोबोट बहुत बेहतर हो गया।
- इसने "विजुअल नॉलेज" परीक्षण में अपने स्कोर में काफी सुधार किया।
- यह अन्य सामान्य वीडियो परीक्षणों में भी बेहतर हुआ, जिससे यह सिद्ध हुआ कि दुनिया को समझने से इसे कई क्षेत्रों में मदद मिलती है।
बड़ी तस्वीर (The Big Picture)
यह शोध पत्र तर्क देता है कि रोबोट को वास्तव में बुद्धिमान बनने के लिए, उन्हें केवल "पैटर्न मैचर" (वस्तुओं को पहचानना) बनना बंद करना होगा और "दुनिया को समझने वाले" बनना होगा। ठीक वैसे ही जैसे एक मानव बच्चा दुनिया को देखकर सीखता है कि आग गर्म होती है और कांच टूटने योग्य होता है, रोबोटों को इन "विजुअल सत्यों" को सीखने की आवश्यकता है ताकि वे केवल एक छवि देखने और उसमें जो हो रहा है उसे वास्तव में समझने के बीच के अंतर को पाट सकें।
संक्षेप में: इस शोध पत्र ने एक परीक्षण बनाया यह दिखाने के लिए कि रोबोट कॉमन सेंस में कमजोर हैं, और फिर एक नई प्रशिक्षण पद्धति बनाई जो उन्हें अनुमान लगाने से पहले सबूत देखने के लिए मजबूर करती है, जिससे वे बहुत अधिक स्मार्ट और विश्वसनीय बन जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।