MolmoPoint: Better Pointing for VLMs with Grounding Tokens
यह शोध पत्र MolmoPoint को प्रस्तुत करता है, जो एक नवीन विजन-लैंग्वेज मॉडल है जो पारंपरिक टेक्स्ट-आधारित समन्वय जनरेशन (coordinate generation) को विशेष ग्राउंडिंग टोकन का उपयोग करने वाले अधिक कुशल और सहज तंत्र से बदल देता है ताकि विजुअल टोकन और सबपैट्चेस को सीधे चुना जा सके, जिससे इमेज, GUI और वीडियो पॉइंटिंग कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को फोटो में चीजों की ओर इशारा करना सिखा रहे हैं।
पुराना तरीका (टेक्स्ट कोऑर्डिनेट्स):
पहले, यदि आप एक रोबोट से पूछते, "लाल कार की ओर इशारा करो," तो उसे एक गणितज्ञ की तरह सोचना पड़ता। उसे गणना करनी पड़ती, "ठीक है, लाल कार x-अक्ष पर पिक्सेल 450 और y-अक्ष पर 320 पर है।" फिर वह उन नंबरों को टेक्स्ट के रूप में टाइप करता: "450, 320।"
- समस्या: यह धीमा, बोझिल और भ्रमित करने वाला है। रोबोट को एक जटिल कोऑर्डिनेट सिस्टम (जैसे एक मैप ग्रिड) सीखना पड़ता है जो हमेशा उसकी तस्वीर देखने के तरीके से मेल नहीं खाता। अगर तस्वीर का आकार बदल जाता है, तो नंबर गड़बड़ हो जाते हैं। यह समुद्र तट पर रेत के एक विशिष्ट कण का वर्णन करने के लिए उसके अक्षांश और देशांतर (latitude and longitude) देने जैसा है, बजाय इसके कि आप बस अपनी उंगली से इशारा कर दें।
नया तरीका (MolmoPoint):
MolmoPoint के पीछे के शोधकर्ताओं ने रोबोट को गणित करने के लिए कहना बंद कर दिया और इसके बजाय उनसे वही करने को कहा जो इंसान करते हैं: बस इशारा करना।
नंबर टाइप करने के बजाय, मॉडल विशेष "मैजिक टोकन" (सोचिए डिजिटल स्टिकी नोट्स की तरह) का उपयोग करता है ताकि वह इमेज के उस सटीक हिस्से को भौतिक रूप से चुन सके जिसे वह देख रहा है।
यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:
"ज़ूम-इन" गेम
कल्पना कीजिए कि इमेज एक विशाल जिग्सॉ पहेली (jigsaw puzzle) है।
- चरण 1: बड़ी तस्वीर (
)
मॉडल पहले पूरी पहेली को देखता है और उसका एक बड़ा हिस्सा चुनता है। वह कहता है, "मेरी दिलचस्पी इस बड़े चौकोर हिस्से में है।" उसे कोऑर्डिनेट्स जानने की ज़रूरत नहीं है; वह बस उस पहेली के टुकड़े को पकड़ लेता है जो उस क्षेत्र का प्रतिनिधित्व करता है। - चरण 2: करीब से देखना (
)
अब, वह उस विशिष्ट हिस्से पर ज़ूम करता है। वह उस बड़े चौकोर के अंदर एक छोटा टुकड़ा चुनता है। "ठीक है, इस बड़े चौकोर के भीतर, मैं इस छोटे चौकोर को देख रहा हूँ।" - चरण 3: सटीक स्थान (
)
अंत में, वह उस नन्हे चौकोर के भीतर सटीक स्थान चुनता है। "ठीक यहीं, इस विशिष्ट पिक्सेल पर।"
इन तीन त्वरित चरणों में, मॉडल बिना किसी गणना के "पूरी कार" से "बाईं हेडलाइट" और फिर "हेडलाइट के ठीक केंद्र" तक पहुँच जाता है।
यह एक बड़ी बात क्यों है?
- यह तेज़ है: "450, 320" टाइप करने में बहुत अधिक कंप्यूटर ब्रेनपावर (टोकन) लगता है। बस इमेज के टुकड़े को पकड़ना बहुत कम समय लेता है। यह एक विस्तृत मैप और GPS कोऑर्डिनेट्स भेजने के बजाय "वहाँ देखो!" का टेक्स्ट मैसेज भेजने जैसा है।
- यह स्मार्ट है: क्योंकि मॉडल वास्तव में उस विजुअल डेटा को पकड़ रहा है जिसे उसने पहले ही "देखा" है, वह वस्तु को बेहतर समझता है। यदि वह अपनी मेमोरी में "ब्रेक लाइट" देखता है, तो वह सीधे उस मेमोरी की ओर इशारा कर सकता है। उसे "ब्रेक लाइट" को "x=500, y=200" में अनुवाद करने की आवश्यकता नहीं है।
- यह वीडियो और स्क्रीन को संभालता है:
- वीडियो: यह वीडियो चलते समय एक चलते हुए ऑब्जेक्ट (जैसे सॉकर बॉल) को ट्रैक करने के लिए बस अपने "पहेली के टुकड़े" को अपडेट करके उसे ट्रैक कर सकता है।
- स्क्रीन: यह कंप्यूटर स्क्रीन पर बटन (जैसे "'सेव' बटन पर क्लिक करें") को बहुत अधिक सटीकता से क्लिक कर सकता है क्योंकि वह ग्रिड के आधार पर अनुमान लगाने के बजाय वास्तविक बटन को देख रहा है।
"स्टॉप" बटन
एक चतुर जुड़ाव एक विशेष "नो मोर पॉइंट्स" (अब और इशारा नहीं) टोकन है। पुराने दिनों में, यदि कोई रोबोट भ्रमित हो जाता था, तो वह यादों के टूटे हुए रिकॉर्ड की तरह बेतरतीब जगहों पर इशारा करता रहता था। इस नए मॉडल में यह कहने का एक स्पष्ट संकेत है कि, "मैंने इशारा करना बंद कर दिया है," जो इसे गड़बड़ी करने से रोकता है।
परिणाम
पेपर दिखाता है कि यह नया तरीका एक बड़ा अपग्रेड है:
- बेहतर सटीकता: इसने फोटो में वस्तुओं की ओर इशारा करने और स्क्रीन पर बटन क्लिक करने के परीक्षणों पर अब तक के उच्चतम स्कोर प्राप्त किए।
- बेहतर ट्रैकिंग: यह वीडियो में चलती हुई वस्तुओं का पीछा करने में बहुत बेहतर है।
- दक्षता: यह इशारा करने में कुशल होने के लिए तेज़ी से सीखता है और इसे कम डेटा की आवश्यकता होती है।
संक्षेप में: MolmoPoint ने रोबोटों को मानव कैलकुलेटर बनने के बजाय उन्हें 'ह्यूमन पॉइंटर' (इंसानी इशारा करने वाला) बनाना शुरू कर दिया। "कोऑर्डिनेट्स X, Y पर जाओ" कहने के बजाय, यह बस उस चीज़ को पकड़ लेता है जिसके बारे में आप बात कर रहे हैं। यह दृश्य दुनिया के साथ बातचीत करने का एक सरल, तेज़ और अधिक सहज तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।