← नवीनतम पेपर
💻 computer science

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

यह शोध पत्र मल्टी-व्यू रिलेशनल डिस्टिलेशन (MVRD) प्रस्तावित करता है, जो एक ऐसी विधि है जो ज्योमेट्री-ग्राउंडेड टीचर्स (geometry-grounded teachers) से विभिन्न व्यूज़ के माध्यम से पैच-वाइज कोसाइन सिमिलरिटीज़ (patch-wise cosine similarities) को डिस्टिल करके विजन-लैंग्वेज मॉडल्स की ज्यामितीय तर्क क्षमताओं को बढ़ाता है, जिससे प्रीट्रेन लैंग्वेज अलाइनमेंट को संरक्षित करते हुए और फीचर फ्यूजन के कम्प्यूटेशनल ओवरहेड से बचते हुए स्थानिक समझ में सुधार होता है।

मूल लेखक: Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

प्रकाशित 2026-08-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखा रहे हैं। आप उसे एक कैमरा और एक माइक्रोफ़ोन देते हैं, और आप चाहते हैं कि वह केवल एक "कप" या "कुर्सी" को ही न पहचाने, बल्कि यह भी समझे कि वे 3D स्पेस में कहाँ हैं, वे एक-दूसरे से कितनी दूर हैं, और वे एक-दूसरे से कैसे संबंधित हैं। यह विज़न-लैंग्वेज मॉडल्स (VLMs) की दुनिया है। इन मॉडल्स को उन सुपर-स्मार्ट छात्रों के रूप में सोचें जिन्होंने लाइब्रेरी की हर किताब पढ़ी है और लाखों तस्वीरें देखी हैं। वे शब्दों को छवियों के साथ जोड़ने में माहिर हैं—जैसे यह जानना कि "डॉग" शब्द एक रोएंदार जानवर की तस्वीर के साथ जाता है। लेकिन यहाँ एक पेंच है: हालांकि वे भाषा में अत्यंत कुशल हैं, लेकिन वे ज्यामिति (geometry) में अक्सर बहुत खराब होते हैं। वे जानते होंगे कि "माइक्रोवेव" कैसा दिखता है, लेकिन उन्हें यह समझने में संघर्ष करना पड़ता है कि क्या यह टोस्टर के बाईं ओर है या दाईं ओर, या वास्तव में इसका आकार कितना बड़ा है। यह रोबोटों, सेल्फ-ड्राइविंग कारों और एआई सहायकों के लिए एक बहुत बड़ी समस्या है जिन्हें वास्तविक भौतिक स्थानों में नेविगेट करने की आवश्यकता होती है। वैज्ञानिक इन मॉडल्स को ज्यामिति सिखाकर इस "स्थानिक अंधापन" (spatial blindness) को ठीक करने की कोशिश कर रहे हैं, लेकिन सामान्य तरीके ऐसे थे जैसे पूरे घर को बदलने के बजाय छत के रिसाव को ठीक करने की कोशिश करना: या तो वे मॉडल की भाषा समझने की क्षमता को तोड़ देते हैं, या वे मॉडल को इतना विशाल और धीमा बना देते हैं कि वह वास्तविक समय के कार्यों के लिए बेकार हो जाता है।

यहाँ एक नया विचार आता है जिसे मल्टी-व्यू रिलेशनल डिस्टिलेशन (MVRD) कहा जाता है, जिसे शोधकर्ता कीट टी. एनगुयेन और उनके सहयोगियों द्वारा प्रस्तावित किया गया है। छात्र मॉडल को शिक्षक के ज्ञान के सटीक "आकार" को याद करने के लिए मजबूर करने के बजाय (जो उसके भाषा कौशल को तोड़ देता है), उन्होंने इसे चीजों के बीच के संबंधों को सिखाने का निर्णय लिया। कल्पना कीजिए कि आप किसी को एक शहर का लेआउट सिखाने की कोशिश कर रहे हैं। पुराना तरीका यह था कि उन्हें हर इमारत के सटीक जीपीएस निर्देशांक (GPS coordinates) याद करने के लिए मजबूर किया जाए। यदि वे निर्देशांक थोड़े भी गलत कर देते, तो वे गलत पड़ोस में पहुँच सकते थे, और भूल जाते कि बेकरी कहाँ थी। नया तरीका, MVRD, ऐसा है जैसे कहना, "सटीक निर्देशांकों की चिंता मत करो। बस यह याद रखो कि बेकरी पार्क के पास है, और लाइब्रेरी बेकरी के सामने है।" सापेक्ष संबंधों (रिलेशंस) पर ध्यान केंद्रित करके (न कि पूर्ण स्थितियों पर), मॉडल बिना अपनी भाषा समझने की क्षमता खोए स्थान को समझना सीख जाता है।

शोधकर्ताओं ने इसका परीक्षण एक मॉडल LLaVA-Video-7B पर किया। उन्होंने अपने नए तरीके की तुलना पुराने "फीचर डिस्टिलेशन" दृष्टिकोण (निर्देशांक याद करने वाले तरीके) से की। परिणाम स्पष्ट थे: पुराने तरीके ने मॉडल को ज्यामिति में बेहतर बनाया लेकिन इसके कारण वह सरल भाषा संबंधी कार्यों, जैसे वस्तुओं को गिनने या उनके आने के क्रम को ट्रैक करने में विफल रहा। यह एक ऐसे छात्र की तरह था जो एक सटीक मानचित्र तो बना सकता है लेकिन सड़क के संकेतों को पढ़ना भूल गया हो। इसके विपरीत, MVRD ने मॉडल की स्थानिक तर्क क्षमता (spatial reasoning) में महत्वपूर्ण सुधार किया—एक स्थानिक तर्क परीक्षण (VSI-Bench) पर इसकी औसत सटीकता को मानक संस्करण के लिए 59.9% और एक विशेष "ड्यूल पाथवे" संस्करण के लिए 60.4% तक बढ़ा दिया—जबकि इसके भाषा कौशल को बरकरार रखा। वास्तव में, यह नया तरीका मौजूदा सर्वोत्तम पद्धति के मात्र 0.5 अंक करीब था जो एक विशाल, अलग ज्यामिति इंजन का उपयोग करती है, लेकिन इसने बहुत कम अतिरिक्त पैरामीटर्स (केवल 0.19B अतिरिक्त पैरामीटर्स) और बहुत कम विलंबता (latency) के साथ यह कार्य किया।

पेपर सुझाव देता है कि दृश्य के कई दृश्यों (views) में "कोसाइन सिमिलैरिटीज़" (विभिन्न सूचनाओं के बीच कोणों की समानता मापने का एक गणितीय तरीका) पर ध्यान केंद्रित करके, मॉडल भाषा की समझ के "मांस" को ओवरराइट किए बिना 3D स्पेस के "कंकाल" को सीख सकता है। यह दृष्टिकोण मजबूत भी साबित हुआ, जो विभिन्न प्रकार के बेस मॉडल्स पर अच्छी तरह काम करता है और कमरे में विशिष्ट वस्तुओं को खोजने या दृश्य का विस्तृत वर्णन करने जैसे जटिल 3D कार्यों के लिए सामान्यीकृत होता है। अनिवार्य रूप से, शोधकर्ताओं ने पाया कि वे एआई को बात करना भूले बिना दिशा और गहराई का बोध करा सकते हैं, जो रोबोटों को हमारे भौतिक संसार में नेविगेट करने के लिए एक हल्का, तेज़ और स्मार्ट रास्ता प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →