← नवीनतम पेपर
💻 computer science

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

यह शोध पत्र ByDeWay-V2 प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा (training-free framework) है जो डेप्थ संकेतों के साथ स्पष्ट, मानव-पठनीय युग्मवार ज्यामितीय संबंधों को एकीकृत करके निर्णय-महत्वपूर्ण अनुप्रयोगों के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में स्थानिक तर्क और व्याख्यात्मकता को बढ़ाता है, जिससे सख्त संसाधन सीमाओं के भीतर कुशलतापूर्वक कार्य करते हुए मतिभ्रम (hallucinations) को काफी कम करता है और स्थानिक बेंचमार्क पर प्रदर्शन में सुधार करता है।

मूल लेखक: Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

प्रकाशित 2026-07-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को दुनिया देखना सिखा रहे हैं। यह रोबोट केवल एक कैमरा नहीं है; यह एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल" (या संक्षेप में MLLM) है, जो कृत्रिम बुद्धिमत्ता (AI) का एक प्रकार है जो किसी तस्वीर को देख सकता है और उसके बारे में बात कर सकता है, सवालों के जवाब दे सकता है, और यहाँ तक कि निर्णय भी ले सकता है। इसे एक शानदार छात्र के रूप में समझें जिसने पुस्तकालय की हर किताब पढ़ ली है लेकिन वास्तव में कभी बाहर कदम नहीं रखा है। क्योंकि इसने मुख्य रूप से टेक्स्ट (पाठ) से सीखा है, इसलिए यह कभी-कभी भौतिक दुनिया को गलत समझ लेता है। यह आत्मविश्वास के साथ आपको बता सकता है कि एक बिल्ली मेज पर बैठी है, जबकि फोटो में बिल्ली वास्तव में मेज के नीचे होती है। इस गलती को "हैलुसिनेशन" (hallucination) कहा जाता है।

वास्तविक दुनिया में, ये गलतियाँ खतरनाक हो सकती हैं। यदि एक रोबोट को कप को गिराए बिना उठाने के लिए कहा जाता है, या यदि एक सुरक्षा प्रणाली को चलती हुई कार के सामने खड़े व्यक्ति को पहचानना होता है, तो "लगभग सही" होना काफी नहीं है। हमें रोबට सटीक होने की आवश्यकता है और, उतना ही महत्वपूर्ण रूप से, हमें यह जानने की आवश्यकता है कि इसने वह निर्णय क्यों लिया। हम इस पर भरोसा कर सकते हैं? वैज्ञानिक एक बड़ा सवाल पूछ रहे हैं: हम इन AI मॉडलों को स्थान और स्थिति के बारे में तथ्य गढ़ने से कैसे रोक सकते हैं, और हम उनकी सोच को मनुष्यों के जाँचने के लिए पर्याप्त स्पष्ट कैसे बना सकते हैं?

यहीं पर एक नया शोध पत्र आता है जिसमें ByDeWay-V2 नामक एक चतुर, कम लागत वाला समाधान दिया गया है। शोधकर्ताओं ने महसूस किया कि इन रोबोटों को ठीक करने के पिछले प्रयास कुछ हद तक उन्हें एक धुंधला नक्शा देने जैसे थे। वे जानते थे कि चीजें लगभग कितनी दूर थीं (जैसे "पास", "मध्यम", या "दूर"), लेकिन वे यह नहीं जानते थे कि एक वस्तु का दूसरी वस्तु के संबंध में सटीक स्थान क्या था। यह ऐसा है जैसे यह जानना कि एक व्यक्ति और एक रेफ्रिजरेटर दोनों कमरे के "निकटतम" हिस्से में हैं, लेकिन यह न जानना कि व्यक्ति फ्रिज के बगल में खड़ा है या उसके अंदर है।

इसे हल करने के लिए, टीम ने एक ऐसी प्रणाली बनाई है जो रोबोट की आँखों के लिए एक सुपर-संगठित टूर गाइड की तरह काम करती है। इससे पहले कि रोबोट किसी प्रश्न का उत्तर देने का प्रयास करे, सिस्टम पहले दृश्य की एक त्वरित फोटो लेता है और हर उस वस्तु के चारों ओर अदृश्य बॉक्स बनाने के लिए एक विशेष उपकरण (जिसे YOLO-World-L कहा जाता है) का उपयोग करता है जो उसे दिखाई देती है। फिर, यह सटीक ज्यामिति (geometry) का पता लगाने के लिए कुछ त्वरित गणित करता है: "कप लैपटॉप के बाईं ओर 5 इंच पर है," या "बिल्ली फूलदान को छू रही है।" यह इन गणितीय तथ्यों को सरल, मानव-पठनीय वाक्यों में बदल देता है और उन्हें सीधे एक "चीट शीट" के रूप में रोबोट को फीड करता है।

इसके परिणाम काफी प्रभावशाली हैं। जब उन्होंने विभिन्न AI मॉडलों पर इस नई पद्धति का परीक्षण किया, तो सुधार नाटकीय था। BLIP-Base नामक एक छोटे, हल्के मॉडल के लिए, इस प्रणाली ने एक लगभग रैंडम अनुमान (0.05 स्कोर) को एक ठोस, प्रतिस्पर्धी प्रदर्शन (0.53 स्कोर) में बदल दिया। BLINK नामक एक कठिन परीक्षण पर, जो विशेष रूप से पूछता है कि चीजें एक-दूसरे के सापेक्ष कहाँ हैं, इस प्रणाली ने एक शीर्ष-स्तरीय मॉडल के स्कोर को 46% तक सुधारने में मदद की। शायद वास्तविक दुनिया के उपयोग के लिए सबसे रोमांचक बात यह है कि इस पूरी प्रक्रिया के लिए रोबोट को फिर से प्रशिक्षित करने या विशाल सुपरकंप्यूटरों का उपयोग करने की आवश्यकता नहीं है। उनके सिस्टम का सबसे हल्का संस्करण एक मानक कंप्यूटर प्रोसेसर (CPU) पर 40 शब्दों के "मेमोरी" (टोकन) से कम का उपयोग करके चल सकता है, जो यह साबित करता है कि स्थान की स्पष्ट और विश्वसनीय समझ रखने के लिए आपको विशाल मस्तिष्क की आवश्यकता नहीं है।

संक्षेप में, ByDeWay-V2 केवल रोबोट को स्मार्ट नहीं बनाता है; यह रोबोट को ईमानदार बनाता है। इसे वस्तुओं के स्थान के बारे में स्पष्ट, चरण-दर-चरण साक्ष्य देकर, रोबोट अनुमान लगाना बंद कर देता है और अपने तर्क को समझाने लगता है, जिससे यह उन महत्वपूर्ण कार्यों के लिए बहुत सुरक्षित और विश्वसनीय हो जाता है जो हम उससे करवाना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →