← नवीनतम पेपर
🤖 AI

360{\deg} Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method

यह शोध पत्र 360-डिग्री इमेज परसेप्शन पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक व्यापक बेंचमार्क, 360Bench पेश करता है, और Free360 का प्रस्ताव देता है, जो एक ट्रेनिंग-मुक्त, सीन-ग्राफ-आधारित फ्रेमवर्क है जो तर्क को विभाजित करके और गोलाकार छवियों को अनुकूल रूप से रूपांतरित करके VQA प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro, Kang-Jun Liu, Takayuki Okatani

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro, Kang-Jun Liu, Takayuki Okatani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने 360-डिग्री वीआर (VR) चश्मा पहना हुआ है। आप ऊपर, नीचे, बाएं, दाएं देख सकते हैं और यहाँ तक कि पूरी दुनिया को एक नज़र में देखने के लिए चारों ओर घूम भी सकते हैं। अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट एआई (AI) सहायक से पूछते हैं, "फायर हाइड्रेंट कहाँ है?" या "कितनी लाल कारें हैं?"

ये एआई सहायक (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) सामान्य, सपाट तस्वीरों को देखने में अद्भुत हैं, लेकिन जब आप उन्हें 360-डिग्री वाली तस्वीर देते हैं, तो वे पूरी तरह से भटक जाते हैं। उन्हें दुनिया के आकार, वस्तुओं के बीच की दूरी और चीजें किनारों पर कैसे मुड़ती हैं, इसे समझने में कठिनाई होती है।

यह शोध पत्र इन एआई को 360-डिग्री दुनिया में नेविगेट करने में मदद करने के लिए एक रिपोर्ट कार्ड और नए ट्रेनिंग व्हील्स (सहायक पहियों) की तरह है।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "अनरोल्ड कारपेट" (बिछाए गए कालीन) का भ्रम

एक 360-डिग्री छवि की कल्पना एक विशाल, फुलाए हुए गुब्बारे की तरह करें। कंप्यूटर स्क्रीन पर इसे दिखाने के लिए, हमें गुब्बारे को "फोड़कर" उसे एक कालीन की तरह बिछाना पड़ता है।

  • विकृति (Distortion): जब आप एक गुब्बारे को खोलते हैं, तो ऊपर और नीचे के हिस्से (ध्रुव) टॉफी की तरह खिंच जाते हैं, जबकि बीच का हिस्सा सामान्य रहता है।
  • एआई का संघर्ष: वर्तमान एआई सामान्य, सपाट तस्वीरों पर प्रशिक्षित होते हैं। जब वे इस "अनरोल्ड रग" (बिछाए गए कालीन) को देखते हैं, तो वे भ्रमित हो जाते हैं। वे सोच सकते हैं कि एक खिंची हुई इमारत वास्तव में तीन अलग-अलग इमारतें है, या वे यह नहीं बता पाते कि दो वस्तुएं एक-दूसरे के बगल में हैं या कमरे के विपरीत दिशा में हैं।

2. परीक्षण: "360Bench" (ड्राइविंग टेस्ट)

लेखकों ने 360Bench नामक एक नया परीक्षण बनाया।

  • सेटअप: उन्होंने शहरों, घरों के अंदर और यहाँ तक कि ड्रोन शॉट्स से 7,000-रेज़ोल्यूशन वाली उच्च-गुणवत्ता वाली 360-डिग्री तस्वीरें एकत्र कीं (जो बहुत शार्प हैं!)।
  • प्रश्न: उन्होंने 1,500+ ऐसे प्रश्न लिखे जिन्हें इंसान आसानी से हल कर सकते हैं लेकिन एआई को कठिन पाते हैं। उदाहरण के लिए:
    • "मेज पर कितने रिमोट कंट्रोल हैं?" (चीजों के खिंच जाने के कारण गिनती करना कठिन है)।
    • "क्या खिलौनों की दुकान किराने की दुकान के सामने है?" (स्थानिक तर्क/Spatial reasoning)।
    • "कूड़ेदान पर लगे साइन पर क्या लिखा है?" (विकृत सतहों पर टेक्स्ट पढ़ना)।
  • परिणाम: उन्होंने 13 अलग-अलग एआई का परीक्षण किया। सबसे स्मार्ट एआई भी केवल 46% सही उत्तर दे पाए। मनुष्यों की तुलना में, जो 86% सही थे। एआई मूल रूप से समझने के बजाय अनुमान अधिक लगा रहे थे।

3. समाधान: "Free360" (एक स्मार्ट टूर गाइड)

चूंकि इन विशाल एआई को फिर से प्रशिक्षित करना महंगा और धीमा है (जैसे रेडियो ठीक करने के लिए कार का इंजन बदलना), लेखकों ने Free360 का आविष्कार किया। यह एक "ट्रेनिंग-फ्री" विधि है, जिसका अर्थ है कि यह आपके पास पहले से मौजूद एआई के साथ ही काम करती है, बस इसे बेहतर निर्देश देकर।

Free360 को एक स्मार्ट टूर गाइड के रूप में समझें जो एआई को पहेली सुलझाने में चार चरणों में मदद करता है:

  1. वस्तुओं को पहचानना (जासूस): पूरे विकृत "कालीन" को देखने के बजाय, गाइड छवि के छोटे, साफ टुकड़े काटता है जहाँ वस्तुएं स्थित हैं। यह एक मानचित्र के विशिष्ट भाग पर ज़ूम करने जैसा है ताकि एआई खिंचाव से भ्रमित न हो।
  2. विवरण बताना (रिपोर्टर): गाइड एआई से केवल उस छोटे टुकड़े का वर्णन करने के लिए कहता है। "यह एक लाल साइन है जिस पर 'Toys' लिखा है।"
  3. दुनिया को घुमाना (नेविगेटर): यह जादुई ट्रिक है। यह पता लगाने के लिए कि दो वस्तुओं के बीच संबंध क्या है, Free360 360-डिग्री छवि को घुमाता है ताकि दोनों वस्तुएं बिल्कुल केंद्र में आ जाएं और एआई के सामने हों। यह ग्लोब को तब तक घुमाने जैसा है जब तक कि दो शहर आपके सामने न आ जाएं, जिससे यह देखना आसान हो जाता है कि वे पड़ोसी हैं या दूर।
  4. मानचित्र बनाना (आर्किटेक्ट): गाइड इन सभी सुरागों को एक सीन ग्राफ (Scene Graph) में डाल देता है। कल्पना करें कि यह एक फ्लोचार्ट या फैमिली ट्री है, लेकिन कमरे के लिए।
    • नोड 1: खिलौनों की दुकान (दर्शक के पीछे)।
    • नोड 2: किराने की दुकान (दाईं ओर)।
    • कनेक्शन: "खिलौनों की दुकान किराने की दुकान के सामने है।"

अंत में, एआई इस व्यवस्थित "मानचित्र" को पढ़ता है और सही उत्तर देता है।

4. परिणाम: एक बड़ी छलांग

जब उन्होंने इस "टूर गाइड" पद्धति का उपयोग किया:

  • एआई का स्कोर 38% से बढ़कर 45% हो गया (एआई की दुनिया में एक बहुत बड़ा सुधार)।
  • इसने विशिष्ट कठिन समस्याओं (जैसे "मेरे सापेक्ष वस्तु कहाँ है?") को 23% अधिक सटीकता के साथ हल किया।
  • उन्होंने यह सब बिना एआई मॉडल को फिर से प्रशिक्षित किए किया, जिससे समय और धन की बचत हुई।

निष्कर्ष

यह शोध पत्र दिखाता है कि हालांकि एआई स्मार्ट हो रहा है, फिर भी इसे 360-डिग्री छवियों की "घुमावदार" दुनिया को समझने के लिए मदद की आवश्यकता है। समस्या को छोटे, प्रबंधनीय चरणों में तोड़कर और जानकारी को व्यवस्थित करने के लिए एक "मानचित्र" का उपयोग करके, हम इन एआई को केवल एक सपाट, विकृत तस्वीर के बजाय पूरी दुनिया को देखने में बहुत बेहतर बना सकते हैं।

संक्षेप में: उन्होंने एक कठिन परीक्षण बनाया जिससे पता चला कि एआई कहाँ विफल होता है, और फिर एक चतुर, चरण-दर-चरण सहायक प्रणाली बनाई जो एआई को बिना किसी बड़े बदलाव के 360-डिग्री दुनिया के माध्यम से "सोचने" का तरीका देती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →