← नवीनतम पेपर
💻 computer science

SpaceVista: All-Scale Visual Spatial Reasoning from mm to km

यह शोधपत्र SpaceVista प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें SpaceVista-1M डेटासेट, SpaceVista-7B मॉडल और एक नया बेंचमार्क शामिल है, ताकि एक संरचित ज्ञान प्रणाली और प्रगतिशील प्रशिक्षण प्रतिमान के माध्यम से डेटा क्यूरेशन की सीमाओं और स्केल-विशिष्ट ओवरफिटिंग को दूर करते हुए मिलीमीटर से लेकर किलोमीटर तक की सुदृढ़ ऑल-स्केल विजुअल स्पेशियल रीजनिंग (all-scale visual spatial reasoning) को सक्षम बनाया जा सके।

मूल लेखक: Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xiangyu Yue

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xiangyu Yue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखा रहे हैं। अभी, अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने केवल एक ही, पूरी तरह से रोशनी वाले कमरे में पढ़ाई की है। वे उस कमरे में एक कुर्सी कहाँ है, यह जानने में तो बहुत माहिर हैं, लेकिन यदि आप उन्हें वर्कबेंच पर एक छोटा सा पेंच (screw) दिखा दें या किसी शहर के पार्क का ड्रोन व्यू दिखा दें, तो वे पूरी तरह भ्रमित हो जाते हैं। वे यह नहीं समझ पाते कि कमरे में एक "कुर्सी" और मानचित्र (map) पर एक "कुर्सी" अलग-अलग होती है, या यह कि एक "छोटी वस्तु" को एक "विशाल परिदृश्य" की तुलना में एक अलग तरह की आँखों की आवश्यकता होती है।

पेपर SpaceVista एक नया तरीका पेश करता है जिससे रोबोट को हर आकार (every size) पर स्थान को देखने और उसके बारे में तर्क करने के लिए सिखाया जा सके, रेत के कण (मिलीमीटर) के आकार से लेकर पूरे शहर के ब्लॉक (किलोमीटर) के आकार तक।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल

वर्तमान AI मॉडल एक ऐसे व्यक्ति की तरह हैं जो एक छोटी किताब पढ़ने के लिए बने चश्मे पहनकर शहर के नक्शे को पढ़ने की कोशिश कर रहा है।

  • अंतराल (The Gap): पिछला शोध ज्यादातर इनडोर कमरों (जैसे लिविंग रूम) पर केंद्रित था। वे छोटी चीजों (जैसे पेंच) या विशाल चीजों (जैसे जंगलों के ड्रोन व्यू) के साथ संघर्ष करते थे।
  • भ्रम (The Confusion): यदि आप एक मॉडल को बिना किसी विशेष देखभाल के एक ही समय में छोटे पेंच और बड़ी इमारतों दोनों पर प्रशिक्षित करते हैं, तो मॉडल "भ्रमित" हो जाता है। यह सोच सकता है कि एक पेंच एक इमारत जितना बड़ा है क्योंकि यह हर चीज़ पर एक ही नियम लागू करने की कोशिश कर रहा है। इसे नॉलेज कॉन्फ्लिक्ट (knowledge conflict) कहा जाता है।

2. समाधान: एक "स्विस आर्मी नाइफ" दृष्टिकोण

लेखकों ने इसे ठीक करने के लिए तीन मुख्य भागों वाला एक पूर्ण सिस्टम बनाया है:

A. लाइब्रेरी: SpaceVista-1M (डेटासेट)

इसे हर पैमाने को कवर करने वाली वीडियो की एक विशाल लाइब्रेरी बनाने के रूप में सोचें।

  • उन्होंने क्या किया: केवल कमरों को स्कैन करने के बजाय, उन्होंने नन्हे टेबलटॉप से लेकर शहरों के ड्रोन फुटेज तक के 38,000 वीडियो दृश्य एकत्र किए।
  • पैमाना (The Scale): उन्होंने इन वीडियो के बारे में 10 लाख प्रश्न और उत्तर बनाए।
    • उदाहरण: "पेंच, नट से कितनी दूर है?" (सूक्ष्म पैमाना) बनाम "पार्क कितना बड़ा है?" (विशाल पैमाना)।
  • चालकी (The Trick): उन्होंने दूरियों को मापने और वस्तुओं को गिनने के लिए स्वचालित उपकरणों (जैसे विशेष रोबोट) का उपयोग किया, लेकिन यह सुनिश्चित करने के लिए कि उत्तर भौतिक रूप से सही हों, उन्होंने कठिन वाले प्रश्नों के लिए मनुष्यों से भी दोबारा जांच करवाई।

B. मस्तिष्क: SpaceVista-7B (मॉडल)

यह स्वयं AI मॉडल है। ऊपर बताए गए "भ्रम" को रोकने के लिए, उन्होंने सारा डेटा एक साथ मस्तिष्क में नहीं डाला।

  • "विशेषज्ञ" प्रणाली (The "Specialist" System): एक अस्पताल की कल्पना करें जहाँ एक डॉक्टर एक ही समय में सब कुछ जानने का विशेषज्ञ बनने की कोशिश नहीं करता है। इसके बजाय, उनके पास एक राउटर (एक रिसेप्शनिस्ट की तरह) होता है जो यह तय करता है कि किस विशेषज्ञ को बुलाना है।
    • यदि प्रश्न एक छोटे पेंच के बारे में है, तो राउटर उसे "माइक्रो-एक्सपर्ट" (Micro-Expert) के पास भेज देता है।
    • यदि प्रश्न एक ड्रोन व्यू के बारे में है, तो वह "मैक्रो-एक्सपर्ट" (Macro-Expert) के पास जाता है।
  • परिणाम: मॉडल दृश्य के आकार के आधार पर अपने "गियर" बदलना सीख जाता है, जिससे मिलीमीटर और किलोमीटर का आपस में मिश्रण होने से रोका जा सके।

C. प्रशिक्षण: प्रगतिशील पुरस्कार (Progressive Rewards)

मॉडल को सिखाते समय, उन्होंने केवल "सही" या "गलत" नहीं कहा। उन्होंने इसे बिल्कुल एक इंसान की तरह चरण-दर-चरण सोचने के लिए सिखाया।

  • प्रक्रिया: "यह कितनी दूर है?" का उत्तर देने से पहले, मॉडल को पहले यह कहने के लिए पुरस्कृत किया जाता है कि, "मैं एक मेज देख रहा हूँ," फिर "मैं देख रहा हूँ कि पैमाना छोटा है," और फिर दूरी की गणना करने के लिए।
  • एंकर (The Anchor): वे "स्केल" (पैमाने) का उपयोग एक एंकर के रूप में करते हैं। यदि मॉडल को एहसास होता है कि वह एक छोटी वस्तु को देख रहा है, तो वह दूरी का अनुमान लगाने से पहले उस तथ्य पर टिक जाता है। यह उसे बेतरतीब ढंग से अनुमान लगाने से रोकता है।

3. परिणाम: "वास्तविक दुनिया" का परीक्षण पास करना

लेखकों ने अपने नए मॉडल का परीक्षण अन्य शीर्ष AI मॉडलों के मुकाबले एक नए, सख्त परीक्षण SpaceVista-Bench का उपयोग करके किया।

  • परीक्षण: यह केवल एक बहुविकल्पीय क्विज़ नहीं था; यह वास्तविक दुनिया के मापों (जैसे रूलर या मानचित्र की जांच करना) के विरुद्ध एक कठोर जांच थी।
  • परिणाम: SpaceVista-7B ने अन्य मॉडलों की तुलना में काफी बेहतर प्रदर्शन किया, विशेष रूप से पेचीदा क्षेत्रों जैसे छोटी वस्तुओं और बड़े बाहरी दृश्यों में। इसने दिखाया कि दुनिया के स्केल का सम्मान करना सिखाने से, AI दुनिया को बहुत बेहतर तरीके से समझ सकता है।

सारांश

संक्षेप में, SpaceVista एक नया टूलकिट है जो AI को दुनिया को एक एकल, सपाट चित्र के रूप में देखना बंद करने के लिए सिखाता है। इसके बजाय, यह AI को यह सिखाता है कि चाहे वह एक पेंच को देख रहा हो या एक गगनचुंबी इमारत को, उसे अलग-अलग "लेंस" पहनने चाहिए, जिससे यह सुनिश्चित हो सके कि वह हमारी वास्तविक, बहु-आकार वाली दुनिया में चीजों के वास्तविक आकार और दूरी को समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →