← नवीनतम पेपर
🤖 AI

EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery

यह शोध पत्र EarthSpatialBench प्रस्तुत करता है, जो 325K से अधिक प्रश्न-उत्तर युग्मों से युक्त एक व्यापक बेंचमार्क है जिसे पृथ्वी की छवियों पर दूरी, दिशा, टोपोलॉजी और विविध ज्यामितीय वस्तु निरूपण सहित जटिल, मात्रात्मक स्थानिक तर्क करने में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमताओं का मूल्यांकन करने और उनकी सीमाओं को उजागर करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang

प्रकाशित 2026-02-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो किसी फोटो को देख सकता है और आपसे उसके बारे में बात कर सकता है। आप उससे पूछ सकते हैं, "वह इमारत क्या है?" या "क्या वह एक कुत्ता है?" और वह सही उत्तर देगा। लेकिन अब, कल्पना कीजिए कि आपने उससे बहुत अधिक कठिन सवाल पूछा: "वह लाल घर नदी से कितनी दूर है, और उसके 10 मिनट की पैदल दूरी के भीतर कितने अन्य घर हैं?"

आज के अधिकांश स्मार्ट AI सहायक इसमें लड़खड़ा जाएंगे। वे चीजों के नाम बताने में बेहतरीन हैं, लेकिन मानचित्र पर स्थान, दूरी और ज्यामिति (geometry) को समझने में बहुत खराब हैं।

यह पेपर EarthSpatialBench नामक एक नए टूल का परिचय देता है ताकि यह परीक्षण किया जा सके कि ये AI रोबोट "मानचित्र पढ़ने" में कितने अच्छे हैं। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: AI "मानचित्र-अंधा" (Map-Blind) है

वर्तमान AI मॉडल को एक ऐसे पर्यटक की तरह समझें जिसने कभी दिशा-सूचक यंत्र (compass) या स्केल का उपयोग नहीं किया है।

  • वे शहर की तस्वीर देखकर कह सकते हैं, "यह एक पार्क है।"
  • लेकिन यदि आप उनसे पूछें, "क्या पार्क बाड़ (fence) के अंदर है, या बाड़ पार्क के चारों ओर है?" या "पार्क सड़क से कितने मीटर की दूरी पर है?", तो वे अक्सर गलत अनुमान लगाते हैं।
  • वास्तविक दुनिया के कार्यों (जैसे बाढ़ के दौरान मदद करना या नया शहर योजना बनाना) के लिए सटीक उत्तरों की आवश्यकता होती है, न कि केवल अनुमानों की।

2. समाधान: एक "मानचित्र-पढ़ने" वाली अंतिम परीक्षा

लेखकों ने EarthSpatialBench बनाया है, जो AI के लिए एक विशाल, कठोर अंतिम परीक्षा की तरह है, जिसे विशेष रूप से पृथ्वी की उपग्रह (satellite) और ड्रोन तस्वीरों के लिए डिज़ाइन किया गया है।

केवल "यह क्या है?" पूछने के बजाय, यह परीक्षा तीन प्रकार के कठिन प्रश्न पूछती है:

  • रूलर टेस्ट (दूरी): "वह घर नदी से कितनी दूर है?" (AI को केवल "पास" या "दूर" नहीं, बल्कि एक संख्या देनी होगी)।
  • कम्पास टेस्ट (दिशा): "क्या वह इमारत साइलो (silo) के उत्तर-पूर्व में है या दक्षिण-पश्चिम में?" (AI को कोणों की गणना करनी होगी)।
  • पज़ल टेस्ट (टोपोलॉजी): "क्या यह सड़क पार्क के बीच से गुजर रही है, या पार्क सड़क के लूप के अंदर है?" (AI को यह समझना होगा कि आकार एक-दूसरे में कैसे फिट होते हैं)।

3. परीक्षा सामग्री: पहेलियों का एक बड़ा डिब्बा

इस परीक्षा को निष्पक्ष और कठिन बनाने के लिए, उन्होंने वास्तविक उपग्रह छवियों पर आधारित 325,000 प्रश्नों का एक डेटासेट बनाया है।

  • वस्तुएं (Objects): उन्होंने केवल साधारण बॉक्स का उपयोग नहीं किया। उन्होंने पॉलीगॉन (आकार जो वास्तविक पार्क की सीमाओं की तरह दिखते हैं), पॉलीलाइन्स (नदियों और सड़कों के लिए टेढ़ी-मेढ़ी रेखाएं), और बॉक्सेस (इमारतों के लिए) का उपयोग किया।
  • संदर्भ (References): कभी-कभी AI को किसी वस्तु को ढूंढना होता है क्योंकि आपने उसका वर्णन किया है ("एकमात्र लाल घर"), और कभी-कभी इसलिए क्योंकि आपने उसे सटीक निर्देशांक (coordinates) दिए हैं ("इन GPS बिंदुओं वाला घर")।

4. परिणाम: AI अभी भी एक "नौसिखिया" है

शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI मॉडलों (जैसे GPT-5, Gemini, और Claude) का इस परीक्षा पर परीक्षण किया। यहाँ उन्हें क्या पता चला:

  • बातचीत में अच्छे, गणित में खराब: AI सरल प्रश्नों के "हाँ" या "ना" कहने में बहुत अच्छे हैं, लेकिन वे दूरियों या कोणों के लिए सटीक संख्या देने में संघर्ष करते हैं। यह एक ऐसे छात्र की तरह है जो आपको बता सकता है कि "यह दूर है" लेकिन जब उससे इंचों में मापने के लिए कहा जाता है तो वह विफल हो जाता है।
  • "ग्राउंडिंग" का अंतर: यह सबसे बड़ी समस्या है। मानचित्र के बारे में गणितीय प्रश्न का उत्तर देने के लिए, AI को पहले चित्र पर उस वस्तु को ढूंढना होगा। यदि AI चित्र पर "लाल घर" को सटीक रूप से नहीं दिखा सकता, तो वह नदी तक की दूरी की गणना नहीं कर सकता। अध्ययन में पाया गया कि कई AI "भ्रमित" (hallucinating) हो रहे हैं (यानी चीजें कहाँ हैं, इसकी कल्पना कर रहे हैं), जो उनकी गणित को खराब कर देता है।
  • विजुअल बनाम टेक्स्ट: जब शोधकर्ताओं ने AI को एक तस्वीर दी जिसके चारों ओर एक लाल घेरा बना हुआ था, तो AI उसे खोजने में बेहतर हो गया। लेकिन जब उन्होंने केवल टेक्स्ट निर्देश दिए, तो AI भ्रमित हो गया। यह दर्शाता है कि AI अभी भी शब्दों को पिक्सेल से जोड़ने का तरीका सीख रहा है।

5. यह क्यों मायने रखता है?

एक भविष्य की कल्पना करें जहाँ AI तूफान के दौरान जीवन बचाने में मदद करता है।

  • वर्तमान AI: "मुझे कुछ पानी दिख रहा है। शायद लोग मुसीबत में हैं?"
  • भविष्य का AI (इस बेंचमार्क के साथ): "मैं नदी के 50 मीटर के भीतर 15 घर डूबे हुए देख रहा हूँ। निकटतम सड़क 200 मीटर दूर है। इन सटीक निर्देशांकों पर बचाव नौकाएं भेजें।"

निष्कर्ष

EarthSpatialBench एक चेतावनी है। यह दिखाता है कि जबकि AI "देखने" और "बात करने" में स्मार्ट हो रहा है, यह "मापने" और "नेविगेट करने" में अभी भी अनाड़ी है।

लेखकों को उम्मीद है कि AI को यह कठिन "मानचित्र-पढ़ने" की परीक्षा देकर, डेवलपर्स बेहतर रोबोट बनाएंगे जो एक दिन वास्तव में भौतिक दुनिया को समझ सकेंगे, जिससे हमें शहरों की योजना बनाने, पर्यावरण की निगरानी करने और आपदाओं के प्रति सटीक प्रतिक्रिया देने में मदद मिलेगी। तब तक, हमें अभी किसी AI पर बचाव नाव चलाने के लिए भरोसा नहीं करना चाहिए!

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →