PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models
यह शोध पत्र PlanBench-V प्रस्तुत करता है, जो कि पेशेवर मानचित्र व्याख्या में विजन-लैंग्वेज मॉडल्स (Vision-Language Models) की क्षमताओं का आकलन करने के लिए 223 स्थानिक नियोजन मानचित्रों और 1,629 प्रश्न-उत्तर युग्मों के एक विशेषज्ञ-एनोटेटेड डेटासेट के साथ-साथ एक चार-चरणीय मूल्यांकन ढांचे वाला पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि हाल के मॉडल्स ने महत्वपूर्ण प्रगति दिखाई है, फिर भी वे जटिल, नीति-संवेदनशील निर्णय लेने वाले कार्यों में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शहर के जटिल, रंगीन मानचित्र को देख रहे हैं। एक सामान्य व्यक्ति के लिए, यह केवल सड़कों और पार्कों की एक तस्वीर है। लेकिन एक शहर योजनाकार (city planner) के लिए, यह एक कानूनी दस्तावेज़, नियमों का एक समूह और भविष्य के लिए एक दृष्टिकोण है, जो सब कुछ एक साथ समाहित है। यह आपको बताता है कि एक स्कूल कहाँ जाना चाहिए, एक इमारत कितनी ऊँची हो सकती है, और किन नदियों को कानून द्वारा संरक्षण की आवश्यकता है।
यह शोध पत्र एक नया "टेस्ट" पेश करता है जिसे PlanBench-V कहा जाता है, ताकि यह देखा जा सके कि आधुनिक AI (विशेष रूप से विज़न-लैंग्वेज मॉडल, या "स्मार्ट कैमरे जो पढ़ सकते हैं") इन विशेष मानचित्रों को कितनी अच्छी तरह समझ सकते हैं।
यहाँ शोधकर्ताओं ने क्या किया और क्या पाया, इसका विवरण सरल उपमाओं (analogies) के साथ दिया गया है:
1. समस्या: AI एक पर्यटक की तरह है, योजनाकार की तरह नहीं
वर्तमान AI मॉडल सामान्य कार्यों में बहुत अच्छे हैं। यदि आप उन्हें बिल्ली की फोटो दिखाते हैं, तो वे जानते हैं कि वह एक बिल्ली है। यदि आप उन्हें एक सामान्य मानचित्र दिखाते हैं, तो वे बता सकते हैं कि न्यूयॉर्क कहाँ है।
लेकिन स्थानिक नियोजन मानचित्र (Spatial Planning Maps) अलग हैं। वे एक गुप्त कोड की तरह हैं। वे विशिष्ट रंगों, प्रतीकों और सूक्ष्म टेक्स्ट का उपयोग करते हैं जिन्हें केवल प्रशिक्षित पेशेवर ही समझते हैं। शोध पत्र का तर्क है कि वर्तमान AI एक कानूनी अनुबंध को देखने वाले पर्यटक की तरह है: वे शब्दों को देख सकते हैं, लेकिन वे उनके पीछे के नियमों को नहीं समझते हैं। वे इस तथ्य को मिस कर सकते हैं कि एक लाल रेखा का अर्थ है "कोई निर्माण नहीं करने दिया जाएगा" या हरे रंग का एक विशिष्ट शेड का अर्थ है "संरक्षित आर्द्रभूमि (wetland)"।
2. समाधान: एक "सिटी प्लानर की परीक्षा" बनाना
इसे ठीक करने के लिए, शोधकर्ताओं ने PlanBench-V नामक एक विशाल टेस्ट बैंक बनाया।
- सामग्री: उन्होंने चीन, अमेरिका, यूरोप और जापान से 223 वास्तविक दुनिया के नियोजन मानचित्र एकत्र किए। इन्हें परीक्षा के लिए "पाठ्यपुस्तक के पन्नों" के रूप में सोचें।
- प्रश्न: उन्होंने वास्तविक मानव शहर योजनाकारों द्वारा लिखे गए 1,629 प्रश्न बनाए। ये केवल "यह किस रंग का है?" जैसे प्रश्न नहीं हैं। ये जटिल परिदृश्य हैं जैसे, "इस मानचित्र के आधार पर, क्या यह भवन योजना कानूनी है?" या "यह लेआउट यातायात को कैसे प्रभावित करता है?"
3. परीक्षा के चार स्तर
शोधकर्ताओं ने केवल एक प्रकार के प्रश्न नहीं पूछे। उन्होंने इसे इस तरह डिज़ाइन किया कि यह एक मानव योजनाकार के सोचने के तरीके की नकल करे, जो सरल से बहुत कठिन की ओर बढ़ता है:
- स्तर 1: धारणा (Perception) - ("आंखें")
- उपमा: क्या आप सूप में सामग्री पहचान सकते हैं?
- कार्य: AI को बस मानचित्र पर चीजों को खोजना है। "उत्तर दिशा का तीर कहाँ है?" "इस नीले प्रतीक का क्या अर्थ है?" "कोने में लिखे टेक्स्ट को पढ़ें।"
- स्तर 2: तर्क (Reasoning) - ("मस्तिष्क")
- उपमा: क्या आप समझ सकते हैं कि सामग्रियां एक साथ कैसे जुड़ती हैं?
- कार्य: AI को बिंदुओं को जोड़ना होगा। "यदि स्कूल यहाँ है और सड़क वहाँ है, तो क्या वे बहुत करीब हैं?" "क्या यह लेआउट एक शहर के लिए तर्कसंगत है?"
- स्तर 3: साहचर्य (Association) - ("पुस्तकालय")
- उपमा: क्या आप रेसिपी बुक और स्वास्थ्य कानूनों को जानते हैं?
- कार्य: AI को मानचित्र को बाहरी नियमों से जोड़ना होगा। "यह मानचित्र एक पार्क दिखाता है; कौन सा सरकारी कानून इस प्रकार के पार्क की रक्षा करता है?" "क्या यह योजना राष्ट्रीय ज़ोनिंग नियमों का पालन करती है?"
- स्तर 4: कार्यान्वयन (Implementation) - ("न्यायाधीश")
- उपमा: क्या आप मुख्य शेफ बन सकते हैं और व्यंजन की आलोचना कर सकते हैं?
- कार्य: यह सबसे कठिन हिस्सा है। AI को एक वरिष्ठ योजनाकार की तरह कार्य करना होगा। "क्या यह भवन योजना अच्छी है या बुरी? क्यों? यदि आप मेयर होते, तो क्या आप इसे मंजूरी देते, और आप इसमें क्या बदलाव करते?"
4. परिणाम: "पुराना" बनाम "नया" AI
शोधकर्ताओं ने दो पीढ़ियों के AI मॉडल का परीक्षण किया:
- 2025 के मॉडल (The "Old Guard"): इनमें GPT-4o जैसे शीर्ष मॉडल शामिल थे। वे प्रतीकों को पहचानने (स्तर 1) और बुनियादी तर्क (स्तर 2) करने में सक्षम थे।
- 2026 के मॉडल (The "New Agents"): ये नए मॉडल हैं जिनमें "एजेंटिक रीजनिंग" (वे एक पहेली सुलझाने वाले इंसान की तरह चरणों में सोच सकते हैं) है।
बड़ी जीत: नए 2026 मॉडल काफी बेहतर थे। सबसे अच्छा नया मॉडल (Qwen3.6-Plus) सबसे अच्छे पुराने मॉडल की तुलना में लगभग 27% अधिक स्कोर करता था। यह एक स्मार्ट हाई स्कूल छात्र से कॉलेज स्नातक बनने जैसा था।
बड़ी संघर्ष (The Big Struggle): सबसे अच्छा नया AI भी स्तर 4 (कार्यान्वयन) पर लड़खड़ा गया।
- रूपक: कल्पना कीजिए कि एक छात्र है जिसने पूरी नियम पुस्तिका रट ली है और गणित के सवालों को पूरी तरह हल कर सकता है। लेकिन जब आप उससे वास्तविक जीवन की स्थिति के बारे में पूछते हैं जहाँ नियम आपस में टकराते हैं (जैसे, "हमें यहाँ एक अस्पताल चाहिए, लेकिन कानून कहता है कि नदियों के पास अस्पताल नहीं हो सकते"), तो AI भ्रमित हो जाता है। वह लंबे, शब्दबहुल उत्तर देता है जो सुनने में स्मार्ट लगते हैं लेकिन उनमें स्पष्ट, निर्णायक निर्णय की कमी होती है। वह उन "कठिन चुनाव" को करने में संघर्ष करता है जो वास्तविक योजनाकार हर दिन करते हैं।
5. निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हालांकि AI नियोजन मानचित्रों को "देखने" और "पढ़ने" में बहुत बेहतर हो रहा है, लेकिन इसने अभी तक नियोजन की "आत्मा" को नहीं सीखा है।
वास्तविक नियोजन केवल डेटा के बारे में नहीं है; यह निर्णय, नीति और समझौते के बारे में है। वर्तमान AI एक बहुत तेज़ लाइब्रेरियन की तरह है जो कोई भी किताब ढूंढ सकता है, लेकिन वह अभी तक एक शहर योजनाकार नहीं बना है जो यह तय कर सके कि क्या बनाना है जब किताबें आपस में असहमत हों। शोधकर्ता कहते हैं कि हमें AI को केवल मानचित्र देखना ही नहीं, बल्कि उसके पीछे के कानूनों और तर्क को समझना भी सिखाने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।