← नवीनतम पेपर
🤖 AI

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

यह शोधपत्र DreamHouse प्रस्तुत करता है, जो भौतिक जनरेटिव रीजनिंग (physical generative reasoning) के लिए एक नवीन बेंचमार्क है, जो विजन-लैंग्वेज मॉडल्स की पुनरावृत्ति एजेंटिक इंटरैक्शन (iterative agentic interaction) के माध्यम से संरचनात्मक रूप से सुदृढ़ और कोड-अनुपालन वाले टिम्बर-फ्रेम घरों के निर्माण की क्षमता का मूल्यांकन करता है, जो भौतिक तर्क (physical reasoning) में महत्वपूर्ण क्षमता अंतराल को प्रकट करता है जो वर्तमान विजुअल-रियलिज्म-केंद्रित मूल्यांकनों में अदृश्य हैं।

मूल लेखक: Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luyu Yang, Yutong Dai, An Yan, Viraj Prabhu, Ran Xu, Zeyuan Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घर की एक बेहद सुंदर, सजीव (photorealistic) फोटो देख रहे हैं। यह एकदम सटीक लग रहा है। छत का रंग सही है, खिड़कियाँ संरेखित (aligned) हैं, और बरामदा बहुत ही आकर्षक लग रहा है।

अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट AI से आपके लिए ठीक वैसा ही घर बनाने के लिए कहते हैं।

समस्या:
वर्तमान AI मॉडल उन अविश्वसनीय कलाकारों की तरह हैं जो घर की इतनी अच्छी तस्वीर बना सकते हैं कि वह असली लगे। लेकिन अगर आप उनसे वास्तव में वह घर बनाने के लिए कहें, तो वे नींव लगाना भूल सकते हैं, गलत आकार की लकड़ी का उपयोग कर सकते हैं, या ऐसी छत बना सकते हैं जो अपने ही वजन से ढह जाए। वे चीजों को दिखने में सही बनाने में माहिर हैं, लेकिन उन्हें काम करने में सक्षम बनाने में वे बहुत खराब हैं।

समाधान: "DreamHouse"
इस शोध पत्र के पीछे के शोधकर्ताओं ने एक नया परीक्षण बनाया जिसे DreamHouse कहा जाता है। इसे AI के लिए एक "ड्राइविंग टेस्ट" की तरह समझें, लेकिन यहाँ AI कार नहीं चला रहा, बल्कि घर बना रहा है।

उन्होंने इसे कैसे किया, इसके कुछ सरल उदाहरण यहाँ दिए गए हैं:

1. "जादुई ब्लूप्रिंट" बनाम "असली घर"

अधिकांश AI परीक्षण किसी छात्र को पुल का चित्र बनाने के लिए कहने जैसा है। यदि चित्र अच्छा दिखता है, तो उन्हें 'A' ग्रेड मिलता है।
DreamHouse अलग है। यह AI को वास्तविक निर्माण कोड (एक रोबोट के लिए निर्देशों का एक सेट) लिखने के लिए कहता है।

  • पेंच (The Catch): AI केवल चित्र नहीं बना रहा है; वह एक रेसिपी लिख रहा है। यदि वह कहता है "यहाँ एक बीम रखें," तो उस बीम को वास्तव में छत को थामना ही होगा। यदि गणित गलत है, तो घर विफल हो जाएगा, भले ही चित्र एकदम परफेक्ट क्यों न दिखे।

2. "छिपे हुए कंकाल" की चुनौती

शोधकर्ताओं ने इस परीक्षण के लिए टिम्बर-फ्रेम घरों (दिखने वाले बीम वाले लकड़ी के घर) का उपयोग किया।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक व्यक्ति को देखकर रहे हैं जिसने मोटा विंटर कोट पहना हुआ है। आप उसके शरीर का आकार देख सकते हैं, लेकिन आप उसका कंकाल नहीं देख सकते।
  • परीक्षण: AI को बने हुए घर की एक तस्वीर (वह "कोट") दिखाई जाती है। उसे इसके अंदर के अदृश्य लकड़ी के कंकाल (बीम, स्टड्स और राफ्टर्स) का पता लगाना होता है और उसे सही ढंग से बनाना होता है।
  • यह कठिन क्यों है: सिर्फ इसलिए कि एक दीवार सीधी दिख रही है, इसका मतलब यह नहीं है कि उसके अंदर के स्टड्स (studs) सही दूरी पर रखे गए हैं। यदि स्टड्स बहुत दूर-दूर होंगे, तो दीवार गिर जाएगी। AI को केवल दृश्य चित्र की नकल करने के बजाय, अदृश्य भौतिकी (physics) के बारे में "सोचना" होगा।

3. "सख्त निरीक्षक" (The Strict Inspector)

वास्तविक दुनिया में, घर बनाने के लिए सख्त नियमों (जैसे इंटरनेशनल रेसिडेंशियल कोड) का पालन करना आवश्यक है।

  • उपमा: एक बहुत ही बारीक/नखरे दिखाने वाले बिल्डिंग इंस्पेक्टर की कल्पना करें जो 10 विशिष्ट चीजों की जांच करता है:
    1. क्या छत वास्तव में जमीन को छूती है?
    2. क्या बीम की मोटाई सही है?
    3. क्या लकड़ी की दूरी ठीक 16 इंच है?
    4. क्या छत का भार सुरक्षित रूप से जमीन तक स्थानांतरित हो रहा है?
  • परिणाम: यदि AI इनमें से एक भी नियम चूक जाता है, तो पूरा घर विफल हो जाता है। उसे आंशिक क्रेडिट (partial credit) नहीं मिलता। एक सुंदर छत वाला घर जिसमें एक सपोर्ट बीम गायब है, वह "फेल" माना जाएगा।

4. "गलती और सुधार" का चक्र (The Trial and Error Loop)

AI को केवल एक मौका नहीं मिलता। यह एक वीडियो गेम की तरह है जहाँ आपको चरण-दर-चरण घर बनाना होता है।

  1. AI नींव बनाता है।
  2. "निरीक्षक" (कंप्यूटर प्रोग्राम) इसकी जांच करता है।
  3. यदि नींव बहुत कमजोर है, तो निरीक्षक कहता है, "त्रुटि! बीम बहुत छोटा है।"
  4. AI को इसे ठीक करना होता है और फिर से प्रयास करना होता है।
  5. वह यह तब तक करता रहता है जब तक कि घर संरचनात्मक रूप से मजबूत (गिर न जाए) और दृश्यात्मक रूप से सटीक (लक्ष्य चित्र जैसा दिखे) न हो जाए।

उन्होंने क्या पाया?

शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI मॉडलों (जैसे GPT-5, Claude, और Gemini) का इस चुनौती पर परीक्षण किया। परिणाम आश्चर्यजनक थे:

  • "कलाकार" बनाम "इंजीनियर": वे मॉडल जो कोडिंग या प्रश्न पूछने में माहिर माने जाते हैं, वे निर्माण कार्य में बुरी तरह विफल रहे। वे एक आदर्श घर का चित्र तो बना सकते थे लेकिन ऐसा घर नहीं बना सके जो ढहे नहीं।
  • विजुअल्स \neq वास्तविकता: एक मॉडल एक ऐसा घर बना सकता था जो लक्ष्य फोटो के 99% समान दिखता था, लेकिन वह भौतिकी (physics) के परीक्षण में विफल रहा क्योंकि बीम का आकार गलत था।
  • "चरण-दर-चरण" का लाभ: मॉडल तब बहुत बेहतर प्रदर्शन करते थे जब उन्हें घर को छोटे, प्रबंधनीय चरणों में बनाने की अनुमति दी जाती थी (पहले नींव, फिर दीवारें, फिर छत) बजाय इसके कि वे एक ही बड़ी छलांग में पूरा घर बनाने की कोशिश करें।
  • बड़ा अंतर: सबसे अच्छे AI ने भी घर बनाने के उन प्रयासों में से केवल लगभग 7% में सफलता प्राप्त की जो सुरक्षित और दिखने में सटीक दोनों थे।

निष्कर्ष (The Takeaway)

यह शोध पत्र हमें बताता है कि वर्तमान में AI दुनिया की सतह की नकल करने (सुंदर चित्र बनाने) में बहुत अच्छा है, लेकिन वह उन नियमों को समझने में अभी भी बहुत खराब है जो दुनिया को थामे रखते हैं (भौतिकी, इंजीनियरिंग और तर्क)।

DreamHouse एक नया उपकरण है जो AI को केवल "दिखावा" करने के बजाय वास्तव में यह सोचने के लिए मजबूर करता है कि वास्तविक भौतिक दुनिया में चीजें कैसे काम करती हैं। यह एक चेतावनी है: भविष्य का निर्माण करने के लिए, AI को केवल एक कलाकार नहीं, बल्कि एक इंजीनियर बनने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →