← नवीनतम पेपर
💻 computer science

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

यह शोध पत्र स्थानिक बुद्धिमत्ता (spatial intelligence) के लिए विजन-लैंग्वेज मॉडल्स (VLMs) और वीडियो जनरेशन मॉडल्स (VGMs) का एक व्यवस्थित तुलनात्मक अध्ययन प्रस्तुत करता है, जो सिमेंटिक समझ बनाम ज्यामितीय तर्क (geometric reasoning) में उनकी पूरक शक्तियों को उजागर करता है और यह प्रदर्शित करता है कि उनके फीचर्स को मिलाने से स्थानिक कार्यों के लिए एक बेहतर बैकबोन निर्मित होता है।

मूल लेखक: Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

प्रकाशित 2026-05-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दो अलग-अलग प्रकार के रोबोटों को एक भौतिक कमरे को समझना सिखाने की कोशिश कर रहे हैं। एक रोबोट सुपर रीडर (एक विजन-लैंग्वेज मॉडल, या VLM) है, और दूसरा रोबोट मास्टर डायरेक्टर (एक वीडियो जनरेशन मॉडल, या VGM) है।

बड़ा सवाल जो यह पेपर पूछता है वह है: कौन सा रोबोट "स्थानिक बुद्धिमत्ता" (spatial intelligence) को समझने में बेहतर है?

इस उत्तर को खोजने के लिए, शोधकर्ताओं ने रोबोटों को नए करतब सीखने या अंतिम परीक्षा देने के लिए नहीं छोड़ा। इसके बजाय, उन्होंने रोबोटों को एक "फ्रोजन" (frozen) अवस्था में रखा—जैसे किसी वीडियो गेम के पात्र को खेलने शुरू करने से ठीक पहले पॉज़ कर देना—और एक सरल प्रश्न पूछा: "अभी इस समय तुम्हारे मस्तिष्क में पहले से ही कौन सी जानकारी संग्रहीत है?"

उन्होंने इन फ्रोजन दिमागों का परीक्षण तीन विशिष्ट कार्यों पर किया, जिसमें एक बहुत ही छोटा और हल्का "प्रोब" (एक त्वरित क्विज़ की तरह) इस्तेमाल किया गया ताकि देखा जा सके कि प्रत्येक रोबोट क्या याद कर सकता है।

तीन परीक्षण

  1. "वह क्या है?" टेस्ट (सिमेंटिक टैगिंग):

    • कार्य: एक वीडियो देखें और उसमें दिखने वाली वस्तुओं की सूची बनाएं (जैसे, "सोफा," "दरवाजा," "मेज")।
    • परिणाम: सुपर रीडर (VLM) ने इस टेस्ट में सबको पछाड़ दिया। क्योंकि इसे किताबें पढ़ने और कैप्शन के साथ चित्रों को देखने से प्रशिक्षित किया गया था, इसलिए यह जानता है कि वस्तुओं को क्या कहा जाता है और वे कैसी दिखती हैं। मास्टर डायरेक्टर (VGM) ठीक-ठाक था, लेकिन वह अक्सर मुख्य वस्तुओं को पहचानने में चूक गया (जैसे यह भूल जाना कि सोफा वहां मौजूद था)।
  2. "कौन किसका हिस्सा है?" टेस्ट (इंस्टेंस ग्रुपिंग):

    • कार्य: यदि आप तीन अलग-अलग कैमरा एंगल से एक लाल कुर्सी देखते हैं, तो क्या आप बता सकते हैं कि वह तीनों शॉट्स में वही एक ही कुर्सी है?
    • परिणाम: सुपर रीडर फिर से जीत गया। यह कहने में माहिर है कि, "वह पिक्सेल समूह एक कुर्सी है, और वह दूसरा पिक्सेल समूह भी वही कुर्सी है।" मास्टर डायरेक्टर को इसमें थोड़ी कठिनाई हुई, कभी-कभी वह अलग-अलग वस्तुओं को आपस में मिला देता था या उन्हें अलग रखने में विफल रहता था।
  3. "सब कुछ कहाँ है?" टेस्ट (3D ज्योमेट्री):

    • कार्य: क्या आप कमरे का 3D मैप बना सकते हैं? शेल्फ कितनी गहरी है? कैमरा कितनी दूर है?
    • परिणाम: मास्टर डायरेक्टर (VGM) ने यहाँ स्वर्ण पदक जीता। क्योंकि इसे शुरुआत से वीडियो बनाने के लिए प्रशिक्षित किया गया था, इसने सीखा कि वस्तुओं को सही स्थान पर रहना चाहिए और वे यथार्थवादी तरीके से हिलनी चाहिए। इसने इसे गहराई, दूरी और 3D संरचना का एक बहुत मजबूत बोध दिया। सुपर रीडर जानता था कि शेल्फ क्या है, लेकिन इसका 3D मैप धुंधला और अस्पष्ट था।

बड़ी खोज: आदर्श टीम

सबसे रोमांचक खोज यह है कि कोई भी रोबोट अपने आप में पूर्ण नहीं है। वे एक संपूर्ण इकाई के दो आधे हिस्सों की तरह हैं:

  • सुपर रीडर नामों और पहचान (Semantics) का विशेषज्ञ है।
  • मास्टर डायरेक्टर आकार और स्थान (Geometry) का विशेषज्ञ है।

शोधकर्ताओं ने एक "नेइव फ्यूजन" (एक साधारण मिक्स-एंड-मैच) का प्रयास किया। उन्होंने सुपर रीडर के फ्रोजन दिमाग और मास्टर डायरेक्टर के फ्रोजन दिमाग को लिया और उन्हें आपस में जोड़ दिया।

परिणाम? संयुक्त रोबोट एक सुपरहीरो था। वह हर वस्तु का नाम पूरी तरह से बता सकता था और कमरे का एक सटीक 3D मैप भी बना सकता था। यह पेपर सुझाव देता है कि भविष्य के रोबोटों या सेल्फ-ड्राइविंग कारों के लिए AI बनाने का सबसे अच्छा तरीका एक मॉडल को चुनना नहीं है, बल्कि एक भाषा विशेषज्ञ के "दिमाग" को एक वीडियो निर्माता के "दिमाग" के साथ मिलाना है।

संक्षेप में सार

  • VLMs (सुपर रीडर्स): चीज़ें क्या हैं, यह जानने में बेहतरीन हैं।
  • VGMs (मास्टर डायरेक्टर्स): चीज़ें 3D स्पेस में कहाँ हैं, यह जानने में बेहतरीन हैं।
  • समाधान: उन्हें एक साथ मिलाएं ताकि एक ऐसा AI प्राप्त हो सके जो दुनिया के नामों और लेआउट दोनों को पूरी तरह से समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →