← नवीनतम पेपर
💻 computer science

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

यह शोधपत्र MASS का परिचय देता है, जो एक मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो गहराई-आधारित 3D एन्कोडिंग और मोशन ट्रैकिंग के माध्यम से स्पैटियोटेम्पोरल (spatiotemporal) संकेतों को इंजेक्ट करके विजन-लैंग्वेज मॉडल्स की भौतिकी तर्क और समझ को बढ़ाता है, जिसे नए MASS-Bench बेंचमार्क और अत्याधुनिक क्लोज्ड-सोर्स मॉडल्स के तुलनीय प्रदर्शन प्राप्त करने के लिए सुदृढीकरण फाइन-ट्यूनिंग (reinforcement fine-tuning) द्वारा समर्थित किया गया है।

मूल लेखक: Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को फिल्में देखना सिखा रहे हैं। यह रोबोट, जिसे विज़न-लैंग्वेज मॉडल (VLM) कहा जाता है, जो देखता है उसका वर्णन करने में माहिर है। यदि आप उसे लेजर पॉइंटर का पीछा करते हुए एक बिल्ली का वीडियो दिखाते हैं, तो वह बता सकता है, "बिल्ली तेज़ी से दौड़ रही है!" या "लेजर लाल है।"

लेकिन समस्या यह है: रोबोट वास्तव में भौतिकी (physics) को नहीं समझता।

यदि आप उसे एक ऐसा वीडियो दिखाते हैं जहाँ एक गेंद आसमान में ऊपर की ओर तैरती है बजाय नीचे गिरने के, या एक बास्केटबॉल जादुई रूप से नीचे से ऊपर की ओर हुप (hoop) के पार निकल जाती है, तो रोबोट केवल यह कहकर रह जाएगा, "कूल ट्रिक!" बिना यह महसूस किए कि यह वास्तविक दुनिया में असंभव है। यह वैसा ही है जैसे कोई व्यक्ति जिसने केवल भौतिकी के बारे में पढ़ा हो लेकिन उसने कभी सेब को गिरते हुए नहीं देखा; वह सोच सकता है कि अगर उसने किसी काल्पनिक किताब में पढ़ा है तो सेब तैर भी सकता है।

यह पेपर MASS नामक एक नया सिस्टम पेश करता है ताकि इस समस्या को ठीक किया जा सके। MASS को एक रोबोट को सुपर-चश्मे और एक फिजिक्स नोटबुक देने के रूप में समझें।

समस्या: रोबोट गति (Motion) के प्रति "अंधा" है

वर्तमान रोबोट वीडियो को सुंदर चित्रों की एक श्रृंखला के रूप में देखते हैं। वे वास्तव में गति के पीछे के गणित को नहीं देखते।

  • पुराना तरीका: रोबोट एक बास्केटबॉल और एक हुप देखता है। वह अनुमान लगाता है, "गेंदें आमतौर पर हुप में जाती हैं।" वह यह चेक नहीं करता कि कैसे गेंद हिली।
  • परिणाम: यदि गेंद पीछे की ओर (हुप के माध्यम से ऊपर की ओर) चलती है, तो रोबोट भ्रमित हो जाता है या भ्रम (hallucinate) पैदा करता है, यह सोचकर कि यह सामान्य है क्योंकि यह एक बास्केटबॉल वीडियो जैसा दिखता है।

समाधान: MASS (मोशन-अवेयर स्पेशियल-टेम्पोरल ग्राउंडिंग)

लेखकों ने MASS को रोबोट के लिए एक स्पोर्ट्स रेफरी की तरह काम करने के लिए बनाया है। इससे पहले कि रोबोट किसी प्रश्न का उत्तर देने की कोशिश करे, MASS तीन चीजें करता है:

  1. 3D मैप (डेप्थ): यह केवल एक सपाट चित्र नहीं देखता; यह कमरे का एक 3D मैप बनाता है। वह जानता है कि गेंद हुप से कितनी दूर है।
  2. मोशन ट्रैकर (द "घोस्ट" ट्रेल): यह हर चलती हुई वस्तु के पीछे एक अदृश्य रेखा खींचता है, जिससे यह ट्रैक होता है कि वह कहाँ से शुरू हुई, कहाँ समाप्त हुई, और कितनी तेज़ चली। यह रोबोट के पीछे चलने के लिए ब्रेडक्रंब्स (रोटी के टुकड़ों) की एक चमकती हुई रेखा छोड़ने जैसा है।
  3. अनुवादक (The Translator): यह इस जटिल गणित (कोऑर्डिनेट्स, गति, 3D स्पेस) को सरल अंग्रेजी वाक्यों में अनुवादित करता है जिसे रोबोट पढ़ सके।
    • सिर्फ एक गेंद देखने के बजाय, रोबोट अब पढ़ता है: "गेंद खिलाड़ी के हाथ से शुरू हुई, हुप के माध्यम से ऊपर की ओर बढ़ी, और छत पर समाप्त हुई।"

नया टेस्ट: MASS-Bench

रोबोट को सिखाने के लिए, टीम ने वीडियो का एक विशाल पुस्तकालय बनाया जिसे MASS-Bench कहा जाता है।

  • असली वीडियो: वास्तविक जीवन के क्लिप जहाँ भौतिकी काम करती है (सेब गिरते हैं, कारें रुकती हैं)।
  • नकली वीडियो (AIGC): AI जनरेटर द्वारा बनाए गए क्लिप जहाँ भौतिकी टूट जाती है (छत पर चलते लोग, ऊपर की ओर बहता पानी)।
  • क्विज़: वे रोबोट से पेचीदा सवाल पूछते हैं जैसे, "क्या गेंद नीचे गिरी या ऊपर तैर गई?"

परिणाम: "अनुमान लगाने" से "जानने" तक

जब उन्होंने रोबोट को ये "सुपर-चश्मे" (MASS) दिए और इसे एक विशेष तरीके (रीइन्फोर्समेंट फाइन-ट्यूनिंग) के साथ प्रशिक्षित किया, तो कुछ अद्भुत हुआ:

  • पहले: रोबोट एक ऐसे छात्र की तरह था जो परीक्षा में अनुमान लगा रहा था। वह लगभग 50% सही था।
  • बाद में: रोबोट एक भौतिकी के प्रोफेसर की तरह बन गया। वह नकली वीडियो को तुरंत पहचान सकता था।
  • स्कोर: MASS का उपयोग करने वाला रोबोट लगभग उन सबसे महंगे, क्लोज्ड-सोर्स सुपर-इंटेलिजेंस (जैसे Gemini-2.5) के बराबर प्रदर्शन करता है, भले ही वह रोबोट स्वयं बहुत छोटा और सस्ता था।

एक बड़ी उपमा (Analogy)

कल्पना कीजिए कि आप अपने एक दोस्त को कार दुर्घटना के बारे में समझाने की कोशिश कर रहे हैं जिसने कभी कार नहीं देखी है।

  • MASS के बिना: आप कहते हैं, "कार पेड़ से टकराई।" आपका दोस्त एक कार्टून कार की कल्पना करता है जो धीरे से पेड़ से टकराती है।
  • MASS के साथ: आप कहते हैं, "कार 60 मील प्रति घंटे की रफ्तार से चल रही थी, 45-डिग्री के कोण पर पेड़ से टकराई, और बल के कारण धातु मुड़ गई।" आपका दोस्त अब दुर्घटना की भौतिकी को समझता है, न कि केवल चित्र को।

संक्षेप में: यह पेपर AI को केवल वीडियो को "देखने" के बजाय ब्रह्मांड के उन अदृश्य नियमों को "समझने" के लिए सिखाता है जो दुनिया को चलाते हैं। यह AI को यह कहने की क्षमता देता है, "रुको, वह गेंद वहां तैरनी नहीं चाहिए!" बिल्कुल वैसे ही जैसे एक इंसान करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →