← नवीनतम पेपर
💻 computer science

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

यह शोध पत्र UCS-Bench प्रस्तुत करता है, जो एगोसेंट्रिक (egocentric) वीडियो में उपयोगकर्ता-केंद्रित निरंतर स्थानिक तर्क (continual spatial reasoning) के मूल्यांकन के लिए एक बड़े पैमाने का डेटासेट है, और DirectMe का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो मल्टीमॉडल एलएलएम (LLMs) की दीर्घकालिक स्थानिक तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए संरचित स्थानिक स्मृति (structured spatial memory) को क्रमिक रूप से निर्मित करता है।

मूल लेखक: Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Keep It in Mind: User-Centric Continual Spatial Intelligence" पेपर का सरल भाषा में अनुवाद दिया गया है:

मुख्य विचार: "भुलक्कड़ टूर गाइड" की समस्या

कल्पना कीजिए कि आप एक विशाल और जटिल घर में चलते समय अपने सिर पर एक कैमरा (जैसे GoPro) पहने हुए हैं। आप रसोई में जाते हैं, एक कप उठाते हैं, घूमते हैं, लिविंग रूम में जाते हैं, और फिर वापस रसोई में आते हैं।

यदि आप एक मानक AI असिस्टेंट से पूछें, "अभी मेरे सापेक्ष (relative to me) कप कहाँ है?", तो वह भ्रमित हो सकता है। वह वर्तमान वीडियो फ्रेम को देख सकता है, मेज पर रखे कप को देख सकता है, और कह सकता है, "यह आपके सामने है।" लेकिन क्या होगा यदि आपने 10 सेकंड पहले अपनी दिशा बदल ली थी? अब कप आपके पीछे है।

वर्तमान AI मॉडल उन टूर गाइडों की तरह हैं जो केवल अगले 5 सेकंड में जो देखते हैं, उसे ही याद रखते हैं। यदि आप किसी लैंडमार्क की ओर अपनी पीठ घुमा लेते हैं, तो वे भूल जाते हैं कि वह अस्तित्व में है या आपकी नई स्थिति के सापेक्ष वह कहाँ है। उन्हें यह बताने में कठिनाई होती है कि "फ्रिज आपके पीछे बाईं ओर है," क्योंकि वे आपके चलते समय अपने दिमाग में कमरे का मानसिक रोटेशन (mental rotation) नहीं कर पाते।

समाधान: UCS-Bench और DirectMe

लेखकों ने इसे ठीक करने के लिए दो चीजें बनाईं: एक नया परीक्षण (UCS-Bench) और एक नई विधि (DirectMe)।

1. परीक्षण: UCS-Bench (द "मेमोरी जिम")

शोधकर्ताओं ने AI के लिए स्थानिक स्मृति (spatial memory) का अभ्यास करने के लिए एक विशाल जिम बनाया।

  • वर्कआउट: उन्होंने 170 घंटे से अधिक का फर्स्ट-पर्सन वीडियो (जैसे कोई अपने दैनिक जीवन में घूम रहा हो) एकत्र किया।
  • प्रश्न: उन्होंने 8,000 से अधिक प्रश्न लिखे जो समय और गति के आधार पर बदलते हैं।
    • उदाहरण: "वेंडिंग मशीन कहाँ है?"
    • समय 1: आप इसके सामने हैं। उत्तर: "आपके सामने है।"
    • समय 2: आपने अपनी दिशा बदल ली। उत्तर: "आपके पीछे बाईं ओर है।"
  • लक्ष्य: यह परीक्षण करता है कि क्या एक AI एक ऐसा मानसिक मानचित्र (mental map) रख सकता है जो आपके चलने के साथ-साथ अपडेट होता रहे, न कि केवल उस चीज़ का वर्णन करे जो वर्तमान में स्क्रीन पर दिख रही है।

2. विधि: DirectMe (द "मेंटल मैप बिल्डर")

लेखकों ने इस तरह के वीडियो को संभालने के लिए एक नई विधि प्रस्तावित की, जिसे DirectMe कहा जाता है।

उपमा: स्केचबुक बनाम स्नैपशॉट

  • पुराना AI (स्नैपशॉट): कल्पना कीजिए कि आप हर सेकंड एक फोटो खींचते हैं और केवल उस फोटो को देखकर सवाल का जवाब देने की कोशिश करते हैं जो अभी आपके हाथ में है। यदि वस्तु फोटो में नहीं है, तो आपको पता नहीं चलेगा कि वह कहाँ है।
  • DirectMe (स्केचबुक): कल्पना कीजिए कि एक कलाकार आपके साथ चल रहा है। केवल फोटो खींचने के बजाय, वह लगातार एक 3D मैप को अपनी स्केचबुक में बना रहा है।
    • जैसे-जैसे आप चलते हैं, कलाकार वस्तुओं (फ्रिज, कुर्सी, कप) को बनाता है और कमरे में उनकी सटीक स्थिति अंकित करता है।
    • महत्वपूर्ण रूप से, कलाकार यह भी अंकित करता है कि आप कहाँ हैं और आपका मुख किस दिशा में है
    • जब आप पूछते हैं, "कप कहाँ है?", तो कलाकार वर्तमान दृश्य को नहीं देखता; वह स्केचबुक को देखता है। वह देखता है कि कप 5 मीटर दूर है, और क्योंकि आप विपरीत दिशा में देख रहे हैं, वह आपको बताता है, "यह आपके पीछे है।"

DirectMe कैसे काम करता है (सरल शब्दों में):

  1. देखना और मापना: यह वीडियो को देखता है और गणित का उपयोग करके यह पता लगाता है कि चीजें कितनी गहरी हैं और कैमरा (आप) कैसे हिल रहा है।
  2. मैप बनाना: यह एक "सीन ग्राफ" (Scene Graph) बनाता है। इसे वस्तुओं और आपके बीच एक डिजिटल वेब के रूप में समझें। यह याद रखता है कि "कप मेज पर है" और "मेज रसोई में है।"
  3. रियल-टाइम में अपडेट करना: जैसे-जैसे आप चलते हैं, मैप अपडेट होता रहता है। यह जानता है कि आप बाईं ओर मुड़े हैं, इसलिए यह मानसिक मैप को तदनुसार घुमाता है।
  4. सवाल का जवाब देना: जब आप कोई सवाल पूछते हैं, तो यह मैप के प्रासंगिक हिस्से को निकालता है और उसे आपके वर्तमान परिप्रेक्ष्य (जैसे, "बाएँ," "दाएँ," "पीछे") में अनुवादित करता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इनका परीक्षण उपलब्ध सबसे स्मार्ट AI मॉडलों (जैसे Qwen, InternVL, आदि) के विरुद्ध किया।

  • अंतराल (The Gap): यहाँ तक कि सर्वश्रेष्ठ AI मॉडल भी लगभग 50% प्रश्नों का सही उत्तर दे पाए। मनुष्य लगभग 91% सही थे। यह दर्शाता है कि वर्तमान AI अभी भी चलते समय "अपना स्थान बनाए रखने" (keeping its bearings) में बहुत कमजोर है।
  • सुधार: जब उन्होंने DirectMe का उपयोग किया, तो AI का प्रदर्शन काफी बढ़ गया। यह उन चीजों के बारे में सवाल का जवाब देने में बहुत बेहतर हो गया जो अब कैमरे के दृश्य में नहीं थीं।
  • मुख्य अंतर्दृष्टि: AI की सबसे बड़ी विफलता वस्तुओं को पहचानना नहीं था (वह जानता है कि कुर्सी क्या है); बल्कि यह था कि चलते हुए व्यक्ति के सापेक्ष कुर्सी कहाँ है, इसे ट्रैक करना। AI यह भूल जाता था कि आप हिले थे, न कि कुर्सी।

सारांश

यह पेपर कहता है: "वर्तमान AI एक एकल फोटो का वर्णन करने में महान है, लेकिन चलती दुनिया में नेविगेट करने में बहुत खराब है। हमने इसे साबित करने के लिए एक नया परीक्षण बनाया और एक नया टूल (DirectMe) बनाया जो एक मानसिक स्केचबुक की तरह काम करता है, जिससे AI को यह याद रखने में मदद मिलती है कि आपके चलते समय आपके सापेक्ष चीजें कहाँ हैं।"

इसका अंतिम लक्ष्य पहनने योग्य AI सहायकों (जैसे दृष्टिहीनों के लिए चश्मा या रोबोट) को बेहतर बनाने में मदद करना है जो वास्तव में आपको अपने घर या शहर में रास्ता खोजने में मदद कर सकें बिना खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →