← नवीनतम पेपर
💻 computer science

Ego-Human Motion Prediction with 3D-Aware LLM

यह शोध पत्र Ego3DLM पेश करता है, जो एक नवीन ढांचा है जो स्थानिक दृश्य समझ को क्रॉस-मोडल निरंतरता के साथ समग्र रूप से एकीकृत करने के माध्यम से एक विशेष तीन-चरणीय प्रशिक्षण योजना द्वारा एगोसेंट्रिक परिप्रेक्ष्य से भविष्य की मानव गति और संबंधित वर्णन को एक साथ पूर्वानुमान लगाने के लिए 3D-सचेत लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।

मूल लेखक: Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने स्मार्ट चश्मा पहना हुआ है जो ठीक वही देख सकता है जो आप देख रहे हैं। आपका लक्ष्य एक ऐसा AI सहायक बनाना है जो न केवल आपको देखे, बल्कि यह भी अनुमान लगाए कि आप आगे क्या करेंगे और व्याख्या करे कि आप ऐसा क्यों कर रहे हैं, और वह सब करते हुए यह भी समझे कि आप किस कमरे में हैं।

यह चुनौती "Ego-Human Motion Prediction with 3D-Aware LLM" नामक शोध पत्र द्वारा हल की गई है। लेखकों ने एक नया AI सिस्टम बनाया है जिसे Ego3DLM कहा जाता है। यह कैसे काम करता है, इसे सरल अवधारणाओं और उपमाओं के माध्यम से यहाँ समझाया गया है।

समस्या: प्रथम-व्यक्ति दृष्टि (First-Person Vision) का "ब्लाइंड स्पॉट"

जब आप अपने सिर पर कैमरा पहनते हैं (एगोसेंट्रिक व्यू), तो आपके पास एक बड़ी समस्या होती है: आप अपने शरीर को नहीं देख सकते। आप केवल अपने हाथ और शायद अपने पैर देखते हैं। आप पूरे कमरे को भी स्पष्ट रूप से नहीं देख पाते क्योंकि आपका दृश्य आपके अपने सिर और हाथों द्वारा बाधित होता है।

केवल अपने हाथों के धुंधले और आंशिक दृश्य को देखकर यह अनुमान लगाना कि कोई व्यक्ति आगे क्या करने वाला है, किसी फिल्म के अंत का अनुमान लगाने जैसा है जहाँ आप केवल अभिनेता की उंगलियों की हरकत देख पा रहे हैं। यह बहुत सारे गलत उत्तरों वाला एक अनुमान लगाने वाला खेल है।

समाधान: "3D-सचेत जासूस" (The 3D-Aware Detective)

लेखकों ने महसूस किया कि मानव गति का सटीक अनुमान लगाने के लिए, AI को दो चीजों की आवश्यकता है:

  1. कमरे का एक मानचित्र: उसे पता होना चाहिए कि दीवारें, कुर्सियाँ और मेज कहाँ हैं (3D स्थानिक संदर्भ)।
  2. एक कहानीकार: उसे यह समझना चाहिए कि कोई व्यक्ति क्यों हिल रहा है, न कि केवल यह कि वह कैसे हिल रहा है (सिमेंटिक संदर्भ)।

अधिकांश पिछले AI मॉडल ने मूवमेंट और कहानी को अलग-अलग अनुमान लगाने की कोशिश की, या उन्होंने 3D कमरे के लेआउट को अनदेखा कर दिया। Ego3DLM इन दोनों को एक साथ करता है।

Ego3DLM कैसे काम करता है: तीन-चरणीय प्रशिक्षण

इस AI को प्रशिक्षित करना एक नए कर्मचारी को एक बहुत ही विशिष्ट कार्य के लिए प्रशिक्षित करने जैसा है। लेखकों ने तीन चरणों वाली प्रक्रिया का उपयोग किया है:

चरण 1: कमरे को समझना (द "हाउस टूर")

इससे पहले कि AI किसी व्यक्ति को चलते हुए देखे, वे इसे 3D वातावरण को समझना सिखाते हैं।

  • उपमा: कल्पना कीजिए कि AI को कमरों की हजारों तस्वीरें दिखाई जा रही हैं और पूछा जा रहा है, "क्या बाईं ओर का रास्ता एक कुर्सी रोक रही है?" या "मेज पर कितने कप हैं?"
  • लक्ष्य: AI बाधाओं, खुले स्थानों और चीजें कहाँ स्थित हैं, इसे पहचानना सीख जाता है। इससे पहले कि वह किसी इंसान की गति का अनुमान लगाए, वह एक "स्थानिक जासूस" बन जाता है।

चरण 2: "वन-पास" कहानीकार (द "सिमल्टेनियस ट्रांसलेटर")

अब, वे AI को एक वीडियो दिखाते हैं जिसमें एक व्यक्ति हिल रहा है और उसे एक ही विचार प्रक्रिया में चार चीजें एक साथ करने के लिए सिखाते हैं:

  1. व्यक्ति ने अभी-अभी क्या किया उसका वर्णन करें (Past Motion)।
  2. व्यक्ति क्या करने वाला है उसका वर्णन करें (Future Motion)।
  3. पिछले कार्य का वर्णन करने वाला एक वाक्य लिखें (Past Action)।
  4. भविष्य के कार्य का वर्णन करने वाला एक वाक्य लिखें (Future Action)।
  • उपमा: कल्पना कीजिए कि एक अनुवादक है जो फ्रेंच में एक वाक्य सुनता है और उसे तुरंत अंग्रेजी अनुवाद लिखना है और साथ ही व्याकरण के नियमों की व्याख्या भी करनी है और कहानी के अगले वाक्य का अनुमान भी लगाना है, वह भी एक ही सांस में।
  • यह क्यों महत्वपूर्ण है: ऐसा एक साथ करने से, AI मजबूर हो जाता है कि "मूवमेंट" और "कहानी" एक दूसरे से पूरी तरह मेल खाएं। यदि AI अनुमान लगाता है कि व्यक्ति दीवार के माध्यम से चलेगा, तो जो कहानी वह लिखेगा वह अजीब लगेगी, और AI मूवमेंट और कहानी दोनों को एक साथ ठीक करना सीख जाता है।

चरण 3: "कोच" (द "रिवॉर्ड सिस्टम")

अंत में, वे एक सुदृढीकरण लर्निंग तकनीक (जिसे GRPO कहा जाता है) का उपयोग एक सख्त कोच के रूप में करते हैं।

  • उपमा: कल्पना कीजिए कि AI एक छात्र है जो परीक्षा दे रहा है। यदि छात्र मूवमेंट सही करता है लेकिन कहानी गलत, तो कोच कम स्कोर देता है। यदि मूवमेंट और कहानी एक दूसरे का खंडन करते हैं (जैसे, कहानी कहती है "बैठना" लेकिन मूवमेंट "कूदना" दिखाता है), तो स्कोर और भी कम होता है।
  • लक्ष्य: यह AI को यह सुनिश्चित करने के लिए मजबूर करता है कि भौतिक गति और भाषा का विवरण पूरी तरह से संरेखित हों और एक साथ अर्थपूर्ण हों।

परिणाम: एक अति-बुद्धिमान भविष्यवक्ता

टीम ने अपने सिस्टम का परीक्षण Nyimea नामक डेटासेट पर किया, जिसमें लोगों के घूमने के वास्तविक वीडियो और कमरों के 3D मानचित्र शामिल हैं।

  • परिणाम: Ego3DLM ने अन्य सभी मौजूदा मॉडलों को पछाड़ दिया।
  • प्रमाण: परीक्षणों में, अन्य मॉडल अक्सर यह अनुमान लगाते थे कि व्यक्ति सीधे दीवार या मेज में जा टकराएगा क्योंकि उन्होंने बाधा को "देखा" नहीं था। Ego3DLM, क्योंकि इसे 3D कमरे को समझने के लिए प्रशिक्षित किया गया था, इसने अनुमान लगाया कि व्यक्ति बाधा के चारों ओर जाएगा।
  • भाषा: इसने बेहतर विवरण भी लिखे। क्योंकि मूवमेंट और टेक्स्ट एक साथ उत्पन्न किए गए थे, इसलिए विवरण बहुत अधिक सटीक थे और वीडियो की भौतिक वास्तविकता से मेल खाते थे।

सारांश

संक्षेप में, Ego3DLM एक ऐसा AI है जो केवल वीडियो नहीं देखता; वह कमरे, व्यक्ति और कहानी को एक साथ समझता है। 3D दुनिया को देखने और मूवमेंट एवं भाषा को एक साथ उत्पन्न करने के माध्यम से, यह पिछले तरीकों की तुलना में बहुत अधिक सटीकता के साथ अनुमान लगा सकता है कि व्यक्ति आगे क्या करेगा, जिससे यह सुनिश्चित होता है कि भविष्यवाणी भौतिक रूप से संभव है (दीवार के माध्यम से नहीं जाएगा) और सिमेंटिक रूप से सही है (कमरे के संदर्भ में अर्थपूर्ण है)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →