← नवीनतम पेपर
🤖 AI

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

यह शोध पत्र HAT-4D प्रस्तुत करता है, जो एक नवीन मानव-एजेंट सहयोगात्मक ढांचा है जो एकल (मोनोक्युलर) वीडियो से भौतिक रूप से विश्वसनीय 4D बहु-वस्तु अंतःक्रियाओं के पुनर्निर्माण के लिए विजन-लैंग्वेज मॉडल और मानव-इन-द-लूप फीडबैक का लाभ उठाता है, जिससे MVOIK-4D बेंचमार्क का निर्माण संभव होता है और एम्बॉडीड AI (Embodied AI) के लिए डेटा जनरेशन को आगे बढ़ाया जा सकता है।

मूल लेखक: Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अराजक दृश्य का एक एकल वीडियो है: कोई चाकू से केला काट रहा है, टुकड़े बिखर रहे हैं, और फिर एक हाथ उन्हें ढक देता है। अब, कल्पना कीजिए कि उस सपाट, 2D वीडियो को एक पूर्ण, वास्तविक, 3D दुनिया में बदलने की कोशिश करना जहाँ आप केले के चारों ओर घूम सकते हैं, चाकू को पीछे से देख सकते हैं, और टुकड़ों को स्लो मोशन में उड़ते हुए देख सकते हैं।

यह कंप्यूटरों के लिए अविश्वसनीय रूप से कठिन है। यह एक पूरे केक का आकार केवल उसके एक टुकड़े को देखकर अनुमान लगाने जैसा है, खासकर जब कोई अपने हाथ से उसके कुछ हिस्सों को ढक देता है।

यह पेपर HAT-4D पेश करता है, जो एक नया सिस्टम है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: सिंगल कैमरों का "ब्लाइंड स्पॉट" (अंधा कोना)

वर्तमान कंप्यूटर किसी एक वस्तु (जैसे घूमता हुआ खिलौना) के 3D मॉडल बनाने में बहुत अच्छे हैं, लेकिन वे इंटरेक्शन (अंतःक्रियाओं) में संघर्ष करते हैं। जब चाकू केले को काटता है, तो कंप्यूटर भ्रमित हो जाता है:

  • डेप्थ (गहराई): क्या चाकू केले के सामने है या पीछे?
  • ऑक्लूजन (आवरण): जब हाथ केले को ढक लेता है, तो केला कहाँ गया? क्या वह गायब हो गया?
  • फिजिक्स (भौतिकी): क्या केले का टुकड़ा स्वाभाविक रूप से गिरता है, या वह एक भूत की तरह तैरता रहता है?

मौजूदा तरीके या तो महंगे, विशाल कैमरा स्टूडियो (जैसे 50 कैमरों वाला एक मूवी सेट) की आवश्यकता रखते हैं या वे ऐसे AI का उपयोग करते हैं जो अंधाधुंध अनुमान लगाता है, जिसके परिणामस्वरूप तैरती हुई वस्तुएं और अजीब, असंभव भौतिकी देखने को मिलती है।

2. समाधान: एक "निर्देशक" और एक "क्रू"

HAT-4D एक स्मार्ट फिल्म निर्देशक की तरह काम करता है जो विशेषज्ञ एजेंटों के एक क्रू के साथ काम करता है। बिना सोचे-समझे अनुमान लगाने के बजाय, यह एक ह्यूमन-इन-द-लूप (मानव-इन-द-लूप) दृष्टिकोण का उपयोग करता है, जिसका अर्थ है कि जब कंप्यूटर अटक जाता है, तो वास्तविक मनुष्य कभी-कभी हस्तक्षेप करके उसे सही दिशा देने के लिए आते हैं।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

चरण A: "स्क्रिप्ट राइटर" (नॉलेज ग्राफ)

3D दुनिया बनाने से पहले, सिस्टम वीडियो को पढ़ता है और एक "स्क्रिप्ट" लिखता है जिसे इंटरैक्शन नॉलेज ग्राफ (IKG) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक स्टोरीबोर्ड कलाकार जो केवल चित्र ही नहीं बनाता बल्कि दृश्य के नियम भी लिखता है।
  • यह क्या करता है: यह कंप्यूटर को बताता है: "इस क्षण में, चाकू केले को छू रहा है। केला पीला और नरम है। चाकू केले के ऊपर है। जब हाथ केले को ढक लेता है, तो केला अभी भी वहीं है, बस छिपा हुआ है।"
  • यह स्क्रिप्ट एक मानचित्र के रूप में कार्य करती है, जो कंप्यूटर को यह कल्पना करने से रोकती है कि केला सेब में बदल गया या हवा में तैरने लगा।

चरण B: "बिल्डर्स" (3D जनरेशन)

स्क्रिप्ट का उपयोग करके, विशेष एजेंट 3D वस्तुओं का निर्माण करते हैं।

  • वे केले और चाकू को 3D आकृतियों के रूप में बनाते हैं (एक तकनीक का उपयोग करके जिसे "गौसियन स्प्लैट्स" कहा जाता है, जो लाखों छोटे, चमकते पिक्सेल से एक मूर्ति बनाने जैसा है)।
  • वे सुनिश्चित करते हैं कि चाकू वास्तव में केले को छू रहा है, न कि उसके ऊपर तैर रहा है।

चरण C: "एनिमेटर्स" (4D प्रोपेगेशन)

अब सिस्टम को समय के माध्यम से दृश्य को चलाने की आवश्यकता है।

  • उपमा: एक फ्लिपबुक के बारे में सोचें। सिस्टम के पास पहला फ्रेम और "की फ्रेम्स" (सबसे महत्वपूर्ण क्षण, जैसे कटने का क्षण) होते हैं। फिर यह उनके बीच के पन्नों को भरने की कोशिश करता है।
  • मेमोरी ट्रिक: यदि कोई हाथ 5 सेकंड के लिए केले को ढक देता है, तो सिस्टम अपने "मेमोरी" (स्क्रिप्ट द्वारा निर्देशित) का उपयोग यह याद रखने के लिए करता है कि ढकने से पहले केला कैसा दिखता था, ताकि हाथ हटने पर वह केले के आकार को भूल न जाए या उसे बदल न दे।

डी: "एडिटर" (मानव फीडबैक)

यही असली सफलता का मंत्र है। कभी-कभी कंप्यूटर गलती कर सकता है (उदाहरण के लिए, केले का टुकड़ा बहुत अधिक डगमगाता हुआ दिख सकता है)।

  • उपमा: कल्पना कीजिए कि एक मानव संपादक एनिमेशन देखते हुए। यदि वे कोई गड़बड़ी देखते हैं, तो वे कह सकते हैं, "उस टुकड़े को ठीक करें," या "चाकू को और तेज बनाएं।"
  • सिस्टम इस थोड़े से मानवीय सहयोग से सीखता है। इसे सब कुछ ठीक करने के लिए इंसान की आवश्यकता नहीं होती; केवल कुछ प्रमुख क्षणों पर किए गए सुधार ही AI को बाकी चीजें सही ढंग से करने के लिए सिखाने के लिए पर्याप्त हैं।

3. परिणाम: एक नया खेल का मैदान (MVOIK-4D)

चूंकि यह सिस्टम बहुत अच्छी तरह से काम करता है, इसलिए लेखकों ने इसका उपयोग एक विशाल नया डेटासेट बनाने के लिए किया है जिसे MVOIK-4D कहा जाता है।

  • इसे 3D इंटरेक्शन दृश्यों (77 अलग-अलग कार्य, जैसे काटना, छीलना और स्टैकिंग) के एक विशाल पुस्तकालय के रूप में समझें जिसका उपयोग अन्य शोधकर्ता अपने स्वयं के रोबोट और AI को प्रशिक्षित करने के लिए कर सकते हैं।
  • उन्होंने यह जांचने के लिए एक नया "टेस्ट" भी बनाया है कि क्या 3D दुनिया वास्तविक दिखती है। क्या भौतिकी समझ में आती है? क्या वस्तु छिपे रहने के बाद भी अपना आकार याद रखती है?

सारांश

HAT-4D एक स्मार्ट सिस्टम है जो फ्लैट वीडियो को 3D दुनिया में बदल देता है:

  1. एक स्क्रिप्ट लिखता है (नॉलेज ग्राफ) ताकि इंटरेक्शन के नियमों को समझा जा सके।
  2. विशेष AI एजेंटों का उपयोग करके दृश्य को बनाता और एनिमेट करता है।
  3. मानव से मदद मांगता है केवल तभी जब चीजें भ्रमित करने वाली हों, जिससे यह सुनिश्चित होता है कि अंतिम परिणाम शारीरिक रूप से वास्तविक और सुसंगत दिखे।

यह महंगे मूवी-स्टूडियो कैमरों और अविश्वसनीय AI अनुमानों के बीच के अंतर को पाटता है, जिससे कंप्यूटर को यह सिखाने का एक नया तरीका मिलता है कि भौतिक दुनिया वास्तव में कैसे काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →