← नवीनतम पेपर
💻 computer science

InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement

यह शोध पत्र InHabit को प्रस्तुत करता है, जो एक पूर्णतः स्वचालित और स्केलेबल फ्रेमवर्क है जो 2D इमेज फाउंडेशन मॉडल्स का लाभ उठाकर एक बड़े पैमाने पर, फोटो-रियलिस्टिक 3D मानव-दृश्य संपर्क (human-scene interaction) डेटासेट तैयार करता है, जिससे वास्तविक दुनिया के डेटा की कमी को दूर किया जा सके और 3D मानव पुनर्निर्माण (human reconstruction) तथा संपर्क अनुमान (contact estimation) कार्यों में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikita Kister, Pradyumna YM, István Sárándi, Jiayi Wang, Anna Khoreva, Gerard Pons-Moll

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर में रहना सिखाने की कोशिश कर रहे हैं। आप उसे घर के ब्लूप्रिंट (घर की 3D ज्यामिति) दिखा सकते हैं और आप उसे एक स्टूडियो में लोगों के नाचने के वीडियो (मोशन कैप्चर) दिखा सकते हैं। लेकिन आपके पास एक बहुत बड़ी समस्या है: आपके पास उस विशिष्ट घर में लोगों के रहने के पर्याप्त वीडियो नहीं हैं।

आपके पास इस बात का फुटेज नहीं है कि कोई किचन काउंटर पर झुक रहा है, टीवी देखने के लिए सोफे पर बैठा है, या गलियारे में खिलौना उठाने के लिए झुक रहा है। वास्तविक जीवन की शूटिंग महंगी, धीमी और हर संभव कमरे के लिए कठिन होती है।

यहाँ आता है InHabit। इसे एक जादुई, स्वचालित इंटीरियर डिज़ाइनर और डायरेक्टर के रूप में समझें जो बिना किसी मानव अभिनेता या कैमरा क्रू के, किसी भी खाली घर को वास्तविक लोगों और उनकी सही गतिविधियों से तुरंत भर सकता है।

यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:

1. "दिमाग" (विज़न-लैंग्वेज मॉडल)

सबसे पहले, सिस्टम एक खाली कमरे के 3D मॉडल (जैसे घर का डिजिटल जुड़वां) को देखता है। यह एक AI "दिमाग" (विज़न-लैंग्वेज मॉडल) से एक सरल प्रश्न पूछता है: "इस कमरे में एक इंसान स्वाभाविक रूप से क्या करेगा?"

  • पुराना तरीका: आप कंप्यूटर को बता सकते हैं, "यहाँ एक व्यक्ति को रखो।" कंप्यूटर बस एक व्यक्ति को कमरे के बीच में खड़ा कर देगा, जो अजीब लगेगा।
  • InHabit का तरीका: AI "दिमाग" कमरे को देखता है और सोचता है, "ओह, यह एक किचन है जिसमें एक चूल्हा है। एक व्यक्ति शायद खाना बना रहा होगा। यह एक सोफा है जिसके सामने टीवी है? कोई शो देख रहा होगा।" यह दृश्य के लिए एक स्क्रिप्ट तैयार करने के लिए वास्तविक दुनिया के अपने ज्ञान का उपयोग करता है।

2. "कलाकार" (इमेज-एडिटिंग मॉडल)

एक बार जब "दिमाग" तय कर लेता है कि कौन सी क्रिया (जैसे, "खाना बनाना") करनी है, तो वह आदेश एक AI "कलाकार" (इमेज-एडिटिंग मॉडल) को भेज देता है। यह कलाकार एक मास्टर पेंटर की तरह है जिसने इंटरनेट पर लोगों के खाना बनाने की लाखों तस्वीरें देखी हैं।

कलाकार केवल दृश्य पर किसी व्यक्ति का स्टिकर नहीं चिपकाता है। इसके बजाय, वे दृश्य में सीधे एक नया व्यक्ति पेंट करते हैं। वे सुनिश्चित करते हैं कि व्यक्ति एक चम्मच पकड़े हुए है, चूल्हे की ओर झुका हुआ है, और बर्तन की ओर देख रहा है। उनकी मुद्रा (pose) एकदम सटीक है क्योंकि कलाकार ने इंटरनेट पर मौजूद तस्वीरों के माध्यम से इस क्रिया को लाखों बार "देखा" है।

3. "वास्तुकार" (3D लिफ्टिंग)

अब, हमारे पास एक सुंदर 2D तस्वीर है जिसमें एक व्यक्ति है, लेकिन हमें उन्हें 3D दुनिया में मौजूद होने की आवश्यकता है ताकि एक रोबोट उनके साथ बातचीत कर सके। यह सबसे कठिन हिस्सा है।

कल्पना कीजिए कि आप एक व्यक्ति के सपाट चित्र को एक 3D मूर्ति में बदलने की कोशिश कर रहे हैं जो कमरे के फर्नीचर में पूरी तरह फिट बैठती है। InHabit इस काम के लिए एक गणितीय "वास्तुकार" का उपयोग करता है। यह 2D पेंटिंग को लेता है और एक 3D शरीर (एक मानक मानव आकार जिसे SMPL-X कहा जाता है) को तराशता (sculpts) है, जो ठीक उसी जगह फिट बैठता है जहाँ पेंटिंग ने उस व्यक्ति को रखा था।

यह भौतिकी (physics) की जाँच करता है:

  • क्या व्यक्ति हवा में तैर रहा है? (नहीं, पैर जमीन पर हैं)।
  • क्या वे दीवार के आर-पार जा रहे हैं? (नहीं, शरीर दीवार पर रुक जाता है)।
  • क्या आकार सही है? (हाँ, वे कोई विशालकाय या बहुत छोटा व्यक्ति नहीं हैं)।

यह एक बड़ी बात क्यों है?

1. यह वास्तविकता का एक "कॉपी-पेस्ट" मशीन है
इससे पहले, यदि आप एक रोबोट को यह समझने के लिए प्रशिक्षित करना चाहते थे कि मनुष्य वस्तुओं के साथ कैसे व्यवहार करते हैं, तो आपको महंगे मोशन-कैप्चर सूट और अभिनेताओं की आवश्यकता होती थी। InHabit स्वचालित रूप से 78,000 अलग-अलग परिदृश्य 800 अलग-अलग वर्चुअल घरों में उत्पन्न कर सकता है। यह ऐसा है जैसे आपके पास प्लास्टिक के खिलौनों के बजाय "मानव व्यवहार" प्रिंट करने वाली एक फैक्ट्री हो।

2. यह "सामान्य समझ" (Common Sense) को समझता है
पुराने तरीके केवल ज्यामिति (geometry) जानने वाले रोबोट की तरह थे: "यदि वहां एक सपाट सतह है, तो एक व्यक्ति को वहां रखें।" इससे अजीब परिणाम मिलते हैं, जैसे कि एक व्यक्ति छत पर खड़ा है या लटकते हुए लैंप पर बैठा है। InHabit संदर्भ (context) को समझता है। वह जानता है कि आप कुर्सी पर बैठते हैं, उसके नीचे नहीं, और आप चूल्हे पर खाना बनाते हैं, फ्रिज के अंदर नहीं।

3. यह रोबोटों को स्मार्ट बनाता है
लेखकों ने इस नए डेटा का उपयोग करके रोबोट को यह पहचानने के लिए प्रशिक्षित किया कि मनुष्य चीजों को कहाँ छू रहे हैं। जब रोबोट को InHabit के डेटा पर प्रशिक्षित किया गया, तो वे पुराने डेटा की तुलना में मानव व्यवहार का अनुमान लगाने में बहुत बेहतर हो गए। वास्तव में, एक परीक्षण में जहाँ मनुष्यों ने वोट दिया कि कौन सा रोबोट व्यवहार सबसे वास्तविक लग रहा है, 78% लोगों ने मौजूदा सर्वोत्तम तरीकों की तुलना में InHabit की रचनाओं को पसंद किया।

निष्कर्ष

InHabit एक ऐसा उपकरण है जो 2D इंटरनेट छवियों के "सामान्य समझ" वाले ज्ञान को 3D वास्तविकता में बदल देता है। यह "डेटा की कमी" की समस्या को हल करता है और स्वचालित रूप से लाखों वास्तविक परिदृश्य उत्पन्न करता है जहाँ मनुष्य अपने वातावरण के साथ बातचीत करते हैं, जिससे हमें बेहतर रोबोट और AI बनाने में मदद मिलती है जो वास्तव में यह समझ सकें कि हम कैसे रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →