← नवीनतम पेपर
🤖 AI

CubePart: An Open-Vocabulary Part-Controllable 3D Generator

CubePart एक जनरेटिव फ्रेमवर्क है जो वैश्विक टेक्स्ट प्रॉम्प्ट्स और उपयोगकर्ता-निर्धारित पार्ट स्कीमा को स्वीकार करके ओपन-वोकैबलरी, पार्ट-कंट्रोलेबल 3D मेश जनरेशन को सक्षम बनाता है ताकि स्पष्ट रूप से संरचित सिमेंटिक घटकों से असेंबल किए गए सुसंगत, एनिमेशन-रेडी एसेट्स का उत्पादन किया जा सके।

मूल लेखक: Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो गेम डेवलपर हैं। आप अपने गेम के लिए एक 3D कार बनाना चाहते हैं। पुराने दिनों में, आपको एक कलाकार को पूरी कार डिजिटल क्ले (डिजिटल मिट्टी) से तराशने के लिए काम पर रखना पड़ता, फिर उसे मैन्युअल रूप से टुकड़ों में काटना पड़ता: जैसे पहिए, दरवाजे, इंजन और चेसिस। आपको हर टुकड़े को लेबल भी करना पड़ता ताकि गेम कोड को पता चल सके, "ओह, यह विशेष हिस्सा पहिया है, इसलिए मैं इसे घुमा सकता हूँ।"

यह मैन्युअल रूप से काटने और लेबल करने की प्रक्रिया धीमी, महंगी और बड़े पैमाने पर करने में कठिन थी।

हाल ही में, AI टेक्स्ट विवरणों से 3D ऑब्जेक्ट बनाने में बहुत अच्छा होने लगा है। लेकिन एक समस्या थी: AI एक "मोनोलिथ" (एक अखंड पिंड) उगल देता था—एक एकल, ठोस ब्लॉक की तरह डिजिटल क्ले। वह एक कार जैसा दिखता तो था, लेकिन वह एक ही ठोस टुकड़ा था। आप पहिए नहीं घुमा सकते थे या दरवाजे नहीं खोल सकते थे क्योंकि AI को यह नहीं पता था कि हिस्से कहाँ खत्म होते हैं और कहाँ से शुरू होते हैं। अन्य AI विधियों ने हिस्सों का अनुमान लगाने की कोशिश की, लेकिन वे एक शेफ की तरह थे जो बिना रेसिपी के सूप में सामग्री का अनुमान लगा रहा हो; वे शायद सही संख्या में टुकड़े तो बना लेते, लेकिन वे उस विशिष्ट रेसिपी से मेल नहीं खाते जिसकी आपको आवश्यकता थी।

एंट्री क्यूबपार्ट (CubePart): "लेगो-बिल्डर" AI।

यह पेपर CubePart को पेश करता है, जो एक नए मास्टर लेगो बिल्डर की तरह है जो आपके सटीक निर्देशों का पालन करता है।

मुख्य विचार: "रेसिपी" और "ब्लूप्रिंट"

सिर्फ यह कहने के बजाय कि, "मेरे लिए एक कार बनाओ," आप AI को दो चीजें देते हैं:

  1. विवरण (Description): "मेरे लिए एक कूल, भविष्यवादी (futuristic) टो ट्रक बनाओ।"
  2. ब्लूप्रिंट (Schema): आपके द्वारा आवश्यक हिस्सों की एक विशिष्ट सूची: "मुझे एक कैब, एक चेसिस, चार पहिए, एक रूफ बीकन और एक टो असेंबली चाहिए।"

CubePart केवल अनुमान नहीं लगाता; यह आपके विवरण के अनुसार विशेष रूप से एक वस्तु का निर्माण करता है। यह सुनिश्चित करता है कि अंतिम परिणाम केवल एक बड़ा ढेर न हो, बल्कि अलग-अलग, अलग टुकड़ों का एक संग्रह हो जो आपस में पूरी तरह फिट बैठते हों, ताकि आपका गेम इंजन उन्हें पकड़ सके और एनिमेट कर सके।

यह कैसे काम करता है: "दो-चरणों वाली रसोई"

लेखकों ने इस सिस्टम को दो-चरणीय कुकिंग प्रक्रिया का उपयोग करके बनाया है:

चरण 1: पूरा केक बेक करना
सबसे पहले, AI आपके विवरण के आधार पर एक आदर्श, पूरा केक (पूरी वस्तु) बेक करना सीखता है। यह एक विशाल लाइब्रेरी का उपयोग करता है जिसमें उसने एक बहुत बड़े डेटासेट (4,60,000 से अधिक वस्तुओं!) से प्राप्त 3D आकृतियाँ और टेक्स्ट विवरण सीखे हैं। यह चरण सुनिश्चित करता है कि वस्तु सही दिखे और उसका सामान्य आकार सही हो।

चरण 2: केक को काटना
एक बार जब पूरा केक बेक हो जाता है, तो AI दूसरे चरण में जाता है। यह उस पूरे केक को लेता है और आपके "ब्लूप्रिंट" के अनुसार उसे ठीक से काट देता है।

  • सीक्रेट सॉस: पेपर एक विशेष "क्रॉस-पार्ट अटेंशन" (Cross-Part Attention) मैकेनिज्म पेश करता है। इसे स्लाइस (टुकड़ों) के बीच एक संचार नेटवर्क के रूप में समझें। जब AI "बायां पहिया" काट रहा होता है, तो वह "दाएं पहिये" से बात करता है ताकि यह सुनिश्चित हो सके कि वे एक ही आकार के हैं और एक-दूसरे के ऊपर नहीं चढ़ रहे हैं। यह सुनिश्चित करता है कि हिस्से अलग होने के बावजूद, वे एक सुसंगत पूर्ण रूप बनाने के लिए एक साथ फिट बैठते हैं, बिल्कुल एक असली कार की तरह।

डेटा इंजन: "स्मार्ट लाइब्रेरियन"

AI को यह सिखाने के लिए, शोधकर्ताओं को उदाहरणों की एक विशाल लाइब्रेरी बनानी थी। उन्होंने केवल लाखों हिस्सों को लेबल करने के लिए इंसानों से नहीं पूछा (क्योंकि इसमें बहुत समय लगता)। इसके बजाय, उन्होंने उन्नत AI विजन मॉडल का उपयोग करके एक स्वचालित "स्मार्ट लाइब्रेरियन" सिस्टम बनाया।

यह लाइब्रेरियन 3D मॉडलों को देखता है, सभी कोणों से तस्वीरें लेता है, और "सेट-ऑफ-मार्क" (Set-of-Mark) नामक एक ट्रिक का उपयोग करता है (जैसे किसी फोटो में अलग-अलग हिस्सों पर नंबर वाले स्टिकर लगाना)। फिर यह एक सुपर-स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) से पूछता है कि उन स्टिकर्स को देखे और कहे, "ठीक है, स्टिकर #1 और #2 दोनों पहिए हैं, इसलिए आइए उन्हें एक समूह में रखें और उन्हें 'फ्रंट व्हील्स' कहें।" इसने उन्हें किसी भी पिछले पार्ट-बेस्ड डेटासेट की तुलना में 11 गुना बड़ा डेटासेट स्वचालित रूप से बनाने में सक्षम बनाया।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि यह इंटरैक्टिव 3D कंटेंट (जैसे वीडियो गेम) के लिए एक गेम-चेंजर है क्योंकि:

  • यह उपयोग के लिए तैयार है: इसका आउटपुट केवल एक सुंदर तस्वीर नहीं है; यह अलग-अलग मेश (meshes) का एक सेट है जिसे तुरंत गेम इंजन में डाला जा सकता है।
  • यह नियंत्रणीय है: आप AI को बता सकते हैं, "मुझे हुड का एक अलग हिस्सा चाहिए ताकि मैं इसे खोलने के लिए एनिमेट कर सकूँ," और यह बिल्कुल वैसा ही करेगा।
  • यह जटिलता को संभालता है: पेपर "जेलीफिश-थीम वाले रेस कार" या "टर्रेट के साथ टैंक" जैसे जटिल ऑब्जेक्ट्स के उदाहरण दिखाता है, जहाँ AI सफलतापूर्वक पहियों, बॉडी, टर्रेट और कैनन को अलग-अलग, उपयोगी हिस्सों में विभाजित करता है।

सीमाएँ (गलतियाँ/कमियाँ)

लेखक ईमानदार हैं कि सिस्टम अभी भी कहाँ लड़खड़ाता है:

  • कठोर बनाम लचीला (Rigid vs. Flexible): वर्तमान में, यह कारों और रोबोट जैसी कठोर वस्तुओं (rigid bodies) के लिए बहुत अच्छा है। यह अभी तक पात्रों (characters) के लिए "त्वचा" या मांसपेशियों को संभालने के बारे में नहीं जानता है जिन्हें मुड़ने और खिंचने की आवश्यकता होती है (जैसे मानव हाथ)।
  • ग्लिच वाली सीमाएँ (Glitchy Boundaries): कभी-कभी, AI दो ऐसे हिस्से बना सकता है जिन्हें अलग होना चाहिए (जैसे दरवाजा और कार की बॉडी), लेकिन वे थोड़े ओवरलैप या एक-दूसरे में समाहित हो जाते हैं, जैसे दो लोग एक ही कुर्सी पर बैठने की कोशिश कर रहे हों।
  • बाएं बनाम दाएं: AI कभी-कभी "बाएं" और "दाएं" के बारे में भ्रमित हो जाता है, विशेष रूप से यदि वस्तु सममित (symmetrical) है, तो यह बाएं पहिये को दाएं पहिये से बदल सकता है।

संक्षेप में, CubePart एक ऐसा टूल है जो "मेरे लिए एक 3D ऑब्जेक्ट बनाओ" के अस्पष्ट विचार को भागों के एक सटीक, पूर्व-असेंबल किट में बदल देता है, जिससे कलाकारों को उनकी रचनाओं को मैन्युअल रूप से काटने के थकाऊ काम से मुक्ति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →