← नवीनतम पेपर
💻 computer science

Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi-View Images

Uni3R एक नवीन फीड-फॉरवर्ड फ्रेमवर्क है जो क्रॉस-व्यू ट्रांसफॉर्मर का उपयोग करके अनपोज़्ड मल्टी-व्यू इमेजेस से सीधे हाई-फिडेलिटी 3D सीन्स को पुनर्गठित करने और ओपन-वोकैबुलरी सिमेंटिक अंडरस्टैंडिंग करने के लिए 3D गॉसियन प्रिमिटिव्स को सिमेंटिक फीचर फील्ड्स के साथ रिग्रेस करता है, जिससे कई बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Xiangyu Sun, Haoyi Jiang, Liu Liu, Seungtae Nam, Gyeongjin Kang, Xinjie Wang, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang, Eunbyung Park

प्रकाशित 2026-03-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangyu Sun, Haoyi Jiang, Liu Liu, Seungtae Nam, Gyeongjin Kang, Xinjie Wang, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang, Eunbyung Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कमरे में जाते हैं और अलग-अलग कोणों से कुछ त्वरित तस्वीरें लेते हैं। आपको ठीक से पता नहीं है कि प्रत्येक फोटो लेते समय आप कहाँ खड़े थे, और आपके पास कोई 3D स्कैनर भी नहीं है। आपका लक्ष्य? उस कमरे का एक सटीक, इंटरैक्टिव 3D मॉडल तुरंत बनाना जिसे आप घूमकर देख सकें, और साथ ही कंप्यूटर को यह भी समझ आ जाए कि हर वस्तु वास्तव में क्या है (जैसे, "वह एक लाल सोफा है," या "वह एक लकड़ी की मेज है")।

यह समस्या है जिसे Uni3R हल करता है।

यहाँ इस पेपर को सरल शब्दों में, कुछ रचनात्मक उपमाओं (analogies) का उपयोग करके समझाया गया है।

समस्या: बिना चित्र वाला "जिग्सॉ पज़ल"

परंपरागत रूप से, तस्वीरों से 3D मॉडल बनाना एक विशाल जिग्सॉ पज़ल को बिना बॉक्स पर बने चित्र के हल करने जैसा है।

  • पुराने तरीके: आपको प्रत्येक विशिष्ट कमरे के लिए पज़ल के टुकड़ों को घंटों (या यहाँ तक कि दिनों) तक मैन्युअल रूप से ठीक करने में समय बिताना पड़ता था। यह धीमा और महंगा था, और यदि आप किसी नए कमरे में जाते थे, तो आपको फिर से शुरुआत करनी पड़ती थी।
  • "सिमेंटिक" (अर्थ संबंधी) अंतर: भले ही आपने 3 "3D आकार बना लिया हो, लेकिन कंप्यूटर वास्तव में यह नहीं जानता था कि वस्तुएं क्या थीं। वह केवल पिक्सेल का एक ढेर देखता था। इसे "कुर्सी" बनाम "मेज" समझने के लिए, आपको आमतौर पर हर एक वस्तु को मैन्युअल रूप से लेबल करने की आवश्यकता होती थी, जो एक बुरा सपना है।

समाधान: Uni3R (एक "त्वरित वास्तुकार")

Uni3R एक अत्यंत बुद्धिमान, त्वरित वास्तुकार की तरह है जो कुछ धुंधली, अव्यवस्थित तस्वीरों को देख सकता है और तुरंत एक पूर्ण, लेबल किया हुआ 3D संसार बना सकता है।

1. "जादुई मस्तिष्क" (क्रॉस-व्यू ट्रांसफॉर्मर)
कल्पना कीजिए कि आपके पास जासूसों की एक टीम है जो अलग-अलग कोणों से एक ही अपराध स्थल को देख रही है।

  • पुराना तरीका: प्रत्येक जासूस अकेले काम करता है, और फिर वे बाद में आपस में तुलना करने की कोशिश करते हैं। इससे भ्रम और विवरणों में विसंगति पैदा होती है।
  • Uni3R का तरीका: सभी जासूस एक घेरे में बैठते हैं और एक साथ बात करते हैं। वे जो देखते हैं उसे तुरंत साझा करते हैं। Uni3R ऐसा करने के लिए "क्रॉस-व्यू ट्रांसफॉर्मर" का उपयोग करता है। यह आपकी सभी तस्वीरों को एक साथ देखता है, यह पता लगाता है कि वे कैसे जुड़ती हैं, और एक ही सेकंड में एक सुसंगत, निरंतर 3D चित्र बनाता है। इसे यह जानने की आवश्यकता नहीं है कि आपके कैमरे की स्थिति क्या थी; यह प्रक्रिया के दौरान खुद ही इसका पता लगा लेता है।

2. "लेगो ब्रिक्स" (3D गॉसियन स्प्लेटिंग)
पारंपरिक 3D मॉडल की तरह चिकनी, भारी दीवारों के साथ कमरा बनाने के बजाय, Uni3R इसे लाखों छोटे, चमकते हुए, धुंधले लेगो ब्रिक्स (जिन्हें 3D गॉसियन्स कहा जाता है) का उपयोग करके बनाता है।

  • ये ब्रिक्स विशेष हैं क्योंकि इन्हें किसी भी आकार में फिट होने के लिए दबाया, खींचा और घुमाया जा सकता है।
  • क्योंकि ये इतने कुशल हैं, आप एक सामान्य कंप्यूटर पर वास्तविक समय में 3D कमरे के चारों ओर घूम सकते हैं, बिल्कुल एक वीडियो गेम की तरह।

3. "लेबलिंग की महाशक्ति" (ओपन-वोकैबुलरी सिमेंटिक्स)
यह सबसे शानदार हिस्सा है। आमतौर पर, यदि आप चाहते हैं कि कंप्यूटर एक "सोफा" को पहचाने, तो आपको इसे विशेष रूप से सोफे के लिए प्रशिक्षित करना होगा।

  • Uni3R की तरकीब: यह प्रत्येक एकल लेगो ब्रिक से एक "मानसिक टैग" जोड़ता है। ये टैग केवल नंबर नहीं हैं; वे भाषा के एक विशाल पुस्तकालय (जैसे एक उन्नत शब्दकोश) से जुड़े हुए हैं।
  • परिणाम: आप कंप्यूटर से पूछ सकते हैं, "मुझे सभी लाल कुर्सियाँ दिखाओ," या यहाँ तक कि "मुझे विंटेज लैंप दिखाओ," और यह तुरंत 3D स्थान में उन वस्तुओं को हाइलाइट कर देगा, भले ही इसने पहले कभी "विंटेज लैंप" न देखा हो। यह केवल आकार को नहीं, बल्कि अवधारणा (concept) को समझता है।

यह कैसे सीखता है (The "शिक्षक" और "मार्गदर्शक")

ऐसा करने के लिए AI को प्रशिक्षित करना कठिन है क्योंकि आप इसे केवल अंतिम उत्तर नहीं दिखा सकते (3D लेबल दुर्लभ हैं)। इसलिए, Uni3R एक चतुर दो-चरणीय शिक्षण पद्धति का उपयोग करता है:

  1. "कला समीक्षक" (फोटोमेट्रिक लॉस): यह अपने 3D मॉडल से मूल तस्वीरों को फिर से बनाने की कोशिश करता है। यदि 3D मॉडल फोटो से अलग दिखता है, तो "कला समीक्षक" कहता है, "इसे ठीक करो!" यह सुनिश्चित करता है कि 3D आकार वास्तविक दिखे।
  2. "मानचित्र पाठक" (ज्यामिति लॉस): यही Uni3R का गुप्त मंत्र है। यह दीवारों और फर्श के कहाँ होने का अनुमान लगाने के लिए एक पूर्व-प्रशिक्षित AI (VGGT) को "मानचित्र पाठक" के रूप में उपयोग करता है। यह AI को पूर्ण होने के लिए मजबूर नहीं करता है, लेकिन इसे एक हल्का संकेत देता है: "हे, फर्श शायद यहाँ सपाट है।" यह AI को भ्रमित होने और अजीब, तैरती हुई संरचनाएं बनाने से रोकता है।

यह क्यों मायने रखता है (वास्तविक दुनिया पर प्रभाव)

सेल्फ-ड्राइविंग कारों या किसी नई इमारत में प्रवेश करने वाले रोबोटों के बारे में सोचें।

  • पहले: वे फंस सकते थे क्योंकि वे लेआउट को समझने में या किसी नए कमरे में "कुर्सी" क्या है, यह समझने में असमर्थ होते थे।
  • Uni3R के साथ: वे एक त्वरित वीडियो ले सकते हैं, तुरंत कमरे का 3D मानचित्र बना सकते हैं, बाधाओं के स्थान को समझ सकते हैं, और जानते हैं कि वे बाधाएं वास्तव में क्या हैं, और वह भी एक सेकंड के बहुत छोटे हिस्से में।

सारांश

Uni3R एक "वन-स्टॉप-शॉप" AI है जो:

  1. यादृच्छिक तस्वीरें लेता है (किसी कैमरा डेटा की आवश्यकता नहीं)।
  2. तुरंत एक उच्च-गुणवत्ता वाला 3D मॉडल बनाता है।
  3. समझता है कि मॉडल में सब कुछ क्या है (भाषा का उपयोग करके)।
  4. यह सब एक ही, तेज़ चरण में करता है, बिना प्रत्येक नए कमरे के लिए पुन: प्रशिक्षित हुए।

यह कंप्यूटर को एक कमरे में जाने, मानसिक स्नैपशॉट लेने और तुरंत कमरे के लेआउट और सामग्री को जानने की क्षमता देने जैसा है, ताकि वह तुरंत अन्वेषण के लिए तैयार हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →