← नवीनतम पेपर
🤖 AI

Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video

SAGE एक स्केलेबल फ्रेमवर्क है जो बिना एनोटेटेड इंटरनेट वीडियो का उपयोग करके 3D ज्यामितीय फाउंडेशन मॉडल्स को अनुकूलित करता है, जिसमें हाइब्रिड सुपरविजन के लिए स्पार्स SfM-आधारित स्ट्रक्चरल गाइडेंस और डेंस डिफरेंशिएबल 3D गॉसियन रेंडरिंग को संयोजित करने वाला एक पदानुक्रमित (hierarchical) माइनिंग पाइपलाइन नियोजित किया गया है।

मूल लेखक: Zihui Gao, Ke Liu, Donny Y. Chen, Duochao Shi, Guosheng Lin, Hao Chen, Chunhua Shen

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zihui Gao, Ke Liu, Donny Y. Chen, Duochao Shi, Guosheng Lin, Hao Chen, Chunhua Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को कमरे का एक सटीक 3D मानचित्र बनाना सिखाने की कोशिश कर रहे हैं।

इसे पूरी तरह से करने के लिए, आपको सामान्य रूप से उसे एक पेशेवर वास्तुकार (architect) का ब्लूप्रिंट देना होगा (जिसे वैज्ञानिक "लेबल किया गया 3D डेटा" कहते हैं)। लेकिन एक समस्या है: ब्लूप्रिंट महंगे होते हैं, उन्हें ढूंढना कठिन है, और वे केवल कुछ हज़ार कमरों के लिए ही मौजूद हैं। यदि आप उस बच्चे को केवल कुछ ही ब्लूप्रिंट दिखाते हैं, तो वह उन विशिष्ट कमरों को बनाने में तो बहुत अच्छा होगा, लेकिन यदि आप उसे किसी नए पार्क या किसी अलग घर में ले जाते हैं, तो वह पूरी तरह से खो जाएगा।

यह शोध पत्र SAGE को पेश करता है, जो इन "डिजिटल कलाकारों" (3D फाउंडेशन मॉडल्स) को सिखाने का एक नया तरीका है, जिसका उपयोग करके हम उस चीज़ का लाभ उठाते हैं जो हमारे पास असीमित मात्रा में उपलब्ध है: यूट्यूब वीडियो।

SAGE कैसे काम करता है, इसे तीन सरल रूपकों (metaphors) के माध्यम से समझाया गया है:

1. समस्या: "आंखों पर पट्टी बंधा वास्तुकार"

वर्तमान 3D AI मॉडल अंधेरे में काम करने वाले वास्तुकारों की तरह हैं। उन्होंने कुछ उच्च-गुणवत्ता वाले ब्लूप्रिंट देखे हैं, लेकिन उन्होंने "वास्तविक दुनिया" को नहीं देखा है। जब वे किसी रैंडम वीडियो से किसी दृश्य का पुनर्निर्माण (reconstruct) करने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं क्योंकि वीडियो के साथ ब्लूप्रिंट नहीं आते—वे केवल सपाट, चलते-फिरते चित्र होते हैं। यदि आप उन्हें केवल इस "अनुमान" के आधार पर सिखाने की कोशिश करते हैं कि गहराई (depth) क्या है, तो AI "चक्कर" खाने लगता है और टेढ़े-मेढ़े, विकृत आकार बनाने लगता है।

2. समाधान: तीन-परत वाला शिक्षक (SAGE)

AI को ब्लूप्रिंट देने के बजाय, SAGE एक बहु-स्तरीय शिक्षक की तरह कार्य करता है जो वीडियो का उपयोग करके "सुराग" प्रदान करता है।

  • कंकाल (Sparse Geometric Anchors): कल्पना कीजिए कि आप जंगल में चलते हुए एक व्यक्ति का वीडियो देख रहे हैं। भले ही आपके पास कोई नक्शा न हो, फिर भी आप बड़ी, ठोस चीजों को देख सकते हैं: जैसे एक विशाल पेड़ का तना या एक बड़ा पत्थर। SAGE इन "बड़ी, ठोस पहचान वाली वस्तुओं" को खोजने के लिए एक टूल (जिसे SfM कहा जाता है) का उपयोग करता है। यह AI को बताता है, "मुझे नहीं पता कि हर पत्ती कहाँ है, लेकिन मैं निश्चित रूप से जानता हूँ कि यह विशाल पत्थर यहीं है।" यह AI को विवरणों में खो जाने से रोकता है।
  • त्वचा (Dense Differentiable Consistency): एक बार जब "कंकाल" सेट हो जाता है, तो AI को खाली जगहों को भरने की आवश्यकता होती है (जैसे घास, दीवारें, फर्नीचर)। SAGE "गौसियन स्प्लैटिंग" (Gaussian Splatting) नामक तकनीक का उपयोग करता है, जो एक डिजिटल स्प्रे पेंट की तरह काम करता है। यह AI को बताता है, "यदि आप अपना कैमरा थोड़ा बाईं ओर घुमाते हैं, तो दीवार अभी भी दीवार जैसी ही दिखनी चाहिए।" अलग-अलग कोणों से यह लगातार जांच करते हुए कि "पेंट किया गया" 3D दृश्य कितना सुसंगत (consistent) दिखता है, AI बारीक विवरणों को सहजता से भरना सीख जाता है।
  • मेमोरी गार्ड (Regularization): जब आप किसी को एक नए तरीके (जैसे वीडियो) का उपयोग करके एक नया कौशल (जैसे डांस) सिखाते हैं, तो वे अपने पुराने कौशल (जैसे चलना) को भूल सकते हैं। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) कहा जाता है। SAGE मूल पेशेवर ब्लूप्रिंट की एक छोटी "चीट शीट" रखता है ताकि AI को याद दिला सके, "हे, इन जंगली यूट्यूब वीडियो से सीखते समय ज्यामिति (geometry) के बुनियादी नियमों को मत भूलना!"

3. परिणाम: "सुपर-लर्नर"

शोधकर्ताओं ने SAGE को 10,000 वीडियो क्लिप खिलाकर इसका परीक्षण किया—जो आमतौर पर उपयोग किए जाने वाले डेटा से दस गुना अधिक है।

परिणाम? AI एक "सुपर-लर्नर" बन गया। क्योंकि इसने बहुत सारे विविध फुटेज पर अभ्यास किया था, इसलिए यह केवल उन वीडियो में बेहतर नहीं हुआ जिन्हें इसने देखा था; बल्कि यह पूरी तरह से नई जगहों का पुनर्निर्माण करने में बहुत बेहतर हो गया जिसे इसने पहले कभी नहीं देखा था। इसने पुराने तरीके की तुलना में त्रुटियों को 42% तक कम कर दिया।

संक्षेप में

SAGE से पहले: AI केवल कुछ महंगी पाठ्यपुस्तकों से पढ़ने वाला एक छात्र था। वह बुद्धिमान था लेकिन संकीर्ण सोच वाला था।

SAGE के साथ: AI एक ऐसा छात्र है जिसने लाखों घंटों के ट्रैवल व्लॉग देखे हैं। वह उन वीडियो के "बड़े लैंडमार्क" और "दृश्य निरंतरता" का उपयोग करके दुनिया की 3D समझ विकसित करता है, जिससे वह लगभग किसी भी वातावरण में पुनर्निर्माण का उस्ताद बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →