← नवीनतम पेपर
💻 computer science

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

यह शोध पत्र REALM को प्रस्तुत करता है, जो एक MLLM-एजेंट फ्रेमवर्क है जो व्यापक 3D-विशिष्ट पोस्ट-ट्रेनिंग के बिना जटिल मानवीय निर्देशों और सटीक 3D ऑब्जेक्ट हेरफेर के बीच के अंतर को पाटने के लिए एक नवीन ग्लोबल-टू-लोकल स्पेशियल ग्राउंडिंग रणनीति का उपयोग करते हुए, Gaussian Splatting पर ओपन-वर्ल्ड 3D रीजनिंग सेगमेंटेशन और एडिटिंग को सक्षम बनाता है।

मूल लेखक: Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके कंप्यूटर के अंदर एक जादुई, अदृश्य 3D दुनिया है, जो लाखों छोटे, चमकते हुए कणों से बनी है (इसे 3D Gaussian Splatting कहा जाता है)। अब, कल्पना कीजिए कि आप एक रोबोट को कहना चाहते हैं, "वह नीला खिलौना हाथी ढूँढो जिसे बच्चा पसंद करता है" या "उस कुर्सी को हटा दो जो सेब को रोक रही है।"

समस्या यह है कि अधिकांश रोबोट ऐसे होते हैं जैसे वे एक ही निश्चित कैमरा आँख वाले लोग हों। यदि आप उन्हें किसी जटिल सुराग के आधार पर कुछ खोजने के लिए कहते हैं, तो वे भ्रमित हो जाते हैं यदि कोई वस्तु छिपी हुई हो या यदि सुराग के लिए सोचने की आवश्यकता हो (जैसे "सेब के पास वाली कुर्सी")। वे गलत कोण से देख सकते हैं और उसे पूरी तरह से मिस कर सकते हैं।

मिलिए REALM से, जो रोबनों के लिए एक नया "मस्तिष्क" है जो इस समस्या को हल करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "एक-आँख" का अंधा कोना (The "One-Eye" Blind Spot)

कल्पना कीजिए कि आप एक अस्त-व्यस्त कमरे में एक विशिष्ट चाबी को ढूँढने की कोशिश कर रहे हैं। यदि आप कमरे को केवल एक कोण से देखते हैं (मान लीजिए दरवाजे से खड़ा होकर), तो आप चाबी को मिस कर सकते हैं क्योंकि वह एक कुर्सी के पीछे छिपी हो सकती है। यदि आप एक साथ हर कोण से देखने की कोशिश करते हैं, तो आपका दिमाग अभिभूत (overwhelmed) हो जाएगा और आप ध्यान केंद्रित नहीं कर पाएंगे।

मौजूदा AI मॉडल वैसे ही हैं। वे या तो एक तस्वीर देखते हैं और संदर्भ (context) को मिस कर देते हैं, या वे बहुत सारी तस्वीरों को देखने की कोशिश करते हैं और भ्रमित हो जाते हैं। वे यह कहने में माहिर हैं कि "यह एक कप है," लेकिन यह बताने में खराब हैं कि "यह वही कप है जो किताब के बगल में है।"

2. समाधान: "शरलॉक होम्स" एजेंट

REALM एक AI एजेंट है जो एक जासूस की तरह काम करता जिसके पास एक सुपरपावर है: वह एक विशाल, सुपर-स्मार्ट मस्तिष्क (एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल, या MLLM) से बात कर सकता है और उसे दृश्य के बारे में तर्क करने के लिए कह सकता है।

यहाँ वह स्टेप-बाय-स्टेप प्रक्रिया दी गई है जिसे REALM एक खोज दल (Search Party) के उदाहरण के साथ उपयोग करता है:

स्टेप A: "वाइड-एंगल स्कैन" (ग्लोबल ग्राउंडिंग)

एक ही जगह घूरने के बजाय, REALM खोजियों की एक टीम भेजता है जो एक ही समय में 8 अलग-अलग कोणों से कमरे को देखती है।

  • उपमा: कल्पना कीजिए कि आप एक खोए हुए कुत्ते को ढूँढ रहे हैं। आप सिर्फ एक जगह खड़े नहीं होते; आप घर के सामने, पीछे, बाएँ और दाएँ से दोस्तों को भेजते हैं।
  • क्या होता है: प्रत्येक "खोजकर्ता" (कैमरा व्यू) सुपर-स्मार्ट मस्तिष्क से पूछता है: "मुझे यहाँ एक नीला हाथी दिख रहा है। क्या यह वही है?" मस्तिष्क कहता है, "हाँ, यह नीला हाथी जैसा लग रहा है!"
  • जादू: REALM इन सभी जवाबों को लेता है और वोट करता है। यदि 8 में से 7 खोजकर्ता कहते हैं, "वह हाथी है," तो रोबोट जानता है कि हाथी 3D स्पेस में कहाँ है, भले ही एक खोजकर्ता उसे देख न पाया हो।

स्टेप B: "ज़ूम-इन" (लोकल रिफाइनमेंट)

एक बार जब टीम को मोटे तौर पर पता चल जाता है कि हाथी कहाँ है, तो वे वहीं नहीं रुकते। वे ज़ूम इन करते हैं।

  • उपमा: अब जब आप जानते हैं कि कुत्ता पिछवाड़े में है, तो आप बाड़ के बिल्कुल करीब जाते हैं और बारीकी से देखते हैं कि उसके पंजे कहाँ हैं।
  • क्या होता है: AI केवल उस क्षेत्र की क्लोज-अप, हाई-डेफिनिशन तस्वीरें बनाता है। वह मस्तिष्क से फिर से पूछता है: "ठीक है, अब जब हम करीब हैं, तो कौन से पिक्सेल हाथी के हैं?" यह वस्तु का एक सटीक, विस्तृत आउटलाइन (मास्क) बनाता है।

3. सुपरपावर: "तर्क करना" (Reasoning)

यह सबसे शानदार हिस्सा है। REALM केवल कीवर्ड्स नहीं ढूँढता; यह सोचता है।

  • सुराग: "वह खिलौना ढूँढो जिसे देखकर वह बच्चा खुश होगा जिसे नीला रंग पसंद है।"
  • रोबोट की विचार प्रक्रिया:
    1. कमरे को स्कैन करें।
    2. वस्तुओं की पहचान करें: वहाँ एक लाल गेंद, एक हरी कार और एक नीला हाथी है।
    3. तर्क लागू करें: बच्चा नीला पसंद करता है। नीला हाथी सबसे अच्छा मेल है।
    4. कार्रवाई: "लक्ष्य प्राप्त हुआ: नीला हाथी।"

पुराने रोबोट "खिलौना" शब्द पर अटक जाते और शायद लाल गेंद को पकड़ लेते। REALM संदर्भ (context) को समझता है।

4. "जादुई छड़ी" (एडिटिंग)

एक बार जब REALM ने वस्तु को ढूँढ लिया है और उसके चारों ओर एक सटीक 3D आउटलाइन बना ली है, तो यह बिना कुछ तोड़े दृश्य में "जादुई करतब" कर सकता है।

  • हटाना (Remove): "सेब के पास वाली कुर्सी को हटा दो।" (कुर्सी गायब हो जाती है, लेकिन सेब वहीं रहता है)।
  • बदलना (Replace): "नीले हाथी को टेडी बियर से बदल दो।" (हाथी चला जाता है, और उसी स्थान पर एक भालू दिखाई देता है)।
  • स्टाइल बदलना (Style Change): "हरी कुर्सी को सोने की बना दो।" (कुर्सी की सामग्री बदल जाती है, लेकिन उसका आकार और स्थिति एकदम सही रहती है)।

यह एक बड़ी बात क्यों है?

इसे एक 2D मैप से 3D होलोग्राम में अपग्रेड करने के रूप में सोचें।

  • पहले: आप कंप्यूटर को "सेब ढूँढो" कह सकते थे, और वह सेब को ढूँढ लेता था।
  • अब (REALM के साथ): आप कंप्यूटर को कह सकते हैं, "वह सेब ढूँढो जो किताब के पीछे लेकिन लैंप के सामने है, और उसे सुनहरा बना दो।" कंप्यूटर स्थानिक संबंधों (spatial relationships) और जटिल निर्देशों को समझता है, ठीक वैसे ही जैसे एक इंसान करता है।

संक्षेप में: REALM एक स्मार्ट रोबोट सहायक है जो कैमरों की एक टीम और एक सुपर-ब्रेन का उपयोग करके जटिल, "पहेली जैसे" निर्देशों को समझता है, सही वस्तुओं को ढूँढता है, और आपको उनके आसपास की दुनिया को एक साधारण वाक्य के साथ बदलने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →