← नवीनतम पेपर
💻 computer science

G2^2TAM: Geometry Grounded Track Anything Model

यह शोध पत्र G2^2TAM को प्रस्तुत करता है, जो एक एकीकृत ढांचा (framework) है जो विभिन्न दृष्टिकोणों और अवरोधों (occlusions) के बीच सुदृढ़, प्रॉम्प्टेबल 3D इंस्टेंस ट्रैकिंग और वीडियो सेगमेंटेशन प्राप्त करने के लिए स्थानिक रूप से संरेखित ज्यामितीय निरूपणों को एक अंतर्निहित स्मृति (implicit memory) के रूप में उपयोग करता है, जिसे नवनिर्मित InsTrack डेटासेट द्वारा समर्थित किया गया है।

मूल लेखक: Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले, बिखरे हुए कमरे में टहल रहे हैं। आपकी नज़र एक विशिष्ट लाल कुर्सी पर पड़ती है। जैसे-जैसे आप कमरे में घूमते हैं, आपकी आँखों में कुर्सी का आकार बदलता जाता है: बगल से देखने पर यह चपटी दिखाई देती है; पीछे से देखने पर आपको केवल उसके पैर दिखाई देते हैं; यदि आप एक बुकशेल्फ़फ के पीछे जाते हैं, तो वह पूरी तरह से गायब हो जाती है।

वर्तमान के अधिकांश कंप्यूटर विज़न सिस्टम एक ऐसे व्यक्ति की तरह हैं जिसकी याददाश्त बहुत कम समय के लिए होती है और जो चीज़ों को केवल इस आधार पर पहचानते हैं कि वे अभी कैसी दिख रही हैं। यदि लाल कुर्सी एक "पतली रेखा" बन जाती है या छिप जाती है, तो ये सिस्टम उसे खो देते हैं, यह सोचकर कि यह एक नई वस्तु है या यह हमेशा के लिए गायब हो गई है। वे किसी वस्तु के पिछले रूप का मिलान करने के लिए एक "फोटो एल्बम" पर निर्भर रहते हैं।

G2TAM (जियोमेट्री ग्राउंडेड ट्रैक एनीथिंग मॉडल) एक नया AI सिस्टम है जो अलग तरह से सोचता है। केवल तस्वीरों को याद रखने के बजाय, यह कमरे का एक 3D मानसिक मानचित्र (Mental 3D Map) बनाता है। यह समझता है कि "पतली रेखा" और "पैर" वास्तव में एक ही लाल कुर्सी हैं क्योंकि वे एक ही 3D स्थान में फिट बैठते हैं।

यह कैसे काम करता है, इसका विवरण यहाँ दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. मुख्य विचार: "3D मेमोरी" बनाम "फोटो एल्बम"

  • पुराना तरीका (फोटो एल्बम): वर्तमान सिस्टम किसी वस्तु की तस्वीरों का एक ढेर (मेमोरी बैंक) रखते हैं। यदि वस्तु घूम जाती है या छिप जाती है, तो सिस्टम एक मेल खाने वाली फोटो खोजने की कोशिश करता है। यदि कोण बहुत अलग है या वस्तु बहुत लंबे समय तक छिपी रहती है, तो सिस्टम भ्रमित हो जाता है।
  • G2TAM का तरीका (मानसिक मानचित्र): G2TAM केवल तस्वीर को नहीं देखता; यह तुरंत दृश्य का 3D आकार समझ लेता है। यह इस 3D आकार को अपनी "मेमोरी" के रूप में उपयोग करता है। भले ही लाल कुर्सी किसी दीवार के पीछे छिपी हो, G2TAM जानता है कि वह 3D स्पेस में ठीक कहाँ है क्योंकि वह कमरे की ज्यामिति (geometry) को समझता है। इसे तस्वीरों के ढेर की आवश्यकता नहीं है; इसके पास एक स्थायी, अदृश्य मानचित्र है।

2. यह निर्देश कैसे लेता है (द "प्रॉम्प्ट" सिस्टम)

आप G2TAM को तीन तरीकों से निर्देश दे सकते हैं, ठीक वैसे ही जैसे आप किसी मित्र को दिशा-निर्देश देते हैं:

  • पॉइंटिंग (इशारा करना): आप स्क्रीन पर एक जगह टैप करते हैं (जैसे, "वह लाल कुर्सी")।
  • बॉक्सिंग (घेरा बनाना): आप किसी वस्तु के चारों ओर एक वर्ग बनाते हैं (जैसे, "इस बॉक्स के अंदर की कुर्सी")।
  • बातचीत (बोलना): आप कहते हैं, "खिड़की के पास वाली कुर्सी को ढूँढो।"

G2TAM इन निर्देशों को लेता है और तुरंत उन्हें अपने 3D मानसिक मानचित्र में बदल देता है। यह केवल एक लाल धब्बे को नहीं खोजता; यह उस 3D वस्तु को खोजता है जो उस विशिष्ट स्थान में आपके विवरण से मेल खाती है।

3. प्रशिक्षण का "जादू"

पेपर का दावा है कि G2TAM बेहतर ट्रैकिंग इसलिए करता है क्योंकि यह दो चीजें एक साथ सीखता है:

  1. वस्तु को बनाने का तरीका (सेगमेंटेशन)।
  2. 3D कमरा बनाने का तरीका (रिकंस्ट्रक्शन)।

इसे एक छात्र के कार बनाने की कला सीखने जैसा समझें। यदि वे केवल सामने से कार बनाने का अभ्यास करते हैं, तो वे बगल से बनाने के लिए कहे जाने पर असफल हो सकते हैं। लेकिन यदि वे कार को हर कोण से बनाने के साथ-साथ उसका 3D मॉडल बनाना भी सीखते हैं, तो वे समझते हैं कि पहिये शरीर से कैसे जुड़े होते हैं। G2TAM यही करता है: 3D दुनिया को फिर से बनाने को सीखकर, यह कैमरा हिलने या वस्तु के छिपने पर भी उसका पीछा करने में बहुत सक्षम हो जाता है।

4. यह क्या कर सकता है (पेपर के दावों के आधार पर)

शोधकर्ताओं ने G2TAM का परीक्षण किया और पाया कि यह इसमें उत्कृष्ट है:

  • अराजकता के बीच ट्रैकिंग: यह किसी वस्तु का पीछा तब भी कर सकता है जब कैमरा तेजी से घूम रहा हो या वस्तु लंबे समय के लिए गायब हो जाए, क्योंकि इसे पता होता है कि 3D स्पेस में वस्तु को कहाँ होना चाहिए
  • भाषा की समझ: यह जटिल विवरणों (जैसे, "खिड़की के पास वाली कुर्सी") के आधार पर वस्तुओं को ढूंढ सकता है और विभिन्न कैमरा कोणों में उन्हें ट्रैक कर सकता है।
  • दुनिया का निर्माण: ट्रैकिंग करते समय, यह दृश्य का 3D मानचित्र भी बनाता है, जिसमें कैमरा कहाँ है और कमरे की गहराई कितनी है, यह भी शामिल है।

5. नया "जिम" (डेटासेट)

इसे प्रशिक्षित और परीक्षण करने के लिए, लेखकों ने InsTech नामक एक नया डेटासेट बनाया है। इसे एक विशाल, जटिल बाधा दौड़ (obstacle course) के रूप में समझें जो वीडियो और 3D स्कैन से भरी हुई है। उन्होंने विशिष्ट चुनौतियाँ बनाई हैं जहाँ वस्तुएँ छिपी होती हैं, कैमरे तेजी से चलते हैं, और निर्देश कठिन होते हैं, ताकि यह साबित किया जा सके कि G2TAM पिछले सिस्टमों की तुलना में अधिक मजबूत है।

निष्कर्ष

G2TAM एक ऐसा सिस्टम है जो देखने (वस्तु कैसी दिखती है) और स्थान को समझने (वस्तु 3D में कहाँ है) को जोड़ता है। अपनी मेमोरी को केवल तस्वीरों की सूची के बजाय दुनिया की ज्यामिति (geometry) पर आधारित करके, यह वस्तुओं को अधिक विश्वसनीय रूप से ट्रैक कर सकता है, भले ही वे हिलें, अपना आकार बदलें या दृष्टि से ओझल हो जाएं। यह उस AI की ओर एक कदम है जो दुनिया को वैसे ही समझता है जैसे मनुष्य समझते हैं: एक स्थिर, 3D स्थान के रूप में, न कि केवल 2D चित्रों की एक श्रृंखला के रूप में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →