← नवीनतम पेपर
💻 computer science

TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation

TrajRAG एक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो ज़ीरो-शॉट ऑब्जेक्ट गोल नेविगेशन को पिछले एपिसोड्स से संरचित ज्यामितीय-सिमेंटिक अनुभवों को संचित और पुनर्प्राप्त करके वेपॉइंट चयन के लिए लार्ज-मॉडल रीजनिंग को निर्देशित करके बेहतर बनाता है।

मूल लेखक: Yiyao Wang, Sixian Zhang, Keming Zhang, Xinhang Song, Songjie Du, Shuqiang Jiang

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiyao Wang, Sixian Zhang, Keming Zhang, Xinhang Song, Songjie Du, Shuqiang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी ऐसे घर में एक विशिष्ट वस्तु, जैसे कि "लाल कुर्सी", को खोजने की कोशिश कर रहे हैं जिसे आपने पहले कभी नहीं देखा है। आप केवल वही देख सकते हैं जो आपके ठीक सामने है, और आपके पास कोई नक्शा नहीं है। यह जीरो-शॉट ऑब्जेक्ट नेविगेशन (Zero-Shot Object Navigation) की चुनौती है।

अधिकांश वर्तमान AI रोबोट इसे हल करने के लिए एक विशाल "दिमाग" (एक लार्ज लैंग्वेज मॉडल) से सलाह मांगकर कोशिश करते हैं, जैसे, "कुर्सियाँ आमतौर पर कहाँ पाई जाती हैं?" समस्या यह है कि यह दिमाग केवल वही जानता है जो उसने इंटरनेट पर पढ़ा है। यह नहीं जानता कि इस विशिष्ट कमरे में एक कुर्सी कैसी दिखती है, और जैसे ही रोबोट आगे बढ़ता है, वह पिछले कुछ सेकंडों में रोबोट ने जो कुछ भी देखा था उसे भूल जाता है। यह एक भूलभुलैया में केवल पहले कदम को याद रखने और बाकी रास्ते को अनदेखा करने जैसा है।

TrajRAG एक नया सिस्टम है जो रोबोट को "लॉन्ग-टर्म मेमोरी" (दीर्घकालिक स्मृति) देता है और उसे अपने पिछले साहसिक कारनामों से सीखने का एक तरीका प्रदान करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: रोबोट का कम ध्यान देने का समय (Short Attention Span)

वर्तमान रोबोट उन पर्यटकों की तरह हैं जो एक कमरे की फोटो खींचते हैं, एक गाइड से दिशा-निर्देश मांगते हैं, एक कदम उठाते हैं, और फिर तुरंत फोटो डिलीट कर देते हैं। वे पूरे घर का मानसिक मानचित्र नहीं बनाते। वे यह भी याद नहीं रखते कि वे अभी-अभी एक घेरे में घूमकर वापस आ गए हैं, इसलिए वे बार-बार चक्कर काटते रहते हैं।

2. समाधान: एक "ट्रैवल जर्नल" (TrajRAG)

लेखकों ने TrajRAG बनाया है, जो रोबोट के लिए एक स्मार्ट "ट्रैवल जर्नल" (यात्रा डायरी) की तरह काम करता है। हर एक कच्चे वीडियो फ्रेम को सहेजने के बजाय (जो बहुत भारी और अव्यवस्थित होगा), रोबोट अपनी यात्रा का एक संक्षिप्त सारांश (condensed summary) लिखता है।

"टोपो-पोलर" मैप (Topo-Polar Map): एक स्केच, फोटो नहीं

कल्पना कीजिए कि आप अपने दोस्त के लिए एक घर का नक्शा बना रहे हैं। आप हर ईंट नहीं बनाते; आप मुख्य गलियारे बनाते हैं और कोनों के सापेक्ष फर्नीचर को चिह्नित करते हैं।

  • टोपोलॉजिकल (Topological): रोबमान महत्वपूर्ण "जंक्शनों" (जैसे कि किसी हॉलवे में T-इंटरसेक्शन या कमरे का कोना) की पहचान करता है।
  • पोलर (Polar): प्रत्येक जंक्शन पर, रोबोट एक घेरे में चारों ओर देखता है (एक घड़ी के चेहरे की तरह) और प्रत्येक हिस्से में जो देखता है उसे नोट करता है (जैसे, "12 बजे: टीवी, 3 बजे: सोफा")।
  • परिणाम: यह स्थान का एक संक्षिप्त "फिंगरप्रिंट" बनाता है। यह एक वीडियो की तुलना में बहुत छोटा है लेकिन इसमें सभी महत्वपूर्ण ज्यामितीय और सिमेंटिक (अर्थ-आधारित) विवरण सुरक्षित रहते हैं।

"लाइब्रेरी" सिस्टम: कोर्स-टू-फाइन सर्च (Coarse-to-Fine Search)

रोबोट इन स्केच को बस एक ढेर में नहीं डाल देता। वह उन्हें एक लाइब्रेरी में व्यवस्थित करता है:

  1. कैटलॉग (कोर्स सर्च): सबसे पहले, रोबोट समान स्केच को एक साथ समूहित करता है। उदाहरण के लिए, "टीवी के बाईं ओर वाले सभी लिविंग रूम" एक फोल्डर में हैं। यह टोपो-पोलर सारांश (Topo-Polar Summary) है।
  2. विशिष्ट पुस्तक (फाइन सर्च): जब रोबोट को मदद की ज़रूरत होती है, तो वह पूरी लाइब्रेरी नहीं खोजता। वह पहले सही "फोल्डर" (जैसे, "लिविंग रूम") ढूंढता है, और फिर उस विशिष्ट "किताब" (सटीक पथ) को देखता है जो उसकी वर्तमान स्थिति से मेल खाती है।

3. यह रोबोट को नेविगेट करने में कैसे मदद करता है

जब रोबोट फंस जाता है या उसे यह तय करने की आवश्यकता होती है कि आगे कहाँ जाना है:

  1. वह आगे देखता है: वह कल्पना करता है कि वह कौन से संभावित पथ ले सकता है (जैसे "बाएं जाओ," "दाएं जाओ")।
  2. वह अपने जर्नल की जांच करता है: वह TrajRAG से पूछता है, "क्या मैंने पहले कभी ऐसा रास्ता देखा है? क्या इससे कुर्सी मिली थी?"
  3. उसे एक संकेत मिलता है: TrajRage एक पिछला अनुभव खोजता है जो समान दिखता है। यह रोबोट के "दिमाग" (LLM) को बताता है, "हे, एक समान लेआउट में, बाएं जाने से एक कुर्सी मिली थी।"
  4. वह हमेशा के लिए सीखता है: एक बार जब रोबोट अपनी यात्रा पूरी कर लेता है, तो वह डेटा को फेंकता नहीं है। वह इस नई यात्रा को लाइब्रेरी में जोड़ देता है, जिससे रोबet अगली बार किसी नए घर में प्रवेश करने पर अधिक स्मार्ट हो जाता है।

4. यह बेहतर क्यों काम करता है

लेखकों ने इसका परीक्षण तीन अलग-अलग वर्चुअल हाउस डेटासेट्स (MP3D, HM3D-v1, और HM3D-v2) पर किया।

  • परिणाम: TrajRAG अन्य तरीकों की तुलना में लक्ष्य वस्तुओं को अधिक बार और तेज़ी से ढूंढ पाया।
  • कारण: यह "सामान्य ज्ञान" (इंटरनेट कुर्सियों के बारे में क्या कहता है) और "विशिष्ट अनुभव" (रोबोट ने वास्तव में समान कमरों में क्या देखा) के बीच के अंतर को पाटता है। यह रोबोट को लूप में फंसने से रोकता है और उसे यह अनुमान लगाने में मदद करता है कि आगे कहाँ देखना है।

संक्षेप में: TrajRAG एक ऐसे रोबोट को, जो कुछ कदमों के बाद सब कुछ भूल जाता है, एक अनुभवी खोजकर्ता में बदल देता है जो अपनी यात्राओं का एक विस्तृत, व्यवस्थित डायरी रखता है, जिससे वह हर गलती और सफलता से सीखकर नए स्थानों को कुशलतापूर्वक नेविगेट कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →