← नवीनतम पेपर
💻 computer science

Language-in-the-Loop Culvert Inspection on the Erie Canal

यह शोध पत्र VISION को प्रस्तुत करता है, जो एक एंड-टू-एंड स्वायत्तता प्रणाली है जो एक वेब-स्केल विजन-लैंग्वेज मॉडल और कन्सट्रेंड व्यूपॉइंट प्लानिंग का लाभ उठाती है ताकि एक क्वाड्रुपेड रोबोट एरी कैनाल के पुराने कलवर्ट्स (culverts) का स्वायत्त रूप से निरीक्षण कर सके, और सफलतापूर्वक प्रारंभिक परिकल्पनाओं को विशेषज्ञ-संरेखित निष्कर्षों में परिष्कृत कर सके बिना किसी डोमेन-विशिष्ट फाइन-ट्यूनिंग के।

मूल लेखक: Yash Turkar, Yashom Dighe, Karthik Dantu

प्रकाशित 2026-02-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Turkar, Yashom Dighe, Karthik Dantu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एरी नहर (Erie Canal) एक विशाल, ऐतिहासिक जलमार्ग है जिसे 200 साल पहले बनाया गया था। इस नहर के किनारों के नीचे, सैकड़ों छोटे, गोल सुरंगों जैसे छेद हैं जिन्हें कलवर्ट्स (culverts) कहा जाता है। ये सुरंगें नहर के 'प्लंबिंग' की तरह काम करती हैं, जो पानी को बाहर निकालती हैं ताकि किनारे ढह न जाएं।

समस्या क्या है? ये सुरंगें अंधेरी, नम, तंग और अक्सर पानी से भरी होती हैं। इनमें दरारें, जंग या रिसाव की जांच करना इंसानों के लिए खतरनाक और कठिन है। यह ऐसा है जैसे किसी व्यक्ति को टॉर्च के बिना एक गीली, अंधेरी पाइप के अंदर रेंगकर एक बहुत ही बारीक दरार ढूंढने के लिए कहना।

यहाँ आता है VISION, एक नया रोबोटिक सिस्टम जिसका वर्णन इस शोध पत्र में किया गया है। VISION को केवल एक रोबोट नहीं, बल्कि एक सुपर-स्मार्ट जासूसी कुत्ते के रूप में सोचें जिसके पास एक "जादुई आंख" है जो क्लाउड (cloud) में मौजूद एक विशाल मस्तिष्क से बात कर सकती है।

यहाँ बताया गया है कि VISION कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. रोबोट कुत्ता (शरीर)

टीम बोस्टन डायनेमिक्स स्पॉट (Boston Dynamics Spot) का उपयोग करती है, जो एक चार पैरों वाला रोबोट है जो एक यांत्रिक कुत्ते जैसा दिखता है।

  • कुत्ता ही क्यों? क्योंकि कलवर्ट्स (सुरंगें) अस्त-व्यस्त होती हैं। वहाँ खड़ी ढलानें, कीचड़ भरा पानी और ऊबड़-खाबड़ जमीन होती है। एक पहियों वाला रोबोट फंस जाएगा, लेकिन एक रोबोट कुत्ता असली कुत्ते की तरह चल सकता है, उथले पानी में चल सकता है और बाधाओं के ऊपर चढ़ सकता है।
  • उपकरण: रोबोट दो कैमरे और चमकदार लाइटें लेकर चलता है। एक कैमरा "स्काउट" (सामने देखने वाला) है, और दूसरा "आवर्धक लेंस" (magnifying glass) है (जो एक घूमने वाले सिर पर लगा होता है) जो ज़ूम कर सकता है और कोनों के आसपास देख सकता है।

2. जादुई आंख और क्लाउड ब्रेन (The "Language-in-the-Loop")

यही सबसे रचनात्मक हिस्सा है। आमतौर पर, रोबोट को उन चीजों की एक विशिष्ट सूची के साथ प्रोग्राम करने की आवश्यकता होती है जिन्हें उन्हें देखना है (जैसे, "जंग देखें," "दरारें देखें")। यदि रोबोट कुछ ऐसा देखता है जो उस सूची में नहीं है, तो वह उसे अनदेखा कर देता है।

VISION इसे अलग तरह से करता है।

  • प्रॉम्प्ट (निर्देश): एक मानव निरीक्षक रोबोट को एक साधारण टेक्स्ट संदेश भेजता है, जैसे: "किसी भी ऐसी चीज़ को खोजो जो अजीब, क्षतिग्रस्त या खतरनाक लगे।"
  • क्लाउड ब्रेन: रोबोट एक फोटो को एक विशाल AI (एक विजन-लैंग्वेज मॉडल, या VLM) को भेजता है जिसने पूरा इंटरनेट पढ़ा है। यह AI एक अनुभवी विशेषज्ञ की तरह कार्य करता है जिसने लाखों तस्वीरें देखी हैं। यह केवल "जंग" को नहीं देखता; यह क्षति की अवधारणा (concept) को समझता है।
  • परिकल्पना (Hypothesis): AI कहता है, "अरे, छत पर सफेद रंग का वह पैच लग रहा है जैसे कि कंक्रीट टूट रहा हो," या "नीचे के पास वह काला धब्बा रुकावट जैसा लग रहा है।" यह संदिग्ध क्षेत्र के चारों ओर एक बॉक्स बनाता है और उसका कारण भी बताता है।

3. "देखना, निर्णय लेना, हिलना, पुनः इमेज बनाना" का चक्र (The "See, Decide, Move, Re-Image" Loop)

यहीं पर रोबोट भौतिक रूप से कार्य करता है।

  1. देखना (See): रोबोट एक विस्तृत फोटो लेता है और क्लाउड ब्रेन से पूछता है, "क्या गलत लग रहा है?"
  2. निर्णय लेना (Decide): ब्रेन तीन संदिग्ध स्थानों की ओर इशारा करता है।
  3. हिलना (Move): रोबोट केवल दूर से फोटो नहीं लेता। वह जानता है कि वह एक संकीली पाइप में है। वह गणना करता है कि दीवारों से टकराए बिना करीब से देखने के लिए सही कोण क्या होगा। वह कुछ फीट आगे बढ़ता है और अपने सिर (गिम्बल) को घुमाता है ताकि ठीक उस संदिग्ध स्थान को देख सके।
  4. पुनः इमेज बनाना (Re-Image): वह उस विशिष्ट स्थान की सुपर-हाई-रिज़ॉल्यूशन फोटो लेता है।
  5. सत्यापन (Verify): वह यह नई, क्लोज-अप फोटो वापस क्लाउड ब्रेन को भेजता है। ब्रेन कहता है, "ठीक है, करीब से देखने पर, वह सफेद चीज़ वास्तव में केवल खनिज जमाव (mineral buildup) है, दरार नहीं। लेकिन वह काला धब्बा? वह निश्चित रूप से एक रुकावट है।"

4. परिणाम: एक बेहतर रिपोर्ट

अतीत में, एक मानव निरीक्षक को अंधेरी सुरंग में रेंगना पड़ता था, जो उन्होंने देखा उसका अनुमान लगाना पड़ता था, और एक ऐसी रिपोर्ट लिखनी पड़ती थी जो अस्पष्ट हो सकती थी या कुछ चीजें छोड़ सकती थी।
VISION के साथ, रोबोट अंदर जाता है, समस्या वाले स्थानों को ढूंढता है, क्लाउड ब्रेन से दूसरी राय लेता है, और एक स्पष्ट, हाई-डेफिनिशन रिपोर्ट तैयार करता है।

उपमा (Analogy):
कल्पना कीजिए कि आप एक मंद रोशनी वाले संग्रहालय में एक पेंटिंग देख रहे हैं।

  • पुराना तरीका: आप अपनी आँखें सिकोड़ते हैं, अनुमान लगाते हैं कि वह छाया क्या है, और लिखते हैं, "शायद एक पक्षी?"
  • VISION का तरीका: आप अपने दोस्त (AI) से पूछते हैं, "तुम्हें क्या दिख रहा है?" वे कहते हैं, "वह छाया एक पक्षी के पंख जैसी लग रही है।" फिर आप पेंटिंग के बिल्कुल करीब जाते हैं (रोबोट मूव करता है), एक तेज़ रोशनी जलाते हैं (क्लोज-अप कैमरा), और एक फोटो लेते हैं। आप फिर से अपने दोस्त से पूछते हैं, "क्या यह एक पक्षी है?" वे कहते हैं, "हाँ, निश्चित रूप से एक ब्लू जे (blue jay) है।" अब आपके पास एक अनुमान नहीं, बल्कि एक पुष्ट तथ्य है।

यह क्यों महत्वपूर्ण है

  • सुरक्षा: इंसानों को खतरनाक, डूबी हुई सुरंगों में रेंगने की आवश्यकता नहीं है।
  • गति: रोबोट यह काम लगभग 90 मिनट में कर सकता है, जबकि एक इंसान को 2 घंटे या उससे अधिक समय लग सकता है।
  • सटीकता: इस प्रणाली ने पहली कोशिश में ही 61% "संदिग्ध स्थानों" को पकड़ लिया, और करीब से देखने के बाद, यह 80% बार मानव विशेषज्ञों के साथ सहमत हुआ।
  • लचीलापन: क्योंकि यह भाषा का उपयोग करता है, आपको हर नए प्रकार के नुकसान के लिए रोबोट को फिर से प्रोग्राम करने की आवश्यकता नहीं है। आप बस साधारण अंग्रेजी में उसे बता सकते हैं कि उसे क्या खोजना है।

संक्षेप में, VISION एक कठिन, अनुमान-आधारित काम को एक सुरक्षित, सटीक और स्वचालित प्रक्रिया में बदल देता है, जिसमें एक मजबूत रोबोट कुत्ते और एक सुपर-स्मार्ट AI का मेल है जो मानव भाषा बोल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →