← नवीनतम पेपर
🤖 AI

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

यह शोध पत्र TinyDamage को प्रस्तुत करता है, जो एक हाइब्रिड एजेंटिक फ्रेमवर्क है जो सूक्ष्म वाहन क्षति मूल्यांकन में स्थानिक ग्राउंडिंग विफलताओं को दूर करने के लिए एक समर्पित मल्टी-टास्क सेगमेंटेशन मॉडल को विजन-लैंग्वेज मॉडल के साथ एकीकृत करता है, जो सुपरवाइज्ड कॉन्ट्रास्टिव लर्निंग और एक LangGraph पाइपलाइन का लाभ उठाकर मतिभ्रम (hallucination) की दरों को काफी कम कर देता है।

मूल लेखक: Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को यह सिखाने की कोशिश कर रहे हैं कि एक तस्वीर को कैसे देखा जाए और उसके बारे में कहानी कैसे सुनाई जाए। विज्ञान का यह क्षेत्र "विज़न-लैंग्वेज" (Vision-Language) कहलाता है, जहाँ कंप्यूटर छवियों को देखना और उनके बारे में बोलना सीखते हैं। लंबे समय तक, ये रोबोट बड़ी तस्वीर का वर्णन करने में माहिर थे—जैसे कि यह कहना कि "वह एक लाल कार है।" लेकिन वे बारीक विवरणों में संघर्ष करते थे, जैसे कि बंपर पर खरोंच ठीक कहाँ है, यह बताना। यह थोड़ा वैसा ही है जैसे आपका कोई दोस्त जो आपको फिल्म के बारे में कहानी तो बता सकता है लेकिन यह नहीं बता सकता कि किस पात्र ने नीली टोपी पहनी है। यह महत्वपूर्ण है क्योंकि वास्तविक दुनिया में, यदि किसी रोबट को बीमा में मदद करने के लिए कार की क्षति की जाँच करनी है, तो वह केवल अनुमान नहीं लगा सकता; उसे ठीक से पता होना चाहिए कि समस्या कहाँ है, अन्यथा वह ऐसी क्षति का आविष्कार कर सकता है जो वहाँ है ही नहीं।

इस शोध पत्र के शोधकर्ताओं ने इस समस्या को हल करने के लिए Qwen-VL नामक एक रोबोट को एक बेहतर जासूस बनाने में मदद करने के लिए TinyDamage नामक एक नया सिस्टम बनाने पर काम किया। उन्होंने पाया कि जबकि रोबोट यह जानने में बहुत अच्छा था कि खरोंच या दरार कैसी दिखती है (नाम बताने में 87.3% सही था), वह फोटो में उनकी ओर इशारा करने में बहुत खराब था। जब क्षति को खोजने के लिए कहा गया, तो रोबोट अक्सर "हैलुसिनेट" (hallucinate) करता था, जिसका अर्थ है कि वह चमकदार प्रतिबिंबों में खरोंचें देखता था या लंबी, पतली दरारों को पूरी तरह से मिस कर देता था। यह एक ऐसे जासूस की तरह था जो जानता है कि उंगलियों के निशान कैसे दिखते हैं, लेकिन लाइनअप में बार-बार गलत व्यक्ति की ओर इशारा करता रहता है।

इसे ठीक करने के लिए, टीम ने रोबोट को बेहतर ढंग से इशारा करने के लिए मजबूर करने की कोशिश नहीं की। इसके बजाय, उन्होंने उसे एक साथी दिया। उन्होंने एक विशेष "स्पॉटर" (TinyDamage मॉडल) बनाया जिसका एकमात्र काम छोटी, कठिन क्षति को खोजना और उसके चारों ओर एक मास्क बनाना था। फिर, उन्होंने मुख्य रोबोट को अपनी रिपोर्ट लिखने के लिए उस मास्क का उपयोग गाइड के रूप में करने दिया। इसे एक टूर गाइड की तरह समझें जो सारा इतिहास जानता है लेकिन आसानी से रास्ता भटक जाता है, जिसे एक स्थानीय गाइड के साथ जोड़ा गया है जो जानता है कि हर सड़क कहाँ है। स्थानीय गाइड रास्ता दिखाता है, और टूर गाइड कहानी सुनाता है।

परिणाम आश्चर्यजनक और बहुत विशिष्ट थे। टीम ने पाया कि "स्पॉटर" को सिखाने का तरीका, स्पॉटर के स्वयं के डिज़ाइन से अधिक महत्वपूर्ण था। उन्होंने पाया कि "फोकल लॉस" (focal loss) नामक एक सामान्य शिक्षण पद्धति का उपयोग करने से स्पॉटर छोटी खरोंचों के प्रति पूरी तरह से अंधा हो गया, जिससे वह उन्हें 100% बार मिस कर देता था। हालाँकि, एक अलग पद्धति "सुपरवाइज्ड कॉन्ट्रास्टिव लर्निंग" (supervised contrastive learning) में स्विच करके, स्पॉटर क्षति को बैकग्राउंड से अलग करने में बहुत बेहतर हो गया।

जब उन्होंने पूरी टीम का एक साथ परीक्षण किया, तो अंतर बहुत बड़ा था। यदि उन्होंने रोबोट को केवल तस्वीर के आधार पर रिपोर्ट लिखने के लिए कहा, तो उसने 78% बार नकली क्षति बनाई। यदि उन्होंने केवल एक टेक्स्ट विवरण के आधार पर पूछा, तो उसने 92% बार क्षति का आविष्कार किया। लेकिन जब उन्होंने रोबोट को अपनी लेखन को निर्देशित करने के लिए "स्पॉटर" के मानचित्र का उपयोग करने दिया, तो नकली क्षति की दर गिरकर केवल 31% रह गई। यह शोध पत्र सुझाव देता है कि वास्तविक दुनिया में रोबोट को विश्वसनीय बनाने के लिए, हमें केवल उन्हें छोटी चीजों को देखने के लिए "अधिक प्रयास करने" के लिए नहीं कहना चाहिए; इसके बजाय, हमें उन्हें छोटी चीजों को खोजने के लिए एक समर्पित उपकरण देना चाहिए, और फिर रोबोट को उस उपकरण का उपयोग करके सच बोलने देना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →