← नवीनतम पेपर
🤖 AI

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

यह शोधपत्र WasteAssistant को प्रस्तुत करता है, जो एक विनियमन-निर्देशित विजुअल क्वेश्चन अनस्वियरिंग फ्रेमवर्क है जो अपशिष्ट पृथक्करण की सटीकता में सुधार करने और भारत के ठोस अपशिष्ट प्रबंधन नियम 2016 का अनुपालन सुनिश्चित करने के लिए मल्टीमॉडल लैंग्वेज मॉडल्स और एक नए डेटासेट का लाभ उठाता है।

मूल लेखक: Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कचरे के एक बिखरे हुए ढेर के सामने खड़े हैं। आप एक अजीब सी, चमकती हुई वस्तु उठाते हैं और सोचने लगते हैं, "क्या यह एक पुनर्चक्रण योग्य (recyclable) प्लास्टिक की बोतल है, या यह एक खतरनाक मेडिकल सिरिंज है? और अगर यह सिरिंज है, तो कानून कहता है कि मुझे इसके साथ क्या करना चाहिए?"

लंबे समय तक, कंप्यूटर प्रोग्राम जो इसमें मदद करने की कोशिश कर रहे थे, वे एक बहुत ही सख्त लाइब्रेरियन की तरह थे जो केवल कुछ चीज़ देखने पर "किताब!" या "पत्रिका!" चिल्लाकर बता सकते थे। वे आपको बता सकते थे कि कोई वस्तु क्या थी, लेकिन वे आपको यह नहीं बता सकते थे कि उसके साथ क्या करना है, खासकर यदि नियम जटिल हों। वे एक ही मोड में फंसे थे: केवल देखना, सोचना नहीं।

यहाँ WasteAssistant का प्रवेश होता है, जो एक नया डिजिटल सहायक है जो एक साधारण लेबल लगाने वाले की तुलना में एक बुद्धिमान, नियम मानने वाले मार्गदर्शक की तरह काम करता है। शोधकर्ताओं की एक टीम द्वारा बनाए गए इस प्रोजेक्ट में एक ऐसा सिस्टम पेश किया गया है जो केवल कचरे को "देखता" नहीं है; वह नियमों को "पढ़ता" है और उससे जुड़े आपके सवालों के जवाब देता है।

जादुई मस्तिष्क: केवल छांटना नहीं, बल्कि सवाल पूछना

इसका असली मंत्र विजुअल क्वेश्चन अनस्वर्सिंग (VQA) है। इसे एक खेल की तरह समझें जहाँ आप कंप्यूटर को कचरे की एक तस्वीर दिखाते हैं, और केवल "प्लास्टिक" जैसा लेबल मिलने के बजाय, आप पूछ सकते हैं, "क्या यह नीले बिन में जा सकता है?" या "क्या यह 2016 के भारतीय कचरा नियमों के तहत खतरनाक है?"

इसके बाद कंप्यूटर विजन (छवि देखना) और भाषा (नियमों को समझना) को जोड़ने वाले एक "मस्तिष्क" का उपयोग करता है ताकि आपको एक विशिष्ट उत्तर दे सके। यह एक ऐसे दोस्त की तरह है जो न केवल एक सांप को पहचानता है, बल्कि तुरंत जानता भी है कि, "यह जहरीला है; इसे न छुएं, और इसे संभालने का सटीक प्रोटोकॉल यह है।"

नया नियम पुस्तिका: WasteVQA

इस कंप्यूटर को एक अच्छा नियम मानने वाला बनाने के लिए, शोधकर्ताओं को एक नई प्रशिक्षण नियमावली बनानी पड़ी जिसे WasteVQA कहा गया। इससे पहले, ऐसा कोई डेटासेट नहीं था जो कचरे की तस्वीरों को भारत के ठोस अपशिष्ट प्रबंधन नियम 2016 के विशिष्ट कानूनी नियमों के साथ जोड़ता हो।

उन्होंने 21 अलग-अलग प्रकार के कचरे को कवर करने वाले 13,500 से अधिक प्रश्न-उत्तर जोड़े एकत्र किए, जिसमें स्वच्छता संबंधी वस्तुएं, खतरनाक रसायन और ई-कचरा जैसी पेचीदा चीजें शामिल थीं। उन्होंने केवल रैंडम फोटो नहीं लीं; उन्होंने सुनिश्चित किया कि प्रत्येक उत्तर आधिकारिक सरकारी दिशानिर्देशों का पालन करता हो। यह एक छात्र को केवल लाल बत्ती पहचानने के लिए नहीं, बल्कि यह जानने के लिए प्रशिक्षित करने जैसा है कि लाल बत्ती देखते ही यातायात कानून के अनुसार क्या करना चाहिए।

बड़ा परीक्षण: कौन जीतता है खेल?

टीम ने अलग-अलग "मस्तिष्क" (मॉडल्स) को यह देखने के लिए टेस्ट किया कि कौन इन नियमों को सबसे अच्छी तरह सीख सकता है। उन्होंने BLIP और InstructBLIP जैसे मानक मॉडल्स का परीक्षण किया, लेकिन उन्होंने उन्हें Qwen2-VL-7B नामक एक बहुत शक्तिशाली इंजन से लैस करने की भी कोशिश की।

यहाँ मामला दिलचस्प और थोड़ा आश्चर्यजनक हो जाता है। आप सोच सकते हैं कि अधिक संवादात्मक (conversational) मॉडल (InstructBLIP) जीतेगा क्योंकि वह बात करने में बेहतर है। लेकिन पेपर सुझाव देता है कि मानक सेटअप का उपयोग करने पर इसके विपरीत हुआ।

  • परिणाम: मानक BLIP मॉडल वास्तव में सही, नियम-आधारित उत्तर देने में बेहतर प्रदर्शन कर गया। इसने 0.8291 का BLEU स्कोर और 0.9273 का BERTScore प्राप्त किया।
  • हारने वाला (इस विशिष्ट खेल में): फैंसी InstructBLIP मॉडल कम स्कोर कर गया, जिसका BLEU 0.6345 और BERTScore 0.7612 था।

सरल मॉडल क्यों जीता? शोधकर्ता बताते हैं कि InstructBLIP को बातचीत करने और लंबी, वर्णनात्मक कहानियाँ लिखने के लिए प्रशिक्षित किया गया है। लेकिन कचरा प्रबंधन के लिए "हरे बिन" या "खतरनाक" जैसे छोटे, तथ्यात्मक, नियम-आधारित उत्तरों की आवश्यकता होती है। संवादात्मक मॉडल ने अतिरिक्त शब्द और बातचीत का फालतू हिस्सा जोड़ दिया, जिससे स्कोरिंग सिस्टम भ्रमित हो गया। सरल BLIP मॉडल एक स्नाइपर की तरह था: उसने छवि देखी, नियम देखा, और एक सटीक, छोटा उत्तर दिया।

हालाँकि, एक मोड़ आया: जब शोधकर्ताओं ने इसके अंतर्निहित इंजन को बदलकर Qwen2-VL-7B का उपयोग किया, तो प्रदर्शन काफी बढ़ गया। Qwen2-VL-7B द्वारा संचालित BLIP मॉडल ने सभी में उच्चतम स्कोर प्राप्त किया, जिसमें 0.8785 का BLEU और 0.9517 का BERTScore था। यह साबित करता है कि हालांकि मॉडल की शैली (सरल बनाम संवादात्मक) मायने रखती है, लेकिन उसके नीचे का मजबूत आधार (बैकबोन) और भी अधिक महत्वपूर्ण है। Qwen2-VL-7B बैकबोन ने छवियों और नियमों की बहुत समृद्ध समझ प्रदान की, जिससे यह इस कार्य के लिए शीर्ष विकल्प बन गया।

वास्तविक दुनिया के लिए इसका क्या अर्थ है

पेपर सुझाव देता है कि यह दृष्टिकोण शहरों और आम लोगों को स्रोत पर ही कचरे को सही ढंग से छांटने में मदद कर सकता है। कल्पना कीजिए कि एक ऐप है जहाँ आप अपने कचरे की एक फोटो खींचते हैं, पूछते हैं, "यह कहाँ जाएगा?", और आपको एक ऐसा उत्तर मिलता है जो गारंटी के साथ कानून का पालन करता है।

टीम ने वास्तविक दुनिया के परिदृश्यों के साथ इसका परीक्षण किया, जिसमें चलते हुए कचरे के फ्रेम का विश्लेषण करने वाला एक वीडियो केस स्टडी भी शामिल था। उन्होंने पाया कि जबकि कुछ मॉडल किसी वस्तु को ठीक से पहचानने (precision) में बेहतर थे, अन्य मॉडल प्रश्न के पीछे के अर्थ (semantic alignment) को समझने में बेहतर थे।

निचोड़

यह कोई जादुई छड़ी नहीं है जो रातों-रात दुनिया की कचरे की समस्या को हल कर देगी। शोधकर्ता सावधानी से कहते हैं कि यह एक नए तरीके का सुझाव है, न कि आज हर शहर के लिए तैयार कोई अंतिम उत्पाद। उन्होंने डेटासेट बनाया, मॉडल्स को प्रशिक्षित किया, और दिखाया कि विजन को विशिष्ट कानूनी नियमों के साथ जोड़ना केवल तस्वीरों को देखने से बेहतर काम करता है।

उन्होंने साबित किया कि कचरा प्रबंधन के लिए, आपको हमेशा सबसे जटिल, बातूनी AI की आवश्यकता नहीं होती। कभी-कभी, आपको एक ऐसे मॉडल की आवश्यकता होती है जो शांत, सटीक हो और कड़ाई से नियम पुस्तिका का पालन करे। WasteVQA डेटासेट बनाकर और यह दिखाकर कि BLIP मॉडल (विशेष रूप से Qwen2-VL-7B बैकबोन द्वारा संचालित) इस विशिष्ट कार्य में उच्च सटीकता प्राप्त कर सकता है, उन्होंने भविष्य में स्मार्ट और अधिक अनुपालन वाली कचरा पृथक्करण (waste segregation) के द्वार खोल दिए हैं।

कोड और डेटासेट अब किसी के भी उपयोग के लिए उपलब्ध हैं, जो यह सुझाव देता है कि अगला कदम दूसरों के लिए इस नींव पर निर्माण करना है ताकि हमारे शहर स्वच्छ और हमारे नियम आसान बन सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →