← नवीनतम पेपर
💻 computer science

​WolverBear-Enhanced Evolution Transformer for Optimized Scene Understanding and Classification

यह शोध पत्र एक WolverBear-Enhanced Evolution Transformer (WoBeOA + E-former) फ्रेमवर्क प्रस्तावित करता है जो छवि-आधारित दृश्य वर्गीकरण को अनुकूलित करता है और व्यापक दृश्य ग्राफ (scene graphs) बनाने के लिए एक Visformer के माध्यम से ऑडियो-व्युत्पन्न प्रासंगिक क्रियाओं को एकीकृत करता है, जिससे बहु-मोडल दृश्य समझ में उच्च सटीकता प्राप्त होती है।

मूल लेखक: S Monesh, N C Senthilkumar

प्रकाशित 2026-09-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: S Monesh, N C Senthilkumar

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मशीनें दुनिया को देखना कैसे सीखती हैं, इसे समझने के लिए हमें पहले यह समझना होगा कि वे इसके साथ संघर्ष कैसे करती हैं। दशकों से, कंप्यूटर वस्तुओं की पहचान करने में उत्कृष्ट रहे हैं: एक बिल्ली, एक कार, एक पेड़। लेकिन एक "दृश्य" (सीन) को पहचानना—वह जटिल, जीवंत संदर्भ जहाँ वे वस्तुएं एक साथ मौजूद होती हैं—एक कठिन चुनौती बना हुआ है। एक कंप्यूटर एक व्यक्ति और एक कुर्सी को देख सकता है, लेकिन वह अक्सर यह समझने में विफल रहता है कि वह व्यक्ति एक कक्षा में बैठा है, या कि कमरा किसी विशिष्ट प्रकार की गतिविधि से भरा हुआ है। यह कठिनाई तब और बढ़ जाती है जब वातावरण बदलता है, जैसे कि जब रोशनी बदलती है या जब वस्तुएं आंशिक रूप से छिपी होती हैं। इसके अलावा, वास्तविक दुनिया शांत नहीं है; यह ध्वनियों से भरी है। एक कक्षा में बातचीत का शोर होता है, एक जंगल में हवा की सरसराहट होती है, और एक समुद्र तट पर लहरों का गर्जन होता है। वर्तमान विधियां अक्सर इन समस्याओं को केवल चित्र को देखकर या केवल ध्वनि को सुनकर हल करने की कोशिश करती हैं, जिससे दोनों के बीच के समृद्ध संबंध छूट जाते हैं। जब एक मशीन जो देखती है उसे जो सुनती है के साथ जोड़ने में असमर्थ होती है, तो दुनिया की उसकी समझ सपाट और अधूरी रह जाती है।

वेल्लोर इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं ने इस अंतर को पाटने का एक नया तरीका प्रस्तावित किया है, एक ऐसी प्रणाली बनाई है जो एक मानव पर्यवेक्षक की गहराई के साथ दृश्यों को समझने के लिए डिज़ाइन की गई है। उनका दृष्टिकोण, जो हाल ही में किए गए एक अध्ययन में विस्तृत है, न केवल एक छवि को देखता है या एक रिकॉर्डिंग को सुनता है; बल्कि यह एक दृश्य का मानसिक मानचित्र बनाता है जो वस्तुओं को क्रियाओं से जोड़ता है। उनकी नवाचार का मूल एक नए प्रशिक्षण तरीके में है जिसे 'इवोल्यूशन ट्रांसफार्मर' (Evolution Transformer) नामक एक शक्तिशाली प्रकार के कृत्रिम बुद्धिमत्ता (AI) के रूप में विकसित किया गया है। यह प्रणाली दृश्य की विशेषताओं को सीखने के लिए डिज़ाइन की गई है, लेकिन शोधकर्ताओं ने पाया कि मानक प्रशिक्षण विधियां वास्तविक दुनिया के वातावरण की जटिलता को संभालने के लिए पर्याप्त कुशल नहीं थीं। इसे ठीक करने के लिए, उन्होंने एक कस्टम अनुकूलन रणनीति विकसित की जिसे वे 'वॉल्वरबियर' (WolverBear) एल्गोरिदम कहते हैं। यह विधि वॉल्वरिन (wolverine) की शिकार करने की प्रवृत्ति को जोड़ती है, जो लंबी दूरी तक शिकार का पीछा करने की अपनी क्षमता के लिए जाना जाता है, और एक भूरे भालू (brown bear) के भोजन खोजने के व्यवहार को, जो एक विशिष्ट क्षेत्र में भोजन खोजने में कुशल है। इन दो अलग-अलग पशु रणनीतियों की नकल करके, कंप्यूटर व्यापक रूप से नई संभावनाओं की खोज करना सीखता है और साथ ही सबसे आशाजनक समाधानों में गहराई तक खुदाई भी करता है, यह सुनिश्चित करता है कि वह किसी मृत अंत में फंसे बिना दृश्य को समझने का सबसे अच्छा तरीका खोज सके।

प्रक्रिया तब शुरू होती है जब सिस्टम डेटा का एक सिंक्रोनाइज़्ड जोड़ा प्राप्त करता है: एक दृश्य की छवि और उसके अनुरूप ऑडियो रिकॉर्डिंग। छवि को सबसे पहले दृश्य के भीतर प्रमुख वस्तुओं, जैसे कि लोग, फर्नीचर या प्राकृतिक तत्वों की पहचान करने के लिए विभाजित किया जाता है। इन वस्तुओं को फिर 'इवोल्यूशन ट्रांसफार्मर' में भेजा जाता है, जो इस ऑपरेशन का मस्तिष्क है, और जिसे 'वॉल्वरबियर' एल्गोरिदम द्वारा परिष्कृत किया गया है। यह परिष्कृत मस्तिष्क दृश्य पैटर्न का विश्लेषण करता है और दृश्य को वर्गीकृत करता है, यह तय करता है कि वह समुद्र तट है, जंगल है, कक्षा है, या रेस्तरां है। यह वर्गीकरण कहानी का अंत नहीं है; यह एक बड़े ढांचे के आधार या "नोड" (node) के रूप में कार्य करता है। साथ ही, सिस्टम रिकॉर्डिंग से ऑडियो को प्रोसेस करता है, विशिष्ट ध्वनि पैटर्न निकालता है जो प्रकट करते हैं कि क्या हो रहा है। यह क्रियाओं की पहचान करने के लिए एक विशेष विजन-एंड-साउंड मॉडल का उपयोग करता है, जैसे कि किसी का बात करना, कार का चलना, या पक्षियों का चहचहाना। इन क्रियाओं को वस्तुओं के बीच संबंधों का वर्णन करने वाले "एजेस" (edges) के रूप में माना जाता है।

वर्गीकृत दृश्य को पहचाने गए कार्यों के साथ जोड़कर, सिस्टम एक 'सीन ग्राफ' (scene graph) का निर्माण करता है। यह एक संरचित प्रतिनिधित्व है जहाँ वस्तुएं बिंदु हैं और क्रियाएं उन्हें जोड़ने वाली रेखाएं हैं, जो वातावरण की एक पूर्ण तस्वीर बनाती हैं। उदाहरण के लिए, एक कक्षा में, सिस्टम केवल एक व्यक्ति और एक कुर्सी को नहीं देखता; बल्कि वह समझता है कि व्यक्ति कुर्सी पर बैठा है जबकि शिक्षक बोल रहे हैं। यह ग्राफ मशीन को दृश्य के बारे में उस तरह से तर्क करने की अनुमति देता है जो पहले कृत्रिम बुद्धिमत्ता के लिए कठिन था। शोधकर्ताओं ने अपने इस ढांचे का परीक्षण आठ अलग-अलग वातावरणों, जिनमें समुद्र तट, शहर, जंगल और किराना स्टोर शामिल हैं, के चित्रों और ध्वनियों वाले डेटासेट पर किया। उन्होंने अपने नए तरीके की तुलना कई मौजूदा अत्याधुनिक तकनीकों के विरुद्ध की जो एकल प्रकार के डेटा या पुराने अनुकूलन विधियों पर निर्भर करती हैं। परिणामों ने उनके दृष्टिकोण के लिए स्पष्ट लाभ दिखाया।

नए सिस्टम के प्रदर्शन को इस बात से मापा गया कि वह सही दृश्य की कितनी सटीक पहचान कर सकता है और वह दूसरों से खुद को कितनी अच्छी तरह अलग कर सकता है। परीक्षणों में, वॉल्वरबियर-अनुकूलित सिस्टम ने 97.368% की समग्र सटीकता प्राप्त की। इसने सकारात्मक उदाहरणों को, जैसे कि समुद्र तट के दृश्य के उपस्थित होने पर, 98.146% बार सही ढंग से पहचाना। इसने गलत दृश्यों को खारिज करने में भी उच्च प्रभावी प्रदर्शन किया, 96.579% की 'ट्रू नेगेटिव रेट' हासिल की। ये संख्याएं प्रतिस्पर्धी विधियों की तुलना में लगातार अधिक थीं, जो जटिल प्रकाश व्यवस्था, अवरोधों (occlusions) और ध्वनि एवं दृष्टि के एकीकरण के साथ संघर्ष करती थीं। अध्ययन बताता है कि नए पैटर्न की व्यापक खोज और सर्वश्रेष्ठ पैटर्न के केंद्रित परिशोधन के बीच संतुलन बनाकर, सिस्टम अधिक मजबूत विशेषताएं सीखता है। यह इसे पिछले मॉडलों की तुलना में वास्तविक दुनिया के अव्यवस्थित और अप्रत्याशित स्वभाव को बेहतर ढंग से संभालने की अनुमति देता है।

इन मजबूत परिणामों के बावजूद, शोधकर्ता अपने कार्य की सीमाओं को नोट करने में सावधानी बरतते हैं। प्रयोग एक विशिष्ट डेटासेट पर किए गए थे, और हालांकि परिणाम आशाजनक हैं, सिस्टम का अभी तक वास्तविक दुनिया की पूर्ण और अराजक विविधता पर परीक्षण नहीं किया गया है। वर्तमान मॉडल वस्तुओं के जोड़ों के बीच के संबंधों पर ध्यान केंद्रित करता है और अभी तक कई चलते हुए हिस्सों वाले जटिल इंटरैक्शन को पूरी तरह से कैप्चर नहीं कर पाता है। इसके अतिरिक्त, प्रशिक्षण प्रक्रिया को अनुकूलित करने का अतिरिक्त चरण कम्प्यूटेशनल लागत की एक परत जोड़ता है, जो इसे रोबोट या स्मार्टफोन जैसे छोटे, बैटरी से चलने वाले उपकरणों पर चलाना कठिन बना सकता है। लेखक स्वीकार करते हैं कि व्यापक उपयोग के लिए सिस्टम को वास्तव में तैयार होने के लिए, इसे बड़े, अधिक विविध डेटासेट पर परीक्षण करने और अधिक कुशल बनाने की आवश्यकता होगी। फिर भी, यह अध्ययन मशीनों को दुनिया को एक एकीकृत, गतिशील स्थान के रूप में देखने और सुनने में सिखाने की दिशा में एक महत्वपूर्ण कदम प्रदान करता है, जो सरल पहचान से परे वास्तविक समझ की ओर बढ़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →