🤖 AI

Barnamala: Parameter-Efficient Handwritten Devanagari Recognition at Benchmark Saturation

यह शोध पत्र 'बर्णमाला' (Barnamala) का परिचय देता है, जो एक अत्यंत सघन 1.11M-पैरामीटर वाला कनवोल्यूशनल नेटवर्क है, जो हस्तलिखित देवनागरी पहचान पर 99.73% की अत्याधुनिक सटीकता प्राप्त करता है, और प्रभावी रूप से प्रदर्शन संतृप्ति (performance saturation) तक पहुँचता है जहाँ यह काफी बड़े मॉडलों के बराबर या उनसे बेहतर प्रदर्शन करता है और साथ ही उत्कृष्ट सुदृढ़ता और अंतरणीयता (transferability) प्रदर्शित करता है।

Ashish Thapa, Samrat Karki2026-07-16
💻 computer science

Towards a Modular Bin-picking Framework for Handling Object Pose Uncertainties

यह शोध पत्र एक नवीन मॉड्यूलर फ्रेमवर्क प्रस्तुत करता है जो पोज़ डिस्ट्रीब्यूशन एस्टीमेशन, मल्टी-व्यू फ्यूजन और एरर कंपनसेशन मॉड्यूल के माध्यम से ऑब्जेक्ट पोज़ और ग्रैस्पिंग अनिश्चितताओं को संयुक्त रूप से संबोधित करता है, जो वास्तविक दुनिया के बिन-पिकिंग अनुप्रयोगों में बेहतर दक्षता और विश्वसनीयता प्रदर्शित करता है।

Frederik Hagelskjær2026-07-16
💻 computer science

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation

यह अध्ययन यह प्रदर्शित करने के लिए कि जहाँ संभावित नैदानिक संकेत (prospective clinical indications) प्रदर्शन में महत्वपूर्ण सुधार करते हैं, वहीं पोस्ट-हॉक रिपोर्ट टेक्स्ट (post-hoc report text) पर्याप्त लेबल लीकेज (label leakage) उत्पन्न करता है, और डीपसेट्स (DeepSets) एवं रैंडम-स्वैप (random-swap) जैसी परम्यूटेशन-जागरूक फ्यूजन रणनीतियाँ मानक फ्यूजन विधियों के प्रतिस्पर्धी और सुव्यवस्थित विकल्प प्रदान करती हैं, पेशेंट-क्लस्टर्ड बूटस्ट्रैपिंग (patient-clustered bootstrapping) का उपयोग करके मल्टी-मोडल चेस्ट रेडियोग्राफ वर्गीकरण का मूल्यांकन करता है।

Kamran Shahid, Muhammad Munwar Iqbal2026-07-16
⚡ electrical engineering

TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model

TCAM-Diff एक नवीन 3D मेडिकल इमेज जनरेशन मॉडल है जो ट्रिप्लेन प्रतिनिधित्व के लिए डिकोडर-ओनली ऑटोएनकोडर को ट्रिप्लेन-अवेयर क्रॉस-अटेंशन डिफ्यूजन मॉडल के साथ जोड़कर मेमोरी आवश्यकताओं को कम करता है, जिससे मौजूदा तरीकों की तुलना में विभिन्न मेडिकल डेटासेट्स पर बेहतर पुनर्निर्माण और जनरेशन गुणवत्ता प्राप्त होती है।

Zhenkai Zhang, Krista A. Ehinger, Tom Drummond2026-07-16
💻 computer science

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads

यह शोध पत्र एक नवीन रिकर्सिव (पुनरावर्ती) ArUco मार्कर डिज़ाइन प्रस्तावित करता है जो काले और सफेद बिट्स दोनों के भीतर पूर्ण मार्कर को एम्बेड करके असीमित पुनरावृत्ति गहराई और आंशिक अवरोध के तहत मजबूत पहचान सक्षम करता है, जिससे यह मौजूदा फ्रैक्टल और Harco मार्कर्स की सीमाओं को पार करते हुए मल्टी-ड्रोन UAV लैंडिंग संचालन के लिए एक स्केलेबल, अद्वितीय पहचानकर्ता प्रणाली प्रदान करता है।

Rafael Munoz-Salinas, Francisco Jose Romero-Ramirez, Sergio Garrido-Jurado2026-07-16
💻 computer science

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL मल्टीमॉडल सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन ढांचा है जो ऑपरेटर-कंडीशन्ड पर्यवेक्षण को आउटकम-कंडीशन्ड, सैंपल-वाइज संरेखण से बदलकर विजुअल ग्राउंडिंग को बढ़ाता है, जिसमें विविध बेंचमार्क पर बेहतर तर्क प्रदर्शन के लिए देखे गए रिवॉर्ड ड्रॉप्स के आधार पर हस्तक्षेपों को गतिशील रूप से रूट करने के लिए एक फ्रोजन ऑडिट पॉलिसी का उपयोग किया जाता है।

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yiron (…)2026-07-16
💻 computer science

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

यह शोध पत्र CF-Net प्रस्तुत करता है, जो एक गहरा मल्टीमॉडल नेटवर्क है जो अनकन्स्ट्रेंड (unconstrained) वीडियो में द्वंद्व (ambivalence) और हिचकिचाहट का पता लगाने के लिए स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने हेतु स्पीकर नॉर्मलाइजेशन, क्रॉस-मोडल विसंगति के लिए स्पष्ट संघर्ष संलयन (explicit conflict fusion), और निश्चितता-भारित प्रशिक्षण (certainty-weighted training) का लाभ उठाता है।

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh2026-07-16
💻 computer science

Screening Is Effective for Visual Recognition

यह शोधपत्र विजनस्क्रीन (VisionScreen) को प्रस्तुत करता है, जो एक नवीन विजन मॉडल है जो क्वेरी-की (query-key) समानता के आधार पर अप्रासंगिक इमेज पैचेस का स्वतंत्र रूप से मूल्यांकन और निष्कासन करके स्क्रीनिंग तंत्र को लैंग्वेज मॉडलिंग से विजुअल रिकग्निशन में अनुकूलित करता है, जिससे यह इमेज क्लासिफिकेशन बेंचमार्क पर पारंपरिक विजन ट्रांसफॉर्मर्स से बेहतर प्रदर्शन करता है।

Shunya Shimomura, Kazuhiro Hotta2026-07-16
⚡ electrical engineering

Traffic-Aware Pedestrian Intention Prediction

यह शोध पत्र एक ट्रैफिक-अवेयर स्पैटियो-टेम्पोरल ग्राफ कन्वोल्यूशनल नेटवर्क (TA-STGCN) प्रस्तावित करता है जो स्वायत्त वाहनों के लिए पैदल यात्री इरादा भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार करने हेतु गतिशील ट्रैफिक सिग्नल अवस्थाओं और बाउंडिंग बॉक्स विशेषताओं को एकीकृत करता है, जिससे PIE डेटासेट पर बेसलाइन मॉडल की तुलना में 4.75% की वृद्धि प्राप्त हुई है।

Fahimeh Orvati Nia, Hai Lin2026-07-15
⚡ electrical engineering

Recent Advances in Transformer and Large Language Models for UAV Applications

यह समीक्षा पत्र यूएवी (UAV) प्रणालियों में हालिया ट्रांसफॉर्मर-आधारित और लार्ज लैंग्वेज मॉडल की प्रगति को व्यवस्थित रूप से वर्गीकृत और मूल्यांकित करता है, जो शोधकर्ताओं और अभ्यासकर्ताओं को क्षेत्र में मार्गदर्शन करने के लिए एक एकीकृत वर्गीकरण, तुलनात्मक प्रदर्शन विश्लेषण, और चुनौतियों एवं भविष्य की दिशाओं का एक आलोचनात्मक मूल्यांकन प्रस्तुत करता है।

Hamza Kheddar, Yassine Habchi, Mohamed Chahine Ghanem, Mustapha Hemis, Dusit Niyato2026-07-15