🤖 machine learning

Multi-modal Rail Crossing Safety Analysis

यह शोध पत्र एक मल्टी-मोडल एआई पाइपलाइन का प्रस्ताव करता है जो रेलवे क्रॉसिंग की छवियों से प्राप्त दृश्य डेटा को संरचित दुर्घटना इतिहास के साथ जोड़कर सुरक्षा स्कोर का मजबूती से अनुमान लगाने और जोखिम स्तरों को वर्गीकृत करने के लिए डिज़ाइन किया गया है, जो ऐसा प्रदर्शन प्राप्त करता है जो फेडरल रेलरोड एडमिनिस्ट्रेशन के मानकों और विशेषज्ञ मूल्यांकनों के अनुरूप है।

Paimon Goulart, Chansong Lim, Nícolas Roque dos Santos, Yue Dong, Sheldon Peterson, Jia Chen, Evangelos E. Papalexakis2026-07-03
💻 computer science

Computer Vision for Wildlife Monitoring: Detecting Brown Howler Monkeys using YOLO

यह अध्ययन कैनोपी ब्रिज पर भूरे रंग के हाउलर बंदरों की निगरानी की चुनौती को संबोधित करने के लिए YOLOv10 फ्रेमवर्क का उपयोग करके एक स्वचालित पहचान प्रणाली विकसित करता है, जो सटीकता में सुधार करने और संरक्षणवादियों पर मैन्युअल समीक्षा के बोझ को कम करने के लिए सहायक डेटा का लाभ उठाता है।

Gabriel Ferri Schneider, Guido Luis Glufke Mainardi, Paulo Ricardo Knob, Patrícia Dias, Márcia Jardim, Júlio César Bicca (…)2026-07-03
💻 computer science

Beyond Heatmaps: Unsupervised Concept-Graph Reasoning for Interpretable Visual Explanation

यह शोध पत्र ग्राफ-आधारित कॉन्सेप्ट बॉटलनेक मॉडल (G-CBM) प्रस्तुत करता है, जो एक अनसुपरवाइज्ड फ्रेमवर्क है जो नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन के माध्यम से कॉन्सेप्ट्स की खोज और ग्राउंडिंग करता है, उन्हें ग्राफ अटेंशन नेटवर्क के साथ रीजनिंग के लिए प्रति-छवि ग्राफ में नोड्स के रूप में निरूपित करता है, और बिना किसी पूर्व-निर्धारित शब्दावली या बाहरी एनोटेशन की आवश्यकता के मेडिकल इमेजिंग बेंचमार्क पर उत्कृष्ट व्याख्यात्मकता और भविष्य कहनेवाला प्रदर्शन प्राप्त करता है।

Md Mohasin Hossain (German Research Center for Artificial Intelligence, Saarland University, Saarbrücken, Germany), Anar (…)2026-07-03
💻 computer science

How Much Future Helps? A Controlled Study of Future-Privileged Supervision for Causal Egocentric Gaze Estimation

यह शोध पत्र एक नियंत्रित ढांचे को प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि भविष्य का संदर्भ (future context) कारणत्मक इगोसेंट्रिक गेज़ अनुमान (causal egocentric gaze estimation) में महत्वपूर्ण सुधार करता है, अनुकूल प्रशिक्षण लुक-अहेड (optimal training look-ahead) लंबी क्षितिज सीमाओं के साथ निरंतर रूप से बढ़ने के बजाय सीमित (लगभग 1.7–3.3 सेकंड) है।

Jia Li, Wenjie Zhao, Fnu Atisri, Sanskriti Aripineni, Shijian Deng, Jon E. Froehlich, Yuhang Zhao, Yapeng Tian2026-07-03
💻 computer science

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

यह शोध पत्र एक लागत-सचेत (cost-aware), युग्मित ऑडिटिंग प्रोटोकॉल प्रस्तुत करता है जो सटीकता और अनुमान लागत (inference cost) का संयुक्त रूप से मूल्यांकन करता है ताकि यह प्रकट किया जा सके कि डायनेमिक-SAGE फ्रेमवर्क, जो एजेंटिक VideoQA के लिए मिश्रित उपकरणों (composite tools) को संश्लेषित करता है, सटीकता में महत्वपूर्ण सुधार करता है और रीजनिंग टर्न्स को कम करता है, जबकि टोकन उपयोग और समग्र लागत को बढ़ाता है, जो स्केलर मेट्रिक्स के बजाय बहु-अक्षीय मूल्यांकन की आवश्यकता को प्रदर्शित करता है।

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban2026-07-03
💻 computer science

MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting

MVFusion-GS गतिशील-स्थिर पृथक्करण के लिए एक मोशन-वेरिएंस गाइडेड रिफाइनमेंट मैकेनिज्म और स्थानीय गति निर्भरताओं को मॉडल करने के लिए एक MotionFormer टेम्पोरल अटेंशन मॉड्यूल पेश करके डायनेमिक 3D गॉसियन स्प्लेटिंग को बढ़ाता है, जिससे डायनेमिक सीन रिकंस्ट्रक्शन और डिस्ट्रैक्टर-मुक्त परिदृश्यों दोनों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jianwei Hu, Tingxuan Huang, Hengyu Zhou, Ningna Wang, Xiaohu Guo Jinshan Lai, Bin Wang2026-07-03
💻 computer science

Online Segment 3D Gaussians via Launching Virtual Drones

यह शोध पत्र SAGO को प्रस्तुत करता है, जो एक नवीन सेटअप-मुक्त फ्रेमवर्क है जो वर्चुअल ड्रोन का उपयोग करके कार्य को एक ऑनलाइन नेक्स्ट-बेस्ट-व्यू प्लानिंग समस्या के रूप में पुनर्गठित करके, मौजूदा विधियों के लिए आवश्यक समय लेने वाले प्रति-दृश्य सेटअप को समाप्त करता है और सब-सेकंड लेटेंसी के साथ रीयल-टाइम इंटरैक्टिव 3D गॉसियन सेगमेंटेशन सक्षम करता है।

Liwei Liao, Rongjie Wang, Ronggang Wang2026-07-03
💻 computer science

Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images

यह शोधपत्र COVScene का प्रस्ताव करता है, जो एक पोज़-फ्री (pose-free) फ्रेमवर्क है जो बिना बाहरी कैमरा अंशांकन (external camera calibration) के, अनपोज़्ड छवियों (unposed images) से व्यापक ओपन-वोकैबुलरी सीन अंडरस्टैंडिंग प्राप्त करने के लिए डिफरेंशिएबल वॉल्यूमेट्रिक लिफ्टिंग के माध्यम से 3D गौसियंस और सिमेंटिक ऑक्यूपेंसी को जोड़ता है।

Hu Zhu, Bohan Li, Xianda Guo, Yanlun Peng, Zheng Zhu, Xin Jin, Wenjun Zeng, Chang Wen Chen2026-07-03
💻 computer science

HistoSeg++: Delving deeper with attention and multiscale feature fusion for biomarker segmentation

HistoSeg++ एक नवीन Nested-UNet आर्किटेक्चर है जो मल्टीस्केल फीचर फ्यूजन और बाउंड्री सटीकता को सुधारने के लिए इनर और आउटर अटेंशन यूनिट्स, फीचर रीकैलिब्रेशन के लिए स्क्वीज़-एंड-एक्सिटेशन मॉड्यूल्स, और एक एज-अवेयर लॉस फंक्शन को एकीकृत करके बायोमार्कर सेगमेंटेशन प्रदर्शन और सामान्यीकरण (जनरलाइजेशन) को बढ़ाता है।

Saad Wazir, Rao Faizan, Daeyoung Kim2026-07-03
💻 computer science

Structure-Aware Gaussian Splatting for Large-Scale Scene Reconstruction

यह शोध पत्र SIG का प्रस्ताव करता है, जो बड़े पैमाने पर 3D गॉसियन स्प्लेटिंग के लिए एक नवीन संरचना-जागरूक ढांचा है, जो अनियंत्रित घनत्व वृद्धि को समाप्त करने और अत्याधुनिक दक्षता एवं रेंडरिंग गुणवत्ता प्राप्त करने के लिए अनुकूली शेड्यूलिंग और गोलाकार-प्रतिबंधित अनुकूलन के माध्यम से छवि पर्यवेक्षण को गॉसियन आवृत्तियों के साथ सिंक्रोनाइज़ करता है।

Weiyi Xue, Fan Lu, Chi Zhang, Tianhang Wang, Sanqing Qu, Zehan Zheng, Boyuan Zheng, Junqiao Zhao, Guang Chen2026-07-03