🤖 AI

Temporal Preservation over Processing: Diagnosing and Designing Spatiotemporal Single-Stage Video Detectors

यह शोधपत्र TemporalLens प्रस्तुत करता है, जो एक नैदानिक ढांचा (diagnostic framework) है जो यह प्रकट करता है कि क्या सिंगल-स्टेज वीडियो डिटेक्टर वास्तव में टेम्पोरल कॉन्टेक्स्ट का उपयोग करते हैं या वे एकल फ्रेम पर निर्भर रहते हैं, और YOLO-3D प्रस्तावित करता है, जो एक रियल-टाइम आर्किटेक्चर है जो बैकबोन के माध्यम से टेम्पोरल डेप्थ को संरक्षित करके प्रदर्शन में महत्वपूर्ण सुधार करता है।

Karam Tomotaki-Dawoud, Anna Hilsmann, Peter Eisert, Sebastian Bosse2026-07-01
💻 computer science

Towards a foundational model for recognising diastematic Gregorian notation

यह शोध पत्र चार पूर्व में विलगित डेटासेट को एक सामान्य S-GABC एन्कोडिंग में एकीकृत करके डायस्टेमैटिक ग्रेगोरियन नोटेशन को पहचानने के लिए एक मौलिक मॉडल प्रस्तावित करता है, जिससे उन सभी में एक नया अत्याधुनिक मानक (state of the art) स्थापित होता है।

Daniel Kurek, Jan Hajič jr2026-07-01
🤖 AI

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक स्वायत्त अनुसंधान एजेंट है जो मूल कारणों का निदान करने और जमीनी रिपोर्टिंग (grounded reporting) को लागू करने के लिए एक संरचित मल्टी-हाइपोथेसिस विफलता एट्रिब्यूशन तंत्र का उपयोग करके एकल-प्रतिबिंब विफलता रिकवरी की भंगुरता पर विजय प्राप्त करता है, जिससे मौजूदा बेसलाइन की तुलना में वैज्ञानिक आर्टिफ़ैक्ट्स की विश्वसनीयता और गुणवत्ता में महत्वपूर्ण सुधार होता है।

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji2026-07-01
💻 computer science

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

ड्राइविंगडेप्थ (DrivingDepth) स्वायत्त ड्राइविंग गहराई अनुमान के लिए एक नवीन ढांचे का प्रस्ताव करता है जो स्पार्स (sparse) LiDAR डेटा का उपयोग केवल प्रॉम्प्ट के रूप में प्रति-पिक्सेल स्केल सुधार सीखने के लिए करके फाउंडेशन मॉडल्स की ज्यामितीय सुसंगतता को बनाए रखता है, जिससे गहराई को शून्य से पुन: उत्पन्न किए बिना अत्याधुनिक मीट्रिक सटीकता और संरचनात्मक निरंतरता प्राप्त होती है।

Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang2026-07-01
💻 computer science

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL एक नवीन ढांचा है जो प्राकृतिक भाषा प्रश्नों से 3D मेश पर सूक्ष्म ज्यामितीय संस्थाओं को स्थानीयकृत करने के लिए एक प्रॉम्प्ट-कंडीशन्ड व्यू सिलेक्शन रणनीति का लाभ उठाता है, जो व्यूपॉइंट संवेदनशीलता और ऑक्लूजन चुनौतियों को संबोधित करके मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।

Kartik Bali, Roland Aydin2026-07-01
💻 computer science

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver एक स्व-विकसित (self-evolving) मल्टी-एजेंट फ्रेमवर्क है जो टेक्स्ट-समृद्ध इमेज डेटासेट को पुनरावृत्ति के माध्यम से परिष्कृत करने के लिए अस्वीकृत डेटा नमूनों को कार्रवाई योग्य फीडबैक में बदल देता है, जो OCR सटीकता और टेक्स्ट रेंडरिंग गुणवत्ता दोनों में स्थिर डेटा पाइपलाइनों की तुलना में काफी बेहतर प्रदर्शन करता है।

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang2026-07-01
🤖 machine learning

Localized Conformal Prediction for Image Classification with Vision-Language Models

यह शोध पत्र विज़न-लैंग्वेज मॉडल्स के साथ इमेज क्लासिफिकेशन के लिए एक लोकलाइज्ड कॉन्फॉर्मल प्रेडिक्शन फ्रेमवर्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जहाँ रॉ कोसाइन सिमिलरिटी (raw cosine similarity) नॉन-लोकल बेसलाइन्स से बेहतर प्रदर्शन करने में विफल रहती है, वहीं इन सिमिलरिटीज का एक प्रस्तावित सरल नॉन-लीनियर ट्रांसफॉर्मेशन मार्जिनल कवरेज गारंटी बनाए रखते हुए प्रेडिक्शन सेट के आकार को महत्वपूर्ण रूप से कम कर देता है।

Clément Fuchs, Tim Bary, Benoît Macq2026-07-01
🤖 AI

DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers

यह शोध पत्र यह पहचान करता है कि रोटेशन (घूर्णन) और ट्रांसलेशन (स्थानांतरण) को वैल्यू वेक्टर्स के समान आयामों में संग्रहीत करने से स्केल्ड-अप मल्टी-व्यू ट्रांसफॉर्मर्स में प्रशिक्षण ठहराव (ट्रेनिंग स्टैग्नेशन) होता है, और इन घटकों को स्पष्ट रूप से अलग करने के लिए डिकपल्ड पोज पोजिशनल एनकोडिंग (DPPE) का प्रस्ताव करता है, जिससे नवीन दृश्य संश्लेषण (नोवेल व्यू सिंथेसिस) कार्यों में स्थिर दीर्घकालिक प्रशिक्षण और बेहतर सामान्यीकरण सक्षम होता है।

Shun Kenney, Teppei Suzuki2026-07-01
💻 computer science

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

यह शोध पत्र एक डिकपल्ड (decoupled), मल्टी-व्हीकल लैंडिंग फ्रेमवर्क प्रस्तावित करता है जो उच्च-सटीकता वाले समुद्री सिमुलेशन में लहरों के प्रभाव को कम करते हुए 100% सफलता दर के साथ मजबूत, वेव-कंपनसेटेड (wave-compensated) स्वायत्त लैंडिंग प्राप्त करने के लिए ड्यूल डीप रिइन्फोर्समेंट लर्निंग एजेंटों का उपयोग करके एक USV-माउंटेड 3-RPU स्टेबलाइज्ड प्लेटफॉर्म को एक UAV के साथ सिंक्रोनाइज़ करता है।

Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho, Andry M. Pinto2026-07-01
💻 computer science

LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization

LiteMatch एक हल्का, ज़ीरो-शॉट स्टीरियो मैचिंग फ्रेमवर्क है जो ग्लोबल और हाई-फ्रीक्वेंसी फीचर्स के लिए पूरक एनकोडर्स, कॉस्ट वॉल्यूम कंसिस्टेंसी लॉस का उपयोग करके कॉस्ट डिस्ट्रीब्यूशन को स्थिर करने, और एक हल्के रिफाइनमेंट मॉड्यूल का उपयोग करके, महंगे 3D कनवल्शन के बिना मजबूत क्रॉस-डोमेन जनरलाइजेशन और उच्च सटीकता प्राप्त करता है।

Md Raqib Khan, Santosh Kumar Vipparthi, Subrahmanyam Murala2026-07-01