💻 computer science

UniVR: Thinking in Visual Space for Unified Visual Reasoning

यह शोध पत्र UniVR प्रस्तुत करता है, जो एक नवीन ढांचा है जो सीधे कच्चे विजुअल डेटा से एकीकृत दृश्य तर्क (visual reasoning), भौतिक गतिशीलता (physical dynamics) की समझ और दीर्घकालिक योजना (long-term planning) को सक्षम करने के लिए VR-GRPO सुदृढीकरण शिक्षण (reinforcement learning) प्रतिमान का लाभ उठाता है, जिससे टेक्स्ट या कार्य-विशिष्ट ह्यूरिस्टिक्स पर निर्भर किए बिना नवनिर्मित VR-X बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin2026-07-15
💻 computer science

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

यह शोध पत्र विजुअल प्लेस रिकग्निशन ऑडिटिंग (Visual Place Recognition Auditing) प्रस्तुत करता है, जो एक नवीन ढांचा है जो संयुक्त तर्क के माध्यम से पुनर्प्राप्त छवि मिलानों को स्वतंत्र रूप से सत्यापित करने के लिए विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे निश्चित थ्रेशोल्ड या पर्यावरण-विशिष्ट ग्राउंड ट्रुथ पर निर्भर किए बिना रिकॉल में उल्लेखनीय सुधार होता है और फॉल्स एक्सेप्टेंस रेट में कमी आती है।

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan2026-07-15
💻 computer science

Statistical Non-linear Reconstruction Loss for Image Anomaly Detection

यह शोध पत्र एक सांख्यिकीय नॉन-लीनियर रिकंस्ट्रक्शन लॉस (Statistical Non-linear Reconstruction Loss) प्रस्तावित करता है जो रिकंस्ट्रक्शन-आधारित विसंगति का पता लगाने (anomaly detection) में आउटलियर लीकेज को दबाने के लिए सिग्मॉइड-आधारित स्क्वैशिंग फंक्शन और एक सांख्यिकीय कैलिब्रेशन योजना का उपयोग करता है, जिससे MVTec-AD और VisA जैसे औद्योगिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Nguyen Minh Tri, Hoang Khuong Duy, Huynh Cong Viet Ngu2026-07-15
💻 computer science

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Open-KNEAD एक प्रशिक्षण-मुक्त (training-free), स्थानीय रूप से तैनात करने योग्य एजेंटिक फ्रेमवर्क है जो ऑडिट योग्य, आइटम-दर-आइटम पोषण रिकॉर्ड उत्पन्न करने के लिए चयनात्मक, पोषक तत्व-जागरूक रिट्रीवल का लाभ उठाता है और विशेष रूप से गैर-अमेरिकी व्यंजनों के लिए भाग अनुमानों (portion estimates) में महत्वपूर्ण सुधार करता है, जो उपयोगकर्ता गोपनीयता बनाए रखते हुए फ्रंटियर क्लोज्ड मॉडल्स के प्रत्यक्ष अनुमान और पूर्ववर्ती रिट्रीवल विधियों दोनों से बेहतर प्रदर्शन करता है।

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu2026-07-15
💻 computer science

Point Tracking in Surgery--The 2025 Surgical Tattoos in Infrared Challenge (STIRC2025)

यह शोध पत्र 2025 के सर्जिकल टैटूज़ इन इन्फ्रारेड चैलेंज (STIRC2025) के परिणामों और प्रतिभागी विधियों को प्रस्तुत करता है, जो MICCAI EndoVis 2025 में आयोजित किया गया था, जिसमें सेगमेंटेशन और 3D पुनर्निर्माण जैसे सर्जिकल अनुप्रयोगों को आगे बढ़ाने के लिए STIR डेटासेट का उपयोग करते हुए पॉइंट ट्रैकिंग सटीकता और अनुमान दक्षता पर सात टीमों का मूल्यांकन किया गया।

Adam Schmidt, Mert Asim Karaoglu, Zijian Wu, Jiaming Zhang, Yuxin Chen, Tim Salcudean, Ho-Gun Ha, Minkang Jang, Kyungmin (…)2026-07-15
💻 computer science

ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models

ViCo3D एक नवीन सहयोगात्मक 3D ऑब्जेक्ट डिटेक्शन फ्रेमवर्क है जो पॉइंट क्लाउड्स को DINOv2 फीचर एक्सट्रैक्शन के लिए BEV इमेजेस में प्रोजेक्ट करके LiDAR और विजन फाउंडेशन मॉडल्स के बीच मोडैलिटी गैप को पाटता है, जिससे फीचर-लेवल सहयोग को महत्वपूर्ण रूप से बढ़ाता है और V2X सिस्टम में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Jing Li, Lu Zhang, Jiajun Deng, Yanyong Zhang2026-07-15
💻 computer science

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

X-Lens एक कॉम्पैक्ट, रियल-टाइम फीड-फॉरवर्ड मॉडल है जो लर्नबल कैलिब्रेशन टोकन्स और एक जैकोबियन-पैरामीटराइज्ड डिस्टॉर्शन बायस का लाभ उठाकर विषम फिशआई और पिनहोल कैमरों से सुदृढ़ मेट्रिक डेप्थ एस्टीमेशन प्राप्त करता है, जिसे हाल ही में जारी किए गए एक बड़े पैमाने के सिंथेटिक डेटासेट, जिसे OmniScene कहा जाता है, पर प्रशिक्षित किया गया है।

Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui2026-07-15
🔭 astrophysics

XAMI -- A Benchmark Dataset for Artefact Detection in XMM-Newton Optical Images

यह शोध पत्र XAMI को प्रस्तुत करता है, जो 1,000 हस्त-चिह्नित (hand-annotated) XMM-Newton ऑप्टिकल मॉनिटरिंग छवियों का एक बेंचमार्क डेटासेट है, और खगोलीय अवलोकनों में प्रकाश-परावर्तन आर्टिफैक्ट्स (light-reflection artefacts) के स्वचालित पता लगाने और मास्किंग के लिए एक हाइब्रिड CNN-ट्रांसफॉर्मर इंस्टेंस सेगमेंटेशन विधि का प्रदर्शन करता है।

Julia Dima, Pablo Gómez, Sandor Kruk, Peter Kretschmar, Simon Rosen, Călin-Adrian Popa2026-07-14
🤖 AI

On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes

यह शोध पत्र पांच नए बेंचमार्क डेटासेट पेश करके और यह प्रदर्शित करके वीडियो एक्शन डिटेक्शन पर अवरोधों (occlusions) के प्रभाव की जांच करता है कि सिम्बोलिक घटकों और विशिष्ट प्रशिक्षण विधियों से उन्नत मॉडल स्थिर और गतिशील दोनों प्रकार के अवरोधों को संभालने में मौजूदा दृष्टिकोणों से काफी बेहतर प्रदर्शन करते हैं।

Rajat Modi, Vibhav Vineet, Yogesh Singh Rawat2026-07-14
🤖 AI

Asynchronous Perception Machine For Efficient Test-Time-Training

यह शोध पत्र एसिंक्रोनस परसेप्शन मशीन (APM) को प्रस्तुत करता है, जो टेस्ट-टाइम-ट्रेनिंग के लिए एक गणनात्मक रूप से कुशल आर्किटेक्चर है जो आउट-ऑफ-डिस्ट्रीब्यूशन डेटा को पहचानने और बिना किसी डेटासेट-विशिष्ट प्री-ट्रेनिंग या प्रिटैक्स्ट टास्क की आवश्यकता के, एक सिंगल फॉरवर्ड पास में सिमेंटिक क्लस्टरिंग उत्पन्न करने के लिए इमेज पैचेस को एसिंक्रोनस रूप से प्रोसेस करता है।

Rajat Modi, Yogesh Singh Rawat2026-07-14