💻 computer science

Nexus: Native Mesh Generation with Diffusion

नेक्सस (Nexus) एक नवीन डिफ्यूजन-आधारित फ्रेमवर्क है जो ऑक्ट्री-आधारित स्पार्स वोक्सेल्स के माध्यम से कोर्स-टू-फाइन (coarse-to-fine) वर्टेक्स जनरेशन और निरंतर प्रति-वर्टेक्स एम्बेडिंग्स का उपयोग करके ग्लोबल टोपोलॉजी रिकवरी के माध्यम से इस प्रक्रिया को अलग करके उच्च-गुणवत्ता वाले 3D मेश जेनरेट करता है, जिससे यह गुणवत्ता और मजबूती दोनों में पारंपरिक ऑटोरेग्रेसिव विधियों से बेहतर प्रदर्शन करता है।

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao2026-07-16
💻 computer science

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets

यह शोध पत्र UniPhysGen को प्रस्तुत करता है, जो एक एकीकृत ढांचा और मॉडल है जो आर्टिकुलेशन सिमेंटिक्स (articulation semantics) और अंतर्निहित भौतिक गुणों पर संयुक्त रूप से तर्क करने द्वारा कच्चे 3D एसेट्स को स्वचालित रूप से सिमुलेशन-तैयार वस्तुओं में बदल देता है, जिसे एक नए बड़े पैमाने के डेटासेट और बेंचमार्क द्वारा समर्थित किया गया है।

Xian Li, Rong Wei, Lujie Yang, Haolin Huang, Junyuan Fang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li2026-07-16
🤖 AI

Semantic Anchoring for Robotic Action Representations

यह शोध पत्र एक प्लग-एंड-प्ले विधि पेश करके फाइन-ट्यूनिंग के दौरान विजन-लैंग्वेज-एक्शन मॉडल्स में सिमेंटिक संरचना के क्षरण को संबोधित करता है, जो तैनात मॉडल को बदले बिना इन-डिस्ट्रीब्यूशन टास्क सफलता और आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण दोनों में महत्वपूर्ण सुधार करता है।

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang2026-07-16
⚡ electrical engineering

Video to All-in-focus Image Reconstruction Algorithm for Automated Microscopic Urinalysis

यह शोध पत्र एक स्वचालित सूक्ष्म मूत्र विश्लेषण पाइपलाइन का प्रस्ताव करता है जो मूत्र अवक्षेपों (urine sediments) के कुशल डीप लर्निंग-आधारित पता लगाने और वर्गीकरण को सक्षम करने के लिए लघु, मैन्युअल रूप से केंद्रित वीडियो से 'ऑल-इन-फोकस' छवियों का पुनर्निर्माण करता है, जिससे कई अलग-अलग फोकल-प्लेन छवियों को कैप्चर करने की समय लेने वाली प्रक्रिया समाप्त हो जाती है।

Chinmay Nema, Hari Om Aggrawal, Dipam Goswami, Rajiv Gupta, Vinti Agarwal2026-07-16
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 एक 0.8B एंड-टू-एंड डॉक्यूमेंट पार्सिंग मॉडल है जो दस्तावेज़ पृष्ठों के सीधे मार्कडाउन निरूपण (Markdown representations) उत्पन्न करने के लिए एक नवीन डेटा इंजन और सुदृढीकरण शिक्षण (reinforcement learning) एवं डिस्टिलेशन (distillation) से युक्त एक बहु-चरणीय प्रशिक्षण रेसिपी का लाभ उठाकर बेंचमार्क डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li (…)2026-07-16
💻 computer science

From Surface Forecasting to Observability Forecasting: A Latent World Model for Cloud-Aware EO Monitoring

यह शोध पत्र LeWorldModel को प्रस्तुत करता है, जो पृथ्वी अवलोकन (Earth Observation) के लिए अनुकूलित एक लेटेंट वर्ल्ड मॉडल है, जो क्लाउड कवर के पूर्वानुमान और भविष्य के उपयोगी उपग्रह अधिग्रहण के समय की भविष्यवाणी करने में पर्सिस्टेंस (persistence) और लाइटजीबीएम (LightGBM) बेसलाइन से काफी बेहतर प्रदर्शन करने के लिए मल्टीस्पेक्ट्रल इमेजरी और मौसम संबंधी डेटा का लाभ उठाता है।

Mohanad Albughdadi2026-07-16
💻 computer science

Fine-grained CLIP fine-tuning with self-annotated region alignment

यह शोध पत्र SFF-CLIP का प्रस्ताव करता है, जो एक फाइन-ट्यूनिंग विधि है जो केवल इमेज-टेक्स्ट पेयर्स के माध्यम से एक रन-टाइम रीजन-फ्रेज अलाइनमेंट स्कीम का उपयोग करके CLIP के फाइन-ग्रेन्ड डेंस फीचर रिप्रेजेंटेशन को बेहतर बनाता है, जिससे अतिरिक्त रीजन एनोटेशन्स की आवश्यकता के बिना मॉडल की मूल ग्लोबल विजुअल-सिमेंटिक क्षमताओं को संरक्षित किया जा सके।

Chenyang Zhao, Wei Lin, Antoni B. Chan, Janet H. Hsiao2026-07-16
💻 computer science

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

POLY-SIM 2026 चुनौती एक मानकीकृत मूल्यांकन ढांचे के माध्यम से लुप्त ऑडियो-विजुअल मोडैलिटी और बहुभाषी परिवर्तनशीलता जैसी वास्तविक दुनिया की चुनौतियों को संबोधित करके सुदृढ़ मल्टीमॉडल स्पीकर पहचान को उन्नत करने का लक्ष्य रखती है।

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yassin Terraf, Yufan (…)2026-07-16
💻 computer science

Towards Spatial Supersensing in the Wild

यह शोध पत्र VSI-Super-Wild को प्रस्तुत करता है, जो वास्तविक दुनिया के लंबे वीडियो का एक बड़े पैमाने का बेंचमार्क है जिसे स्थानिक सुपरसेंसिंग क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मल्टीमॉडल मॉडल स्थानिक पतन (spatial collapse) और अपर्याप्त अपडेट जैसी समस्याओं के कारण समय के साथ सुसंगत विश्व-अवस्था ट्रैकिंग बनाए रखने में मौलिक रूप से विफल रहते हैं।

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei (…)2026-07-16
💻 computer science

Calibrated Closed-Form Uncertainty for Radiative Gaussian Splatting in Sparse-View CT

यह शोध पत्र स्पार्स-व्यू सीटी (sparse-view CT) में रेडिएटिव गॉसियन स्प्लेटिंग (radiative Gaussian splatting) के लिए एक क्लोज्ड-फॉर्म, कैलिब्रेटेड अनसर्टेंटी एस्टीमेशन (uncertainty estimation) विधि प्रस्तुत करता है जो एक्स-रे प्रोजेक्शन की रैखिकता का लाभ उठाकर एक सिंगल फॉरवर्ड पास में सटीक प्रेडिक्टिव वेरिएंस (predictive variance) प्रदान करता है, जो एन्सेम्बल-आधारित ह्यूरिस्टिक्स (ensemble-based heuristics) की तुलना में बेहतर एरर रैंकिंग और कैलिब्रेशन प्रदर्शित करता है और सिद्धांतों पर आधारित व्यू एक्विजिशन (view acquisition) एवं डोज़-एडेप्टिव स्टॉपिंग रणनीतियों (dose-adaptive stopping strategies) को सक्षम बनाता है।

Chulin Zhao, Yiran Xu, Shu Liu2026-07-16