💻 computer science

RoughNet: Mapping Arctic Sea Ice Roughness Using Diffusion-Based Super-Resolution of Satellite Imagery

यह शोध पत्र RoughNet को प्रस्तुत करता है, जो एक कंडीशनल डिफ्यूजन मॉडल है जो 10-मीटर सेंटिनल-2 उपग्रह इमेजरी से उच्च-रिज़ॉल्यूशन वाले आर्कटिक समुद्री बर्फ स्थलाकृति (topography) का पुनर्निर्माण करता है, जिससे 9 सेमी की सटीकता प्राप्त होती है और महंगी हवाई सर्वेक्षणों पर निर्भर रहे बिना जलवायु मॉडलिंग और सुरक्षित यात्रा के लिए स्केलेबल, सूक्ष्म-स्तरीय खुरदरापन अनुमान सक्षम होता है।

Tessa Cannon, Michel Tsamados, Petru Manescu, Thomas Newman, Christian Haas, Veit Helm, Weibin Chen, Randall Scharien2026-07-16
💻 computer science

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

यह शोध पत्र एंकर-अलाइन (Anchor-Align) का प्रस्ताव करता है, जो एक फाइनट्यूनिंग विधि है जो विजन-लैंग्वेज रिप्रेजेंटेशन एंकरिंग और लैंग्वेज-एक्शन अलाइनमेंट को जोड़ती है ताकि VLA पॉलिसियों में प्रीट्रेंड ज्ञान के ओवरराइट होने को रोका जा सके, जिससे विविध बेंचमार्क पर जनरलाइजेशन और रियल-रोबोट सफलता दर में महत्वपूर्ण सुधार होता है।

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana (…)2026-07-16
🤖 AI

Symbiosis-Inspired Knowledge Distillation for Incremental Object Detection

यह शोध पत्र सिम्बायोसिस-इंस्पायर्ड नॉलेज डिस्टिलेशन (SIKD) का प्रस्ताव करता है, जो एक नवीन विधि है जो इंक्रीमेंटल ऑब्जेक्ट डिटेक्शन के लिए है और जो साझा निरूपणों (shared representations) को संरक्षित करने और सिमेंटिक टोपोलॉजी को स्थिर करने के लिए स्थानिक और सिमेंटिक डिस्टिलेशन के माध्यम से ऑब्जेक्ट सिम्बायोसिस का स्पष्ट रूप से लाभ उठाकर कैटास्ट्रोफिक फॉरगेटिंग को कम करती है।

Mingyue Zeng, De Cheng, Zhipeng Xu, Huaijie Wang, Nannan Wang, Xinbo Gao2026-07-16
🤖 machine learning

HIVE-3D: Hierarchical Voxel Enhancement for High-Quality 3D Scene Generation

HIVE-3D एक पदानुक्रमित वोक्सेल संवर्धन ढांचे (hierarchical voxel enhancement framework) को पेश करता है जो 2D और 3D घटकों को एक पदानुक्रमित वृक्ष (hierarchical tree) में संरेखित करके और मोटे-से-सूक्ष्म परिशोधन (coarse-to-fine refinement) प्राप्त करने के लिए एक वोक्सेल सुपर-रिज़ॉल्यूशन मॉडल लागू करके एक एकल छवि से उच्च-गुणवत्ता वाले 3D दृश्य उत्पन्न करता है, जो मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Bin Zang, Wenting Zheng, Xiaoliang Luo, Zhiyuan Fang, Shi Li, Lvchun Wang, Wei Yu, Yi Zhao, Tian Xie, Yuchi Huo, Rengan (…)2026-07-16
⚡ electrical engineering

Bring Music The Horizon: Music-Driven 360^\circ Video Generation

यह शोध पत्र "ब्रिंग म्यूजिक द होराइजन" (Bring Music The Horizon) प्रस्तुत करता है, जो एक इमोशन-अवेयर पाइपलाइन है जो एक गीत के भावनात्मक प्रक्षेपवक्र (इमोशनल ट्रेजेक्टरी) की भविष्यवाणी करके और एक कालानुक्रमिक रूप से निरंतर, इमर्सिव अनुभव के लिए कीफ्रेम जनरेशन और वीडियो सिंथेसिस को निर्देशित करने के लिए इसका उपयोग करके इमर्सिव 360° म्यूजिक विज़ुअलाइज़ेशन वीडियो उत्पन्न करता है।

Kai Hsu Tsai, Yong Wei Fu, Hung I Yang, Yu-Chih Chen2026-07-16
💻 computer science

Nexus: Native Mesh Generation with Diffusion

नेक्सस (Nexus) एक नवीन डिफ्यूजन-आधारित फ्रेमवर्क है जो ऑक्ट्री-आधारित स्पार्स वोक्सेल्स के माध्यम से कोर्स-टू-फाइन (coarse-to-fine) वर्टेक्स जनरेशन और निरंतर प्रति-वर्टेक्स एम्बेडिंग्स का उपयोग करके ग्लोबल टोपोलॉजी रिकवरी के माध्यम से इस प्रक्रिया को अलग करके उच्च-गुणवत्ता वाले 3D मेश जेनरेट करता है, जिससे यह गुणवत्ता और मजबूती दोनों में पारंपरिक ऑटोरेग्रेसिव विधियों से बेहतर प्रदर्शन करता है।

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao2026-07-16
💻 computer science

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets

यह शोध पत्र UniPhysGen को प्रस्तुत करता है, जो एक एकीकृत ढांचा और मॉडल है जो आर्टिकुलेशन सिमेंटिक्स (articulation semantics) और अंतर्निहित भौतिक गुणों पर संयुक्त रूप से तर्क करने द्वारा कच्चे 3D एसेट्स को स्वचालित रूप से सिमुलेशन-तैयार वस्तुओं में बदल देता है, जिसे एक नए बड़े पैमाने के डेटासेट और बेंचमार्क द्वारा समर्थित किया गया है।

Xian Li, Rong Wei, Lujie Yang, Haolin Huang, Junyuan Fang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li2026-07-16
🤖 AI

Semantic Anchoring for Robotic Action Representations

यह शोध पत्र एक प्लग-एंड-प्ले विधि पेश करके फाइन-ट्यूनिंग के दौरान विजन-लैंग्वेज-एक्शन मॉडल्स में सिमेंटिक संरचना के क्षरण को संबोधित करता है, जो तैनात मॉडल को बदले बिना इन-डिस्ट्रीब्यूशन टास्क सफलता और आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण दोनों में महत्वपूर्ण सुधार करता है।

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang2026-07-16
⚡ electrical engineering

Video to All-in-focus Image Reconstruction Algorithm for Automated Microscopic Urinalysis

यह शोध पत्र एक स्वचालित सूक्ष्म मूत्र विश्लेषण पाइपलाइन का प्रस्ताव करता है जो मूत्र अवक्षेपों (urine sediments) के कुशल डीप लर्निंग-आधारित पता लगाने और वर्गीकरण को सक्षम करने के लिए लघु, मैन्युअल रूप से केंद्रित वीडियो से 'ऑल-इन-फोकस' छवियों का पुनर्निर्माण करता है, जिससे कई अलग-अलग फोकल-प्लेन छवियों को कैप्चर करने की समय लेने वाली प्रक्रिया समाप्त हो जाती है।

Chinmay Nema, Hari Om Aggrawal, Dipam Goswami, Rajiv Gupta, Vinti Agarwal2026-07-16
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 एक 0.8B एंड-टू-एंड डॉक्यूमेंट पार्सिंग मॉडल है जो दस्तावेज़ पृष्ठों के सीधे मार्कडाउन निरूपण (Markdown representations) उत्पन्न करने के लिए एक नवीन डेटा इंजन और सुदृढीकरण शिक्षण (reinforcement learning) एवं डिस्टिलेशन (distillation) से युक्त एक बहु-चरणीय प्रशिक्षण रेसिपी का लाभ उठाकर बेंचमार्क डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li (…)2026-07-16