💻 computer science

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

Sparse-LaViDa एक नवीन फ्रेमवर्क है जो विशेष रजिस्टर टोकन और एक सुसंगत प्रशिक्षण अटेंशन मास्क के माध्यम से जनरेशन की गुणवत्ता को बनाए रखते हुए, इन्फरेंस के दौरान अनावश्यक मास्क्ड टोकन को गतिशील रूप से ट्रंकेट करके मास्क्ड डिस्क्रीट डिफ्यूजन मॉडल्स को त्वरित करता है, जिससे विविध मल्टीमॉडल कार्यों में 2x तक की गति वृद्धि प्राप्त होती है।

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen2026-07-17
💻 computer science

CoDi -- an exemplar-conditioned diffusion model for low-shot counting

यह शोध पत्र CoDi को प्रस्तुत करता है, जो एक नवीन एक्सेम्पलर-कंडीशन्ड लेटेंट डिफ्यूजन मॉडल है जो एक विशेष कंडीशनिंग मॉड्यूल के माध्यम से उच्च-गुणवत्ता वाले डेंसिटी मैप्स उत्पन्न करके सटीक लोकलाइजेशन के लिए सघन, छोटे-ऑब्जेक्ट क्षेत्रों की चुनौतियों को प्रभावी ढंग से संबोधित करता है और लो-शॉट ऑब्जेक्ट काउंटिंग में मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।

Grega Šuštar, Jer Pelhan, Alan Lukežič, Matej Kristan2026-07-17
💻 computer science

Fundamental Recovery Bounds for SPAD Signals under Stationary Flux

यह शोध पत्र तीन परिचालन मोडों में लाइकलीहुड स्कोर फंक्शनों को व्युत्पन्न करके मौलिक क्रैमर-राओ बाउंड्स निर्धारित करने और उच्च-निष्ठा वाले डिफ्यूजन-आधारित पुनर्निर्माण को सक्षम करके सिंगल-फोटॉन एवलांच डायोड (SPAD) सिग्नल रिकवरी के लिए एक एकीकृत सैद्धांतिक और एल्गोरिद्मिक ढांचा स्थापित करता है, जो विशेष रूप से उच्च-फ्लक्स शासन (high-flux regimes) में पूर्ववर्ती पृथक दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Lior Dvir, Nadav Torem, Mohit Gupta, Yoav Y. Schechner2026-07-17
💻 computer science

AnyStyle: Single-Pass Multimodal Stylization for 3D Gaussian Splatting

AnyStyle एक फीड-फॉरवर्ड फ्रेमवर्क है जो मौजूदा बैकबोन में मल्टीमॉडल (टेक्स्टुअल और विजुअल) कंडीशनिंग को एकीकृत करके ज़ीरो-शॉट, पोज़-फ्री 3D गॉसियन स्प्लेटिंग पुनर्निर्माण और शैलीकरण को सक्षम बनाता है, जो ज्यामितीय गुणवत्ता को बनाए रखते हुए बेहतर स्टाइल नियंत्रणीयता प्रदान करता है।

Joanna Kaleta, Bartosz Świrta, Kacper Kania, Tomasz Trzciński, Przemysław Spurek, Marek Kowalski2026-07-17
🤖 AI

Quality-Aware Robust Multi-View Clustering for Heterogeneous Observation Noise

यह शोध पत्र क्वालिटी-अवेयर रोबस्ट मल्टी-व्यू क्लस्टरिंग (QARMVC) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो पुनर्निर्माण विसंगतियों (reconstruction discrepancies) के माध्यम से इंस्टेंस-स्तरीय डेटा गुणवत्ता को मात्रात्मक रूप से निर्धारित करके विषम अवलोकन शोर (heterogeneous observation noise) को संबोधित करता है और शोर प्रसार को अनुकूल रूप से दबाने तथा एक सुदृढ़ वैश्विक सर्वसम्मति बनाने के लिए एक पदानुक्रमित शिक्षण रणनीति में इन स्कोर को एकीकृत करता है।

Peihan Wu, Guanjie Cheng, Yufei Tong, Meng Xi, Shuiguang Deng2026-07-17
🤖 machine learning

Automated identification of Ichneumonoidea wasps via YOLO-based deep learning: Integrating HiresCam for Explainable AI

यह अध्ययन उच्च-रिज़ॉल्यूशन वाली छवियों से इचneumonoidea (Ichneumonoidea) ततैया परिवारों की स्वचालित, व्याख्या योग्य पहचान प्राप्त करने के लिए हाई-रिज़ॉल्यूशन क्लास एक्टिवेशन मैपिंग (HiResCAM) के साथ एकीकृत एक YOLO-आधारित डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है, जिससे जैव विविधता और जैविक नियंत्रण कार्यक्रमों में मैनुअल वर्गीकरण संबंधी चुनौतियों का समाधान किया जा सके और 96% से अधिक सटीकता प्राप्त की जा सके।

Joao Manoel Herrera Pinheiro, Gabriela Do Nascimento Herrera, Alvaro Doria Dos Santos, Luciana Bueno Dos Reis Fernandes (…)2026-07-17
💻 computer science

BathyFacto: Refraction-Aware Two-Media Neural Radiance Fields for Bathymetry

BathyFacto एक अपवर्तन-जागरूक (refraction-aware) न्यूरल रेडिएंस फील्ड विस्तार है जो यूएवी (UAV) इमेजरी से मेट्रिक रूप से सटीक अंडरवॉटर पॉइंट क्लाउड्स उत्पन्न करने के लिए स्नेल के नियम (Snell's law) का उपयोग करके वायु-जल प्रकाश प्रसार को मॉडल करता है, जो विभिन्न कैमरा कोणों में डेप्थ सटीकता और ज्यामितीय पूर्णता दोनों में मानक NeRF और नैव (naive) सुधार विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

Markus Brezovsky, Anatol Günthner, Frederik Schulte, Lukas Winiwarter, Boris Jutzi, Gottfried Mandlburger2026-07-17
🤖 machine learning

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

यह शोधपत्र ToolAnchor प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो टीचर मॉडल्स का उपयोग करके काउंटरफैक्टुअल एंकर कॉन्टेक्स्ट (counterfactual anchor contexts) को जेनरेट और वेरिफाई करता है, जिससे टूल-ऑगमेंटेड एजेंट्स में व्यवहार संबंधी जड़ता (behavioral inertia) को कम किया जा सके और बिना पूर्ण रिट्रेनिंग के नए टूलसेट्स के प्रति स्केलेबल अनुकूलन सक्षम बनाया जा सके।

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu2026-07-17
🧬 biology

A vision foundation model for single-cell biology via spatial gene cartography

यह शोध पत्र scVision को प्रस्तुत करता है, जो एक विजन फाउंडेशन मॉडल है जो सिंगल-सेल ट्रांसक्रिप्टोम को सह-अभिव्यक्ति (co-expression) के आधार पर जीन को स्थानिक रूप से व्यवस्थित करके निरंतर छवियों में परिवर्तित करता है, जिससे केवल न्यूरल नेटवर्क आर्किटेक्चर के बजाय जीन लेआउट में निहित जैविक संकेत का लाभ उठाते हुए बिना फाइन-ट्यूनिंग के अत्याधुनिक ज़ीरो-शॉट सेल-टाइप एनोटेशन और जीन प्रोग्राम रिकवरी सक्षम होती है।

Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam2026-07-17
💻 computer science

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

यह शोध पत्र MultiRef-Compass प्रस्तुत करता है, जो 350 क्यूरेटेड नमूनों और 14 उप-मानकों वाले चार-आयामी मूल्यांकन प्रोटोकॉल से युक्त एक एकीकृत बेंचमार्क है, जिसे मल्टी-रेफरेंस-टू-ऑडियो-वीडियो जनरेशन सिस्टम की कई संदर्भों को संरक्षित करने, बांधने और सुसंगत सिंक्रोनाइज़्ड सामग्री में संयोजित करने की उभरती क्षमता का व्यापक रूप से आकलन करने के लिए डिज़ाइन किया गया है।

Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Che (…)2026-07-17