💬 NLP

Towards Robustness against Typographic Attack with Training-free Concept Localization

यह शोध पत्र एक नवीन, प्रशिक्षण-मुक्त मैकेनिस्टिक इंटरप्रिटेबिलिटी विधि प्रस्तावित करता है जो लेक्सिकल (शब्दकोशीय) जानकारी को एनकोड करने के लिए जिम्मेदार विशिष्ट विजन ट्रांसफॉर्मर सर्किटों की पहचान करती है और उनमें हस्तक्षेप करती है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के टाइपोग्राफिक हमलों के विरुद्ध CLIP-आधारित लार्ज विजन लैंग्वेज मॉडल्स की मजबूती को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang2026-07-03
💻 computer science

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

यह शोधपत्र Embodied.cpp को प्रस्तुत करता है, जो एक पोर्टेबल C++ इन्फरेंस रनटाइम है जिसे विविध एम्बोडीड एआई मॉडल (जैसे VLAs और WAMs) के विषम एज रोबॉट्स पर खंडित परिनियोजन को एकीकृत करने के लिए डिज़ाइन किया गया है, जो एक मॉड्यूलर, पांच-स्तरीय आर्किटेक्चर प्रदान करता है जो कम-विलंबता, मल्टी-रेट क्लोज्ड-लूप नियंत्रण सक्षम करता है और साथ ही मेमोरी दक्षता और कार्य सफलता दरों में महत्वपूर्ण सुधार करता है।

Ling Xu, Chuyu Han, Borui Li, Hao Wu, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang2026-07-03
💻 computer science

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

PointDiT एक न्यूनतम, स्क्रैच-ट्रेन्ड पिक्सेल-स्पेस डिफ्यूजन ट्रांसफार्मर पेश करता है जो DINOv3 इमेज टोकन्स द्वारा कंडिशन किए गए रॉ 3D पॉइंट मैप पैचेस पर सीधे संचालित होता है, जो बिना किसी आर्किटेक्चरल ओवरहेड या विशेष टोकनाइज़र की आवश्यकता के, जटिल लेटेंट-आधारित और हाइब्रिड मॉडल्स की तुलना में ज्यामितीय तीक्ष्णता (geometric sharpness) और अस्पष्टता के प्रति मजबूती (robustness to ambiguity) दोनों में श्रेष्ठता प्रदर्शित करता है।

Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geige (…)2026-07-03
💻 computer science

Alignment Is All You Need For X-to-4D Generation

यह शोध पत्र Align4D को प्रस्तुत करता है, जो एक लचीला ढांचा (framework) है जो विविध प्रशिक्षण डेटासेट की आवश्यकता के बिना, मनमाने मल्टीमॉडल इनपुट को सुसंगत वीडियो-3D युग्मों में अनुवादित करने के लिए ऑब्जेक्ट डिस्टेंस अलाइनमेंट, मोशन-ज्यामिति संयुक्त अलाइनमेंट और एसिंक्रोनस ऑप्टिमाइज़ेशन का उपयोग करके उच्च-गुणवत्ता वाले, सुसंगत X-to-4D जनरेशन को सक्षम बनाता है।

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang2026-07-03
🧬 biology

Prediction of Cellular Identities from Trajectory and Cell Fate Information

यह अध्ययन एक मशीन लर्निंग दृष्टिकोण प्रस्तावित करता है जो प्रारंभिक *C. elegans* भ्रूणजनन में कोशिका पहचान की सटीक भविष्यवाणी करने के लिए सेल प्रक्षेपवक्र (cell trajectory) और भाग्य संबंधी जानकारी (fate information) जैसे सरल स्थानिक-कालिक (spatio-temporal) विशेषताओं का लाभ उठाता है, जो पारंपरिक सेल ट्रैकिंग विधियों के एक तेज़ विकल्प के रूप में 91% से अधिक सटीकता प्रदान करता है।

Baiyang Dai, Jiamin Yang, Hari Shroff, Patrick La Riviere2026-07-02
💻 computer science

Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models

यह शोध पत्र ViDiT को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो इमेज पेयर्स (image pairs) से एक एकल ग्लोबल एडिटिंग डायरेक्शन सीखता है ताकि बिना मॉडल फाइन-ट्यूनिंग या प्रति-इमेज ऑप्टिमाइज़ेशन के डिफ्यूजन मॉडल्स में सटीक, ज़ीरो-शॉट विजुअल एट्रिब्यूट ट्रांसफर को सक्षम बनाया जा सके।

Yusuf Dalva, Hidir Yesiltepe, Pinar Yanardag2026-07-02
💻 computer science

Novel adaptation of video segmentation to 3D MRI: efficient zero-shot knee segmentation with SAM2

यह शोध पत्र एक नवीन ज़ीरो-शॉट दृष्टिकोण प्रस्तुत करता है जो स्लाइस को वीडियो फ्रेम के रूप में मानकर SAM2 वीडियो सेगमेंटेशन मॉडल को 3D नी (knee) MRI के अनुकूल बनाता है, जिससे एक एकल प्रॉम्प्ट और बिना किसी अतिरिक्त प्रशिक्षण के अत्यधिक सटीक बोन (bone) सेगमेंटेशन प्राप्त होता है।

Andrew Seohwan Yu, Mohsen Hariri, Xuecen Zhang, Mingrui Yang, Vipin Chaudhary, Xiaojuan Li2026-07-02
💻 computer science

Continuous Speculative Decoding for Autoregressive Image Generation

यह शोधपत्र कंटीन्यूअस स्पेक्युलेटिव डिकोडिंग (CSpD) को प्रस्तुत करता है, जो निरंतर विजुअल ऑटोरेग्रेसिव मॉडल्स के लिए एक नवीन त्वरण ढांचा है, जो डिनोइजिंग ट्रैजेक्टरी अलाइनमेंट और एक्सेप्टेंस-रिजेक्शन सैंपलिंग के माध्यम से डिस्ट्रीब्यूशन मिसमैच और जटिल इंटीग्रल चुनौतियों पर विजय प्राप्त करता है, जिससे इमेज जनरेशन की गुणवत्ता को बनाए रखते हुए 2x से अधिक इन्फरेंस स्पीडअप प्राप्त होता है।

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang2026-07-02
💻 computer science

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

इंटरलीव्ड पैथोलॉजी छवियों और टेक्स्ट की प्रभावी रिट्रीवल में बाधा डालने वाले आर्किटेक्चरल, टास्क और डोमेन मिसमैच को संबोधित करने के लिए, यह शोध पत्र HOMIE पेश करता है, जो एक मॉडल-अज्ञेगर फ्रेमवर्क है जो जेनेरेटिव मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को विशिष्ट रिट्रीवल विशेषज्ञों में अनुकूलित करता है, जिससे नए प्रस्तावित 'पैथोलॉजी कंपोज्ड रिट्रीवल' बेंचमार्क पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang2026-07-02
💻 computer science

Sheet Music Benchmark: Standardized Optical Music Recognition Evaluation

यह शोध पत्र शीट म्यूज़िक बेंचमार्क (SMB), जो 685 पृष्ठों का एक विविध डेटासेट है, और ओएमआर नॉर्मलाइज़्ड एडिट डिस्टेंस (OMR-NED), जो एक सूक्ष्म मूल्यांकन मीट्रिक है, को पेश करता है, ताकि मानकीकृत प्रशिक्षण, मूल्यांकन और स्पष्ट प्रदर्शन तुलना को सक्षम करके ऑप्टिकल म्यूज़िक रिकग्निशन अनुसंधान में लंबे समय से चली आ रही कमियों को दूर किया जा सके।

Juan C. Martinez-Sevilla, Joan Cerveto-Serrano, Noelia Luna, Greg Chapman, Craig Sapp, David Rizo, Jorge Calvo-Zaragoza2026-07-02