💬 NLP

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

यह शोधपत्र OCR-Robust को प्रस्तुत करता है, जो दृश्य गड़बड़ी (visual perturbations) के विरुद्ध 18 विजन-लैंग्वेज मॉडलों की मजबूती का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि उच्च 'क्लीन एक्यूरेसी' लचीलेपन की गारंटी नहीं देती है और चार्ट तथा तालिकाओं जैसे संरचित डेटा को संभालने वाले मॉडल विशेष रूप से गिरावट के प्रति संवेदनशील होते हैं।

Yuxing Cheng, Yuan Wu, Yi Chang2026-06-25
💻 computer science

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

MVTrack4Gen एक मोशन-अवेयर ट्रेनिंग फ्रेमवर्क पेश करता है जो कैमरा-कंडीशन्ड नोवेल-व्यू वीडियो डिफ्यूजन मॉडल्स को बेहतर बनाने के लिए मल्टी-व्यू पॉइंट ट्रैकिंग को एक ज्यामितीय सुपरविजन सिग्नल के रूप में उपयोग करता है, जो अटेंशन लेयर्स में क्रॉस-व्यू कोरेस्पोंडेंस को स्पष्ट रूप से मजबूत करके श्रेष्ठ ज्यामितिक निरंतरता और मोशन फिडेलिटी प्राप्त करता है।

JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang H (…)2026-06-25
🤖 AI

Learning Action Priors for Cross-embodiment Robot Manipulation

यह शोध पत्र एक दो-चरणीय प्रशिक्षण ढांचे का प्रस्ताव करता है जो अनकंडीशन्ड मोशन ट्राजेक्टरीज पर एक लाइटवेट एक्शन मॉड्यूल को प्रीट्रेन करता है ताकि क्रॉस-एम्बॉडीडमेंट टेम्पोरल प्रायर्स को सीखा जा सके, जिन्हें फिर डिकोडर पुन: उपयोग और लेटेंट डिस्टिलेशन के माध्यम से विजन-लैंग्वेज-एक्शन मॉडल्स में स्थानांतरित किया जाता है ताकि डेटा-दुर्लभ वास्तविक दुनिया के मैनिपुलेशन कार्यों में तेज़ अभिसरण, उच्च सफलता दर और बेहतर सामान्यीकरण प्राप्त किया जा सके।

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding2026-06-25
🔬 optics

Configurable Holography: Towards Display and Scene Adaptation

यह शोध पत्र कॉन्फ़िगरेबल होलोग्राफी (Configurable Holography) को प्रस्तुत करता है, जो एक सीखा हुआ ढांचा (learned framework) है जो एक एकल मॉडल को स्पष्ट कंडीशनिंग के माध्यम से विविध डिस्प्ले हार्डवेयर और दृश्य मापदंडों—जैसे कि प्रसार दूरी (propagation distance), चमक और पिक्सेल पिच—के अनुरूप तेजी से अनुकूलित होने में सक्षम बनाता है, जिससे पुन: प्रशिक्षण की आवश्यकता समाप्त हो जाती है और मौजूदा विधियों के समान पुनर्निर्माण गुणवत्ता के साथ 2x तक की गति वृद्धि प्राप्त होती है।

Yicheng Zhan, Liang Shi, Wojciech Matusik, Qi Sun, Kaan Akşit2026-06-24
💻 computer science

Mamba-FSCIL: Dynamic Adaptation with Selective State Space Model for Few-Shot Class-Incremental Learning

यह शोध पत्र Mamba-FSCIL को प्रस्तुत करता है, जो Few-Shot Class-Incremental Learning के लिए एक नवीन दृष्टिकोण है, जो मॉडल आर्किटेक्चर का विस्तार किए बिना नए वर्गों के अनुकूल होने के लिए Selective State Space Models (SSMs) के इनपुट-डिपेंडेंट मापदंडों का लाभ उठाता है, जिससे एक ड्यूल सिलेक्टिव प्रोजेक्टर और क्लास-सेंसिटिव स्कैन तंत्र के माध्यम से पुराने ज्ञान के संरक्षण और नए अवधारणाओं को सीखने के बीच प्रभावी ढंग से संतुलन बनाया जाता है।

Xiaojie Li, Yibo Yang, Jianlong Wu, Yue Yu, Ming-Hsuan Yang, Liqiang Nie, Min Zhang2026-06-24
🤖 machine learning

SEAL: Searching Expandable Architectures for Incremental Learning

SEAL डेटा-इन्क्रीमेंटल लर्निंग के लिए एक न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है जो केवल आवश्यकता होने पर ही मॉडल की क्षमता को गतिशील रूप से विस्तारित करता है और क्रॉस-डिस्टिलेशन के माध्यम से स्थिरता बनाए रखता है, जिससे प्लास्टिसिटी और संसाधन दक्षता के बीच प्रभावी ढंग से संतुलन बनाया जाता है।

Matteo Gambella, Manuel Roveri2026-06-24
💻 computer science

M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection

यह शोध पत्र M4-SAR को प्रस्तुत करता है, जो 1,12,000 से अधिक संरेखित ऑप्टिकल-SAR इमेज युग्मों वाला एक व्यापक मल्टी-रेज़ोल्यूशन, मल्टी-पोलराइजेशन, मल्टी-सीन और मल्टी-सोर्स डेटासेट है, साथ ही एक एकीकृत बेंचमार्किंग टूलकिट और एक नवीन एंड-टू-एंड फ्यूजन फ्रेमवर्क (E2E-OSDet) भी है जो सामूहिक रूप से ऑब्जेक्ट डिटेक्शन सटीकता में महत्वपूर्ण सुधार प्रदर्शित करते हैं, विशेष रूप से उन जटिल वातावरणों में जहाँ सिंगल-सोर्स विधियाँ संघर्ष करती हैं।

Chao Wang, Wei Lu, Xiang Li, Jian Yang, Lei Luo2026-06-24
🧬 biology

Predicting brain tumour enhancement from non-contrast MR imaging with artificial intelligence: a multi-cohort retrospective diagnostic accuracy study

यह बहु-कोहोर्ट रेट्रोस्पेक्टिव अध्ययन प्रदर्शित करता है कि एक डीप लर्निंग मॉडल (nnU-Net), बिना कंट्रास्ट वाले एमआरआई से ब्रेन ट्यूमर कंट्रास्ट एन्हांसमेंट की भविष्यवाणी करने में ब्लाइंडेड रेडियोलॉजिस्ट की तुलना में उच्च नैदानिक सटीकता के साथ कर सकता है, जो न्यूरो-ऑन्कोलॉजी इमेजिंग में गैडोलिनियमिनियम निर्भरता को कम करने के लिए एक संभावित उपकरण प्रदान करता है।

James K Ruffle, Samia Mohinta, Guilherme Pombo, Asthik Biswas, Alan Campbell, Indran Davagnanam, David Doig, Ahmed Hamma (…)2026-06-24
🤖 machine learning

Segmentation and Classification of Pap Smear Images for Cervical Cancer Detection Using Deep Learning

यह अध्ययन सर्वाइकल कैंसर का पता लगाने के लिए यू-नेट (U-Net) सेगमेंटेशन और वर्गीकरण को संयोजित करने वाले एक डीप लर्निंग फ्रेमवर्क का प्रस्ताव करता है, जिसमें यह पाया गया कि हालांकि हर्लेव (Herlev) डेटासेट पर इमेज सेगमेंटेशन से प्रिसिजन (precision) और एफ1-स्कोर (F1-score) में मामूली सुधार होता है, लेकिन वर्गीकरण प्रदर्शन पर इसका समग्र प्रभाव सीमित बना हुआ है।

Nisreen Albzour, Sarah S. Lam2026-06-24
💻 computer science

FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation

FlowerDance एक अत्यधिक कुशल और परिष्कृत 3D डांस जनरेशन फ्रेमवर्क है जो मीनफ्लो (MeanFlow) को भौतिक निरंतरता बाधाओं (physical consistency constraints) और एक BiMamba-आधारित आर्किटेक्चर के साथ जोड़ता है ताकि इंटरैक्टिव एडिटिंग का समर्थन करते हुए गैर-ऑटोरेग्रेसिव (non-autoregressive) तरीके से उच्च-निष्ठा वाला, भौतिक रूप से प्रशंसनीय मोशन उत्पन्न किया जा सके।

Kaixing Yang, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jun He, Hongyan Liu2026-06-24