💻 computer science

RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes

यह शोध पत्र RL-AWB प्रस्तुत करता है, जो एक नया ढांचा है जो बिना किसी ग्राउंड-ट्रुथ डेटा के ऑटो व्हाइट बैलेंस मापदंडों को गतिशील रूप से अनुकूलित करने के लिए एक सांख्यिकीय नाइटटाइम इल्यूमिनेंट अनुमान एल्गोरिदम को डीप रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है, साथ ही विविध प्रकाश स्थितियों में इसकी मजबूत सामान्यीकरण क्षमता को प्रमाणित करने के लिए एक नए मल्टी-सेंसर नाइटटाइम डेटासेट का परिचय देता है।

Yuan-Kang Lee, Kuan-Lin Chen, Chia-Che Chang, Yu-Lun Liu2026-07-09
🤖 machine learning

Attention in Geometry: Scalable Spatial Modeling via Adaptive Density Fields and FAISS-Accelerated Kernels

यह शोध पत्र एडेप्टिव डेंसिटी फील्ड (ADF) का प्रस्ताव करता है, जो एक स्केलेबल ज्यामितीय अटेंशन फ्रेमवर्क है जो बड़े पैमाने की भौगोलिक प्रणालियों में व्याख्यात्मकता, स्थानीयता और दक्षता को एकीकृत करने के लिए एडेप्टिव गॉसियन कर्नेल और FAISS-त्वरित खोज का उपयोग करते हुए स्थानिक एकत्रीकरण को एक क्वेरी-कंडीशन्ड, मेट्रिक-इंड्यूस्ड ऑपरेटर के रूप में मॉडल करता है।

Zhaowen Fan, Yunxiang Han2026-07-09
💻 computer science

Diffusion Model-Based Data Augmentation for Enhanced Neuron Segmentation

यह शोध पत्र एक डिफ्यूजन मॉडल-आधारित डेटा ऑग्मेंटेशन फ्रेमवर्क प्रस्तावित करता है जो इलेक्ट्रॉन माइक्रोस्कोपी के लिए विविध, संरचनात्मक रूप से सुसंगत 3D इमेज-लेबल युग्म उत्पन्न करता है, जो पारंपरिक ज्यामितीय और फोटोट्रॉफ़िक रूपांतरणों की सीमाओं को पार करके कम-एनोटेशन व्यवस्था के तहत न्यूरॉन सेगमेंटेशन प्रदर्शन में महत्वपूर्ण सुधार करता है।

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Yizhuo Lu, Ruining Zhou, Hua Han2026-07-09
🤖 AI

FP-THD: Full page transcription of historical documents

यह शोध पत्र FP-THD प्रस्तुत करता है, जो एक पाइपलाइन है जो लेआउट विश्लेषण को एक विस्तारित टेक्स्ट लाइन रिकग्निशन मॉडल के साथ जोड़ता है ताकि हस्तलिखित, मुद्रित और बहुभाषी स्वरूपों में उनके मूल पात्रों, प्रतीकों और लेआउट को संरक्षित करते हुए 15वीं और 16वीं शताब्दी के लैटिन ऐतिहासिक दस्तावेज़ों को कुशलतापूर्वक ट्रांसक्राइब किया जा सके।

H Neji, J Nogueras-Iso, J Lacasta, MÁ Latre, FJ García-Marco2026-07-09
💻 computer science

MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training

यह शोध पत्र MMEarth-Bench का परिचय देता है, जो 12 मोडैलिटीज़ और पांच पर्यावरणीय कार्यों के साथ एक व्यापक वैश्विक बेंचमार्क है, और मल्टीमॉडल रिकंस्ट्रक्शन के साथ एक मॉडल-अज्ञेय (model-agnostic) टेस्ट-टाइम ट्रेनिंग विधि (TTT-MMR) प्रस्तावित करता है जो इन्फरेंस के दौरान सभी उपलब्ध मोडैलिटीज़ को सहायक कार्यों के रूप में उपयोग करके प्री-ट्रेंड मॉडल्स के भौगोलिक सामान्यीकरण और प्रदर्शन को प्रभावी ढंग से बढ़ाता है।

Lucia Gordon, Serge Belongie, Christian Igel, Nico Lang2026-07-09
💻 computer science

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

MIMFlow एक एकीकृत एंड-टू-एंड जनरेटिव फ्रेमवर्क है जो सिमेंटिक स्ट्रक्चर लर्निंग को हाई-फ्रीक्वेंसी पिक्सेल सिंथेसिस से अलग करने के लिए मास्क्ड इमेज मॉडलिंग को नॉर्मलाइजिंग फ्लो के साथ एकीकृत करता है, जिससे पारंपरिक फ्लो की क्षमता संबंधी बाधाओं को दूर किया जा सके और काफी कम टोकन के साथ ImageNet पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang2026-07-09
💻 computer science

Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics

यह शोध पत्र विज़न नॉन-कॉज़ल ट्रैपेज़ॉइडल मम्बा (VNCT) प्रस्तुत करता है, जो एक द्वितीय-क्रम का नॉन-कॉज़ल स्टेट स्पेस मॉडल है जो ओरिएंटेशन-रोबस्ट रिप्रजेंटेशन प्राप्त करने के लिए डायरेक्शनल टोकन स्कैनिंग को समाप्त करता है और कम इन्फरेंस लेटेंसी बनाए रखते हुए विभिन्न विज़न कार्यों में उत्कृष्ट प्रदर्शन करता है।

Anvitha Ramachandran, Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna2026-07-09
🧬 biology

Triple-Phase Multimodal Knowledge Aggregation Framework for Microbial Keratitis Subtype Diagnosis on Slit-Lamp Photography

यह शोध पत्र एक ट्रिपल-फेज़ मल्टीमॉडल फ्रेमवर्क प्रस्तुत करता है जो उच्च-सटीक बैक्टीरियल-बनाम-फंगल माइक्रोबियल केराटाइटिस निदान प्राप्त करने के लिए तीन इल्यूमिनेशन मोड से स्लिट-लैंप फोटोग्राफ्स को क्लिनिकल मेटाडेटा के साथ एकीकृत करता है, जिसे एक बड़े मल्टीसेंटर डेटासेट और कठोर क्रॉस-साइट सामान्यीकरण मूल्यांकन के माध्यम से मान्य किया गया है।

Yiqing Wang, Maria A. Woodward, Ziyun Yang, N. Venkatesh Prajna, Chunming He, Leslie M. Niziol, Mercy Pawar, Ming-Chen L (…)2026-07-09
💻 computer science

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

यह शोध पत्र VPT का प्रस्ताव करता है, जो वीडियो डिफ्यूजन मॉडल के लिए एक फाइन-ट्यूनिंग फ्रेमवर्क है, जो दृश्य निष्ठा (visual fidelity) को बनाए रखते हुए क्षमता संघर्षों और अनुमान त्रुटियों (inference errors) को कम करने के लिए रोल-अवेयर सिग्नल ग्रुपिंग और मोडैलिटी-डिकपल्ड डिनोइजिंग रणनीति पेश करके दीर्घकालिक भौतिक निरंतरता (long-range physical consistency) को बढ़ाता है।

Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang2026-07-09
🤖 AI

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

यह शोध पत्र SearchGen बेंचमार्क और कॉर्पस को पेश करते हुए विज़ुअल जनरेशन में संरचनात्मक विश्व-ज्ञान की बाधा (structural world-knowledge bottleneck) को संबोधित करता है, यह प्रदर्शित करते हुए कि अनिश्चित प्रतिधारण (indiscriminate retrieval) के कारण सहज खोज (naive search) विफल हो जाती है, और एक 'टीच-देन-सर्च' (teach-then-search) सह-प्रशिक्षण ढांचा प्रस्तावित करता है जो प्रभावी एजेंटिक विज़ुअल जनरेशन को सक्षम करने के लिए जनरेटर की ज्ञान सीमा की गतिशील रूप से खोज करता है।

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen (…)2026-07-09