💬 NLP

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

यह शोध पत्र SpurLens का परिचय देता है, जो एक स्वचालित पाइपलाइन है जो यह प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) महत्वपूर्ण स्प्यूरियस बायस (spurious biases) से ग्रस्त हैं जिससे ऑब्जेक्ट रिकग्निशन की विफलताएं और एम्प्लीफाइड हैलुसिनेशन (amplified hallucinations) होते हैं, और साथ ही उनकी विश्वसनीयता बढ़ाने के लिए शमन रणनीतियों (mitigation strategies) का भी अन्वेषण करता है।

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi2026-07-14
⚡ electrical engineering

pyMEAL: A Multi-Encoder Augmentation-Aware-Learning Toolbox for Robust Medical Image Translation

यह शोध पत्र MEAL को प्रस्तुत करता है, जो एक मल्टी-एनकोडर टूलबॉक्स है जो 3D मेडिकल इमेज ट्रांसलेशन की मजबूती और संरचनात्मक निष्ठा (structural fidelity) को बढ़ाने के लिए समर्पित पथों के माध्यम से कई ऑग्मेंटेशन वेरिएंट्स को प्रोसेस करता है, विशेष रूप से पारंपरिक तरीकों की तुलना में CT-से-MRI संश्लेषण में बेहतर प्रदर्शन प्रदर्शित करता है।

Abdul-mojeed Olabisi Ilyas, Adeleke Maradesa, Jamal Banzi, Jianpan Huang, Henry K. F. Mak, Kannie W. Y. Chan2026-07-14
💻 computer science

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

यह शोध पत्र TIIF-Bench प्रस्तुत करता है, जो 5,000 विविध प्रॉम्प्ट्स और एक नवीन ग्लोबल नॉर्मलाइज्ड एडिट डिस्टेंस मेट्रिक से युक्त एक व्यापक बेंचमार्क है, जिसका उपयोग स्वचालित विजन-लैंग्वेज मॉडल इवैल्यूएटर्स के माध्यम से टेक्स्ट-टू-इमेज मॉडल्स की सूक्ष्म-स्तरीय इंस्ट्रक्शन-फॉलोइंग क्षमताओं का व्यवस्थित रूप से मूल्यांकन करने के लिए किया जाता है।

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang2026-07-14
🤖 AI

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

यह शोध पत्र MixFlow को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण दृष्टिकोण है जो "स्लोड इंटरपोलेशन मिक्सचर" (slowed interpolation mixture) रणनीति का लाभ उठाकर डिफ्यूजन मॉडल्स में एक्सपोज़र बायस को कम करता है ताकि प्रशिक्षण और परीक्षण स्थितियों को बेहतर ढंग से संरेखित किया जा सके, जिससे ImageNet पर अत्याधुनिक इमेज जनरेशन परिणाम प्राप्त होते हैं।

Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang2026-07-14
💻 computer science

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

यह शोध पत्र UniRec-0.1B को प्रस्तुत करता है, जो टेक्स्ट और फॉर्मूला रिकग्निशन के लिए एक अत्यधिक कुशल 0.1B-पैरामीटर वाला एकीकृत मॉडल है, जो एक नए 40M-सैंपल डेटासेट, पदानुक्रमित पर्यवेक्षण (hierarchical supervision) और एक सिमेंटिक-डिकपल्ड टोकेनाइज़र का लाभ उठाकर कई रिकग्निशन स्तरों पर महत्वपूर्ण गति वृद्धि प्राप्त करते हुए बड़े विजन-लैंग्वेज मॉडल्स से बेहतर प्रदर्शन करता है।

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang2026-07-14
💻 computer science

Driving Like Yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving

यह शोधपत्र Person2Drive को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और फ्रेमवर्क है, जो एक स्केलेबल डेटा संग्रह प्रणाली, स्टाइल-आधारित मेट्रिक्स और एक सुरक्षित, प्लग-एंड-प्ले फाइन-ट्यूनिंग दृष्टिकोण के माध्यम से डेटा की कमी, मूल्यांकन अंतराल और एल्गोरिथम संबंधी सीमाओं को संबोधित करते हुए क्लोज्ड-लूप पर्सनलाइज्ड एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए बनाया गया है।

Xiaoru Dong, Ruiqin Li, Xiao Han, Zhenxuan Wu, Jiamin Wang, Jian Chen, Qi Jiang, SM Yiu, Xinge Zhu, Yuexin Ma2026-07-14
💬 NLP

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

यह शोधपत्र SaMer का प्रस्ताव करता है, जो एक ऑब्जेक्ट-अवेयर टोकन मर्जिंग फ्रेमवर्क है जो प्रशिक्षण के दौरान महत्वपूर्ण ऑब्जेक्ट-लेवल साक्ष्य को संरक्षित करके विजन-लैंग्वेज रिट्रीवल के लिए इमेज-साइड टोकन को महत्वपूर्ण रूप से संकुचित करता है, जिससे बिना ग्राउंड-ट्रुथ बाउंडिंग बॉक्स की आवश्यकता के इन्फरेंस के दौरान स्टोरेज लागत कम होती है और रिट्रीवल प्रदर्शन में सुधार होता है।

Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang2026-07-14
🤖 AI

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles

यह शोध पत्र DSiGAT का प्रस्ताव करता है, जो एक डायनेमिक सीन ग्राफ अटेंशन फ्रेमवर्क है जो ट्रैफ़िक को एक समय-परिवर्तनीय इंटरेक्शन ग्राफ के रूप में मॉडल करता है ताकि कई वाहनों के लिए लेन-चेंज इरादों और भविष्य के प्रक्षेप पथों (ट्रैजेक्टरीज) की एक साथ भविष्यवाणी की जा सके, जिससे मानक डेटासेट्स पर मौजूदा बेसलाइन्स की तुलना में बेहतर सटीकता और सीन-स्तरीय निरंतरता प्राप्त होती है।

Joshua Kofi Asamoah, Blessing Agyei Kyem, Eugene Denteh, Armstrong Aboah2026-07-14
🧬 biology

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

यह शोधपत्र WiCAT को प्रस्तुत करता है, जो वाइडफील्ड कैल्शियम इमेजिंग के लिए एक मल्टी-सब्जेक्ट फाउंडेशन मॉडल है जो अनसीन सब्जेक्ट्स पर ज़ीरो-शॉट बिहेवियर डिकोडिंग और ब्रेन रीजन रिकंस्ट्रक्शन को सक्षम करने के साथ-साथ सिंगल-सेशन बेसलाइन्स की तुलना में बेहतर प्रदर्शन प्राप्त करने के लिए एटलस-अलाइन्ड स्पैटियोटेम्पोरल टोकनाइज़ेशन और सेल्फ-सुपरवाइज्ड प्रीट्रेनिंग का उपयोग करता है।

Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi2026-07-14
💻 computer science

Knowledge-Constrained Shape Optimization with a Mixture-of-Experts Neural Operator for High-Confidence Design

यह शोध पत्र एक ज्ञान-प्रतिबंधित आकार अनुकूलन ढांचे (knowledge-constrained shape optimization framework) का प्रस्ताव करता है जो विविध वाहन ज्यामिति में 4-10% के उच्च-विश्वास वाले ड्रैग न्यूनीकरण को स्वचालित करने और इंजीनियरिंग बाधाओं को प्राप्त करने के लिए अनिश्चितता-जागरूक फीडबैक के साथ एक मिक्स्चर-ऑफ-एक्सपर्ट्स न्यूरल ऑपरेटर को एकीकृत करता है।

Wenhao Fan, Yuanwei Bin, Jianghan Gu, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen2026-07-14