💻 computer science

MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation

यह शोध पत्र MLLM-DataEngine को प्रस्तुत करता है, जो एक नवीन क्लोज्ड-लूप सिस्टम है जो मानवीय हस्तक्षेप के बिना, मूल्यांकन की कमजोरियों का विश्लेषण करके लक्षित, उच्च-गुणवत्ता वाले वृद्धिशील प्रशिक्षण डेटासेट उत्पन्न करने के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को स्वचालित रूप से पुनरावृत्ति रूप से उन्नत करता है।

Zhiyuan Zhao, Bin Wang, Linke Ouyang, Yiqi Lin, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He2026-07-20
💻 computer science

Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection

यह शोध पत्र मानक वीडियो बैकबोन रीडआउट्स में अत्यधिक स्थानिक-कालिक एकत्रीकरण (spatiotemporal aggregation) को एआई-जनित वीडियो डिटेक्शन में उनके खराब प्रदर्शन के कारण के रूप में पहचानता है और एक हल्के, प्लग-एंड-प्ले मॉड्यूल जिसे वेलोसिटी गेटेड पैच वेलोसिटी प्रोफाइलिंग (V-PVP) कहा जाता है, का प्रस्ताव करता है जो इस एकत्रीकरण को प्रभावी ढंग से सूक्ष्म अस्थायी आर्टिफ़ैक्ट्स (temporal artifacts) को पकड़ने के लिए प्रतिस्थापित करता है, जिससे फ्रोजन बैकबोन के साथ भी डिटेक्शन सटीकता में महत्वपूर्ण वृद्धि होती है।

Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhen (…)2026-07-20
💻 computer science

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

यह शोध पत्र OP-HRG को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित फ्रेमवर्क है जो एक मोटे-से-सूक्ष्म पदानुक्रमित तर्क (coarse-to-fine hierarchical reasoning) रणनीति और आत्म-चिंतनशील सुधार (self-reflective correction) को नियोजित करके मल्टीमॉडल मॉडलों में पार्ट-लेवल विजुअल ग्राउंडिंग में सुधार करता है, जिससे एक 4B मॉडल को कई बेंचमार्क पर बड़े 7B ग्राउंडिंग LLMs और SAM3 से बेहतर प्रदर्शन करने में सक्षम बनाया जा सकता है।

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thoma (…)2026-07-20
🤖 AI

Partial Information Decomposition as a Multi-Contrast 3D MRI Selection Strategy for Resource-Constrained Deep Neural Network Training in Brain Tumor Segmentation

यह शोध पत्र यह प्रदर्शित करता है कि 'पार्शियल इन्फॉर्मेशन डिकम्पोजिशन' का उपयोग करके T1c+T2-FLAIR MRI जोड़ी को हल्के (लाइटवेट) 3D U-Net के इनपुट के रूप में चुनने से, सभी चार अनुक्रमों (0.687 डाइस) की तुलना में लगभग इष्टतम ब्रेन ट्यूमर सेगमेंटेशन प्रदर्शन (0.676 डाइस) प्राप्त होता है, जो कम्प्यूटेशनल बाधाओं के तहत डीप न्यूरल नेटवर्क को प्रशिक्षित करने के लिए एक संसाधन-कुशल रणनीति प्रदान करता है।

Agamdeep Chopra, Mehmet Kurt2026-07-20
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

यह शोध पत्र एक पूर्णतः स्वचालित, क्लोज्ड-लूप AutoML फ्रेमवर्क प्रस्तुत करता है जो अरबी, फारसी और अंग्रेजी डेटासेट्स पर बिना किसी मानवीय हस्तक्षेप के 93% से अधिक माध्य सटीकता और कम विलंबता (लो लेटेंसी) प्राप्त करते हुए, क्रॉस-लिंगुअल हस्तलिखित OCR के लिए न्यूरल आर्किटेक्चर को पुनरावृत्ति रूप से डिजाइन, प्रशिक्षित और परिष्कृत करने के लिए स्वायत्त एजेंटों के रूप में GPT-5, GPT-4o और Claude Sonnet 4 का लाभ उठाता है।

Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani2026-07-20
💻 computer science

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting

यह शोध पत्र ImprovedVBGS प्रस्तुत करता है, जो वास्तविक समय के निरंतर वेरिएशनल बेयस गॉसियन स्प्लेटिंग (Variational Bayes Gaussian Splatting) के लिए एक त्वरित ढांचा है, जो स्थानिक रूप से ट्रंकेटेड वेरिएशनल इन्फरेंस और अनुकूलित पुनर्नियुक्ति (reassignment) के माध्यम से प्रति-फ्रेम विलंबता में 1680x की गति वृद्धि प्राप्त करता है, जिससे गुणवत्ता से समझौता किए बिना ऑन-द-फ्लाई पुनर्निर्माण सक्षम होता है।

Damani Mguni-Coker2026-07-20
💻 computer science

When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?

यह शोध पत्र ज़ीरो-शॉट 3D CT विज़न-लैंग्वेज मॉडल्स के लिए टेस्ट-टाइम एडेप्टेशन की सशर्त प्रभावकारिता की जांच करता है और CARVE पेश करता है, जो एक नवीन विधि है जो पॉजिटिव-लेबल कार्डिनैलिटी का अनुमान लगाती है और वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के तहत मल्टी-लेबल भविष्यवाणी विश्वसनीयता में सुधार करने के लिए मेमोरी-कुशल मल्टी-व्यू ऑप्टिमाइज़ेशन का उपयोग करती है।

Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He, Leonid Sigal2026-07-20
⚡ electrical engineering

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

यह शोध पत्र विजन-लैंग्वेज मॉडल्स में "क्वेश्चन-फर्स्ट पैराडॉक्स" (प्रश्न-प्रथम विरोधाभास) की पहचान और समाधान करता है—जहाँ छवियों से पहले प्रश्नों को रखना सहज रूप से धारणा का मार्गदर्शन तो करता है लेकिन उत्तर निर्माण में विफल रहता है—एक प्रशिक्षण-मुक्त "प्रॉम्प्ट इकोइंग" रणनीति पेश करके जो धारणा को निर्देशित करने और उत्तर तक पहुंच सुनिश्चित करने के लिए छवि के दोनों ओर प्रश्न को पुन: दोहराती है, जिससे कई बेंचमार्क पर प्रदर्शन में महत्वपूर्ण वृद्धि होती है।

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare2026-07-20
💻 computer science

WREN: Low Light Image Enhancement Using Retinex theory-based Double U-Net-like Structures

यह शोधपत्र WREN प्रस्तुत करता है, जो रेटिनेक्स सिद्धांत पर आधारित एक सुदृढ़ लो-लाइट इमेज एन्हांसमेंट नेटवर्क है, जो छवियों को रिफ्लेक्टेंस और इल्यूमिनेशन मैप्स में स्थिरता से विघटित करने के लिए एक ड्यूल U-Net जैसे आर्किटेक्चर का उपयोग करता है, और विविध डायनेमिक रेंज में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए ट्रांसफार्मर-एन्हांस्ड इल्यूमिनेशन रिफाइनमेंट और स्केल-इनवेरिएंट ट्रेनिंग का उपयोग करता है।

Reina Kaneko, Junya Hara, Hiroshi Higashi, Yuichi Tanaka2026-07-20
💻 computer science

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation

यह अध्ययन nnU-Net का उपयोग करके डीप लर्निंग-आधारित फोकल कॉर्टिकल डिसप्लेसिया (Focal Cortical Dysplasia) विभाजन के लिए विभिन्न एमआरआई (MRI) निरूपणों का व्यवस्थित रूप से बेंचमार्किंग करता है, जिससे यह स्पष्ट होता है कि जबकि FLAIR सबसे मजबूत एकल मोडैलिटी है, पारंपरिक T1w/FLAIR के साथ अनुपात-व्युत्पन्न (ratio-derived) निरूपणों को संयोजित करने वाला एक चार-चैनल मल्टीमॉडल विन्यास, डाइस स्कोर (Dice score) में 5.0% के सापेक्ष सुधार के साथ उच्चतम प्रदर्शन प्राप्त करता है।

Soumen Ghosh, John Phamnguyen, Amit Soni Arya, Subhojit Mandal, Tilottama Goswami, Rajat Vashistha2026-07-20