💻 computer science

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

यह शोध पत्र OP-HRG को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित फ्रेमवर्क है जो एक मोटे-से-सूक्ष्म पदानुक्रमित तर्क (coarse-to-fine hierarchical reasoning) रणनीति और आत्म-चिंतनशील सुधार (self-reflective correction) को नियोजित करके मल्टीमॉडल मॉडलों में पार्ट-लेवल विजुअल ग्राउंडिंग में सुधार करता है, जिससे एक 4B मॉडल को कई बेंचमार्क पर बड़े 7B ग्राउंडिंग LLMs और SAM3 से बेहतर प्रदर्शन करने में सक्षम बनाया जा सकता है।

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thoma (…)2026-07-20
🤖 AI

Partial Information Decomposition as a Multi-Contrast 3D MRI Selection Strategy for Resource-Constrained Deep Neural Network Training in Brain Tumor Segmentation

यह शोध पत्र यह प्रदर्शित करता है कि 'पार्शियल इन्फॉर्मेशन डिकम्पोजिशन' का उपयोग करके T1c+T2-FLAIR MRI जोड़ी को हल्के (लाइटवेट) 3D U-Net के इनपुट के रूप में चुनने से, सभी चार अनुक्रमों (0.687 डाइस) की तुलना में लगभग इष्टतम ब्रेन ट्यूमर सेगमेंटेशन प्रदर्शन (0.676 डाइस) प्राप्त होता है, जो कम्प्यूटेशनल बाधाओं के तहत डीप न्यूरल नेटवर्क को प्रशिक्षित करने के लिए एक संसाधन-कुशल रणनीति प्रदान करता है।

Agamdeep Chopra, Mehmet Kurt2026-07-20
🤖 AI

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

यह शोध पत्र एक पूर्णतः स्वचालित, क्लोज्ड-लूप AutoML फ्रेमवर्क प्रस्तुत करता है जो अरबी, फारसी और अंग्रेजी डेटासेट्स पर बिना किसी मानवीय हस्तक्षेप के 93% से अधिक माध्य सटीकता और कम विलंबता (लो लेटेंसी) प्राप्त करते हुए, क्रॉस-लिंगुअल हस्तलिखित OCR के लिए न्यूरल आर्किटेक्चर को पुनरावृत्ति रूप से डिजाइन, प्रशिक्षित और परिष्कृत करने के लिए स्वायत्त एजेंटों के रूप में GPT-5, GPT-4o और Claude Sonnet 4 का लाभ उठाता है।

Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani2026-07-20
💻 computer science

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting

यह शोध पत्र ImprovedVBGS प्रस्तुत करता है, जो वास्तविक समय के निरंतर वेरिएशनल बेयस गॉसियन स्प्लेटिंग (Variational Bayes Gaussian Splatting) के लिए एक त्वरित ढांचा है, जो स्थानिक रूप से ट्रंकेटेड वेरिएशनल इन्फरेंस और अनुकूलित पुनर्नियुक्ति (reassignment) के माध्यम से प्रति-फ्रेम विलंबता में 1680x की गति वृद्धि प्राप्त करता है, जिससे गुणवत्ता से समझौता किए बिना ऑन-द-फ्लाई पुनर्निर्माण सक्षम होता है।

Damani Mguni-Coker2026-07-20
💻 computer science

When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?

यह शोध पत्र ज़ीरो-शॉट 3D CT विज़न-लैंग्वेज मॉडल्स के लिए टेस्ट-टाइम एडेप्टेशन की सशर्त प्रभावकारिता की जांच करता है और CARVE पेश करता है, जो एक नवीन विधि है जो पॉजिटिव-लेबल कार्डिनैलिटी का अनुमान लगाती है और वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के तहत मल्टी-लेबल भविष्यवाणी विश्वसनीयता में सुधार करने के लिए मेमोरी-कुशल मल्टी-व्यू ऑप्टिमाइज़ेशन का उपयोग करती है।

Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He, Leonid Sigal2026-07-20
⚡ electrical engineering

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

यह शोध पत्र विजन-लैंग्वेज मॉडल्स में "क्वेश्चन-फर्स्ट पैराडॉक्स" (प्रश्न-प्रथम विरोधाभास) की पहचान और समाधान करता है—जहाँ छवियों से पहले प्रश्नों को रखना सहज रूप से धारणा का मार्गदर्शन तो करता है लेकिन उत्तर निर्माण में विफल रहता है—एक प्रशिक्षण-मुक्त "प्रॉम्प्ट इकोइंग" रणनीति पेश करके जो धारणा को निर्देशित करने और उत्तर तक पहुंच सुनिश्चित करने के लिए छवि के दोनों ओर प्रश्न को पुन: दोहराती है, जिससे कई बेंचमार्क पर प्रदर्शन में महत्वपूर्ण वृद्धि होती है।

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare2026-07-20
💻 computer science

WREN: Low Light Image Enhancement Using Retinex theory-based Double U-Net-like Structures

यह शोधपत्र WREN प्रस्तुत करता है, जो रेटिनेक्स सिद्धांत पर आधारित एक सुदृढ़ लो-लाइट इमेज एन्हांसमेंट नेटवर्क है, जो छवियों को रिफ्लेक्टेंस और इल्यूमिनेशन मैप्स में स्थिरता से विघटित करने के लिए एक ड्यूल U-Net जैसे आर्किटेक्चर का उपयोग करता है, और विविध डायनेमिक रेंज में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए ट्रांसफार्मर-एन्हांस्ड इल्यूमिनेशन रिफाइनमेंट और स्केल-इनवेरिएंट ट्रेनिंग का उपयोग करता है।

Reina Kaneko, Junya Hara, Hiroshi Higashi, Yuichi Tanaka2026-07-20
💻 computer science

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation

यह अध्ययन nnU-Net का उपयोग करके डीप लर्निंग-आधारित फोकल कॉर्टिकल डिसप्लेसिया (Focal Cortical Dysplasia) विभाजन के लिए विभिन्न एमआरआई (MRI) निरूपणों का व्यवस्थित रूप से बेंचमार्किंग करता है, जिससे यह स्पष्ट होता है कि जबकि FLAIR सबसे मजबूत एकल मोडैलिटी है, पारंपरिक T1w/FLAIR के साथ अनुपात-व्युत्पन्न (ratio-derived) निरूपणों को संयोजित करने वाला एक चार-चैनल मल्टीमॉडल विन्यास, डाइस स्कोर (Dice score) में 5.0% के सापेक्ष सुधार के साथ उच्चतम प्रदर्शन प्राप्त करता है।

Soumen Ghosh, John Phamnguyen, Amit Soni Arya, Subhojit Mandal, Tilottama Goswami, Rajat Vashistha2026-07-20
🧬 biology

STSBench: A Large-Scale Dataset for Modeling Neuronal Activity in the Dorsal Stream of Primate Visual Cortex

यह शोधपत्र STSBench प्रस्तुत करता है, जो कि प्राकृतिक वीडियो देखते समय प्राइमेट सुपीरियर टेम्पोरल सल्क्सस के 2,000 से अधिक न्यूरॉन्स की रिकॉर्डिंग से बना एक बड़े पैमाने का डेटासेट है, जिसे डॉर्सल स्ट्रीम न्यूरोनल प्रतिक्रियाओं के मॉडलिंग और बेंचमार्किंग को आगे बढ़ाने के लिए डिज़ाइन किया गया है, जो पहले पर्याप्त डेटा की कमी के कारण बाधित थी।

Ethan B. Trepka, Ruobing Xia, Shude Zhu, Sharif Saleki, Danielle Abreu Lopes, Stephen J. Niño Cital, Konstantin F. Wille (…)2026-07-20
💻 computer science

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango एक लागत प्रभावी समानांतर डिफ्यूजन फ्रेमवर्क है जो संदर्भ विभाजनों (context partitions) की विषमता का लाभ उठाकर और अटेंशन स्टेट्स को रणनीतिक रूप से पुन: उपयोग करके मल्टी-नोड DiT जनरेशन को त्वरित करता है, जिससे जनरेशन की गुणवत्ता को बनाए रखते हुए लगभग रैखिक स्केलिंग के साथ 3.2x तक की गति वृद्धि प्राप्त होती है।

Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai2026-07-20