💻 computer science

ShuffleFlow: Scalable Posterior Inference for Bayesian Inverse Imaging

ShuffleFlow एक स्केलेबल वेरिएशनल इन्फरेंस फ्रेमवर्क है जो बेयसियन इनवर्स इमेजिंग के लिए बनाया गया है और यह पिक्सेल अनशफलिंग के माध्यम से छवियों को उप-छवियों में विभाजित करके और न्यूरल फील्ड फीचर्स से कंडिशन्ड एक साझा कंडीशनल नॉर्मलाइजिंग फ्लो के साथ उनके संयुक्त वितरण को मॉडल करके फ्लो-आधारित नेटवर्क की सीमाओं को दूर करता है, जिससे रैखिक और गैर-रैखिक पुनर्निर्माण कार्यों के लिए कुशल, उच्च-नमूना-गणना पोस्टीरियर जनरेशन सक्षम होता है।

Tianao Li, Tjitske Starkenburg, Yu Sun, Emma Alexander2026-06-23
🤖 machine learning

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation

यह शोध पत्र तीन मानकीकृत ऑब्जेक्ट-सेंट्रिक डेटासेट संसाधनों—Cityscapes-Pedestrian, TrafficSigns, और COCO PottedPlant—के एक साझा संग्रह को प्रस्तुत करता है—जिसे विविध ऑब्जेक्ट क्लासों के लिए सुसंगत क्रॉप्स, बाउंडिंग-बॉक्स एनोटेशन और पुनर्निर्माण उपकरण प्रदान करके डेटा-सीमित परिदृश्यों में नियंत्रित इमेज जनरेशन और ऑग्मेंटेशन को सुगम बनाने के लिए डिज़ाइन किया गया है।

Vasile Marian, Yong-Bin Kang, Alexander Buddery2026-06-23
🤖 AI

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

यह शोध पत्र MammoExpert को प्रस्तुत करता है, जो तीन नैदानिक चरणों में चेन-ऑफ-थॉट (Chain-of-Thought) तर्क एनोटेशन वाला पहला मैमोग्राफी डेटासेट है, जो मौजूदा दृष्टिकोणों की तुलना में मॉडलों को प्रशिक्षित करने के लिए उपयोग किए जाने पर स्तन घाव वर्गीकरण की सटीकता और व्याख्यात्मकता में महत्वपूर्ण सुधार करता है।

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shend (…)2026-06-23
💻 computer science

ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization

ChronoLock पहला सक्रिय ढांचा (proactive framework) है जिसे अनधिकृत टेक्स्ट-टू-वीडियो वैयक्तिकरण (text-to-video personalization) से वीडियो को बचाने के लिए डिज़ाइन किया गया है, जो अनुकूलित गड़बड़ियों (optimized perturbations) के माध्यम से मोशन-इमिटेशन क्षमताओं को कम करके टेम्पोरल डीनोइजिंग डायनेमिक्स और मोशन-लर्निंग प्रक्रियाओं को सीधे बाधित करता है।

Jiaming He, Jiashu Zhang, Guanyu Hou, Shuhan Ye, Hanwei Zhu, Yi Yu, Xudong Jiang2026-06-23
🤖 AI

Contrastive and Adaptive Multi-modal Masked Autoencoder for Spatial Transcriptomics

यह शोधपत्र CAMMST का प्रस्ताव करता है, जो एक कंट्रास्टिव और एडेप्टिव मल्टी-मोडल मास्कड ऑटोएनकोडर है, जो स्टेट-ऑफ-द-आर्ट स्पेशियल ट्रांसक्रिप्टोमिक्स इम्प्यूटेशन और होल-स्लाइड जीन एक्सप्रेशन प्रेडिक्शन प्राप्त करने के लिए H&E हिस्टोलॉजी इमेजेस के साथ कंटीगुअस जेनेटिक एंकर्स के बायो-सेलिएन्सी-ड्रिवन चयन का लाभ उठाता है।

Joohyeok Kim, Taejin Jeong, Jinyeong Kim, Seong Jae Hwang2026-06-23
🧬 biology

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO एक परिकल्पना-संचालित ढांचे (hypothesis-driven framework) को प्रस्तुत करता है जो होल-स्लाइड इमेजेस में प्रासंगिक क्षेत्रों को खोजने और सत्यापित करने के लिए परीक्षण योग्य आकृति विज्ञान पूर्वधारणाओं (morphology priors) को उत्पन्न करने हेतु मेल खाते मल्टी-ओमिक्स डेटा का लाभ उठाता है, जिससे लेक्सिकल ऑडिटेबिलिटी (lexical auditability) सुनिश्चित करते हुए और शुद्ध सिमेंटिक मिलान पर निर्भरता कम करते हुए मल्टी-टास्क ब्रेस्ट कैंसर विश्लेषण में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xiangyu Li, Ran Su2026-06-23
🤖 AI

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

यह शोध पत्र एक स्पार्स ऑटोएनकोडर-आधारित ढांचे का प्रस्ताव करता है जो विजन लैंग्वेज मॉडल्स में दृश्य, पाठ्य और मल्टीमॉडल अवधारणाओं को प्रभावी ढंग से निकालता और विश्लेषण करता है, जो मौजूदा तरीकों की तुलना में दृश्य अवधारणा विवरणों की गुणवत्ता में महत्वपूर्ण सुधार करता है और एकीकृत मल्टीमॉडल अवधारणाओं की व्यवस्थित पहचान को सक्षम बनाता है।

Sergio Lanza, Jae Hee Lee, Stefan Wermter2026-06-23
💻 computer science

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production

यह शोध पत्र GARD का प्रस्ताव करता है, जो एक संदर्भ-जागरूक ऑटोरेग्रेसिव डिफ्यूजन मॉडल है जो सिमेंटिक और किनेमैटिक कंडीशनिंग के साथ ग्लॉस को व्यक्तिगत रूप से संश्लेषित करके प्राकृतिक, वाक्य-स्तरीय सांकेतिक भाषा उत्पन्न करता है, जबकि टेम्पोरल ड्रिफ्ट को समाप्त करने और निर्बाध मोशन निरंतरता सुनिश्चित करने के लिए इंटर-ग्लॉस ट्रांज़िशन गाइडेंस और एक ग्लोबल मोशन हारमोनाइज़र का उपयोग करता है।

JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi2026-06-23
🤖 AI

Few-Shot Hyperspectral Aphid Detection via FastGAN Synthetic Data Generation, Transformer-Based Classification and Explainable AI

यह अध्ययन फाबा बीन्स में एफिड डिटेक्शन के लिए सीमित हाइपरस्पेक्ट्रल डेटा की चुनौती को संबोधित करने के लिए FastGAN का उपयोग करके 10,000 सिंथेटिक चित्र उत्पन्न करता है, जिसने स्वस्थ और संक्रमित पत्तियों के बीच सटीक रूप से अंतर करने में ट्रांसफार्मर-आधारित वर्गीकरण मॉडलों, विशेष रूप से विजन ट्रांसफार्मर (ViT) के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया है।

Ali Saeidan2026-06-23
🔬 optics

Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering

यह शोध पत्र एक नवीन नॉन-लाइन-ऑफ-साइट इमेजिंग पाइपलाइन का प्रस्ताव करता है जो स्थानिक रूप से सीमित, विरल रूप से नमूनाकृत स्थितियों में और किसी भी रिले सतह ज्यामिति के तहत छिपे हुए दृश्यों के अत्याधुनिक पुनर्निर्माण को प्राप्त करने के लिए 3D गॉसियन प्रिमिटिव्स और डिफरेंशिएबल ट्रांजिएंट रेंडरिंग का उपयोग करता है, जो मौजूदा विधियों की प्रतिबंधात्मक प्लेनर-वॉल धारणाओं को समाप्त करता है।

Yi Wang, Ziyu Zhan, Yuran Wang, Hao Wang, Qiang Liu, Zuoqiang Shi, Lingyun Qiu, Xing Fu2026-06-23