💻 computer science

CASR: A Robust Cyclic Framework for Arbitrary Large-Scale Super-Resolution with Distribution Alignment and Self-Similarity Awareness

CASR एक सुदृढ़ चक्रीय ढांचे (cyclic framework) को पेश करता है जो किसी भी पैमाने के सुपर-रिज़ॉल्यूशन को इन-डिस्ट्रीब्यूशन ट्रांज़िशन के एक अनुक्रम के रूप में पुनर्गठित करता है, जिसमें क्रॉस-स्केल वितरण बदलावों को समाप्त करने और अत्यधिक आवर्धन (magnification) पर एक ही मॉडल के साथ स्थिर, उच्च-गुणवत्ता वाले परिणाम प्राप्त करने के लिए संरचनात्मक वितरण संरेखण और स्व-समानता जागरूकता का उपयोग किया जाता है।

Wenhao Guo, Zhaoran Zhao, Peng Lu, Sheng Li, Qian Qiao, DeRui Li2026-06-17
💻 computer science

Landsat-Sentinel-2 Algal Bloom Mapping Using Vision Transformers: Model Description, Implementation, and Examples

यह अध्ययन प्रदर्शित करता है कि विजन ट्रांसफॉर्मर-आधारित डीप लर्निंग मॉडल, विशेष रूप से स्विन (Swin) ट्रांसफॉर्मर, सामंजस्यपूर्ण 30-मीटर लैंडसैट और सेंटिनल-2 इमेजरी का उपयोग करके खंडित तटीय शैवाल प्रस्फुटन (algal blooms) को प्रभावी ढंग से मैप करते हैं, जो सटीकता में पारंपरिक स्पेक्ट्रल इंडेक्स और मोटे-रिज़ॉल्यूशन वाले सेंसरों की तुलना में बेहतर प्रदर्शन करते हैं और वायुमंडलीय हस्तक्षेप के विरुद्ध अधिक सुदृढ़ हैं।

Thainara Lima, Vitor Martins2026-06-17
💻 computer science

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

यह शोध पत्र REINS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो वीडियो डिफ्यूजन मॉडल्स को उनके आंतरिक निरूपणों (internal representations) को इन्फरेंस के समय सुरक्षित जनरेशन की ओर निर्देशित करके संरेखित करती है, जो विविध मॉडल्स और स्केल्स में सामान्य क्षमताओं को कम किए बिना हानिकारक सामग्री को प्रभावी ढंग से रोकने के लिए सुपरवाइज्ड PCA के माध्यम से खोजी गई एक एकल रैखिक दिशा का लाभ उठाती है।

Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury2026-06-17
💻 computer science

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA

यह शोध पत्र एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो अनिश्चितता अनुमानों वाले पदानुक्रमित डिजिटल ट्विन निरूपणों पर कार्य करके बड़े भाषा मॉडलों को धारणा (परसेप्शन) को तर्क से अलग करने के लिए प्रशिक्षित करता है, जो एक नवीन संभाव्यता-जागरूक पुरस्कार और REAL-Colon-Reason डेटासेट की प्रस्तुति के माध्यम से सर्जिकल VideoQA बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Yiqing Shen, Han Zhang, Mathias Unberath2026-06-17
💻 computer science

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

यह शोध पत्र OR3 को पेश करता है, जो ऑपरेटिंग रूम क्लिप्स के लिए एक टेक्स्ट-टू-वीडियो रिट्रीवल फ्रेमवर्क है, जो एक्शन-ड्रिवन डिजिटल ट्विन्स और LLM-आधारित इमेजिनेशन का लाभ उठाकर इनडायरेक्ट सेफ्टी-क्रिटिकल क्वेरीज पर रीजनिंग करता है, और रोबोटिक नी प्रोसीजर के एक नए बेंचमार्क पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Yiqing Shen, Hao Ding, Mathias Unberath2026-06-17
💻 computer science

FATE: Pillar Encoding and Frequency-Aware Training for Event-Based Object Detection

यह शोधपत्र FATE का प्रस्ताव करता है, जो इवेंट-आधारित ऑब्जेक्ट डिटेक्शन के लिए एक एकीकृत ढांचा है जो आंतरिक सब-बिनिंग के बिना सूक्ष्म-स्तरीय टेम्पोरल डायनेमिक्स को संरक्षित करने के लिए पिलर एनकोडिंग (Pillar Encoding) को और लो-फ्रीक्वेंसी सुपरविजन तथा हाई-फ्रीक्वेंसी इन्फरेंस के बीच के अंतर को पाटने के लिए फ्रीक्वेंसी-अवेयर ट्रेनिंग (Frequency-Aware Training) को जोड़ता है, जिससे न्यूनतम ओवरहेड के साथ 200 हर्ट्ज़ तक रोबस्ट डिटेक्शन सक्षम होता है।

Md Tawheedul Islam Bhuian, Kyoung-Don Kang2026-06-17
💻 computer science

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

यह शोध पत्र एक एकीकृत ढांचे का प्रस्ताव करता है जो सटीक मोनोक्यूलर एंडोस्कोपिक नेविगेशन और डेप्थ एस्टीमेशन के लिए फाउंडेशन मॉडल्स की ज्योमेट्री-कंसिस्टेंसी और डोमेन रोबस्टनेस को बढ़ाने के लिए सिंथेटिक ज्योमेट्रिक सुपरविजन को एक नवीन पदानुक्रम-जागरूक ज्योमेट्री-सिमेंटिक अडैप्टेशन रणनीति के साथ जोड़ता है।

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathi (…)2026-06-17
💻 computer science

Learning a Maximum Entropy Model for Visual Textures using Diffusion

यह शोध पत्र डिफ्यूजन मॉडल तकनीकों का लाभ उठाकर विजुअल टेक्सचर के एक कॉम्पैक्ट मैक्सिमम एंट्रॉपी मॉडल को सीखने के लिए पहला सिद्धांतिक, अनसुपरवाइज्ड तरीका प्रस्तुत करता है, जो काफी कम सांख्यिकी के साथ अत्याधुनिक जनरेशन गुणवत्ता प्राप्त करता है और रिप्रेजेंटेशन स्पेस में सुचारू इंटरपोलेशन सक्षम बनाता है।

Xinyuan Zhao, Eero P. Simoncelli2026-06-17
📊 statistics

Bayesian Magnetic Resonance Joint Image Reconstruction and Uncertainty Quantification using Sparsity Prior Models and Markov Chain Monte Carlo Sampling

यह शोध पत्र चुंबकीय अनुनाद इमेज पुनर्निर्माण (मैग्नेटिक रेजोनेंस इमेज रिकंस्ट्रक्शन) के लिए एक नवीन बेयसियन ढांचे का प्रस्ताव करता है जो स्पर्सिटी प्रायर्स (sparsity priors) और एक प्रॉक्सिमल मार्कोव चेन मोंटे कार्लो सैंपलिंग पद्धति का लाभ उठाता है ताकि मौजूदा अनुकूलन-आधारित और डीप लर्निंग दृष्टिकोणों की तुलना में बेहतर इमेज गुणवत्ता और विश्वसनीय अनिश्चितता परिमाणीकरण (uncertainty quantification) को एक साथ प्राप्त किया जा सके।

Ahmed Karam Eldaly, Matteo Figini, Daniel C. Alexander2026-06-17
🤖 machine learning

MM++: Unsupervised Scale-Invariant Multilayer OOD Detection via Top-K Gated Feature Fusion

MM++ एक पूर्णतः अनसुपरवाइज्ड (unsupervised), पोस्ट-हॉक (post-hoc) फ्रेमवर्क है जो एक लेडिट-वुल्फ (Ledoit-Wolf) रेगुलराइज्ड टाइड कोवेरियेंस मैट्रिक्स के माध्यम से डिस्क्रिमिनेटिव इंटरमीडिएट लेयर्स को टर्मिनल रिप्रेजेंटेशन्स के साथ फ्यूज करके एक रोबस्ट स्केल-इनवेरिएंट मल्टीलेयर OOD डिटेक्शन प्राप्त करता है, जिससे सहायक डेटा या आर्किटेक्चरल संशोधनों की आवश्यकता समाप्त हो जाती है।

Rahim Hossain, Md Tawheedul Islam Bhuian, Md Farhan Shadiq, Kyoung-Don Kang2026-06-17