🤖 AI

Recovering Diagnostic Value: Super-Resolution-Aided Echocardiographic Classification in Resource-Constrained Imaging

यह अध्ययन प्रदर्शित करता है कि निम्न-गुणवत्ता वाले 2D इकोकार्डियोग्राम पर डीप लर्निंग-आधारित सुपर-रिज़ॉल्यूशन तकनीकों, विशेष रूप से SRResNet को लागू करने से व्यू (view) और कार्डिएक फेज़ (cardiac phase) कार्यों के लिए वर्गीकरण सटीकता में महत्वपूर्ण सुधार होता है, जिससे नैदानिक मूल्य की पुनर्प्राप्ति होती है और संसाधन-सीमित परिवेशों में प्रभावी AI-सहायता प्राप्त देखभाल सक्षम होती है।

Krishan Agyakari Raja Babu, Om Prabhu, Annu, Mohanasankar Sivaprakasam2026-06-19
💻 computer science

When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models

यह शोध पत्र SODA को प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज मॉडल्स के ऑब्जेक्ट जनरेशन में जनसांख्यिकीय पूर्वाग्रह (demographic bias) के ऑडिटिंग के लिए एक नया फ्रेमवर्क है, जो यह प्रकट करता है कि तटस्थ प्रॉम्प्ट (neutral prompts) स्पष्ट रूप से मध्यम आयु वर्ग के श्वेत जनसांख्यिकी का पक्ष लेते हैं जबकि जनसांख्यिकीय संकेत (demographic cues) अत्यधिक रूढ़िवादिता को ट्रिगर करते हैं और वर्तमान डिबायसिंग तकनीकें अक्सर केवल एक रूढ़िवादिता को दूसरी से बदल देती हैं।

Dasol Choi, Jihwan Lee, Minjae Lee, Minsuk Kahng2026-06-19
💻 computer science

S3OD: Towards Generalizable Salient Object Detection with Synthetic Data

यह शोध पत्र S3OD को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-मोडल डिफ्यूजन के माध्यम से जनरेट किए गए एक बड़े पैमाने के सिंथेटिक डेटासेट और एक एम्बिग्युटी-अवेयर मल्टी-मास्क डिकोडर का लाभ उठाकर विविध बेंचमार्क में सैलिएंट ऑब्जेक्ट डिटेक्शन में सामान्यीकरण (जनरलाइजेशन) को महत्वपूर्ण रूप से बढ़ाता है और अत्याधुनिक प्रदर्शन प्राप्त करता है।

Orest Kupyn, Hirokatsu Kataoka, Christian Rupprecht2026-06-19
💻 computer science

Epipolar Geometry Improves Video Generation Models

यह शोध पत्र प्रदर्शित करता है कि प्राथमिकता-आधारित अनुकूलन (preference-based optimization) के माध्यम से शास्त्रीय एपिपोलर ज्यामिति बाधाओं (classical epipolar geometry constraints) को एकीकृत करने से आधुनिक वीडियो डिफ्यूजन मॉडलों की ज्यामितीय निरंतरता और गति स्थिरता में महत्वपूर्ण सुधार होता है, जिससे दृश्य गुणवत्ता से समझौता किए बिना एपिपोलर त्रुटि में 31% की कमी आती है और मानव-रेटेड निरंतरता बढ़कर 72% हो जाती है।

Orest Kupyn, Théo Uscidda, Marta Tintore Gazulla, Fabian Manhardt, Federico Tombari, Christian Rupprecht2026-06-19
💻 computer science

GenTrack2: An Improved Hybrid Approach for Multi-Object Tracking

GenTrack2 एक उन्नत हाइब्रिड मल्टी-ऑब्जेक्ट ट्रैकिंग विधि है जो नॉनलीनियर डायनेमिक्स, नॉन-गॉसियन नॉइज़ और ऑक्लूजन जैसे जटिल इंटरैक्शन को मजबूती से संभालने के लिए पार्टिकल स्वार्म ऑप्टिमाइजेशन द्वारा संवर्धित एक स्टोकेस्टिक पार्टिकल फ़िल्टर को एक डिटर्मिनिस्टिक एसोसिएशन मैकेनिज्म के साथ जोड़ती है, जिससे पूर्व-रिकॉर्डेड वीडियो और लाइव स्ट्रीम दोनों में उत्कृष्ट प्रदर्शन प्राप्त होता है।

Toan Van Nguyen, Rasmus G. K. Christiansen, Dirk Kraft, Leon Bodenhagen2026-06-19
💻 computer science

Hybrid Transformer-Mamba for Weakly Supervised Volumetric Medical Segmentation

यह शोधपत्र TranSamba को प्रस्तुत करता है, जो एक हाइब्रिड ट्रांसफॉर्मर-मैम्बा आर्किटेक्चर है जो प्लेन-लेवल लेबल्स से 3D संदर्भ को कैप्चर करने के लिए कुशल क्रॉस-प्लेन मॉडलिंग का लाभ उठाता है, जिससे कमजोर रूप से पर्यवेक्षित (weakly supervised) वॉल्यूमेट्रिक मेडिकल सेगमेंटेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Yiheng Lyu, Lian Xu, Coen Arrow, Mohammed Bennamoun, Farid Boussaid, Girish Dwivedi2026-06-19
🤖 AI

Bi-Anchor Interpolation Solver for Accelerating Generative Modeling

यह शोध पत्र बायो-एंकर इंटरपोलेशन सॉल्वर (BA-solver) का प्रस्ताव करता है, जो एक हल्का और प्रशिक्षण-कुशल तरीका है जो एक फ्रोजन बैकबोन को एक छोटे साइडनेट (SideNet) के साथ जोड़कर फ्लो मैचिंग जनरेशन को तेज करता है, ताकि बहुमुखीता से समझौता किए बिना या अत्यधिक प्रशिक्षण लागत उठाए बिना मात्र 5-10 न्यूरल फंक्शन इवैल्यूएशन में उच्च-निष्ठा वाला संश्लेषण प्राप्त किया जा सके।

Hongxu Chen, Hongxiang Li, Zhen Wang, Long Chen2026-06-19
💻 computer science

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher एक अभिनव ढांचा है जो सिमेंटिक प्लानिंग के लिए LLMs और रेंडरिंग के लिए फाइन-ट्यून्ड टेक्स्ट-टू-वीडियो डिफ्यूजन मॉडल्स का तालमेल बिठाकर उच्च-गुणवत्ता वाले, टेम्पोरल रूप से सुसंगत क्रमिक स्केच उत्पन्न करता है, जो दो-चरणीय प्रशिक्षण रणनीति के माध्यम से स्टैटिक इमेज जनरेशन और डेटा की कमी की सीमाओं को दूर करता है।

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker2026-06-19
💻 computer science

Can Agents Distinguish Visually Hard-to-Separate Diseases in a Zero-Shot Setting? A Pilot Study

यह पायलट अध्ययन दृश्य रूप से भ्रमित करने वाली बीमारियों के बीच अंतर करने में मल्टीमॉडल लार्ज लैंग्वेज मॉडल एजेंटों की ज़ीरो-शॉट क्षमताओं का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि एक प्रस्तावित मल्टी-एजेंट फ्रेमवर्क कंट्रास्टिव एडजुडिकेशन (तुलनात्मक न्यायनिर्णयन) के साथ नैदानिक सटीकता में सुधार करता है और असमर्थित दावों को कम करता है, हालांकि प्रदर्शन तत्काल नैदानिक तैनाती के लिए अपर्याप्त बना हुआ है।

Zihao Zhao, Frederik Hauke, Juliana De Castilhos, Sven Nebelung, Daniel Truhn2026-06-19
💻 computer science

Geometry-Aware Dataset Condensation for Diffusion Model Training

यह शोध पत्र ज्योमेट्री-अवेयर डेटासेट कंडेंसेशन (GADC) प्रस्तावित करता है, जो एक ऐसी विधि है जो वास्तविक उपसमूह चयन (subset selection) को वन-साइडेड पार्शियल ऑप्टिमल ट्रांसपोर्ट और सिमेंटिक रेगुलराइजेशन का उपयोग करके एक ज्योमेट्री-अवेयर डिस्ट्रीब्यूशन अलाइनमेंट समस्या के रूप में पुनर्गठित करती है, ताकि ऐसे संक्षिप्त डेटासेट का निर्माण किया जा सके जो प्रभावी डिफ्यूजन मॉडल प्रशिक्षण के लिए आवश्यक ज्यामितीय संरचना और वितरण निष्ठा (distributional fidelity) को बनाए रखते हैं।

Xiao Cui, Yulei Qin, Mo Zhu, Wengang Zhou, Hongsheng Li, Houqiang Li2026-06-19