🤖 AI

Efficient bias mitigation in T2I diffusion models using Concept Graphs

यह शोध पत्र CO-ALIGN प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स के लिए एक नवीन बायस मिटिगेशन फ्रेमवर्क है जो आंतरिक ऑन्टोलॉजी के भीतर कॉन्सेप्ट-ग्राफ अलाइनमेंट का लाभ उठाता है ताकि इमेज क्वालिटी को बनाए रखते हुए और कॉन्सेप्ट अनलर्निंग रोबस्टनेस को बढ़ाते हुए हानिकारक बायस और सिमेंटिक इनकोहेरेंस को महत्वपूर्ण रूप से कम किया जा सके।

Mansi, Avinash Kori, Francesco Leofante2026-07-07
🤖 machine learning

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

यह शोधपत्र WorldBagel को प्रस्तुत करता है, जो BAGEL आर्किटेक्चर पर निर्मित एक एकीकृत विजन-लैंग्वेज-एक्शन-वर्ल्ड मॉडलिंग फ्रेमवर्क है, जो यह प्रदर्शित करता है कि मल्टीमॉडल जनरेशन और वर्ल्ड मॉडलिंग को एकीकृत करने से विविध रोबोटिक मैनिपुलेशन कार्यों में कार्य-विशिष्ट विकल्पों की तुलना में बेहतर प्रदर्शन और अधिक संरचित एक्शन रिप्रजेंटेशन प्राप्त होता है।

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen2026-07-07
⚡ electrical engineering

Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation

यह शोध पत्र लाइट फील्ड गुणवत्ता मूल्यांकन के लिए एक मानकीकृत, पुनरुत्पादक रूपरेखा प्रस्तुत करता है जो एक हाइब्रिड व्यक्तिपरक बेंचमार्किंग पद्धति को वस्तुनिष्ठ मीट्रिक मूल्यांकन के साथ एकीकृत करता है, जिससे यह स्पष्ट होता है कि जबकि वर्तमान मीट्रिक्स केवल कोडिंग संबंधी विसंगतियों (artifacts) पर अच्छा प्रदर्शन करते हैं, व्यू सिंथेसिस विकृतियों के शामिल होने पर उनकी सटीकता काफी कम हो जाती है, जिससे भविष्य के मीट्रिक डिज़ाइन में बेहतर व्यू-पूलिंग रणनीतियों की आवश्यकता पर बल मिलता है।

Saeed Mahmoudpour, Mylene C. Q. Farias, Gi-Mun Um, Myllena A. Prado, Ismael Seidel, Leonardo de Sousa Marques, Leonardo (…)2026-07-07
💻 computer science

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

फ्लेक्स-फोर्सिंग (Flex-Forcing) एक एकीकृत वीडियो डिफ्यूजन फ्रेमवर्क है जो वैश्विक सुसंगतता के लिए द्विदिश अनुमान (bidirectional inference) को दक्षता के लिए ऑटोरेग्रेसिव जनरेशन (autoregressive generation) के साथ जोड़ता है, जिससे एक लचीली चंकिंग प्रक्रिया का उपयोग करके, यह कठोर बेसलाइन विधियों की तुलना में बेहतर वीडियो गुणवत्ता, लंबी-वीडियो स्थिरता और तेज़ अनुमान प्राप्त करता है।

Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang2026-07-07
🤖 machine learning

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models

यह शोध पत्र एक मिक्सचर-ऑफ-गॉसियन्स प्रायर के तहत ब्राउनियन ब्रिज डिफ्यूजन मॉडल शेड्यूल्स को डिजाइन करने के लिए एक सिद्धांतिक विश्लेषणात्मक ढांचा स्थापित करता है, जो विशिष्ट क्षरणों से स्वतंत्र सार्वभौमिक शेड्यूल्स के अस्तित्व को सिद्ध करते हुए, धारणात्मक गुणवत्ता और पुनर्निर्माण निष्ठा के बीच संतुलन बनाने वाले क्लोज्ड-फॉर्म ऑब्जेक्टिव्स व्युत्पन्न करता है।

Ron Levi, Michael Elad2026-07-07
💻 computer science

Perceptual Flow Matching for Few-Step Generative Modeling

यह शोध पत्र परसेप्चुअल फ्लो मैचिंग (PFM) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो फ्लो-मैचिंग मॉडल्स को लेटेंट स्पेस के बजाय एक परसेप्चुअल फीचर स्पेस में सुपरवाइज करता है, जिससे बिना किसी टीचर मॉडल या डिस्टिलेशन के उच्च-गुणवत्ता वाली कुछ-चरणों वाली जनरेशन (4–8 स्टेप्स) सक्षम होती है, जो रिग्रेशन ऑब्जेक्टिव को मोड-सीकिंग प्रेडिक्शन्स की ओर स्थानांतरित करके प्राप्त किया जाता है।

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, N (…)2026-07-07
🤖 AI

EPRA U-Net: An Efficient Pyramid Residual Attention Framework for Accurate Infarct Segmentation in Diffusion-Weighted MRI

यह शोध पत्र EPRA U-Net को प्रस्तुत करता है, जो एक कुशल डीप लर्निंग आर्किटेक्चर है जो डिफ्यूजन-वेटेड एमआरआई पर एक्यूट इस्केमिक इन्फार्क्ट सेगमेंटेशन में अत्याधुनिक मॉडलों की तुलना में बेहतर सटीकता और कम मिस लेजन दरों को प्राप्त करने के लिए एफिशिएंटनेट (EfficientNet), रेसिडुअल-रिकरेंट ब्लॉक्स, एट्रस स्पेशियल पाइरमिड पूलिंग और ड्यूल अटेंशन मैकेनिज्म के साथ ट्रेवर्सकी लॉस (Tversky loss) को जोड़ता है।

Hasan Ulutas, Muhammet Emin Sahin, Mustafa Fatih Erkoc, Esra Yuce, Turker Tuncer, Sengul Dogan, Serkan Kiranyaz2026-07-07
⚡ electrical engineering

Motion Estimation Techniques for Volumetric Video Attribute Compression

यह शोध पत्र वॉल्यूमेट्रिक वीडियो एट्रिब्यूट संपीड़न के लिए एक नवीन ढांचे का प्रस्ताव करता है जो एक ज्यामिति-आधारित इंटर-कोडिंग योजना, एक ग्राफ-आधारित मोशन-एस्टिमेशन पद्धति और एक इंटरपोलेशन-मुक्त फ्रैक्शनल-वॉक्सेल रिफाइनमेंट तकनीक को जोड़ता है, जिससे G-PCC, GeS-TM और V-PCC जैसे मौजूदा मानकों की तुलना में महत्वपूर्ण बिटरेट बचत प्राप्त होती है।

Haoran Hong, Eduardo Pavez, Antonio Ortega, Ryosuke Watanabe, Keisuke Nonaka2026-07-07
🤖 AI

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

यह शोध पत्र ईगो-व्यू (ego-view) ट्रैफ़िक दुर्घटना वीडियो में उत्तरदायता वितरण अनुमान (responsibility distribution estimation) के नवीन कार्य को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि फाइन-ट्यून्ड मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स ड्राइवर के प्रत्यक्ष दृश्य परिप्रेक्ष्य का लाभ उठाकर एजेंट की उत्तरदायता प्रतिशत को प्रभावी ढंग से अनुमानित कर सकते हैं।

Ryosei Tamura, Andrew Shin2026-07-07
⚡ electrical engineering

An Interpretable Deep Learning Framework for Discovery and Clinical Validation of Deep Radiomic Signatures in Tumor Classification

यह शोध पत्र एक व्याख्यात्मक (interpretable) डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है जो पारंपरिक होल-ट्यूमर रेडियोमिक्स की तुलना में कई मेडिकल इमेजिंग डेटासेट्स पर बेहतर ट्यूमर वर्गीकरण प्रदर्शन और जैविक अंतर्दृष्टि प्रदर्शित करते हुए, पुनरुत्पादनीय मात्रात्मक इमेजिंग बायोमार्कर निकालने और उन्हें मान्य करने के लिए सेगमेंटेशन, ग्रेड-कैम-गाइडेड सिग्नेचर डिस्कवरी और शैप-आधारित विश्लेषण को एकीकृत करता है।

Chengkun Sun, Jinqian Pan, Renjie Liang, Zhengkang Fan, Xin Miao, Yi Guo, Mei Liu, Muxuan Liang, Russell Terry, Jie Xu2026-07-07