🤖 machine learning

A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of O(2)\mathrm{O}(2)

यह शोधपत्र विज़न ट्रांसफॉर्मर के लिए एक एकीकृत ढांचे (unified framework) को प्रस्तुत करता है जो O(2)\mathrm{O}(2) के किसी भी विवेकी उपसमूहों (discrete subgroups) के प्रति समरूप (equivariant) है, जो अभिव्यंजना (expressivity) पर सैद्धांतिक गारंटी प्रदान करता है और हवाई इमेजरी (aerial imagery) पर प्रयोगों के माध्यम से डेटा-दुर्लभ व्यवस्थाओं (data-scarce regimes) में बेहतर पहचान सटीकता प्रदर्शित करता है।

T\=ıkun Ông, Georg Bökman2026-06-29
💻 computer science

A Multi-Attribute Latent Space for Visual Analysis of Watches

यह शोध पत्र एक संवादात्मक दृश्य-विश्लेषण प्रणाली प्रस्तुत करता है जो विषम दृश्य और अर्थ संबंधी विशेषताओं को एक एकीकृत बहु-विशेषता वाले लेटेंट स्पेस में एकीकृत करके बड़ी कलाई घड़ी संग्रहों की मुक्त-अंत वाली खोज को सक्षम बनाता है, जिससे ई-कॉमर्स इंटरफेस में पारंपरिक मेटाडेटा-आधारित फ़िल्टरिंग की सीमाओं को दूर किया जा सके।

Kai Lawonn, Tobias Günther, Monique Meuschke2026-06-29
🤖 AI

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0 एक मॉड्यूलर इमेज-टू-3D जनरेशन सिस्टम है जो फर्नीचर या सजावट की एकल संदर्भ छवियों को ज्यामिति पुनर्निर्माण, बनावट संश्लेषण, सामग्री प्राप्ति और सिमेंटिक पार्ट जनरेशन के लिए चार एकीकृत मॉड्यूल के माध्यम से उच्च-निष्ठा वाले, डिकम्पोजेबल 3D मेश और फिजिकली-बेस्ड रेंडरिंग सामग्रियों में परिवर्तित करता है।

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, YinDong Kong, Jing Li, Qi Wu, Fe (…)2026-06-29
🤖 AI

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

यह शोधपत्र पैरेलल रोलआउट एप्रोक्सिमेशन (PRA) को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो पिक्सेल-स्पेस ऑटोरेग्रेसिव इमेज जनरेशन में लो-डायमेंशनल इंटरमीडिएट स्टेट्स को जेनरेट करके इन्फ्रेंस-टाइम कंडीशंस को एप्रोक्सिमेट करता है, जिससे इन्फ्रेंस-टाइम गैप को पाटा जाता है, और इस प्रकार पिछले बिलियन-स्केल मॉडल्स की तुलना में काफी कम पैरामीटर्स के साथ ImageNet-1K पर स्टेट-ऑफ-द-आर्ट FID स्कोर प्राप्त किया जाता है।

Jiayi Xu, Di He, Guolin Ke2026-06-29
💻 computer science

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

यह शोध पत्र लेटेंट विजुअल डिफ्यूजन रीजनिंग (LVDR) का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो सटीक कौशल मूल्यांकन और व्याख्यात्मक, चरण-दर-चरण दृश्य तर्क प्रक्षेपवक्र (visual reasoning trajectories) दोनों उत्पन्न करके एक्शन क्वालिटी असेसमेंट को बढ़ाने के लिए कीपॉइंट-गाइडेड मोंटे कार्लो ट्री सर्च को एकीकृत करता है।

Xirui Teng, Nan Xi, Junsong Yuan2026-06-29
🤖 AI

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

यह शोध पत्र पहला व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि वर्तमान डिफ्यूजन-आधारित सुपर-रिज़ॉल्यूशन मॉडल सिंथेटिक प्रशिक्षण डेटा से वास्तविक क्रॉस-सेंसर सैटेलाइट इमेजरी में संक्रमण के दौरान एक महत्वपूर्ण डोमेन गैप से ग्रस्त होते हैं, जो यह प्रकट करता है कि जहाँ सिंथेटिक प्रशिक्षण वास्तविक डेटा पर विफल रहता है, वहीं वास्तविक डेटा पर प्रशिक्षण अनुकूलन चुनौतियों को पेश करता है जो सुपर-रिज़ॉल्यूशन को डोमेन अनुकूलन से अलग करने की आवश्यकता को रेखांकित करता है।

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba2026-06-29
💻 computer science

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

यह शोध पत्र स्पेक्ट्रल डिनोइजिंग सिग्नेचर (SDS) प्रस्तुत करता है, जो एक गैर-आक्रामक एट्रिब्यूशन विधि है जो प्रत्येक मॉडल के अद्वितीय स्पेक्ट्रल ज्योमेट्री को उसके डिनोइजिंग व्यवहार में फिंगरप्रिंट करके डिफ्यूजन-जनरेटेड छवियों के स्रोत की पहचान करती है, और बिना किसी इनवर्जन या ऑप्टिमाइजेशन के विविध आर्किटेक्चर और प्रशिक्षण स्थितियों में उच्च सटीकता प्राप्त करती है।

Pragati Shuddhodhan Meshram, Varun Chandrasekaran2026-06-29
🤖 AI

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR एक वन-स्टेप डिफ्यूजन मॉडल है जो एक ऑक्यूपेंसी-गाइडेड डिस्क्रिमिनेटर, अपूर्ण मास्क को संभालने के लिए एक अल्फा हेड, और उच्च गुणवत्ता वाले प्रशिक्षण डेटा को क्यूरेट करने के लिए एक सिमेंटिक-एंकोर्ड वेरिफिकेशन पाइपलाइन को पेश करके कुशल, इफेक्ट-अवेयर और मास्क-रोबस्ट ऑब्जेक्ट रिमूवल प्राप्त करता है, जिसके परिणामस्वरूप मल्टी-स्टेप बेसलाइन्स की तुलना में काफी तेज़ इन्फरेंस के साथ बेहतर परसेप्चुअल क्वालिटी प्राप्त होती है।

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang2026-06-29
🤖 machine learning

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

यह शोध पत्र CME-AQA का प्रस्ताव करता है, जो एक क्रॉस-व्यू मल्टीमॉडल फ्रेमवर्क है जो पारंपरिक चीनी चिकित्सा पुनर्वास प्रशिक्षण में अवरोध (occlusion) की चुनौतियों को दूर करने के लिए प्रथम-व्यक्ति और तृतीय-व्यक्ति वीडियो को एकीकृत करता है, जो मौजूदा सिंगल-व्यू विधियों की तुलना में एक्यूपंक्चर और तुइना तकनीकों के लिए एक्शन क्वालिटी असेसमेंट में बेहतर प्रदर्शन प्रदर्शित करता है।

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum2026-06-29
🤖 AI

BiDeMem: Bidirectional Degradation Memory for Explainable Image Restoration

यह शोध पत्र BiDeMem का प्रस्ताव करता है, जो एक द्विदिश क्षरण स्मृति (bidirectional degradation memory) ढांचा है जो संकुचित स्मृति स्लॉट्स को पुनर्प्राप्त करके व्याख्यात्मक छवि बहाली (explainable image restoration) को बढ़ाता है ताकि बहाली प्रक्रिया को एक साथ निर्देशित किया जा सके और एक सत्यापन योग्य स्पष्टीकरण पथ प्रदान किया जा सके, जो मौजूदा क्षरण-जागरूक विधियों की तुलना में बेहतर प्रदर्शन और व्याख्यात्मकता प्रदर्शित करता है।

Xinrui Wu, Lichen Huang2026-06-29