💻 computer science

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

माइंडफ्लो (MindFlow) तंत्रिका विज्ञान से प्रेरित एक दोहरी-पथवे जनरेटिव फ्रेमवर्क है जो जीवंत द्वैत चेहरे के एनीमेशन के लिए उच्च-स्तरीय संज्ञानात्मक इरादे और निम्न-स्तरीय मोटर रिफ्लेक्सों को सामंजस्यपूर्ण बनाता है, जिसमें विकसित होते भावनात्मक संदर्भ के लिए एक चंक-स्टेट (Chunk-State) दृष्टिकोण और सटीक, सुदृढ़ गति नियंत्रण के लिए चयनात्मक ध्वनिक गेटिंग (acoustic gating) के साथ एक कंडीशनल ऑटोरेग्रेसिव फ्लो मैचिंग नेटवर्क का उपयोग किया गया है।

Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li2026-06-29
🤖 AI

Improving Adversarial Robustness via Activation Amplification and Attenuation

यह शोध पत्र एक्टिवेशन एम्प्लीफिकेशन एंड एटेनुएशन (A3) को प्रस्तुत करता है, जो एक हल्का प्लग-इन मॉड्यूल है जो सीखने योग्य मापदंडों के माध्यम से न्यूरल नेटवर्क एक्टिवेशन्स को गतिशील रूप से रीस्केल करता है ताकि एम्प्लीफिकेशन मोड में भविष्यवाणियों को कमज़ोर करने और एटेनुएशन मोड में एडवरसैरियल रोबस्टनेस को बढ़ाने के कार्य को एक साथ पूरा किया जा सके, जिससे विभिन्न बैकबोन और डेटासेट्स पर नगण्य कम्प्यूटेशनल ओवरहेड के साथ निरंतर प्रदर्शन सुधार प्राप्त होता है।

Taïga Gonçalves, Yongsong Huang, Tomo Miyazaki, Shinichiro Omachi2026-06-29
💻 computer science

CSD: Content-aware Speculative Decoding for Efficient Image Generation

यह शोध पत्र CSD का प्रस्ताव करता है, जो एक कंटेंट-अवेयर स्पेक्युलेटिव डिकोडिंग एल्गोरिदम है जो वितरण संरेखण (डिस्ट्रीब्यूशन अलाइनमेंट) के माध्यम से उच्च आउटपुट गुणवत्ता बनाए रखते हुए ऑटो-रिग्रेसिव इमेज जनरेशन को महत्वपूर्ण रूप से तेज करने के लिए एंट्रॉपी-आधारित प्रायिकता विश्राम (प्रोबेबिलिटी रिलैक्सेशन) को एक इष्टतम रीसैंपलिंग रणनीति के साथ जोड़ता है।

Mingcheng Wang, Junbo Qiao, Yunchen Li, Lingfu Jiang, Wei Li, Jie Hu, Jiao Xie, Zhou Yu, Xinghao Chen, Guixu Zhang, Shao (…)2026-06-29
🤖 machine learning

A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of O(2)\mathrm{O}(2)

यह शोधपत्र विज़न ट्रांसफॉर्मर के लिए एक एकीकृत ढांचे (unified framework) को प्रस्तुत करता है जो O(2)\mathrm{O}(2) के किसी भी विवेकी उपसमूहों (discrete subgroups) के प्रति समरूप (equivariant) है, जो अभिव्यंजना (expressivity) पर सैद्धांतिक गारंटी प्रदान करता है और हवाई इमेजरी (aerial imagery) पर प्रयोगों के माध्यम से डेटा-दुर्लभ व्यवस्थाओं (data-scarce regimes) में बेहतर पहचान सटीकता प्रदर्शित करता है।

T\=ıkun Ông, Georg Bökman2026-06-29
💻 computer science

A Multi-Attribute Latent Space for Visual Analysis of Watches

यह शोध पत्र एक संवादात्मक दृश्य-विश्लेषण प्रणाली प्रस्तुत करता है जो विषम दृश्य और अर्थ संबंधी विशेषताओं को एक एकीकृत बहु-विशेषता वाले लेटेंट स्पेस में एकीकृत करके बड़ी कलाई घड़ी संग्रहों की मुक्त-अंत वाली खोज को सक्षम बनाता है, जिससे ई-कॉमर्स इंटरफेस में पारंपरिक मेटाडेटा-आधारित फ़िल्टरिंग की सीमाओं को दूर किया जा सके।

Kai Lawonn, Tobias Günther, Monique Meuschke2026-06-29
🤖 AI

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Home3D 1.0 एक मॉड्यूलर इमेज-टू-3D जनरेशन सिस्टम है जो फर्नीचर या सजावट की एकल संदर्भ छवियों को ज्यामिति पुनर्निर्माण, बनावट संश्लेषण, सामग्री प्राप्ति और सिमेंटिक पार्ट जनरेशन के लिए चार एकीकृत मॉड्यूल के माध्यम से उच्च-निष्ठा वाले, डिकम्पोजेबल 3D मेश और फिजिकली-बेस्ड रेंडरिंग सामग्रियों में परिवर्तित करता है।

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, YinDong Kong, Jing Li, Qi Wu, Fe (…)2026-06-29
🤖 AI

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

यह शोधपत्र पैरेलल रोलआउट एप्रोक्सिमेशन (PRA) को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो पिक्सेल-स्पेस ऑटोरेग्रेसिव इमेज जनरेशन में लो-डायमेंशनल इंटरमीडिएट स्टेट्स को जेनरेट करके इन्फ्रेंस-टाइम कंडीशंस को एप्रोक्सिमेट करता है, जिससे इन्फ्रेंस-टाइम गैप को पाटा जाता है, और इस प्रकार पिछले बिलियन-स्केल मॉडल्स की तुलना में काफी कम पैरामीटर्स के साथ ImageNet-1K पर स्टेट-ऑफ-द-आर्ट FID स्कोर प्राप्त किया जाता है।

Jiayi Xu, Di He, Guolin Ke2026-06-29
💻 computer science

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

यह शोध पत्र लेटेंट विजुअल डिफ्यूजन रीजनिंग (LVDR) का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो सटीक कौशल मूल्यांकन और व्याख्यात्मक, चरण-दर-चरण दृश्य तर्क प्रक्षेपवक्र (visual reasoning trajectories) दोनों उत्पन्न करके एक्शन क्वालिटी असेसमेंट को बढ़ाने के लिए कीपॉइंट-गाइडेड मोंटे कार्लो ट्री सर्च को एकीकृत करता है।

Xirui Teng, Nan Xi, Junsong Yuan2026-06-29
🤖 AI

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

यह शोध पत्र पहला व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि वर्तमान डिफ्यूजन-आधारित सुपर-रिज़ॉल्यूशन मॉडल सिंथेटिक प्रशिक्षण डेटा से वास्तविक क्रॉस-सेंसर सैटेलाइट इमेजरी में संक्रमण के दौरान एक महत्वपूर्ण डोमेन गैप से ग्रस्त होते हैं, जो यह प्रकट करता है कि जहाँ सिंथेटिक प्रशिक्षण वास्तविक डेटा पर विफल रहता है, वहीं वास्तविक डेटा पर प्रशिक्षण अनुकूलन चुनौतियों को पेश करता है जो सुपर-रिज़ॉल्यूशन को डोमेन अनुकूलन से अलग करने की आवश्यकता को रेखांकित करता है।

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba2026-06-29
💻 computer science

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

यह शोध पत्र स्पेक्ट्रल डिनोइजिंग सिग्नेचर (SDS) प्रस्तुत करता है, जो एक गैर-आक्रामक एट्रिब्यूशन विधि है जो प्रत्येक मॉडल के अद्वितीय स्पेक्ट्रल ज्योमेट्री को उसके डिनोइजिंग व्यवहार में फिंगरप्रिंट करके डिफ्यूजन-जनरेटेड छवियों के स्रोत की पहचान करती है, और बिना किसी इनवर्जन या ऑप्टिमाइजेशन के विविध आर्किटेक्चर और प्रशिक्षण स्थितियों में उच्च सटीकता प्राप्त करती है।

Pragati Shuddhodhan Meshram, Varun Chandrasekaran2026-06-29