💻 computer science

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

यह शोध पत्र "क्रॉस-स्पेस डिस्टिलेशन" (Cross-Space Distillation) प्रस्तुत करता है, जो एक हल्के "ब्रिज" (Bridge) मॉड्यूल का उपयोग करने वाला एक नवीन ढांचा है ताकि आधुनिक, उच्च-क्षमता वाले डिफ्यूजन टीचर्स (जैसे SD 3.5 और Flux) को अलग-अलग लेटेंट स्पेस (जैसे SD 1.5) में कॉम्पैक्ट, वन-स्टेप स्टूडेंट्स को प्रभावी ढंग से प्रशिक्षित करने में सक्षम बनाया जा सके, जिससे परिनियोजन दक्षता (deployment efficiency) और इकोसिस्टम अनुकूलता बनाए रखते हुए गुणवत्ता में महत्वपूर्ण सुधार प्राप्त किया जा सके।

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuo (…)2026-07-01
🤖 AI

FLORA: A deep learning approach to predict forest attributes from heterogeneous LiDAR data

यह शोध पत्र FLORA को प्रस्तुत करता है, जो एक ऑक्ट्री-आधारित बैकबोन और लेट-फ्यूजन गेटिंग मैकेनिज्म का लाभ उठाने वाला एक डीप लर्निंग फ्रेमवर्क है, जो फ्रांस के विषम, बहु-स्थितीय LiDAR डेटा से छह प्रमुख वन विशेषताओं की मजबूती से भविष्यवाणी करने के लिए उच्च सटीकता और मौजूदा मॉडलों की तुलना में बेहतर क्रॉस-सीजन प्रदर्शन प्राप्त करता है।

Emilie Vautier, Clément Mallet, Cédric Vega2026-07-01
💻 computer science

GEAR: Guided End-to-End AutoRegression for Image Synthesis

GEAR एक नवीन एंड-टू-एंड प्रशिक्षण ढांचा पेश करता है जो एक ड्यूल रीड-आउट तंत्र के माध्यम से एक वेक्टर-क्वांटाइज्ड टोकेनाइज़र और एक ऑटोरेग्रेसिव जनरेटर को संयुक्त रूप से अनुकूलित करता है, जो एक ऐसा प्रतिनिधित्व संरेखण सक्षम बनाता है जो टोकेनाइज़र को एक ऐसे इंडेक्स वितरण की ओर निर्देशित करता है जिसे जनरेटर के लिए भविष्यवाणी करना आसान हो और छवि संश्लेषण अभिसरण को महत्वपूर्ण रूप से त्वरित करता है।

Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng (…)2026-07-01
⚡ electrical engineering

Learnable Blur Kernel for Single-Image Defocus Deblurring in the Wild

यह शोध पत्र एक नवीन अनसुपरवाइज्ड डिफोकस डीब्लरिंग फ्रेमवर्क प्रस्तावित करता है जो डिफोकस मैप अनुमान के लिए एक लर्नबल ब्लर कर्नेल को एक नए डिफोकस एडवरसेरियल लॉस द्वारा निर्देशित जेनरेटिव एडवरसेरियल नेटवर्क (DefocusGAN) के साथ जोड़ता है, जिससे ड्यूल-पिक्सेल सेंसर की आवश्यकता के बिना मैप सटीकता और संवेदी छवि गुणवत्ता दोनों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jucai Zhai, Pengcheng Zeng, Chihao Ma, Yong Zhao, Jie Chen2026-06-30
💻 computer science

Multimodal Large Language Model driven Radiology Report Generation with Clinical Knowledge Enhancement

यह शोध पत्र MLLM-RRG का प्रस्ताव करता है, जो एक नवीन रेडियोलॉजी रिपोर्ट जनरेशन विधि है जो सटीक और नैदानिक रूप से प्रासंगिक चेस्ट एक्स-रे रिपोर्ट उत्पन्न करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को शारीरिक विशेषता निष्कर्षण (anatomical feature extraction), रोग-उन्मुख नैदानिक संरेखण (disease-oriented clinical alignment) और नैदानिक गुणवत्ता सुदृढ़ीकरण शिक्षण (clinical quality reinforcement learning) के साथ एकीकृत करता है, जो अत्याधुनिक दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Miaojing Shi, Tianyu Cen, Zijie Yue, Meng Wei, Oluwatosin Alabi, Tom Vercauteren2026-06-30
💻 computer science

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

यह शोध पत्र अटेंशन मैकेनिज्म की द्विघातीय (quadratic) कम्प्यूटेशनल सीमाओं को दूर करने के लिए वीडियो डिफ्यूजन मॉडल्स में कुशल टेम्पोरल फीचर एक्सट्रैक्टर्स के रूप में द्विदिश (bidirectional) स्ट्रक्चर्ड स्टेट स्पेस मॉडल्स (SSMs) को एकीकृत करने का प्रस्ताव देता है, जिससे मेमोरी की खपत में काफी कमी के साथ उच्च-गुणवत्ता वाले दीर्घकालिक वीडियो निर्माण को सक्षम बनाया जा सके।

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo2026-06-30
💬 NLP

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

यह शोधपत्र VEV-UAP प्रस्तुत करता है, जो एक लागत-कुशल और कार्य-अज्ञेय (task-agnostic) हमला ढांचा है जो टेक्स्ट इनपुट की आवश्यकता के बिना विभिन्न मॉडलों और कार्यों में अत्याधुनिक सफलता दर प्राप्त करने के लिए LVLM विजन एनकोडर्स के मिडिल-लेयर अटेंशन मैकेनिज्म के वैल्यू कंपोनेंट्स में संरचनात्मक रूप से केंद्रित कमजोरियों का लाभ उठाता है।

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim2026-06-30
💻 computer science

Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems

यह शोध पत्र मोर्फियस (Morpheus) का परिचय देता है, जो 130 वास्तविक दुनिया के वीडियो और संरक्षण नियमों (conservation laws) का उपयोग करने वाला एक भौतिकी-आधारित मूल्यांकन ढांचा है, जो यह प्रदर्शित करता है कि समकालीन वीडियो जनरेशन मॉडल दृश्य रूप से आकर्षक परिणाम उत्पन्न करने के बावजूद न्यूटनियन गतिकी (Newtonian dynamics) को सटीक रूप से एनकोड करने में विफल रहते हैं।

Antonios Tragoudaras, Chenyu Zhang, Daniil Cherniavskii, Antonios Vozikis, Thijmen Nijdam, Derck W. E. Prinzhorn, Mark B (…)2026-06-30
💻 computer science

End-to-End Facial Expression Detection in Long Videos

यह शोध पत्र FEDN को प्रस्तुत करता है, जो एक एंड-टू-एंड फेशियल एक्सप्रेशन डिटेक्शन नेटवर्क है जो मल्टी-स्केल टेम्पोरल अटेंशन मैकेनिज्म के माध्यम से एक्सप्रेशन स्पॉटिंग और रिकग्निशन को एकीकृत करता है, सार्वजनिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के साथ-साथ विशेषज्ञ द्वारा एनोटेट किए गए और स्व-रिपोर्ट किए गए इमोशन लेबल्स के बीच एक महत्वपूर्ण विसंगति को भी प्रकट करता है।

Yini Fang, Alec F. Diallo, Frederic Jumelle, Bertram Shi2026-06-30
💻 computer science

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

यह शोध पत्र ISAC को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) और मॉडल-अज्ञेय (model-agnostic) विधि है जो सेल्फ-अटेंशन कंट्रोल के माध्यम से क्लास-अग्नोस्टिक इंस्टेंस लेआउट को स्थिर करके और फिर उन क्षेत्रों के भीतर सिमेंटिक क्रॉस-अटेंशन को बांधकर टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स में मल्टी-इंस्टेंस जनरेशन में सुधार करता है, जिससे छोड़े गए, मर्ज किए गए या सिमेंटिक रूप से मिश्रित ऑब्जेक्ट्स की समस्याओं को प्रभावी ढंग से हल किया जाता है।

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim2026-06-30