⚡ electrical engineering

Compression of 3D Gaussian Splatting Data Using GPU-friendly Graphics Texture Coding

यह शोध पत्र 3D गॉसियन स्प्लेटिंग के लिए एक GPU-अनुकूल संपीड़न विधि का प्रस्ताव करता है जो हार्डवेयर-त्वरित टेक्सचर कोडिंग और प्रिमिटिव रीऑर्डरिंग का लाभ उठाकर गोलाकार हार्मोनिक रंग गुणांकों (spherical harmonic color coefficients) को नगण्य दृश्य गुणवत्ता हानि के साथ कुशलतापूर्वक संपीड़ित करता है और बड़े पैमाने पर समानांतर डिकोडिंग को सक्षम बनाता है।

Amir Said, Randall Rauwendaal2026-07-17
💻 computer science

SwinAD: Multi-stage feature reconstruction for unsupervised industrial anomaly detection

SwinAD एक मल्टी-स्टेज फीचर रिकंस्ट्रक्शन फ्रेमवर्क है जो मल्टी-क्लास अनसुपरवाइज्ड इंडस्ट्रियल एनोमली डिटेक्शन में प्रतिस्पर्धी इमेज-लेवल डिटेक्शन और सुपीरियर पिक्सेल-लेवल लोकलाइजेशन प्राप्त करने के लिए एक फ्रोजन स्विन ट्रांसफॉर्मर V2 एनकोडर और एक डाइवर्सिटी-प्रिजर्विंग डिकोडर का लाभ उठाता है।

Huong Ninh, Chien Thai, Mai Xuan Trang, Vu-Minh Le, Thanh Ha Le, Long Tran2026-07-17
💻 computer science

Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection

यह शोध पत्र लर्निंग-डायनामिक्स-ड्रिवन मेमोरी एंड रिव्यू (LDMR) फ्रेमवर्क का प्रस्ताव करता है, जो मानव-समान इंट्रा-स्टेज रिव्यू और सीन-अवेयर क्रॉस-स्टेज मेमोरी इवोल्यूशन के माध्यम से डिस्ट्रीब्यूशन शिफ्ट और सूडो-लेबलिंग त्रुटियों के हानिकारक स्व-सुदृढ़ीकरण चक्र को तोड़कर लॉन्ग-इन्क्रीमेंटल 3D ऑब्जेक्ट डिटेक्शन में गंभीर मॉडल फॉरगेटिंग को कम करता है।

Peisheng Qian, Jie Xu, Xulei Yang, Na Zhao2026-07-17
🤖 machine learning

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

यह शोध पत्र स्टेबल डिफ्यूजन (Stable Diffusion) के लिए एक नवीन ड्यूल-गाइडेंस फ्रेमवर्क प्रस्तुत करता है जो आर्टिफ़ेक्ट्स को कम करने और सिमेंटिक फिडेलिटी (semantic fidelity) को बढ़ाने के लिए ऑटोमैटिक नेगेटिव प्रॉम्प्ट ऑप्टिमाइज़ेशन हेतु एक फाइन-ट्यून्ड सीक्वेंस-टू-सीक्वेंस एलएलएम (LLM) को लेटेंट-स्पेस गाइडेंस के लिए एक सीएनएन-आरएनएन (CNN-RNN) हाइब्रिड क्लासिफायर के साथ जोड़ता है।

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S2026-07-17
💻 computer science

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

यह शोधपत्र VIABench प्रस्तुत करता है, जो दृष्टिबाधित व्यक्तियों द्वारा की गई प्रथम-व्यक्ति रिकॉर्डिंग से प्राप्त एक व्यापक वीडियो बेंचमार्क है, जिसका उपयोग तीन मुख्य सहायता कार्यों—प्रोएक्टिव रिमाइंडर (सक्रिय अनुस्मारक), विजुअल क्वेश्चन अनसरिंग (दृश्य प्रश्नोत्तर), और विजन-गाइडेड इंटरैक्शन (दृष्टि-निर्देशित इंटरेक्शन)—में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए किया गया है, जो व्यावहारिक दृष्टि सहायता के लिए वर्तमान मॉडलों की वास्तविक समय की प्रतिक्रियाशीलता और प्रासंगिक तर्क क्षमता में महत्वपूर्ण अंतराल को प्रकट करता है।

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang2026-07-17
💻 computer science

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind एक व्यवस्थित ढांचा है जो एक विशेष MLLM (ReBind-Instruct) को पेश करके वीडियो संपादन में कई दृश्य स्रोतों के समन्वय की चुनौती का समाधान करता है, जो स्पष्ट संदर्भ टोकन के साथ अर्थपूर्ण निर्देश उत्पन्न करता है, जिससे दृश्य गुणों को उनके स्रोतों के साथ सटीक रूप से बांधना संभव होता है और मल्टी-रेफरेंस इमेज-कंडीशन वाले वीडियो संपादन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zh (…)2026-07-17
💻 computer science

GlobalForge: Towards Robust AI-Generated Image Detection

यह शोधपत्र GlobalForge को प्रस्तुत करता है, जो एक सुदृढ़ AI-जनित छवि पहचान ढांचा है जो नाजुक स्थानीय आर्टिफैक्ट्स से ध्यान हटाकर एक लोकल इंफॉर्मेशन बॉटलनेक और ग्लोबल स्ट्रक्चरल रीजनिंग मॉड्यूल के माध्यम से स्थिर वैश्विक संरचनात्मक तर्क पर केंद्रित करता है, जो वास्तविक दुनिया की क्षययुक्त छवियों और एक नए प्रस्तावित RealDeg-Bench पर अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu2026-07-17
🤖 AI

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

यह शोध पत्र एक डिस्टिलेशन-आधारित प्रीट्रेनिंग फ्रेमवर्क प्रस्तावित करता है जो मल्टीपल इंस्टेंस लर्निंग नेटवर्क को इनिशियलाइज़ करने के लिए स्लाइड-लेवल फाउंडेशन मॉडल्स (TITAN और CARE) को टीचर्स के रूप में उपयोग करता है, जिससे डेटा की कमी को दूर किया जा सके और 15 बेंचमार्क डेटासेट्स पर प्रदर्शन में सुधार किया जा सके, विशेष रूप से लीनियर प्रोबिंग और फ्यू-शॉट परिदृश्यों में।

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He2026-07-17
🤖 machine learning

Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

यह शोध पत्र टेस्ट-स्पेस ट्रेनिंग (TST) का प्रस्ताव करता है, जो एक स्व-पर्यवेक्षित दृष्टिकोण है जो विशेष रूप से एक विशिष्ट परीक्षण वातावरण से एकत्र किए गए बहु-मोडल डेटा पर क्रॉस-मोडल लर्निंग का लाभ उठाता है ताकि ऐसे विशिष्ट मॉडल विकसित किए जा सकें जो बड़े पैमाने के इंटरनेट डेटासेट पर पूर्व-प्रशिक्षित सामान्यज्ञ मॉडलों के मुकाबले प्रतिस्पर्धी प्रदर्शन प्राप्त करते हैं, जिससे बाहरी डेटा पर निर्भरता कम हो जाती है।

Kunal Pratap Singh, Ali Garjani, Rishubh Singh, Muhammad Uzair Khattak, Efe Tarhan, Jason Toskov, Andrei Atanov, Oğuzhan (…)2026-07-17
💻 computer science

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

VQ-Touch एक डेटा-कुशल स्पर्श संबंधी जनरेशन फ्रेमवर्क है जो विविध सेंसरों और परिदृश्यों में उच्च-सटीक स्पर्श संबंधी डेटा (tactile data) को संश्लेषित करने के लिए एक नवीन DM-VQGAN रिप्रजेंटेशन लर्नर और फ्यू-शॉट मिश्रित प्रशिक्षण के साथ एक डिस्क्रीट डिफ्यूजन डिकोडर का लाभ उठाता है, जिससे यह सामान्यीकरण और डेटा निर्भरता में मौजूदा विधियों की सीमाओं को दूर करता है।

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao2026-07-17