⚡ electrical engineering

CorStitch: Accessible Video Stitching for Coral Monitoring

CorStitch एक ओपन-सोर्स, उपयोगकर्ता के अनुकूल वीडियो-स्टिचिंग सॉफ्टवेयर है जो अंडरवॉटर कोरल रीफ वीडियो से स्वचालित रूप से उच्च-गुणवत्ता वाले, जियोरेफरेंस वाले मोज़ाइक उत्पन्न करने के लिए फूरियर-आधारित इमेज रजिस्ट्रेशन का उपयोग करता है, जो विविध निगरानी हितधारकों के लिए मौजूदा उपकरणों का एक सुलभ विकल्प प्रदान करता है।

Julian Christopher L. Maypa, Johnenn R. Manalang, Wilfredo Y. Licuanan, Maricor N. Soriano2026-07-21
💻 computer science

PI-H2T: Enhancing Long-Tailed Visual Recognition with Permutation-Invariant and Head-to-Tail Feature Fusion

PI-H2T एक प्लग-एंड-प्ले विधि है जो रिप्रजेंटेशन स्पेस को अनुकूलित करने के लिए परम्यूटेशन-इनवेरिएंट फीचर फ्यूजन और सिमेंटिक जानकारी को स्थानांतरित करने के लिए हेड-टू-टेल फीचर फ्यूजन का उपयोग करके लॉन्ग-टेल्ड विजुअल रिकग्निशन को बढ़ाता है, जिससे क्लासिफायर बायस को ठीक किया जाता है और टेल क्लास प्रदर्शन में सुधार होता है।

Mengke Li, Zhikai Hu, Yang Lu, Weichao Lan, Yiu-ming Cheung, Hui Huang2026-07-21
💬 NLP

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

यह शोधपत्र LEGO Co-builder प्रस्तुत करता है, जो एक हाइब्रिड बेंचमार्क और एकीकृत ढांचा है जिसे मल्टीमॉडल LEGO असेंबली कार्यों में विजन-लैंग्वेज मॉडल्स की सूक्ष्म दृश्य समझ और अवस्था पहचान क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जहाँ ऑब्जेक्ट डिटेक्शन अच्छा प्रदर्शन करता है, वहीं वर्तमान मॉडल अभी भी सटीक दृश्य बोध और असेंबली अवस्था तर्क के साथ काफी संघर्ष करते हैं।

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowsk (…)2026-07-21
🤖 AI

DCSCR: A Class-Specific Collaborative Representation based Network for Image Set Classification

यह शोध पत्र डीप क्लास-स्पेसिफिक कोलैबोरेटिव रिप्रेजेंटेशन (DCSCR) नेटवर्क का प्रस्ताव करता है, जो एक नवीन फ्यू-शॉट इमेज सेट वर्गीकरण दृष्टिकोण है जो फ्रेम- और कॉन्सेप्ट-स्तरीय विशेषताओं को एक साथ सीखने और सेट समानताओं को अनुकूल रूप से मापने के लिए डीप फीचर एक्सट्रैक्शन को एक क्लास-स्पेसिफिक कोलैबोरेटिव रिप्रेजेंटेशन मेट्रिक लर्निंग मॉड्यूल के साथ एकीकृत करता है, जिससे यह फ्यू-शॉट डेटासेट्स पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Xizhan Gao, Wei Hu2026-07-21
💻 computer science

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X एक अत्याधुनिक, बहुमुखी मल्टीमॉडल फ्रेमवर्क है जो एक ऑटोरेग्रेसिव डिफ्यूजन ट्रांसफॉर्मर और एक नवीन संदर्भ मोशन कंडीशनिंग रणनीति का लाभ उठाता है, जिसे सबसे बड़े एकीकृत मोशन डेटासेट (OmniMoCap-X) पर प्रशिक्षित किया गया है, ताकि टेक्स्ट-टू-मोशन, म्यूजिक-टू-डांस और स्पीच-टू-जेस्चर जैसे विविध कार्यों में यथार्थवादी, सुसंगत और नियंत्रणीय पूर्ण-शरीर मानव गतियां उत्पन्न की जा सकें।

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu2026-07-21
🤖 AI

BUSTR: Descriptor-Aware Vision-Language Learning for Breast Ultrasound Report Generation

यह शोध पत्र BUSTR का प्रस्ताव करता है, जो एक डिस्क्रिप्टर-अवेयर विजन-लैंग्वेज फ्रेमवर्क है जो सीमित रिपोर्ट पर्यवेक्षण के तहत ब्रेस्ट अल्ट्रासाउंड रिपोर्ट उत्पन्न करने के लिए एक मल्टी-टास्क मॉडल को प्रशिक्षित करने हेतु स्ट्रक्चर्ड लीजन एनोटेशन और रेडियोमिक्स फीचर्स का लाभ उठाता है, जो मौजूदा बेसलाइन्स की तुलना में बेहतर नैदानिक प्रभावकारिता और डिस्क्रिप्टर रिकवरी प्राप्त करता है।

Rawa Mohammed, Mina Attin, Laxmi Gewali, Bryar Shareef2026-07-21
⚡ electrical engineering

Particle Image Velocimetry Refinement via Consensus ADMM for Active Fluid Control

यह शोध पत्र एक सर्वसम्मति-आधारित (consensus-based) ADMM ढांचे को प्रस्तुत करता है जो एकल-एल्गोरिदम दृष्टिकोण की सीमाओं को दूर करने के लिए कई विषम पार्टिकल इमेज वेलोसिटीमाट्री (PIV) अनुमानकों को संलयित करता है, जिससे सटीकता में महत्वपूर्ण सुधार प्राप्त होता है और ड्रैग न्यूनीकरण (drag minimization) तथा स्थिरीकरण (maximization) जैसे सक्रिय द्रव नियंत्रण कार्यों के लिए वास्तविक समय सुदृढीकरण शिक्षण (real-time reinforcement learning) सक्षम होता है।

Alan Bonomi, Francesco Banelli, Antonio Terpin2026-07-21
💻 computer science

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster एक एकीकृत स्थानिक-कालिक ऑटो-रिग्रेसिव वीडियो डिफ्यूजन मॉडल है जो मौजूदा संदर्भ-निर्भर और ज्यामिति-आधारित एनिमेशन विधियों की सीमाओं को दूर करने के लिए सॉफ्ट आइडेंटिटी कंस्ट्रेंट्स और इम्पलिसिट 3D अवेयरनेस का उपयोग करके आइडेंटिटी- और व्यू-अवेयर टॉकिंग पोर्ट्रेट्स उत्पन्न करता है।

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou2026-07-21
💻 computer science

REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion

REGLUE एक एकीकृत लेटेंट डिफ्यूजन फ्रेमवर्क है जो एक ही SiT बैकबोन के भीतर VAE लेटेंट्स को ग्लोबल और लोकली कंप्रेस्ड विजन फाउंडेशन मॉडल सेमेंटिक्स के साथ उलझाकर (entangling) इमेज सिंथेसिस को बढ़ाता है, जिससे मौजूदा बेसलाइन्स की तुलना में बेहतर सैंपल क्वालिटी और तेज़ कन्वर्जेंस प्राप्त होता है।

Giorgos Petsangourakis, Christos Sgouropoulos, Bill Psomas, Theodoros Giannakopoulos, Giorgos Sfikas, Ioannis Kakogeorgi (…)2026-07-21
💻 computer science

UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders

यह शोध पत्र UPLiFT को प्रस्तुत करता है, जो पिक्सेल-सघन फीचर अपसैंपलिंग (pixel-dense feature upsampling) के लिए एक कुशल आर्किटेक्चर है, जो मौजूदा क्रॉस-अटेंशन-आधारित विधियों की तुलना में कम इन्फरेंस लागत के साथ अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक नवीन लोकल अटेंडर (Local Attender) ऑपरेटर का उपयोग करता है, और साथ ही जनरेटिव डाउनस्ट्रीम कार्यों में भी प्रभावशीलता प्रदर्शित करता है।

Matthew Walmer, Saksham Suri, Anirud Aggarwal, Abhinav Shrivastava2026-07-21