💻 computer science

Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance

यह शोध पत्र कंधे के ऊपर से ली गई निगरानी फुटेज से मोबाइल कीस्ट्रोक्स को पुनर्गठित करने के लिए एक मल्टी-मोडल ढांचे का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि सिस्टम उच्च फाल्स-पॉजिटिव दरों और अवरोध (occlusion) के प्रति संवेदनशीलता के कारण अनियंत्रित वातावरण में विश्वसनीय पुनर्गठन प्राप्त करने में विफल रहता है, फिर भी यह ऐसे व्यवहारिक इंटेलिजेंस दृष्टिकोणों की परिचालन सीमाओं को प्रदर्शित करता है।

Mohammadreza Rashidi2026-06-30
💻 computer science

Benchmark AUC Is Not Deployable Reliability: A Cross-Dataset Audit of Off-the-Shelf Features for Surveillance Video Anomaly Detection

यह शोध पत्र प्रदर्शित करता है कि ऑफ-द-शेल्फ वीडियो विसंगति पहचान मॉडल (video anomaly detection models), समान-डेटासेट सेटिंग्स में उच्च बेंचमार्क AUC स्कोर प्राप्त करने के बावजूद, क्रॉस-डेटासेट परिदृश्यों में पूरी तरह विफल हो जाते हैं और यादृच्छिक संभावना (random chance) से बेहतर प्रदर्शन नहीं करते हैं, जो प्रयोगशाला प्रदर्शन और वास्तविक दुनिया में तैनात करने योग्य विश्वसनीयता के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Mohammadreza Rashidi2026-06-30
💻 computer science

GarmentZoom: Generating Zoomable Images from Garment Listings

GarmentZoom एक ऐसी प्रणाली है जो मानक लिस्टिंग से उच्च-सटीकता वाली, ज़ूम करने योग्य गारमेंट इमेज जेनरेट करती है, जो विभिन्न स्केल फैक्टर्स की एक विस्तृत श्रृंखला में स्थानिक रूप से असंबद्ध (spatially unaligned) क्लोज-अप संदर्भों से विवरणों को संश्लेषित करने के लिए एक एकल मॉडल को प्रशिक्षित करके ऐसा करती है, जिससे प्रति-इन्स्टेंस फाइन-ट्यूनिंग या सख्त स्थानिक संरेखण की आवश्यकता के बिना निर्बाध अन्वेषण सक्षम होता है।

Renjie Zhao, Jingwei Ma, Huy Huynh Cao, Brian Curless, Steven M. Seitz, Ira Kemelmacher-Shlizerman2026-06-30
💻 computer science

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET एक नवीन ढांचा है जो जेनेरिक विजुअल एनकोडिंग से आगे बढ़कर क्षेत्रीय SUVR प्रोफाइल सुपरविजन के माध्यम से संरचित मेटाबॉलिक सिमेंटिक्स को सीखने के द्वारा ब्रेन PET विश्लेषण को उन्नत करता है, जिसके परिणामस्वरूप मेटाबॉलिक पुनर्निर्माण, भाषा संरेखण और नैदानिक कार्यों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करने वाले नैदानिक रूप से व्याख्या योग्य एम्बेडिंग्स प्राप्त होते हैं।

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. C (…)2026-06-30
💻 computer science

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

यह शोध पत्र MultiDepth-3k बेंचमार्क प्रस्तुत करता है ताकि यह प्रकट किया जा सके कि मोनोकुलर फाउंडेशन मॉडल परतों वाली दृश्यों में कैसे विविध ज्यामितीय प्राथमिकताएं प्रदर्शित करते हैं, जो यह दर्शाता है कि प्रशिक्षण-मुक्त स्पेक्ट्रल रूपांतरण पूरक 3D व्याख्याओं को अनलॉक कर सकते हैं और गहराई पर्यवेक्षण एवं मूल्यांकन के लिए एक अस्पष्टता-जागरूक दृष्टिकोण का समर्थन करते हैं।

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang2026-06-30
⚡ electrical engineering

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

यह शोध पत्र VIB-AVSR का प्रस्ताव करता है, जो एक शोर-रोधी (noise-robust) ऑडियो-विजुअल स्पीच रिकग्निशन फ्रेमवर्क है जो बिना किसी संरचनात्मक परिवर्तन या अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के, प्रदर्शन बनाए रखने और शोर वाले वातावरण में निरूपण (representations) को नियमित करने के लिए LLM बैकबोन में वेरिएशनल इंफॉर्मेशन बॉटलनेक परतों को एकीकृत करता है।

Piyush Arora, Navlika Singh, Umberto Cappellazzo, Stavros Petridis, Maja Pantic2026-06-30
💻 computer science

PoseShield: Neural Collision Fields for Human Self-Collision Resolution

PoseShield सीधे SMPL पोज़ स्पेस में परिभाषित एक सैद्धांतिक रूप से आधारित न्यूरल कोलिजन कंस्ट्रेंट है जो मानव पोज़ एस्टीमेशन और मोशन जनरेशन में सेल्फ-कोलिजन्स को मजबूती से हल करने के लिए ईकोनलल रेगुलराइजेशन का लाभ उठाता है, एक नए बेंचमार्क पर 95.8% सफलता दर प्राप्त करता है और एक जनरेटर-एग्नोस्टिक पोस्ट-हॉक करेक्टर के रूप में कार्य करता है।

Zhengyuan Li, Zeyun Deng, Yifan Shen, Liangyan Gui, Miaolan Xie, Joseph Campbell, Xifeng Gao, Kui Wu, Zherong Pan, Anike (…)2026-06-30
💻 computer science

MF-UAVPose6D: A Model-Free Monocular 6-DoF Pose Estimation Framework for Fixed-Wing UAVs

यह शोध पत्र MF-UAVPose6D प्रस्तावित करता है, जो एक मॉडल-मुक्त मोनोक्यूलर फ्रेमवर्क है जो हीटमैप-गाइडेड लोकलाइजेशन, एक पर्सपेक्टिव-अवेयर मॉड्यूल और डायनेमिक टोपोलॉजिकल सैंपलिंग का लाभ उठाकर केवल RGB छवियों और कैमरा इंट्रिंसिक्स का उपयोग करके गैर-सहकारी फिक्स्ड-विंग UAVs के 6-DoF पोज़ का अनुमान लगाता है, जिसे एक नए निर्मित सिंथेटिक डेटासेट पर सत्यापित किया गया है।

Juanqin Liu, Leonardo Plotegher, Eloy Roura, Shaoming He2026-06-30
💻 computer science

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

यह शोध पत्र प्रदर्शित करता है कि OpenVLA के आंतरिक फीडफॉरवर्ड एक्टिवेशन्स (feedforward activations) पर प्रशिक्षित हल्के प्रोब्स (lightweight probes), बिना मूल पॉलिसी में किसी बदलाव के, ऑक्लूजन (occlusion) जैसे विजुअल डिस्ट्रीब्यूशन शिफ्ट के कारण होने वाली निकट-अवधि की कार्य विफलताओं की प्रभावी ढंग से भविष्यवाणी कर सकते हैं और उच्च सटीकता प्राप्त कर सकते हैं।

Dipesh Tharu Mahato, Rachel Ren2026-06-30✓ Author reviewed
💬 NLP

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

GUICrafter एक वीकली-सुपरवाइज्ड (weakly-supervised) GUI एजेंट है जो विशाल अनएनोटेटेड स्क्रीनशॉट्स और उच्च गुणवत्ता वाले डेटा की एक छोटी मात्रा पर प्रशिक्षित होने के लिए एक टू-स्टेज करिकुलम लर्निंग फ्रेमवर्क का लाभ उठाता है, जिससे यह UI-TARS जैसे उन्नत सिस्टम द्वारा उपयोग किए गए एनोटेटेड डेटा के केवल 0.1% की आवश्यकता के साथ बेहतर प्रदर्शन और क्रॉस-डिवाइस सामान्यीकरण प्राप्त करता है।

Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu2026-06-30