💻 computer science

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

यह शोधपत्र GuideMe प्रस्तुत करता है, जो स्ट्रीमिंग वीडियो के लिए पहला मल्टी-डोमेन बेंचमार्क है जिसे क्लोज्ड-लूप इंटरैक्टिव टास्क गाइडेंस पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन और प्रशिक्षण देने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल निर्देश प्रदान करने में तो उत्कृष्ट हैं, लेकिन वास्तविक समय में त्रुटि का पता लगाने और सुधारात्मक फीडबैक देने में काफी संघर्ष करते हैं।

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau2026-07-07
🤖 AI

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

ओम्नीफोकस (OmniFocus) एक प्रशिक्षण-मुक्त, क्वेरी-निर्देशित टोकन संपीड़न विधि है जो ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स के लिए ऑडियो और वीडियो टोकन के महत्व का स्वतंत्र रूप से आकलन करके मोडैलिटी-सिमेट्रिक संपीड़न प्राप्त करती है, जिससे क्रॉस-मोडल संरेखण को बनाए रखते हुए और सटीकता-दक्षता ट्रेड-ऑफ में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करते हुए अनुमान लागत को कम किया जाता है।

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun2026-07-07
💻 computer science

ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion

यह शोध पत्र गतिशील दृश्यों में मल्टी-एक्सपोज़र फ्यूज़न के मूल्यांकन के लिए विशेषज्ञ-सत्यापित ग्राउंड ट्रुथ के साथ एक बड़े पैमाने के बेंचमार्क, ExpoMotion का परिचय देता है, और हाउसहोल्डर ऑर्थोगोनल प्रोजेक्शन (HOP) नेटवर्क का प्रस्ताव करता है, जो बेहतर आर्टिफ़ेक्ट-मुक्त विवरण बहाली के लिए एक्सपोज़र संरेखण और घोस्ट रिमूवल को प्रभावी ढंग से अलग करने हेतु हाउसहोल्डर रूपांतरणों का उपयोग करता है।

Yao Liu, Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Yabin Peng, Huipeng Lin, Lei Zhang, Jufeng Yang2026-07-07
🤖 AI

Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning

यह शोध पत्र टेक्स्ट ऐज़ पार्शियल कंस्ट्रेंट (TPC) का प्रस्ताव करता है, जो एक कोर-रेसिड्यूअल अलाइनमेंट फ्रेमवर्क है जो मल्टी-व्यू कैप्शन को अधूरे पर्यवेक्षण के रूप में मानता है ताकि एक सर्वसम्मत अर्थपूर्ण कोर को आसवित (distill) किया जा सके और अनकहे रेसिड्यूल्स पर निर्भरता को स्पष्ट रूप से हतोत्साहित किया जा सके, जिससे अपर्याप्त भाषाई पर्यवेक्षण के तहत सुदृढ़ और विश्वसनीय विजन-लैंग्वेज रिप्रजेंटेशन प्राप्त किया जा सके।

Chengzhen Yu, Canran Xiao, Siyuan Ma, Yang Liu2026-07-07
📊 statistics

CuBAS: Information Geometric Curvature-Based Adaptive Sampling for Supervised Classification

CuBAS एक सूचनात्मक-ज्यामितीय (information-geometric) अनुकूली नमूनाकरण ढांचा है जो पर्यवेक्षित वर्गीकरण (supervised classification) के लिए पॉट्स मार्कोव रैंडम फील्ड मॉडल से प्राप्त स्थानीय वक्रता (local curvature) का लाभ उठाकर समरूप और सीमा-सूचनात्मक डेटा बिंदुओं दोनों की पहचान और चयन करता है, जिससे मौजूदा विधियों की तुलना में विविध डेटासेट पर बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Alexandre L. M. Levada2026-07-07
💻 computer science

Rethinking Brain Decoding with CLIP: The Role of Adversarial Robustness

यह शोध पत्र यह प्रदर्शित करता है कि मानक मॉडलों के बजाय CLIP के एडवर्सैरियली रोबस्ट (adversarially robust) वेरिएंट का उपयोग करना, स्थिर और बोधगम्य रूप से संरचित प्रतिनिधित्वों को बढ़ावा देकर fMRI-आधारित मस्तिष्क डिकोडिंग प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है जो तंत्रिका गतिविधि के साथ बेहतर तालमेल बिठाते हैं।

Byeongseo Bok, Futa Waseda, Jun Liu, Isao Echizen2026-07-07
🤖 machine learning

Seeing Through WiFi: Lightweight Human Pose Estimation with Dynamic Kernel Attention

यह शोध पत्र WiLHPE प्रस्तुत करता है, जो एक हल्का और कुशल ढांचा है जो वाई-फाई आधारित मानव मुद्रा अनुमान (ह्यूमन पोस एस्टीमेशन) के लिए डायनेमिक कर्नेल अटेंशन और हाइपरपैरामीटर ऑप्टिमाइज़ेशन का उपयोग करता है ताकि गोपनीयता बनाए रखते हुए संसाधन-सीमित उपकरणों पर अत्याधुनिक सटीकता प्राप्त की जा सके।

Toan D. Gian, Van-Dinh Nguyen, Vo Phi Son, Nhan Thanh Nguyen, Dinh Thai Hoang, Diep N. Nguyen, Nguyen Cong Luong, Symeon (…)2026-07-07
💬 NLP

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass एक ओपन-सोर्स, गोपनीयता-संरक्षित प्रणाली है जो दृष्टिबाधित और कम दृष्टि वाले उपयोगकर्ताओं के लिए क्लाउड सेवाओं पर निर्भर हुए बिना, कम-विलंबता (लो-लेटेंसी), वास्तविक समय की मल्टीमॉडल सहायता सक्षम करने के लिए ESP32-आधारित चश्मों और एक स्थानीय डिवाइस के बीच विजुअल सेंसिंग और कंप्यूटिंग को विभाजित करती है।

Mengzhang Li, Yuan Yao2026-07-07
💻 computer science

From General Actions to Domain-Specific Monitoring: Prior-Adaptive Transfer for Skeleton-Based Action Recognition

यह शोध पत्र प्रायर-एडेप्टिव ट्रांसफर ऑफ स्केलेटन्स (PATS) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो एक अनुकूली छंटनी तंत्र (adaptive pruning mechanism) के माध्यम से कार्य-प्रासंगिक मोशन प्रायर को चुनिंदा रूप से बनाए रखकर और अनावश्यक प्रायर को फ़िल्टर करके स्वास्थ्य देखभाल निगरानी जैसे डोमेन-विशिष्ट कार्यों के लिए सामान्य स्केलेटन-आधारित एक्शन रिकग्निशन मॉडल के हस्तांतरण को बढ़ाता है, जिससे प्रदर्शन और दक्षता दोनों में सुधार होता है।

Hao Wang, Di Yang, Jiangtao Wang2026-07-07
💬 NLP

Efficient Decentralized Multi-task Dataset Valuation via Model Merging

यह शोधपत्र DMVM का प्रस्ताव करता है, जो एक नवीन ढांचा है जो टास्क अरिथमेटिक (task arithmetic) और सुरक्षित एकत्रीकरण (secure aggregation) का लाभ उठाकर मल्टी-टास्क डेटासेटों के कुशल, गोपनीयता-संरक्षित और विकेंद्रीकृत मूल्यांकन को सक्षम बनाता है, जिससे डेटा साझा किए बिना या पुनरप्रशिक्षण (retraining) की आवश्यकता के बिना सीधे मॉडल मापदंडों से योगदान का अनुमान लगाया जा सके।

Mohammadsajad Alipour, Mohammad Mohammadi Amiri2026-07-07