🤖 machine learning

SloMo-Fast: Slow-Momentum and Fast-Adaptive Teachers for Source-Free Continual Test-Time Adaptation

यह शोध पत्र SloMo-Fast को पेश करता है, जो एक सोर्स-फ्री कॉन्टिनुअल टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो दीर्घकालिक ज्ञान प्रतिधारण (नॉलेज रिटेंशन) और तीव्र डोमेन अनुकूलन के बीच प्रभावी ढंग से संतुलन बनाने के लिए पूरक स्लो (slow) और फास्ट (fast) टीचर्स का उपयोग करता है, जिससे यह विकसित और आवर्ती डोमेन शिफ्ट्स को संभालने में मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

Md Akil Raihan Iftee, Mir Sazzat Hossain, Rakibul Hasan Rajib, Tariq Iqbal, Md Mofijul Islam, M Ashraful Amin, Amin Ahsa (…)2026-07-20
💻 computer science

Gabor Fields: Orientation-Selective Level-of-Detail for Volume Rendering

यह शोध पत्र गेबोर फील्ड्स (Gabor Fields) को प्रस्तुत करता है, जो गेबोर कर्नेल का एक ओरिएंटेशन-चयनात्मक मिश्रण है जो गाऊसीअन-आधारित वॉल्यूम रेंडरिंग के लिए कुशल, निरंतर फ्रीक्वेंसी फ़िल्टरिंग और त्वरित रे ट्रैवर्सल को सक्षम बनाता है, जबकि पदानुक्रमित स्तर-विस्तार (level-of-detail) और प्रक्रियात्मक क्लाउड डिज़ाइन का समर्थन भी करता है।

Jorge Condor, Nicolai Hermann, Mehmet Ata Yurtsever, Piotr Didyk2026-07-20
🤖 machine learning

When Bigger is Worse: A Practitioner's Guide to Model Selection Under Data Scarcity

यह शोध पत्र यह प्रदर्शित करके कि डेटा की कमी वाली स्थितियों में, उच्च-रिज़ॉल्यूशन इनपुट पर प्रशिक्षित YOLO11N जैसे छोटे मॉडल दक्षता और सटीकता दोनों में बड़े मॉडलों से काफी बेहतर प्रदर्शन करते हैं, अर्थ ऑब्जर्वेशन (पृथ्वी अवलोकन) में प्रचलित स्केलिंग लॉ धारणा को चुनौती देता है, जो प्रभावी रूप से पारंपरिक "बड़ा ही बेहतर है" के प्रतिमान को उलट देता है।

Kwame Mbobda-Kuate, Gabriel Kasmi2026-07-20
💻 computer science

VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning

यह शोध पत्र VidNum-1.4K का परिचय देता है, जो एक व्यापक मानव-एनोटेटेड बेंचमार्क है जिसमें 1,379 वीडियो-प्रश्न युग्म शामिल हैं जिन्हें एक तीन-स्तरीय पदानुक्रम में व्यवस्थित किया गया है ताकि वास्तविक दुनिया के वीडियो संदर्भों के भीतर जटिल, बहु-चरणीय संख्यात्मक तर्क करने में वर्तमान विजन-लैंग्वेज मॉडल्स की महत्वपूर्ण सीमाओं का कठोरता से मूल्यांकन और प्रदर्शन किया जा सके।

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He2026-07-20
💻 computer science

RePos: Relative-to-Absolute Pose Factorization for Cross-Environment WiFi-Based 3D Human Pose Estimation

यह शोधपत्र RePos को प्रस्तुत करता है, जो एक फैक्टराइज्ड फ्रेमवर्क है जो मौजूदा वाई-फाई आधारित 3D मानव मुद्रा अनुमान विधियों के खराब क्रॉस-एनवायरनमेंट सामान्यीकरण की समस्या को दूर करने के लिए रूट-रिलेटिव पोज़ एस्टीमेशन को रूट लोकलाइजेशन से अलग करता है, और विशिष्ट पर्यावरणीय स्थान संकेतों से स्वतंत्र मजबूत पोज़ रिप्रजेंटेशन सीखकर महत्वपूर्ण सटीकता सुधार प्राप्त करता है।

Zhangcheng Hou, Tomoaki Ohtsuki2026-07-20
💻 computer science

ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction

ReCal3R स्ट्रीमिंग 3D पुनर्निर्माण (reconstruction) के लिए एक प्रशिक्षण-मुक्त (training-free) विधि है जो शोर वाले अवलोकनों द्वारा ऐतिहासिक दृश्य सूचना के भ्रष्टाचार को रोकने के लिए अनुमानित स्टेट टोकन विश्वसनीयता के आधार पर लर्निंग रेट को गतिशील रूप से कैलिब्रेट करती है, जिससे बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के लंबी इमेज अनुक्रमों पर पोज़, डेप्थ और पुनर्निर्माण की सटीकता में उल्लेखनीय सुधार होता है।

Xinze Li, Yiyuan Wang, Pengxu Chen, Weifeng Su, Weisi Lin, Wentao Cheng2026-07-20
💻 computer science

Video = World + Event Stream

यह शोध पत्र Wan-Streamer v0.3 को प्रस्तुत करता है, जो एक वास्तविक समय (real-time) ऑडियो-विजुअल इंटरेक्शन मॉडल है, जो वीडियो को एक निरंतर "विश्व" (world) और एक गतिशील "इवेंट स्ट्रीम" (event stream) के संयोजन के रूप में फ्रेम करता है ताकि पर्यावरणीय परिवर्तनों और एजेंट व्यवहारों का कम-विलंबता (low-latency) वाला, सामान्य-उद्देश्यीय पूर्वानुमान सक्षम किया जा सके।

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu (…)2026-07-20
💻 computer science

An Empirical Study of Handcrafted Feature Learning and Convolutional Neural Networks for Facial Expression Recognition

यह अनुभवजन्य अध्ययन तीन चेहरे के भावों के डेटासेट पर हैंडक्राफ्टेड फीचर विधियों (HOG और LBP) की एक लाइटवेट CNN के साथ तुलना करता है, जो यह प्रदर्शित करता है कि जहाँ CNN समग्र रूप से बेहतर प्रदर्शन प्राप्त करते हैं, वहीं नियंत्रित वातावरण में HOG जैसे हैंडक्राफ्टेड फीचर्स प्रभावी बने रहते हैं, जबकि LBP खराब परिणाम देता है।

Chethiya Galkaduwa2026-07-20
💻 computer science

MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation

यह शोध पत्र MLLM-DataEngine को प्रस्तुत करता है, जो एक नवीन क्लोज्ड-लूप सिस्टम है जो मानवीय हस्तक्षेप के बिना, मूल्यांकन की कमजोरियों का विश्लेषण करके लक्षित, उच्च-गुणवत्ता वाले वृद्धिशील प्रशिक्षण डेटासेट उत्पन्न करने के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को स्वचालित रूप से पुनरावृत्ति रूप से उन्नत करता है।

Zhiyuan Zhao, Bin Wang, Linke Ouyang, Yiqi Lin, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He2026-07-20
💻 computer science

Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection

यह शोध पत्र मानक वीडियो बैकबोन रीडआउट्स में अत्यधिक स्थानिक-कालिक एकत्रीकरण (spatiotemporal aggregation) को एआई-जनित वीडियो डिटेक्शन में उनके खराब प्रदर्शन के कारण के रूप में पहचानता है और एक हल्के, प्लग-एंड-प्ले मॉड्यूल जिसे वेलोसिटी गेटेड पैच वेलोसिटी प्रोफाइलिंग (V-PVP) कहा जाता है, का प्रस्ताव करता है जो इस एकत्रीकरण को प्रभावी ढंग से सूक्ष्म अस्थायी आर्टिफ़ैक्ट्स (temporal artifacts) को पकड़ने के लिए प्रतिस्थापित करता है, जिससे फ्रोजन बैकबोन के साथ भी डिटेक्शन सटीकता में महत्वपूर्ण वृद्धि होती है।

Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhen (…)2026-07-20