🤖 AI

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

यह शोध पत्र ChladniSonify को प्रस्तुत करता है, जो एक वास्तविक समय का दृश्य-ध्वनिक मैपिंग सिस्टम है जो Chladni पैटर्न को 99.33% सटीकता और 50 ms से कम एंड-टू-एंड विलंबता के साथ वर्गीकृत करने के लिए CBAM युक्त एक हल्के वजन वाले CNN का उपयोग करता है, जिससे नए मीडिया कला निर्माण के लिए सटीक, कम-विलंबता वाली ऑडियो-विजुअल इंटरेक्शन सक्षम होती है।

Yakun Liu, Hai Luan, Dong Liu, Zhiyu Jin2026-05-12
🤖 AI

MoPO: Incorporating Motion Prior for Occluded Human Mesh Recovery

MoPO एक नवीन फ्रेमवर्क है जो अवरुद्ध (occluded) मानव मेश रिकवरी के लिए है, जो अवरोधों का पता लगाने, लुप्त जोड़ों की स्थिति का अनुमान लगाने और अंतिम पोज़ को परिष्कृत करने के लिए पोज़ अनुक्रमों से मोशन प्रायर्स (motion priors) का लाभ उठाता है, जिससे यह अवरोध-विशिष्ट और मानक दोनों बेंचमार्क पर अत्याधुनिक सटीकता और टेम्पोरल कंसिस्टेंसी (temporal consistency) प्राप्त करता है।

Tao Tang, Hong Liu, Xinshun Wang, Wanruo Zhang2026-05-12
🤖 AI

When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning

यह शोध पत्र एक विजन-लैंग्वेज पॉलिसी के भीतर एक सीखने योग्य, स्टेट-कंडीशन्ड कमिटमेंट डेप्थ मैकेनिज्म पेश करता है जो गतिशील रूप से यह निर्धारित करता है कि रीप्लानिंग करने से पहले कितने प्रिमिटिव एक्शन्स निष्पादित किए जाने चाहिए, जो फिक्स्ड-डेप्थ बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है और रीप्लानिंग लागत एवं निष्पादन त्रुटि के बीच के संतुलन को अनुकूलित करके लॉन्ग-होरिज़न रीजनिंग कार्यों में क्लोज्ड-सोर्स मॉडल्स से आगे निकल जाता है।

Chen Li, Zhantao Yang, Fangyi Chen, Han Zhang, Anudeepsekhar Bolimera, Marios Savvides2026-05-12
🤖 machine learning

UFO: A Unified Flow-Oriented Framework for Robust Continual Graph Learning

यह शोधपत्र UFO का प्रस्ताव करता है, जो एक एकीकृत प्रवाह-उन्मुख (flow-oriented) ढांचा है जो रिप्ले के लिए प्रवाह-आधारित जनरेटिव मॉडलिंग और दूषित ज्ञान को कम करने के लिए इंस्टेंस-स्तरीय विश्वसनीयता स्कोरिंग का उपयोग करके निरंतर ग्राफ लर्निंग में कैटास्ट्रोफिक फॉरगेटिंग और शोरयुक्त सुपरविजन की दोहरी चुनौतियों का समाधान करता है।

Danhui Zhang, Zhe Wang, Qing Qing, Jiarui Liu, Wentao Gao, Ziqi Xu, Mingliang Hou, Xikun Zhang, Renqiang Luo2026-05-12
🤖 machine learning

Continuous Latent Contexts Enable Efficient Online Learning in Transformers

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर्स को निरंतर लेटेंट कॉन्टेक्स्ट टोकन (continuous latent context tokens) से सुसज्जित करने से वे वेटेड मेजॉरिटी (weighted majority) और क्यू-लर्निंग (Q-learning) जैसे ऑनलाइन लर्निंग एल्गोरिदम को कुशलतापूर्वक लागू करने में सक्षम होते हैं, जिससे छोटे मॉडल दीर्घकालिक अनुकूली कार्यों (long-term adaptive tasks) पर काफी बड़े एलएलएम (LLMs) से बेहतर प्रदर्शन कर पाते हैं।

Emile Anand, Abdullah Ateyeh, Xinyuan Cao, Max Dabagia2026-05-12
🤖 AI

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

यह शोधपत्र EgoMemReason प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसे एंटिटी (entity), इवेंट (event) और बिहेवियर (behavior) प्रकारों के माध्यम से मेमोरी-ड्रिवन रीजनिंग का परीक्षण करके लॉन्ग-होरिज़न इगोसेंट्रिक वीडियो समझ का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मल्टीमॉडल मॉडल मल्टी-डे टेम्पोरल स्पैन (multi-day temporal spans) में स्पार्स एविडेंस (sparse evidence) को एकीकृत करने में काफी संघर्ष करते हैं।

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal2026-05-12
🤖 machine learning

Key-Value Means

यह शोध पत्र की-वैल्यू मीन्स (KVM) को प्रस्तुत करता है, जो अटेंशन के लिए एक नवीन ब्लॉक-रिकरेंस तंत्र है जो ट्रांसफॉर्मर्स और लीनियर RNNs के लाभों को एकीकृत करता है, जिससे मानक ऑपरेशन्स और न्यूनतम अतिरिक्त पैरामीटर्स का उपयोग करते हुए कुशल, चंक-पैरेललाइज़ेबल ट्रेनिंग के साथ लचीले स्टेट ग्रोथ और सबक्वाड्रेटिक प्रीफिल टाइम को सक्षम बनाया जा सके।

Daniel Goldstein, Eugene Cheah2026-05-12✓ Author reviewed
🤖 AI

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

यह शोध पत्र Polaris-Bench को प्रस्तुत करता है, जो वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) में "कार्टेशियन शॉर्टकट" (Cartesian Shortcut) भेद्यता को उजागर करने के लिए विजुअल रीजनिंग कार्यों को ध्रुवीय निर्देशांकों (polar coordinates) में पुनर्गठित करता है, जिससे यह प्रकट होता है कि मानक ग्रिड-आधारित बेंचमार्क पर उनका उच्च प्रदर्शन मजबूत, टोपोलॉजी-अपरिवर्तनीय दृश्य समझ के बजाय टेक्स्टुअल कोऑर्डिनेट पैटर्न का लाभ उठाने से उत्पन्न होता है।

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang2026-05-12
🤖 machine learning

The Geometric Wall: Manifold Structure Predicts Layerwise Sparse Autoencoder Scaling Laws

यह शोध पत्र यह प्रदर्शित करता है कि न्यूरल नेटवर्क परतों में स्पार्स ऑटोएनकोडर्स (sparse autoencoders) के स्केलिंग लॉ सार्वभौमिक नहीं हैं, बल्कि वे सक्रियता मैनिफोल्ड (activation manifold) की अंतर्निहित ज्यामितीय संरचना, विशेष रूप से इसकी वक्रता (curvature) और आंतरिक आयाम (intrinsic dimension) द्वारा निर्धारित होते हैं, जो विभिन्न मॉडलों में एक हस्तांतरणीय (transferable) तरीके से पुनर्निर्माण त्रुटि फर्श (reconstruction error floors) और चौड़ाई घातांकों (width exponents) को पूर्वानुमानित रूप से निर्देशित करते हैं।

Eslam Zaher, Maciej Trzaskowski, Quan Nguyen, Fred Roosta2026-05-12
🤖 AI

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

यह शोध पत्र "स्यूडो-डेलिब्रेशन" (Pseudo-Deliberation) की अवधारणा प्रस्तुत करता है ताकि तर्क प्रक्रिया की उपस्थिति के बावजूद बड़े भाषा मॉडलों के घोषित मूल्यों और उनके वास्तविक कार्यों के बीच निरंतर विसंगति का वर्णन किया जा सके, और इस मूल्य-क्रिया अंतराल को व्यवस्थित रूप से मापने और संबोधित करने के लिए VALDI फ्रेमवर्क और VIVALDI हस्तक्षेप प्रणाली का प्रस्ताव करता है।

Sushrita Rakshit, Hanwen Zhang, Hua Shen2026-05-12