🤖 machine learning

Multimodal Language Models Cannot Spot Spatial Inconsistencies

यह शोध पत्र स्थानिक रूप से असंगत (spatially inconsistent) छवि युग्मों को उत्पन्न करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में 3D मोशन निरंतरता का मूल्यांकन करने के लिए एक नवीन बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल मनुष्यों की तुलना में काफी खराब प्रदर्शन करते हैं और उनमें 3D भौतिक संरचना की मजबूत समझ का अभाव है।

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash2026-04-02
🤖 machine learning

Routing-Free Mixture-of-Experts

यह शोध पत्र 'रूटिंग-फ्री मिक्स्चर-ऑफ़-एक्सपर्ट्स' प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो केंद्रीकृत रूटिंग तंत्र को समाप्त करके व्यक्तिगत विशेषज्ञों को निरंतर ग्रेडिएंट प्रवाह के माध्यम से स्वयं-सक्रिय होने के लिए सशक्त बनाता है और विशेषज्ञ एवं टोकन संतुलन दोनों को अनुकूलित करने के लिए एक एकीकृत अनुकूलन ढांचे का उपयोग करता है, जिसके परिणामस्वरूप मानक बेसलाइन की तुलना में बेहतर स्केलेबिलिटी और मजबूती प्राप्त होती है।

Yilun Liu, Jinru Han, Sikuan Yan, Volker Tresp, Yunpu Ma2026-04-02
🤖 AI

Emotion Entanglement and Bayesian Inference for Multi-Dimensional Emotion Understanding

यह शोध पत्र EmoScene प्रस्तुत करता है, जो 8-आयामी भावना वेक्टर के साथ एनोटेट किए गए 4,731 संदर्भ-समृद्ध परिदृश्यों का एक चुनौतीपूर्ण बेंचमार्क है, और एक एंटैंगलमेंट-अवेयर बेयसियन इन्फरेंस फ्रेमवर्क प्रस्तावित करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में बहु-आयामी भावना समझ की संरचनात्मक निरंतरता और प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए भावना सह-घटित होने के सांख्यिकी का लाभ उठाता है।

Hemanth Kotaprolu, Kishan Maharaj, Raey Zhao, Abhijit Mishra, Pushpak Bhattacharyya2026-04-02
🤖 AI

PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

पिक्सेलप्रून (PixelPrune) एक प्रशिक्षण-मुक्त, पिक्सेल-स्तरीय अनुकूली टोकन न्यूनीकरण विधि है जो विज़न ट्रांसफार्मर एनकोडर से पहले अनावश्यक इमेज पैच को हटाने के लिए प्रेडिक्टिव कोडिंग का लाभ उठाती है, जो दस्तावेज़ और GUI बेंचमार्क पर प्रतिस्पर्धी सटीकता बनाए रखते हुए विज़न-लैंग्वेज मॉडल्स के लिए प्रशिक्षण और अनुमान दोनों को महत्वपूर्ण रूप से तेज़ करती है।

Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu2026-04-02
📊 statistics

Phase transition on a context-sensitive random language model with short range interactions

यह अध्ययन प्रदर्शित करता है कि रैंडम लैंग्वेज मॉडल्स में परिमित-तापमान चरण संक्रमण (finite-temperature phase transitions) केवल दीर्घ-परासी अंतःक्रियाओं (long-range interactions) पर निर्भर होने के बजाय, लघु-परासी अंतःक्रियाओं वाले संदर्भ-संवेदी व्याकरणों (context-sensitive grammars) की अंतर्निहित प्रकृति से उत्पन्न होते हैं।

Yuma Toji, Jun Takahashi, Vwani Roychowdhury, Hideyuki Miyahara2026-04-02
🤖 AI

Do Phone-Use Agents Respect Your Privacy?

यह शोध पत्र MyPhoneBench को प्रस्तुत करता है, जो फोन-उपयोग एजेंटों में गोपनीयता-सम्मानजनक व्यवहार का मूल्यांकन करने के लिए एक सत्यापन योग्य ढांचा है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल कार्यों को पूरा कर सकते हैं, वे अत्यधिक सहायक निष्पादन के कारण डेटा प्रकटीकरण को कम करने में अक्सर विफल रहते हैं, जो तैनाती की तत्परता को सटीक रूप से आंकने के लिए संयुक्त गोपनीयता और सफलता मेट्रिक्स की आवश्यकता पर प्रकाश डालता है।

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu Li, Chenxin Li, Jingyuan Hu, Shunian Chen (…)2026-04-02
🤖 AI

Multimodal Analysis of State-Funded News Coverage of the Israel-Hamas War on YouTube Shorts

यह शोध पत्र एक मल्टीमॉडल पाइपलाइन प्रस्तुत करता है जो इज़राइल-हमास युद्ध को कवर करने वाले 2,300 से अधिक राज्य-वित्तपोषित यूट्यूब शॉर्ट्स का विश्लेषण करने के लिए स्वचालित ट्रांसक्रिप्शन, एस्पेक्ट-आधारित भावना विश्लेषण और सिमेंटिक सीन क्लासिफिकेशन को संयोजित करता है, जो विभिन्न आउटलेट्स में विशिष्ट भावना पैटर्न को प्रकट करता है और यह प्रदर्शित करता है कि संसाधन-कुशल, डोमेन-अनुकूलित मॉडल इस विशिष्ट अनुसंधान संदर्भ में बड़े ट्रांसफॉर्मर्स से बेहतर प्रदर्शन कर सकते हैं।

Daniel Miehling, Sandra Kuebler2026-04-02
🤖 AI

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

ब्रेनस्टैक्स (Brainstacks) एक मॉड्यूलर निरंतर शिक्षण (continual learning) आर्किटेक्चर है जो शून्य-विस्मृति (zero-forgetting), क्रॉस-डोमेन संरचना (cross-domain composition), और बड़े भाषा मॉडलों में हस्तांतरणीय संज्ञानात्मक प्रिमिटिव्स (transferable cognitive-primitives) की खोज प्राप्त करने के लिए फ्रोजन MoE-LoRA स्टैक्स को नल-स्पेस प्रोजेक्शन (null-space projection) और एक आउटकम-आधारित मेटा-राउटर के साथ जोड़ता है।

Mohammad R. Abu Ayyash2026-04-02
🤖 machine learning

S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models

S0 ट्यूनिंग हाइब्रिड रिकरेंट-अटेंशन मॉडल्स के लिए एक ज़ीरो-ओवरहेड पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग विधि है जो न्यूनतम सत्यापित पर्यवेक्षण का उपयोग करके प्रति परत एक एकल प्रारंभिक अवस्था मैट्रिक्स को अनुकूलित करती है, जिससे बिना वेट मर्जिंग या इन्फरेंस लेटेंसी के आवश्यक रूप से LoRA के समान या उससे अधिक प्रदर्शन लाभ प्राप्त होता है।

Jack Young2026-04-02
📊 statistics

Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning

यह शोध पत्र ऑनलाइन रीजनिंग कैलिब्रेशन (ORCA) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो कॉन्फॉर्मल प्रेडिक्शन को टेस्ट-टाइम ट्रेनिंग के साथ जोड़ता है ताकि लार्ज लैंग्वेज मॉडल सैंपलिंग को गतिशील रूप से कैलिब्रेट किया जा सके, जिससे इन-डिस्ट्रीब्यूशन और आउट-ऑफ-डोमेन दोनों रीजनिंग कार्यों में सैद्धांतिक जोखिम गारंटी बनाए रखते हुए कम्प्यूटेशनल दक्षता और सामान्यीकरण में महत्वपूर्ण सुधार होता है।

Cai Zhou, Zekai Wang, Menghua Wu, Qianyu Julie Zhu, Flora C. Shi, Chenyu Wang, Ashia Wilson, Tommi Jaakkola, Stephen Bat (…)2026-04-02