⚡ electrical engineering

Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio

यह सर्वेक्षण एकल-चैनल बहु-वक्ता स्वचालित भाषण पहचान (मोनोरल मल्टी-स्पीकर एएसआर) के लिए एंड-टू-एंड न्यूरल दृष्टिकोणों की एक व्यापक समीक्षा और व्यवस्थित वर्गीकरण प्रदान करता है, जो वास्तुशिल्प प्रतिमानों, हालिया एल्गोरिदम सुधारों, दीर्घ-रूप भाषण विस्तारों और बेंचमार्क प्रदर्शन का विश्लेषण करते हुए भविष्य की अनुसंधान दिशाओं को रेखांकित करता है।

Xinlu He, Jacob Whitehill2026-05-29
🤖 AI

Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives

यह शोध पत्र यह प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स के लिए वर्तमान पे-पर-टोकन (प्रति-टोकन भुगतान) मूल्य निर्धारण मॉडल प्रदाताओं के लिए टोकन की संख्या को गलत तरीके से बताने और उपयोगकर्ताओं से अधिक शुल्क लेने के लिए एक वित्तीय प्रोत्साहन पैदा करता है, जो पारदर्शिता संबंधी आवश्यकताओं के बावजूद बनी रहने वाली एक भेद्यता है, लेकिन इसे कैरेक्टर-काउंट-आधारित (वर्ण-गणना-आधारित) मूल्य निर्धारण तंत्र को अपनाकर कम किया जा सकता है जो प्रदाताओं के लिए लाभदायक बना रहता है।

Ander Artola Velasco, Stratis Tsirtsis, Nastaran Okati, Manuel Gomez-Rodriguez2026-05-29
🤖 AI

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

EPiC एक कुशल कैमरा नियंत्रण ढांचा है जो पहले फ्रेम की विज़िबिलिटी मास्किंग के माध्यम से सटीक एंकर वीडियो उत्पन्न करके त्रुटि-प्रवण पॉइंट क्लाउड और पोज़ अनुमान की आवश्यकता को समाप्त करता है, जिससे अत्याधुनिक प्रदर्शन के साथ सुदृढ़ और पैरामीटर-हल्का कैमरा-निर्देशित वीडियो जनरेशन सक्षम होता है।

Zun Wang, Jaemin Cho, Jialu Li, Han Lin, Jaehong Yoon, Yue Zhang, Mohit Bansal2026-05-29
🤖 AI

PersonaAgent: Bridging Memory and Action for Personalized LLM Agents

यह शोध पत्र PersonaAgent प्रस्तुत करता है, जो एक नवीन ढांचा है जो गतिशील उपयोगकर्ता व्यक्तित्वों (dynamic user personas) द्वारा निर्देशित व्यक्तिगत स्मृति और क्रिया मॉड्यूल को एकीकृत करके लार्ज लैंग्वेज मॉडल एजेंटों को उन्नत करता है, जिससे एक टेस्ट-टाइम ऑप्टिमाइज़ेशन रणनीति के माध्यम से बेहतर वास्तविक समय प्राथमिकता संरेखण और अनुकूलित प्रदर्शन प्राप्त होता है।

Weizhi Zhang, Xinyang Zhang, Chenwei Zhang, Liangwei Yang, Jingbo Shang, Zhepei Wei, Henry Peng Zou, Zijie Huang, Zhengy (…)2026-05-29
🤖 AI

Position: Text Embeddings Should Capture Implicit Semantics, Not Just Surface Meaning

यह स्थिति पत्र (position paper) तर्क देता है कि टेक्स्ट एम्बेडिंग अनुसंधान को भाषाई रूप से आधारित डेटा, गहरे मूल्यांकन बेंचमार्क और एक मुख्य मॉडलिंग उद्देश्य को अपनाकर सतही अर्थों (surface-level semantics) से हटकर निहित अर्थों—जैसे कि प्रासंगिकता (pragmatics) और वक्ता के इरादे—को पकड़ने पर अपना ध्यान केंद्रित करना चाहिए जो वास्तविक दुनिया की भाषाई जटिलता को बेहतर ढंग से प्रतिबिंबित करता हो।

Yiqun Sun, Qiang Huang, Anthony K. H. Tung, Jun Yu2026-05-29
🤖 machine learning

Model Fusion via Retrofitting

यह शोध पत्र एक न्यूरॉन-केंद्रित मॉडल फ्यूजन फ्रेमवर्क प्रस्तुत करता है जो फ्यूजन को एक रिप्रेजेंटेशन-मैचिंग समस्या के रूप में मानता है, जिसमें मध्यवर्ती न्यूरॉन्स को समूहित किया जाता है और प्रमुख विशेषताओं को संरेखित करने के लिए एट्रिब्यूशन स्कोर का उपयोग किया जाता है, जिससे बिना पुन: प्रशिक्षण के VGGs, ResNets और ViTs जैसे विविध आर्किटेक्चर में—विशेष रूप से ज़ीरो-शॉट और नॉन-IID परिदृश्यों में—मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Phoomraphee Luenam, Andreas Spanopoulos, Amit Sant, Thomas Hofmann, Sotiris Anagnostidis, Sidak Pal Singh2026-05-29
🤖 AI

Structure-Aware Compound-Protein Affinity Prediction via Graph Neural Network with Group Lasso Regularization

यह शोध पत्र एक्टिविटी क्लिफ पेयर्स (activity cliff pairs) का लाभ उठाते हुए कंपाउंड-प्रोटीन एफिनिटी की भविष्यवाणी करने के लिए ग्रुप लासो (group lasso) और स्पार्स ग्रुप लासो (sparse group lasso) रेगुलराइजेशन से उन्नत एक व्याख्यात्मक ग्राफ न्यूरल नेटवर्क फ्रेमवर्क प्रस्तावित करता है, जिससे दवा की खोज के लिए भविष्यवाणी की सटीकता में सुधार होता है और महत्वपूर्ण आणविक उप-संरचनाओं की पहचान होती है।

Zanyu Shi, Yang Wang, Pathum Weerawarna, Jie Zhang, Timothy Richardson, Yijie Wang, Kun Huang2026-05-29
🤖 AI

Taming Data Challenges in ML-based Security Tasks Using Generative AI

यह शोध पत्र यह प्रदर्शित करता है कि जेनेरेटिव एआई द्वारा जनरेट किए गए सिंथेटिक डेटा के साथ प्रशिक्षण डेटासेट को बढ़ाना, जिसमें 'निमाई' (Nimai) नामक एक नवीन विधि शामिल है, मशीन लर्निंग-आधारित सुरक्षा क्लासिफायर के प्रदर्शन और अनुकूलन क्षमता में महत्वपूर्ण सुधार कर सकता है, विशेष रूप से डेटा-सीमित सेटिंग्स में, जबकि साथ ही उन विशिष्ट डेटा विशेषताओं की भी पहचान करता है जो इस तरह के सुधारों में बाधा डाल सकती हैं।

Shravya Kanchi, Neal Mangaokar, Aravind Cheruvu, Sifat Muhammad Abdullah, Shirin Nilizadeh, Atul Prakash, Bimal Viswanat (…)2026-05-29
🤖 AI

GroundAct: Can LLM Agents Ground Actions in Environmental States?

यह शोधपत्र GroundAct प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है यह प्रदर्शित करता है कि जब निर्देश व्यवहार्यता विवरणों को छोड़ देते हैं, तो LLM एजेंट पर्यावरणीय अवस्थाओं में कार्यों को ग्राउंड करने में संघर्ष करते हैं, जिससे यह उजागर होता है कि इस बहुआयामी चुनौती को केवल स्केलिंग के माध्यम से हल नहीं किया जा सकता है और इसके लिए विशेषता (attribute), टूल और समन्वय (coordination) तर्क में विशिष्ट क्षमताओं की आवश्यकता होती है।

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun (…)2026-05-29
⚡ electrical engineering

Scalable RF Simulation in Generative 4D Worlds

यह शोध पत्र WaveVerse को प्रस्तुत करता है, जो एक स्केलेबल, प्रॉम्प्ट-आधारित फ्रेमवर्क है जो गतिशील इनडोर वातावरण में उच्च-सटीकता वाले रेडियो फ्रीक्वेंसी (RF) संकेतों को सिम्युलेट करने के लिए एक भाषा-निर्देशित 4D वर्ल्ड जनरेटर को फेज़-कोहेरेंट रे ट्रेसर के साथ जोड़ता है, जिससे डेटा की कमी को दूर किया जा सकता है और डाउनस्ट्रीम RF परसेप्शन कार्यों में महत्वपूर्ण सुधार किया जा सकता है।

Zhiwei Zheng, Dongyin Hu, Mingmin Zhao2026-05-29