💬 NLP

A cross-species neural foundation model for end-to-end speech decoding

यह शोधपत्र BIT को प्रस्तुत करता है, जो एक क्रॉस-स्पीशीज़ न्यूरल फाउंडेशन मॉडल है जो एक प्रीट्रेंड न्यूरल एनकोडर को ऑडियो लार्ज लैंग्वेज मॉडल्स के साथ एकीकृत करके स्टेट-ऑफ-द-आर्ट, एंड-टू-एंड स्पीच डिकोडिंग प्राप्त करता है, जिससे वर्ड एरर रेट्स में महत्वपूर्ण कमी आती है और एटेम्प्टेड (प्रयासित) एवं इमेजिन्ड (कल्पित) स्पीच के बीच सामान्यीकरण सक्षम होता है।

Yizi Zhang, Linyang He, Chaofei Fan, Tingkai Liu, Han Yu, Trung Le, Jingyuan Li, Scott Linderman, Lea Duncker, Francis R (…)2026-03-03
💬 NLP

Reward Models Inherit Value Biases from Pretraining

यह अध्ययन प्रदर्शित करता है कि रिवॉर्ड मॉडल अपने बेस प्रीट्रेन मॉडल से महत्वपूर्ण और टिकाऊ मूल्य पूर्वाग्रह, विशेष रूप से "एजेंसी" या "कम्यूनियन" के प्रति प्राथमिकताएं, विरासत में प्राप्त करते हैं, जो यह दर्शाता है कि फाउंडेशन मॉडल का चयन बाद के फाइन-ट्यूनिंग के बावजूद संरेखण परिणामों को मौलिक रूप से आकार देता है।

Brian Christian, Jessica A. F. Thompson, Elle Michelle Yang, Vincent Adam, Hannah Rose Kirk, Christopher Summerfield, Ts (…)2026-03-03
💬 NLP

EnsembleLink: Accurate Record Linkage Without Training Data

एन्सेम्बललिंक (EnsembleLink) एक नवीन रिकॉर्ड लिंकेज पद्धति है जो अर्थ संबंधी संबंधों को पकड़ने के लिए पूर्व-प्रशिक्षित भाषा मॉडलों का लाभ उठाकर, बिना किसी लेबल किए गए प्रशिक्षण डेटा के, विविध डेटासेट में उच्च सटीकता प्राप्त करती है।

Noah Dasanaike2026-03-03
📊 statistics

Learn-to-Distance: Distance Learning for Detecting LLM-Generated Text

यह शोध पत्र "लर्न-टू-डिस्टेंस" (Learn-to-Distance) पेश करता है, जो एक नवीन रीराइट-आधारित (rewrite-based) डिटेक्शन एल्गोरिदम है, जो विभिन्न मॉडलों में एलएलएम-जनित (LLM-generated) सामग्री की पहचान करने में मौजूदा बेसलाइन से बेहतर प्रदर्शन करने के लिए मूल और पुनर्गठित (rewritten) पाठ के बीच की दूरी को अनुकूल रूप से सीखता है।

Hongyi Zhou, Jin Zhu, Kai Ye, Ying Yang, Erhan Xu, Chengchun Shi2026-03-03
💬 NLP

From Generative Modeling to Clinical Classification: A GPT-Based Architecture for EHR Notes

यह अध्ययन नैदानिक पाठ वर्गीकरण के लिए एक गणनात्मक रूप से कुशल GPT-आधारित आर्किटेक्चर का प्रस्ताव करता है जो MIMIC-IV रेडियोलॉजी रिपोर्टों पर उत्कृष्ट प्रदर्शन प्राप्त करने के लिए एक पूर्व-प्रशिक्षित डिकोडर-ओनली ट्रांसफॉर्मर के चयनात्मक फाइन-ट्यूनिंग का उपयोग करता है और साथ ही साथ प्रशिक्षित मापदंडों और गणनात्मक लागतों को महत्वपूर्ण रूप से कम करता है।

Fariba Afrin Irany, Sampson Akwafuo2026-03-03
💬 NLP

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

यह शोध पत्र इस घटना को मापने के लिए MANBENCH बेंचमार्क पेश करके, इसके अंतर्निहित कारणों का विश्लेषण करके, और प्रॉम्प्ट-स्तरीय एवं मॉडल-स्तरीय रणनीतियों का प्रस्ताव देकर LLM-आधारित मल्टी-एजेंट सिस्टम में सामूहिक "मैंडेला प्रभाव" (Mandela effect) की जांच करता है, जो इस प्रभाव को औसतन 74.40% तक सफलतापूर्वक कम करती हैं।

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji2026-03-03
💬 NLP

Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts

OOMB एक अत्यधिक मेमोरी-कुशल प्रशिक्षण प्रणाली है जो लंबे-संदर्भ वाले लार्ज लैंग्वेज मॉडल्स के लिए चंक-रिकरेंट फ्रेमवर्क का उपयोग करती है, जिसमें ऑन-द-फ्लाई एक्टिवेशन रीकंप्यूटेशन और सिनर्जिस्टिक KV कैश ऑप्टिमाइज़ेशन शामिल है ताकि सिंगल GPU पर Qwen2.5-7B जैसे मॉडल्स को मिलियन-टोकन संदर्भों के साथ प्रशिक्षित किया जा सके।

Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao2026-03-03
⚡ electrical engineering

WAXAL: A Large-Scale Multilingual African Language Speech Corpus

यह शोध पत्र WAXAL को प्रस्तुत करता है, जो 24 उप-सहारा अफ्रीकी भाषाओं में 1,485 घंटों से अधिक के डेटा वाला एक बड़े पैमाने का, खुले रूप से सुलभ बहुभाषी भाषण संग्रह है, जिसे डिजिटल विभाजन को पाटने और इन कम संसाधन वाले समुदायों के लिए स्पीच टेक्नोलॉजी को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

Abdoulaye Diack, Perry Nelson, Kwaku Agbesi, Angela Nakalembe, MohamedElfatih MohamedKhair, Vusumuzi Dube, Tavonga Siyav (…)2026-03-03
💬 NLP

FASA: Frequency-aware Sparse Attention

FASA एक नवीन फ्रेमवर्क है जो RoPE में फ्रीक्वेंसी-चंक स्पर्सिटी (frequency-chunk sparsity) का लाभ उठाकर लॉन्ग-कॉन्टेक्स्ट LLMs की मेमोरी बॉटलनेक को संबोधित करता है ताकि क्वेरी-अवेयर अटेंशन के लिए केवल सबसे महत्वपूर्ण टोकन की पहचान और उन्हें बनाए रखा जा सके, जिससे KV कैश के काफी कम उपयोग के साथ लगभग ओरैकल सटीकता प्राप्त होती है।

Yifei Wang, Yueqi Wang, Zhenrui Yue, Huimin Zeng, Yong Wang, Ismini Lourentzou, Zhengzhong Tu, Xiangxiang Chu, Julian Mc (…)2026-03-03
⚡ electrical engineering

Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement

यह शोध पत्र URSA-GAN को प्रस्तुत करता है, जो एक एकीकृत जनरेटिव फ्रेमवर्क है जो अनदेखे शोर और चैनल विरूपणों के कारण होने वाले डोमेन शिफ्ट को प्रभावी ढंग से कम करने के लिए एक डुअल-एम्बेडिंग आर्किटेक्चर और डायनेमिक स्टोकेस्टिक परटर्बेशन का उपयोग करता है, जिससे ऑटोमैटिक स्पीच रिकग्निशन और स्पीच एन्हांसमेंट दोनों प्रणालियों की मजबूती और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen2026-03-03