💬 NLP

Using Embedding Models to Improve Probabilistic Race Prediction

असामान्य उपनाम वाले व्यक्तियों की नस्ल का अनुमान लगाने में मानक बेयसियन इम्प्रूव्ड सरनेम जियोकोडिंग (BISG) की सीमाओं को दूर करने के लिए, लेखक "एम्बेडिंग-पावर्ड BISG" (eBISG) का प्रस्ताव करते हैं, जो एक ऐसी विधि है जो जनगणना उपनाम डेटा से छूटे हुए समूहों के लिए नस्ल की संभावना के अनुमानों में उल्लेखनीय सुधार करने के लिए प्री-ट्रेंड टेक्स्ट एम्बेडिंग्स और न्यूरल नेटवर्क का उपयोग करती है।

Noan Dasanaike, Kosuke Imai2026-04-27
💬 NLP

Learning Evidence Highlighting for Frozen LLMs

HighLight एक ऐसा फ्रेमवर्क है जो एक हल्के "एम्फैसिस एक्टर" (Emphasis Actor) को सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से लंबे, शोर वाले संदर्भों के भीतर मुख्य साक्ष्यों के चारों ओर न्यूनतम हाइलाइट टैग डालने के लिए प्रशिक्षित करके फ्रोजन LLMs की तर्क क्षमता में सुधार करता है, जिसमें साक्ष्य लेबल की आवश्यकता नहीं होती और न ही अंतर्निहित सॉल्वर में कोई संशोधन किया जाता है।

Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon (…)2026-04-27
💬 NLP

From graphemic dependence to lexical structure: a Markovian perspective on Dante's Commedia

यह अध्ययन स्वर-व्यंजन एन्कोडिंग पर आधारित एक चार-अवस्था वाले मार्कोव श्रृंखला मॉडल का उपयोग करके यह प्रदर्शित करता है कि दांते की 'डिवाइन कॉमेडी' *इन्फर्नो* से *पैराडिसो* तक ग्राफेमिक निर्भरता में एक प्रगतिशील बदलाव प्रदर्शित करती है, जो स्थानीय प्रतीकात्मक पैटर्न, शाब्दिक संगठन और कविता की समग्र मैक्रो-संरचना के बीच एक संरचित संबंध को प्रकट करती है।

Angelo Maria Sabatini2026-04-27
💬 NLP

Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models

यह शोध पत्र फोनीम-स्तरीय एम्बेडिंग में व्यवस्थित पूर्वाग्रह (systematic bias) और यादृच्छिक भिन्नता (random variance) के बीच अंतर करने के लिए एक रूपरेखा प्रस्तावित करता है और यह प्रदर्शित करता है कि यद्यपि दोनों स्पीच रिकग्निशन में जनसांख्यिकीय अन्याय (demographic unfairness) में योगदान देते हैं, फिर भी निष्पक्षता प्राप्त करने में यादृच्छिक त्रुटि (random error) संभवतः अधिक महत्वपूर्ण बाधा है।

Felix Herron, Solange Rossato, Alexandre Allauzen, François Portet2026-04-27
💬 NLP

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG (बेयसियन एनसेम्बल रिट्रीवल-ऑगमेंटेड जनरेशन) एक नया फ्रेमवर्क है जो भाषा मॉडलों को व्यक्तिगत दस्तावेजों पर आधारित करके और टोकन-दर-टोकन दस्तावेज़ भार को अपडेट करने के लिए बेयस के नियम का उपयोग करके रिट्रीवल-ऑगमेंटेड जनरेशन में सुधार करता है, जो प्रभावी रूप से "लॉस्ट-इन-द-मिडल" प्रभाव को कम करता है और ज्ञान-आधारित विजुअल क्वेश्चन आंसरिंग में एट्रिब्यूशन को बेहतर बनाता है।

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne2026-04-27
💬 NLP

Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought

यह शोध पत्र **एब्स्ट्रैक्ट चेन-ऑफ-थॉट (Abstract Chain-of-Thought)** का प्रस्ताव करता है, जो एक पोस्ट-ट्रेनिंग तंत्र है जो भाषा मॉडलों को लंबी, प्राकृतिक भाषा वाली चेन्स-ऑफ-थॉट के स्थान पर सीखे गए "एब्स्ट्रैक्ट" टोकन के संक्षिप्त अनुक्रमों का उपयोग करके कुशल तर्क करने में सक्षम बनाता है, जिससे तुलनीय प्रदर्शन बनाए रखते हुए इन्फरेंस लागत में उल्लेखनीय कमी आती है।

Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo2026-04-27
🤖 machine learning

Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering

यह शोध पत्र गिरिआमा जैसी कम-संसाधन वाली बांटू भाषाओं में रूपात्मक विशेषताओं की खोज के लिए एक नवीन विधि प्रस्तुत करता है, जो संज्ञा वर्ग निर्धारण और लेमेटाइजेशन (lemmatization) में उच्च सटीकता प्राप्त करने तथा पूर्व में अन dokumented भाषाई पैटर्न की पहचान करने के लिए स्वाहिली से क्रॉस-लिंगुअल ट्रांसफर लर्निंग को अनसुपरवाइज्ड क्लस्टरिंग के साथ जोड़ता है।

Hillary Mutisya, John Mugane2026-04-27
🤖 machine learning

Neural Recovery of Historical Lexical Structure in Bantu Languages from Modern Data

यह शोध पत्र प्रदर्शित करता है कि आधुनिक बंटू रूपात्मक डेटा पर प्रशिक्षित न्यूरल ट्रांसफार्मर मॉडल सफलतापूर्वक उन ऐतिहासिक शाब्दिक संरचनाओं और संज्ञानात्मक पैटर्न को पुन: प्राप्त कर सकते हैं जो स्थापित प्रोटो-बंटू पुनर्निर्माणों के अनुरूप हैं।

Hillary Mutisya, John Mugane2026-04-27
💬 NLP

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

यह शोध पत्र एजेंटिक कोडिंग कार्यों में टोकन खपत का पहला व्यवस्थित अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि एजेंटिक वर्कफ़्लो असाधारण रूप से महंगे और स्टोकेस्टिक (अनिश्चित) हैं, मॉडल दक्षता में काफी भिन्न होते हैं, और फ्रंटियर एलएलएम (LLMs) अपनी स्वयं की टोकन लागत का सटीक अनुमान लगाने में संघर्ष करते हैं।

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei2026-04-27
⚡ electrical engineering

Basic syntax from speech: Spontaneous concatenation in unsupervised deep neural networks

यह शोधपत्र प्रदर्शित करता है कि केवल कच्चे एकल-शब्द भाषण पर प्रशिक्षित पूर्णतः अनसुपरवाइज्ड डीप न्यूरल नेटवर्क स्वतः ही संयोजित बहु-शब्द आउटपुट उत्पन्न कर सकते हैं जिनमें रचनाशीलता (compositionality) के पूर्ववर्ती मौजूद होते हैं, जो ध्वनिक इनपुट से वाक्य रचना (syntax) के विकास के लिए एक संभावित तंत्र का सुझाव देते हैं।

Gašper Beguš, Thomas Lu, Zili Wang2026-04-24