💻 computer science

Spectro-Temporal Modulation Representation Framework for Human-Imitated Speech Detection

यह शोध पत्र मानव-अनुकरणित भाषण के पता लगाने की क्षमता को बढ़ाने के लिए कोक्लियर फिल्टरबैंक मॉडल पर आधारित एक स्पेक्ट्रो-टेम्पोरल मॉड्यूलेशन (STM) प्रतिनिधित्व ढांचे का प्रस्ताव करता है, जो प्रदर्शन के ऐसे स्तर प्राप्त करता है जो मानव श्रवण धारणा के बराबर या उससे भी बेहतर है।

Khalid Zaman, Masashi Unoki2026-04-28
💻 computer science

Small Language Model Helps Resolve Semantic Ambiguity of LLM Prompt

यह शोध पत्र एक प्री-इन्फरेंस प्रॉम्प्ट ऑप्टिमाइज़ेशन तंत्र का प्रस्ताव करता है जो उपयोगकर्ता के प्रॉम्प्ट में अर्थ संबंधी अस्पष्टताओं को स्पष्ट रूप से पहचानने और उन्हें हल करने के लिए स्मॉल लैंग्वेज मॉडल्स (SLMs) का उपयोग करता है, जिससे न्यूनतम कम्प्यूटेशनल लागत के साथ लार्ज लैंग्वेज मॉडल्स (LLMs) के रीजनिंग प्रदर्शन में सुधार होता है।

Zhenzhen Huang, Chaoning Zhang, Fachrina Dewi Puspitasari, Jiaquan Zhang, Yitian Zhou, Shuxu Chen, Yang Yang2026-04-28
🤖 machine learning

Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective

डेटा संदूषण (data contamination) से बचने के लिए औपचारिक भाषाओं को एक नियंत्रित परीक्षण स्थल (controlled testbed) के रूप में उपयोग करते हुए, यह शोध पत्र प्रदर्शित करता है कि जबकि फाइन-ट्यूनिंग (fine-tuning), इन-कॉन्टेक्स्ट लर्निंग (in-context learning) की तुलना में उच्च इन-डिस्ट्रीब्यूशन दक्षता प्राप्त करती है, दोनों ही मोड समान आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण और इंडक्टिव बायस (inductive biases) प्रदर्शित करते हैं, हालांकि इन-कॉन्टेक्स्ट लर्निंग मॉडल स्केल और शब्दावली के प्रति काफी अधिक संवेदनशील है।

Bishwamittra Ghosh, Soumi Das, Till Speicher, Qinyuan Wu, Mohammad Aflah Khan, Deepak Garg, Krishna P. Gummadi, Evimaria (…)2026-04-28
💻 computer science

Lightweight and Production-Ready PDF Visual Element Parsing

यह शोध पत्र एक हल्का, उत्पादन-तैयार (production-ready) पीडीएफ पार्सिंग फ्रेमवर्क प्रस्तुत करता है जो स्थानिक ह्यूरिस्टिक्स (spatial heuristics), लेआउट विश्लेषण और सिमेंटिक समानता का उपयोग करके विजुअल तत्वों को सटीक रूप से पहचानने और उन्हें कैप्शन के साथ जोड़ने के लिए किया जाता है, जिससे लेटेंसी को कम करते हुए मल्टीमॉडल RAG प्रदर्शन में महत्वपूर्ण सुधार होता है।

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li2026-04-28
💻 computer science

From Similarity to Structure: Training-free LLM Context Compression with Hybrid Graph Priors

यह शोध पत्र एक प्रशिक्षण-मुक्त, मॉडल-अज्ञेय (model-agnostic) संदर्भ संपीड़न ढांचे का प्रस्ताव करता है जो लॉन्ग-कॉन्टेक्स्ट लार्ज लैंग्वेज मॉडल्स के लिए वाक्यों के एक संक्षिप्त, सुसंगत और कार्य-प्रासंगिक सेट को चुनने हेतु एक हाइब्रिड सेंटेंस ग्राफ का उपयोग करता है—जो क्रमिक संरचना के साथ अर्थ संबंधी समानता को जोड़ता है।

Yitian Zhou, Chaoning Zhang, Jiaquan Zhang, Zhenzhen Huang, Jinyu Guo, Sung-Ho Bae, Lik-Hang Lee, Caiyan Qin, Yang Yang2026-04-28
💻 computer science

Au-M-ol: A Unified Model for Medical Audio and Language Understanding

Au-M-ol एक नवीन मल्टीमॉडल आर्किटेक्चर है जो एक ऑडियो एनकोडर और एक अडैप्टेशन लेयर को प्रीट्रेंड LLM के साथ एकीकृत करता है ताकि मेडिकल स्पीच रिकग्निशन और क्लिनिकल लैंग्वेज अंडरस्टैंडिंग में महत्वपूर्ण सुधार किया जा सके, जिससे मौजूदा बेसलाइनों की तुलना में वर्ड एरर रेट (WER) में 56% की कमी आती है।

Meizhu Liu, Nistha Mitra, Paul Li, Amine Abdaoui, Adam Ledyard, Tao Sheng2026-04-28
💻 computer science

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations

यह शोध पत्र Human-1 प्रस्तुत करता है, जो हिंदी के लिए पहला खुला और पुनरुत्पादक फुल-डुप्लेक्स स्पोकन डायलॉग सिस्टम है, जो प्राकृतिक व्यवधानों (interruptions) और ओवरलैप्स जैसे भाषण व्यवहारों को सक्षम करने के लिए एक कस्टम टोकेनाइज़र और 26,000 घंटों के वास्तविक दुनिया के संवादात्मक डेटा का उपयोग करके मोशी (Moshi) आर्किटेक्चर को अनुकूलित करता है।

Bhaskar Singh, Shobhit Banga, Pranav Sharma2026-04-28
🤖 machine learning

Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance

यह शोधपत्र **SHEAR** का प्रस्ताव करता है, जो एक ऐसी विधि है जो सही और गलत रोलआउट्स के हिडन-स्टेट डिस्ट्रीब्यूशन्स के बीच वासरस्टीन डिस्टेंस (Wasserstein distance) का उपयोग करके रीजनिंग कार्यों के लिए सुदृढीकरण शिक्षण (reinforcement learning) में सुधार करती है, जिससे बिना किसी अतिरिक्त रिवॉर्ड मॉडल या स्टेप-लेवल एनोटेशन की आवश्यकता के सूक्ष्म, टोकन-स्तरीय क्रेडिट असाइनमेंट किया जा सके।

Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weiji (…)2026-04-28
💻 computer science

Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss

यह शोध पत्र एक सुदृढ़ ऑडियो-टेक्स्ट रिट्रीवल फ्रेमवर्क प्रस्तावित करता है जो लंबे, शोर वाले और कमजोर रूप से लेबल किए गए ऑडियो को प्रभावी ढंग से संभालने के लिए एक क्रॉस-मोडल एम्बेडिंग रिफाइनमेंट मॉड्यूल और एक हाइब्रिड लॉस फंक्शन का उपयोग करता है, यहाँ तक कि छोटे-बैच प्रशिक्षण बाधाओं के तहत भी।

Meizhu Liu, Matthew Rowe, Amit Agarwal, Michael Avendi, Yassi Abbasi, Hitesh Laxmichand Patel, Paul Li, Kyu J. Han, Tao (…)2026-04-28
🤖 machine learning

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

यह शोध पत्र 'रिनफोर्समेंट लर्निंग विद कॉन्फिडेंस मार्जिन' (RLCM) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मार्जिन-वर्धित प्रोसेस रिवॉर्ड का उपयोग करके LLM रीजनिंग कैलिब्रेशन में सुधार करता है ताकि सही और गलत मध्यवर्ती रीजनिंग चरणों के बीच कॉन्फिडेंस गैप को बढ़ाया जा सके, जिससे ओवरकॉन्फिडेंस को कम किया जा सके और अधिक कुशल टेस्ट-टाइम कंप्यूटेशन को सक्षम बनाया जा सके।

Liaoyaqi Wang, Chunsheng Zuo, William Jurayj, Benjamin Van Durme, Anqi Liu2026-04-28