💻 computer science

Au-M-ol: A Unified Model for Medical Audio and Language Understanding

Au-M-ol एक नवीन मल्टीमॉडल आर्किटेक्चर है जो एक ऑडियो एनकोडर और एक अडैप्टेशन लेयर को प्रीट्रेंड LLM के साथ एकीकृत करता है ताकि मेडिकल स्पीच रिकग्निशन और क्लिनिकल लैंग्वेज अंडरस्टैंडिंग में महत्वपूर्ण सुधार किया जा सके, जिससे मौजूदा बेसलाइनों की तुलना में वर्ड एरर रेट (WER) में 56% की कमी आती है।

Meizhu Liu, Nistha Mitra, Paul Li, Amine Abdaoui, Adam Ledyard, Tao Sheng2026-04-28
🤖 machine learning

MetaErr: Towards Predicting Error Patterns in Deep Neural Networks

यह शोध पत्र MetaErr का प्रस्ताव करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) मेटा-लर्निंग फ्रेमवर्क है जिसे यह भविष्यवाणी करने के लिए डिज़ाइन किया गया है कि क्या एक बेस डीप न्यूरल नेटवर्क किसी विशिष्ट डेटा सैंपल पर विफल होगा, जो विभिन्न कंप्यूटर विज़न बेंचमार्क में सेमी-सुपरवाइज्ड लर्निंग और त्रुटि भविष्यवाणी को बेहतर बनाने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Varun Totakura, Shayok Chakraborty2026-04-28
🤖 machine learning

An Analysis of Active Learning Algorithms using Real-World Crowd-sourced Text Annotations

यह शोध पत्र त्रुटिपूर्ण और गैर-उत्तरदायी मानव एनोटेटरों की उपस्थिति में उनके प्रदर्शन का मूल्यांकन करने के लिए वास्तविक दुनिया के क्राउड-सोर्स्ड टेक्स्ट एनोटेशन का उपयोग करके आठ सामान्य एक्टिव लर्निंग तकनीकों का एक अनुभवजन्य अध्ययन करता है।

Varun Totakura, Ankita Singh, Yushun Dong, Shayok Chakraborty2026-04-28
💻 computer science

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations

यह शोध पत्र Human-1 प्रस्तुत करता है, जो हिंदी के लिए पहला खुला और पुनरुत्पादक फुल-डुप्लेक्स स्पोकन डायलॉग सिस्टम है, जो प्राकृतिक व्यवधानों (interruptions) और ओवरलैप्स जैसे भाषण व्यवहारों को सक्षम करने के लिए एक कस्टम टोकेनाइज़र और 26,000 घंटों के वास्तविक दुनिया के संवादात्मक डेटा का उपयोग करके मोशी (Moshi) आर्किटेक्चर को अनुकूलित करता है।

Bhaskar Singh, Shobhit Banga, Pranav Sharma2026-04-28
🤖 machine learning

CombiMOTS: Combinatorial Multi-Objective Tree Search for Dual-Target Molecule Generation

CombiMOTS एक पारेटो मोंटे कार्लो ट्री सर्च फ्रेमवर्क है जिसे दोहरे-लक्ष्य वाले अणु निर्माण के लिए डिज़ाइन किया गया है जो लक्षित आत्मीयता (affinity) और भौतिक-रासायनिक गुणों को संतुलित करने के लिए वेक्टरयुक्त बाधाओं का उपयोग करके एक संश्लेषणीय फ्रैगमेंट स्पेस (synthesizable fragment space) की खोज करता है, जिससे स्केलरकृत अनुकूलन (scalarized optimization) की सीमाओं और सिंथेटिक योजना की कमी को दूर किया जा सके।

Thibaud Southiratn, Bonil Koo, Yijingxiu Lu, Sun Kim2026-04-28
🤖 machine learning

GIFT: Global stabilisation via Intrinsic Fine Tuning

GIFT (ग्लोबल स्टेबिलाइज़ेशन वाया इनट्रिन्सिक फाइन ट्यूनिंग) एक सामान्य-उद्देश्य वाला प्रशिक्षण ढांचा है जिसे एक कस्टम रिवॉर्ड फंक्शन के माध्यम से वैश्विक स्थिरता को अनुकूलित करके, कार्य प्रदर्शन से समझौता किए बिना, डीप रीइन्फोर्समेंट लर्निंग पॉलिसियों की वास्तविक दुनिया की विश्वसनीयता में सुधार करने के लिए डिज़ाइन किया गया है।

Rory Young, Nicolas Pugeault2026-04-28
🤖 machine learning

When Chain-of-Thought Fails, the Solution Hides in the Hidden States

एक्टिवेशन पैचिंग का उपयोग करके रीजनिंग ट्रेसेस (reasoning traces) से हिडन स्टेट्स (hidden states) को डायरेक्ट-आंसर रन्स (direct-answer runs) में स्थानांतरित करते हुए, लेखक यह प्रदर्शित करते हैं कि व्यक्तिगत चेन-ऑफ-थॉट (Chain-of-Thought) टोकन सही उत्तरों को पुनः प्राप्त करने के लिए पर्याप्त कार्य-प्रासंगिक जानकारी को एनकोड करते हैं, भले ही मूल रीजनिंग ट्रेस त्रुटिपूर्ण हो।

Houman Mehrafarin, Amit Parekh, Ioannis Konstas2026-04-28
⚡ electrical engineering

Explainable AI in Speaker Recognition -- Making Latent Representations Understandable

यह शोध पत्र स्पीकर रिकग्निशन (वक्ता पहचान) में व्याख्यात्मक एआई (एक्सप्लेनेबल एआई) के लिए एक नए ढांचे का प्रस्ताव करता है जो न्यूरल नेटवर्क निरूपणों के भीतर पदानुक्रमित संगठनात्मक पैटर्न को उजागर करने और उनके अर्थपूर्ण रूप से व्याख्या करने के लिए पदानुक्रमित क्लस्टरिंग एल्गोरिदम (SLINK और HDBSCAN) और एक नवीन मिलान एल्गोरिदम (HCCM) का उपयोग करता है।

Yanze Xu, Wenwu Wang, Mark D. Plumbley2026-04-28
💻 computer science

Constraint-Based Analysis of Reasoning Shortcuts in Neurosymbolic Learning

यह शोध पत्र न्यूरोसिम्बोलिक लर्निंग में "रीजनिंग शॉर्टकट्स" (तर्क संबंधी शॉर्टकट) को एक बाधा संतुष्टि समस्या (constraint satisfaction problem) के रूप में औपचारिक रूप देता है, जो एक जटिलता विश्लेषण, एक ASP-आधारित सत्यापन एल्गोरिदम और एक ग्रीडी रिपेयर मैकेनिज्म प्रदान करता है ताकि यह सुनिश्चित किया जा सके कि सीखे गए कॉन्सेप्ट मैपिंग्स तार्किक बाधाओं द्वारा विशिष्ट रूप से और सही ढंग से निर्धारित होते हैं।

Akihiro Takemura, Katsumi Inoue, Masaaki Nishino2026-04-28
🤖 machine learning

A Parametric Memory Head for Continual Generative Retrieval

कंटीन्यूअल जनरेटिव रिट्रीवल में स्टेबिलिटी-प्लास्टिसिटी ट्रेड-ऑफ को संबोधित करने के लिए, यह शोध पत्र पोस्ट-अडैप्टेशन मेमोरी ट्यूनिंग (PAMT) का प्रस्ताव करता है, जो एक मॉड्यूलर, स्पार्स पैरामीट्रिक मेमोरी हेड का उपयोग करने वाली एक विधि है जो डिकोडिंग के दौरान रेसिडुअल करेक्शन प्रदान करती है, जिससे मॉडल को पहले से सीखे गए दस्तावेज़ों को भूलने (कैटास्ट्रोफिक फॉरगेटिंग) के बिना नए दस्तावेज़ों को सीखने की अनुमति मिलती है।

Kidist Amde Mekonnen, Yubao Tang, Maarten de Rijke2026-04-28