⚡ electrical engineering

Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization

यह शोध पत्र Bangla-WhisperDiar प्रस्तुत करता है, जो एक सुदृढ़ प्रणाली है जो बांग्ला लंबी अवधि के स्पीच रिकग्निशन और स्पीकर डायराइजेशन में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए व्यापक डेटा ऑग्मेंटेशन और एक कस्टम पाइपलाइन के साथ Whisper और PyAnnote मॉडलों को फाइन-ट्यून करती है, जिससे 0.2441 का वर्ड एरर रेट (WER) और 0.2392 का डायराइजेशन एरर रेट (DER) प्राप्त होता है।

Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan, Amit Chakraborty, Aritra Islam Saswato, Ahmed Faizu (…)2026-05-12
🤖 machine learning

NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning

NoisyCoconut एक रिट्रेनिंग-मुक्त इन्फरेंस-टाइम विधि है जो विविध तर्क पथों (reasoning paths) को उत्पन्न करने के लिए लेटेंट ट्रेजेक्टरीज में नियंत्रित शोर (noise) इंजेक्ट करके लार्ज लैंग्वेज मॉडल की विश्वसनीयता को बढ़ाती है, और उनके सर्वसम्मति (consensus) का उपयोग करके चयनात्मक अपवर्जन (selective abstention) को सक्षम करती है और तर्क संबंधी कार्यों पर त्रुटि दरों को काफी कम करती है।

Michael Jerge, David Evans2026-05-12
🤖 AI

Resource-Aware Evolutionary Neural Architecture Search for Cardiac MRI Segmentation

यह शोध पत्र CardiacNAS को प्रस्तुत करता है, जो एक संसाधन-जागरूक विकासवादी न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है जो ACDC डेटासेट पर कार्डिएक एमआरआई (MRI) सेगमेंटेशन में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए सेगमेंटेशन सटीकता और कम्प्यूटेशनल दक्षता के बीच के संतुलन को अनुकूलित करता है।

Farhana Yasmin, Mahade Hasan, Haipeng Liu, Amjad Ali, Ghulam Muhammad, Yu Xue2026-05-12
🤖 AI

TinySSL: Distilled Self-Supervised Pretraining for Sub-Megabyte MCU Models

यह शोध पत्र CA-DSSL को प्रस्तुत करता है, जो एक शिक्षक-निर्देशित स्व-पर्यवेक्षित शिक्षण ढांचा है जो 500K से कम पैरामीटर वाले माइक्रोकंट्रोलर मॉडलों के लिए प्रभावी प्रीट्रेनिंग को सक्षम करने हेतु विशिष्ट स्केलिंग बाधाओं को दूर करता है, जिससे बिना लेबल की आवश्यकता के CIFAR-100 पर स्टेट-ऑफ-द-आर्ट लीनियर-प्रोब सटीकता और Pascal VOC पर महत्वपूर्ण डिटेक्शन लाभ प्राप्त होता है।

Bibin Wilson2026-05-12
🤖 AI

When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

यह शोध पत्र विजुअल एम्बेडिंग्स और टेक्स्ट मैनिफोल्ड के बीच ज्यामितीय अति-संरेखण (geometric over-alignment) को डिकोडर-आधारित विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) के मूल कारण के रूप में पहचानता है, और प्रशिक्षण-मुक्त एवं फाइन-ट्यूनिंग उपचार प्रस्तावित करता है जो इस भाषाई पूर्वाग्रह को बाहर प्रोजेक्ट करके बिना किसी कम्प्यूटेशनल ओवरहेड के कई बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu2026-05-12
🤖 AI

LLM Translation of Compiler Intermediate Representation

यह शोध पत्र IRIS-14B को प्रस्तुत करता है, जो एक विशिष्ट 14-बिलियन-पैरामीटर वाला लार्ज लैंग्वेज मॉडल है जो GCC के GIMPLE इंटरमीडिएट रिप्रेजेंटेशन को LLVM IR में सटीक रूप से अनुवादित करके मौजूदा अत्याधुनिक मॉडलों से काफी बेहतर प्रदर्शन करता है, जिससे हाइब्रिड न्यूरो-सिंबोलिक कंपाइलर आर्किटेक्चर के भीतर निर्बाध क्रॉस-टूलचेन इंटरऑपरेबिलिटी सक्षम होती है।

Andrea Valenzuela Ramirez, Cristian Gutierrez-Gomez, Marta Barroso, Dario Garcia-Gasulla, Sara Royuela2026-05-12
🤖 AI

Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space

यह शोध पत्र VAE-LFA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले विधि है जो VAE लेटेंट स्पेस के भीतर लो-फ्रीक्वेंसी सांख्यिकी (low-frequency statistics) को संरेखित करके मल्टी-टर्न डिफ्यूजन ट्रांसफार्मर इमेज एडिटिंग में प्रोग्रेसिव सिमेंटिक ड्रिफ्ट को कम करता है, जिससे मॉडल रिट्रेनिंग या डिफ्यूजन पैरामीटर्स तक पहुंच की आवश्यकता के बिना सिमेंटिक निरंतरता और विजुअल फिडेलिटी को बढ़ाया जाता है।

Xiaoce Wang, Sifan Zhou, Kaifei Wang, Leli Xu, Xuerui Qiu, Tao He, Ming Li2026-05-12
🤖 machine learning

Path-Coupled Bellman Flows for Distributional Reinforcement Learning

यह शोध पत्र पाथ-कपल्ड बेलमैन फ्लोज़ (PCBF) को प्रस्तुत करता है, जो एक निरंतर-समय वितरण सुदृढीकरण शिक्षण (डिस्ट्रिब्यूशनल रीइन्फोर्समेंट लर्निंग) विधि है जो बाउंड्री मिसमैच और उच्च-विचलन बूटस्ट्रैपिंग समस्याओं को हल करने के लिए स्रोत-संगत बेलमैन-कपल्ड पथों और एक λ\lambda-पैरामीटराइज्ड कंट्रोल-वेरिएट टारगेट का उपयोग करती है, जिससे बेहतर वितरण निष्ठा (डिस्ट्रिब्यूशनल फिडेलिटी) और प्रशिक्षण स्थिरता प्राप्त होती है।

Boyang Xu, Qing Zou, Siqin Yang, Hao Yan2026-05-12
🤖 machine learning

HyperTransport: Amortized Conditioning of T2I Generative Models

हाइपरट्रांसपोर्ट (HyperTransport) एक हाइपरनेटवर्क फ्रेमवर्क है जो टेक्स्ट-टू-इमेज मॉडल्स के लिए एक्टिवेशन स्टीयरिंग की लागत को कम करता है, जो कॉन्सेप्ट एम्बेडिंग्स को सीधे इंटरवेंशन पैरामीटर्स में मैप करके, बिना प्रति-कॉन्सेप्ट ऑप्टिमाइज़ेशन के, अवधारणाओं के एक विशाल, ओपन-एंडेड सेट पर तत्काल, सुदृढ़ और निरंतर नियंत्रण सक्षम बनाता है।

Valentino Maiorca, Eleonora Gualdoni, Xavier Suau, Marco Cuturi, Luca Zappella, Pau Rodríguez2026-05-12
🤖 AI

Computer Use at the Edge of the Statistical Precipice

यह शोध पत्र गैर-सिद्धांतवादी परिवेश डिजाइन और कार्यप्रणाली के कारण वर्तमान कंप्यूटर उपयोग एजेंट मूल्यांकन में महत्वपूर्ण खामियों की पहचान करता है, और सार्थक अनुसंधान के लिए पूर्व शर्तें स्थापित करने हेतु PRISM डिजाइन ढांचे, DigiWorld बेंचमार्क और एक कठोर सांख्यिकीय एकत्रीकरण पद्धति का प्रस्ताव करता है।

Pierluca D'Oro, Sneha Silwal, William Wong, Yuxuan Sun, Fanyi Xiao, Manchen Wang, Eric Gan, Allen Bolourchi, Joseph Tigh (…)2026-05-12