🤖 AI

MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild

MuVAP एक कॉज़ल मल्टीमॉडल फ्रेमवर्क है जो केवल मोनाउरल ऑडियो और एक सिंगल कैमरा व्यू का उपयोग करके मल्टीपार्टी इंटरैक्शन में स्पीकर-अवेयर टर्न-टेकिंग प्रेडिक्शन को सक्षम बनाता है, जो स्पीकर मॉडलिंग को सरल बनाने के लिए रोल-रिलेटिव प्रोजेक्शन और अनएडिटेड ट्रेनिंग डेटा प्रदान करने के लिए ऑडियो-विजुअल कन्वर्सेशन कॉर्पस को पेश करता है।

Haotian Qi, Gabriel Skantze2026-06-16
💬 NLP

P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

यह शोध पत्र P3B3 को प्रस्तुत करता है, जो एक विशेषज्ञ-क्यूरेटेड बेंचमार्क और मूल्यांकन ढांचा है जो वर्तमान बड़े भाषा मॉडलों (Large Language Models) में यूरोपीय पुर्तगाली की तुलना में ब्राज़ीलियाई पुर्तगाली के प्रति एक महत्वपूर्ण पूर्वाग्रह को प्रकट करता है, जो अधिक संतुलित बहुभाषी प्रतिनिधित्व की तत्काल आवश्यकता को रेखांकित करता है।

Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, Jo (…)2026-06-16
🤖 AI

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

यह शोध पत्र MST-CLIPIQA को प्रस्तुत करता है, जो एक मल्टी-स्केल टू-स्ट्रीम फ्रेमवर्क है जो ड्यूल CLIP एनकोडर और गेटेड फ्यूजन का उपयोग करके सिमेंटिक अंडरस्टैंडिंग को परसेप्चुअल डिस्टॉर्शन से अलग करता है ताकि उच्च दक्षता के साथ एआई-जेनरेटेड इमेज क्वालिटी असेसमेंट में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Zijie Meng2026-06-16
💬 NLP

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

यह शोध पत्र एक्सपर्ट टायिंग (Expert Tying) को प्रस्तुत करता है, जो मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) मॉडलों में लगातार ट्रांसफॉर्मर परतों के बीच एक्सपर्ट पैरामीटर्स को साझा करने की एक विधि है, जिससे प्रदर्शन पर नगण्य प्रभाव के साथ मेमोरी आवश्यकताओं को लगभग आधा कर दिया जाता है, जिससे बड़े भाषा मॉडलों के प्रशिक्षण और स्केलिंग के लिए कंप्यूट-टू-मेमोरी ट्रेड-ऑफ में महत्वपूर्ण सुधार होता है।

Martin Jaggi2026-06-16
🤖 AI

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

यह शोध पत्र ATOM-Bench प्रस्तुत करता है, जो सिंगल-आर्म और ड्यूल-आर्म रोबोट्स के माध्यम से 30 परमाणु (atomic) और 24 कंपोजिशनल हेरफेर कार्यों वाला एक वास्तविक-विश्व बेंचमार्क है, जो व्यापक भौतिक रोलआउट्स के माध्यम से सूक्ष्म मोटर निष्पादन (fine-grained motor execution) में विफलताओं और सीमित कंपोजिशनल सामान्यीकरण (compositional generalization) के बीच अंतर करते हुए जनरलइस्ट पॉलिसियों का मूल्यांकन करता है।

Zenan Wu, Bingqing Wei, Lu Liu, Zheqi He, Xi Wang, Jiakang Liu, Zehui Li, Guocai Yao, Jing-Shu Zheng, Xi Yang, Yongtao W (…)2026-06-16
🤖 AI

Robust Spoofed Speech Detection via Temporal Pyramid Modeling

यह शोध पत्र एक टेम्पोरल पिरामिड एडेप्टर का प्रस्ताव करता है जो मजबूत, मल्टी-स्केल स्पूफ्ड स्पीच डिटेक्शन प्राप्त करने के लिए समानांतर टेम्पोरल कनवल्शन और सेल्फ-सुपरवाइज्ड XLS-R रिप्रेजेंटेशन्स का लाभ उठाता है, जो कई बेंचमार्क डेटासेट्स पर स्टेट-ऑफ-द-आर्ट बेसलाइन्स की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है और क्रॉस-डोमेन एवं क्रॉस-लैंग्वेज सामान्यीकरण में शेष चुनौतियों को रेखांकित करता है।

Mahtab Masoudi Nezhad, Nima Karimian2026-06-16
🤖 AI

Beyond Models: Reflections on Engineering AI-enabled Systems in a Project-Based Course

यह शोध पत्र ब्रेमेन विश्वविद्यालय के एक प्रोजेक्ट-आधारित मास्टर पाठ्यक्रम पर विचार करता है जो छात्रों को पूर्ण-स्तरीय सॉफ्टवेयर आर्किटेक्चर में एआई घटकों को एकीकृत करना सिखाता है, और आर्किटेक्चरल डिज़ाइन और डेटा प्रबंधन में बनी रहने वाली चुनौतियों को उजागर करने के लिए एक मिश्रित-पद्धति अध्ययन का उपयोग करते हुए सिस्टम-स्तरीय तर्क और डेटा-केंद्रित प्रथाओं को बढ़ावा देने में पाठ्यक्रम की सफलता को प्रदर्शित करता है।

Amir Mashmool, Kishan Ravindra Sawant, Mojtaba Shahin, Nico Hochgeschwender, Rainer Koschke2026-06-16
🤖 machine learning

Deep Q-Learning on Hölder Spaces

यह शोध पत्र हॉल्डर-नियमित (Hölder-regular) गुणांकों के तहत निरंतर-समय स्टोकेस्टिक नियंत्रण में बेलमैन लक्ष्यों (Bellable targets) की नियमितता का विश्लेषण करता है, जो यह प्रदर्शित करता है कि वे एनिसोट्रोपिक स्मूथनेस क्लासेज (anisotropic smoothness classes) में मैप होते हैं, जो एक व्युत्पन्न सन्निकटन सीमाओं (derived approximation bounds) और संसाधन व्यापार-बंदों (resource trade-offs) वाले टेंसर-प्रोडक्ट DeepONet आर्किटेक्चर को प्रेरित करता है, जबकि स्पष्ट रूप से यह भी उल्लेख करता है कि व्यावहारिक सैंपल्ड Q-लर्निंग के लिए पूर्ण अभिसरण स्थापित नहीं किया गया है।

Qian Qi2026-06-16
💬 NLP

Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens

यह शोध पत्र ASRD को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो डिकोडिंग संदर्भों को विश्वसनीय एंकर टोकन और अनिश्चित उम्मीदवारों में अलग करके डिफ्यूजन लार्ज लैंग्वेज मॉडल्स को बेहतर बनाता है ताकि त्रुटि प्रसार और स्थानीय त्रुटि सुदृढ़ीकरण को एक साथ दबाया जा सके, जिससे सटीकता और अनुमान थ्रूपुट दोनों में महत्वपूर्ण सुधार प्राप्त होता है।

Yizhen Yao, Qinglin Zhu, Runcong Zhao, Xiangxiang Dai, Yanzheng Xiang, Yulan He, Lin Gui2026-06-16
🤖 AI

Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection

यह शोध पत्र एक व्यापक बेंचमार्क सुइट प्रस्तुत करता है जिसे विविध शोर वाले डेटासेट और यथार्थवादी क्लाइंट-नॉइज़ परिदृश्यों को प्रदान करके फेडरेटेड मेडिकल इमेज सेगमेंटेशन में सिंथेटिक और वास्तविक दुनिया के मूल्यांकन के बीच के अंतर को दूर करने के लिए डिज़ाइन किया गया है, ताकि व्यवस्थित मूल्यांकन और फेडरेटेड नॉइज़ी लेबल लर्निंग विधियों के सूचित चयन को सुगम बनाया जा सके।

Markus Bujotzek, Dimitrios Bounias, Stefan Denner, Ralf Floca, Maximilian Fischer, Peter Neher, Klaus Maier-Hein2026-06-16