🤖 machine learning

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

यह शोध पत्र सैद्धांतिक और अनुभवजन्य रूप से यह प्रदर्शित करता है कि फाईनाइट स्केलर क्वांटाइजेशन (FSQ) टोकेनाइजेशन स्कीम निरंतर डिफ्यूजन मॉडल्स के लिए इष्टतम है जो श्रेणीगत डेटा उत्पन्न करते हैं, जैसा कि टेक्स्ट-टू-स्पीच कार्यों में इसके उत्कृष्ट प्रदर्शन से सिद्ध होता है जहाँ यह ऑटोरेग्रेसिव लार्ज लैंग्वेज मॉडल्स से बेहतर प्रदर्शन करता है और साथ ही काफी छोटा और तेज़ भी है।

Vadim Popov, Wenju Gu, Tasnima Sadekova, Georgii Aparin, Assel Yermekova2026-06-10
⚡ electrical engineering

DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

यह शोध पत्र DeRA-MOS का प्रस्ताव करता है, जो एक विच्छेदित अनुकूलन ढांचा (decoupled optimization framework) है जो संगीत के प्रभाव (music impression) के लिए बैच-जागरूक लिस्टवाइज रैंकिंग लॉस और टेक्स्ट संरेखण (text alignment) के लिए स्कोर-एंकर वाली मोडैलिटी अलाइनमेंट लॉस को पेश करके टेक्स्ट-टू-म्यूजिक मूल्यांकन में सुधार करता है, जिससे बेहतर रैंकिंग प्रदर्शन प्राप्त करने के लिए पारंपरिक पॉइंट-वाइज प्रशिक्षण और मोडैलिटी ड्रिफ्ट की सीमाओं को दूर किया जा सके।

Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen2026-06-10
🤖 machine learning

Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders

यह शोध पत्र प्रदर्शित करता है कि एक टेक्स्ट-टू-स्पीच लैंग्वेज मॉडल के बैकबोन पर स्पार्स ऑटोएनकोडर्स को प्रशिक्षित करने से व्याख्या योग्य, मोडैलिटी-अवेयर फीचर्स प्राप्त होते हैं जिन्हें सामग्री को सुरक्षित रखते हुए हँसी, वक्ता के लिंग और बोलने की गति जैसे विशिष्ट संश्लेषण गुणों को नियंत्रित करने के लिए कॉज़ली स्टीयर किया जा सकता है।

Nikita Koriagin, Georgii Aparin, Nikita Balagansky, Daniil Gavrilov2026-06-10
🤖 AI

Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models

यह शोध पत्र फ्लो-मैचिंग ऑडियो सेपरेशन मॉडल्स की अटेंशन डायनेमिक्स को समझने के लिए एक कॉज़ल प्रोबिंग प्रोटोकॉल प्रस्तुत करता है, जो एक ड्यूल-पाथवे कंडीशनिंग मैकेनिज्म और एसिंक्रोनस कन्वर्जेंस को उजागर करता है जो प्रस्तावित ट्रेनिंग-फ्री लेयर-सिलेक्टिव अटेंशन कैशिंग (LSAC) विधि को नगण्य गुणवत्ता हानि के साथ इन्फरेंस को महत्वपूर्ण रूप से तेज करने में सक्षम बनाता है।

Yuxuan Chen, Haoyuan Xu, Peize He2026-06-10
🤖 AI

Deployment-Time Memorization in Foundation-Model Agents

यह शोध पत्र फाउंडेशन-मॉडल एजेंटों के मूल्यांकन के लिए एक महत्वपूर्ण ढांचे के रूप में "डिप्लॉयमेंट-टाइम मेमोराइजेशन" (परिनियोजन-समय स्मृति) को प्रस्तुत करता है, जो LongMemEval बेंचमार्क के माध्यम से यह प्रदर्शित करता है कि जबकि आक्रामक सारांशीकरण (एग्रेसिव समराइजेशन) वैयक्तिकरण से समझौता किए बिना प्रतिकूल निष्कर्षण जोखिमों को काफी कम कर देता है, यह साथ ही एक "डिलीशन-फिडेलिटी फेल्योर" (विलोपन-निष्ठा विफलता) को भी उजागर करता है जहाँ व्युत्पन्न मेमोरी स्तर तब तक रिकवरेबल अवशेष बनाए रखते हैं जब तक कि एक पूर्ण-पाइपलाइन शुद्धिकरण लागू नहीं किया जाता।

Lei (Rachel), Chen, Guilin Zhang, Kai Zhao, Dalmo Cirne, Andy Olsen, Xu Chu, Zeke Miller, Alet Blanken, Amine Anoun, Je (…)2026-06-10
🤖 machine learning

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

यह शोध पत्र प्रदर्शित करता है कि एक प्रोत्साहन-संरेखित बिटेंसोर एजेंट एरिना (SN15) उच्च-गुणवत्तापूर्ण, विविध एजेंटिक प्रक्षेपवक्र (trajectories) उत्पन्न कर सकता है, जिन्हें जब फ़िल्टर करके एक Qwen3-4B मॉडल को पोस्ट-ट्रेन करने के लिए उपयोग किया जाता है, तो वे सिंथेटिक डेटा के पूर्वाग्रहों और अनफ़िल्टर्ड प्रोडक्शन लॉग्स के शोर से बचते हुए ShoppingBench प्रदर्शन को 18.0% से बढ़ाकर 42.7% ASR तक महत्वपूर्ण रूप से सुधार देते हैं।

Shardul Bansal, Seth Schilbe, Jarrod Barnes2026-06-10
🤖 AI

A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

यह शोध पत्र प्रीट्रेनिंग संदूषण (pretraining contamination) के लिए सार्वजनिक चिकित्सा विजन-लैंग्वेज बेंचमार्क का ऑडिट करता है और मापने योग्य इमेज-सोर्स ओवरलैप और टेक्स्ट-एक्सचेंजेबिलिटी सिग्नल पाता है, जबकि यह प्रदर्शित करता है कि मिंक++ (Min-K%++) जैसे कोहॉर्ट-रिलेटिव डिटेक्टर गैर-चिकित्सा मॉडलों से होने वाले फॉल्स पॉजिटिव के कारण छोटे चिकित्सा कोहॉर्ट्स के लिए अविश्वसनीय हैं।

Bruce Changlong Xu, Lan Wu, Alexander Ryu2026-06-10
🤖 machine learning

Importance-Aware Scheduling for High-Dimensional Hyperparameter Optimization

यह शोध पत्र ग्रीडी इम्पॉर्टेंस फर्स्ट (GIF) का प्रस्ताव करता है, जो एक महत्व-जागरूक शेड्यूलिंग रणनीति है जो हाइपरपैरामीटर महत्व का अनुमान लगाने और परीक्षणों को आनुपातिक रूप से आवंटित करने के लिए छोटे-नमूनों वाले वॉर्म स्टार्ट का लाभ उठाती है, जो उच्च-आयामी हाइपरपैरामीटर अनुकूलन में अत्याधुनिक तरीकों की तुलना में बेहतर नमूना दक्षता और तेज़ अभिसरण प्रदर्शित करता है।

Ruinan Wang, Ian Nabney, Mohammad Golbabaee2026-06-10
🤖 machine learning

Temporal Sheaf Neural Networks with Dynamic Orthogonal Transport

यह शोध पत्र टेम्पोरल शीफ न्यूरल नेटवर्क्स (TSNN) प्रस्तुत करता है, जो एक कारण संबंधी टेम्पोरल लिंक प्रेडिक्शन फ्रेमवर्क है जो विकसित होते इंटरैक्शन सिमेंटिक्स को मॉडल करने के लिए गतिशील, नोड-विशिष्ट ऑर्थोगोनल फ्रेम्स और स्पष्ट ट्रांसपोर्ट का उपयोग करता है, जो एक नवीन शीफ-आधारित डिफ्यूजन प्रक्रिया के माध्यम से ज्यामितीय निरंतरता और मोनोटोन डिसेंट सुनिश्चित करते हुए हेटेरोजेनियस ग्राफ्स पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Md Sadek Hossain Asif, Tanzila Khan, Md. Mosaddek Khan2026-06-10
🧬 biology

VFUSE: Virulent Feature Understanding with Sparse autoEncoders

यह शोध पत्र VFUSE को प्रस्तुत करता है, जो एक मैकेनिस्टिक इंटरप्रिटेबिलिटी फ्रेमवर्क है जो RoseTTAFold3 और RFDiffusion3 जैसे प्रोटीन डिज़ाइन मॉडलों में खतरनाक फीचर्स की पहचान करने और उनका ऑडिट करने के लिए डिफ्यूजन-ट्रांसफॉर्मर एक्टिवेशन्स पर स्पार्स ऑटोएनकोडर्स का उपयोग करता है, जिससे मॉडल के प्रदर्शन को बनाए रखते हुए घातक डिज़ाइनों का उच्च-सटीकता के साथ पता लगाया जा सकता है।

Michael Yu, Matthew L. Olson2026-06-10