🤖 machine learning

Kan Extension Transformers: A Categorical Unification of Attention, Diffusion, and Predict-Detach Self-Conditioning

यह शोध पत्र कान एक्सटेंशन ट्रांसफॉर्मर्स (KETs) को एक श्रेणीगत ढांचे के रूप में प्रस्तुत करता है जो अटेंशन, डिफ्यूजन और सेल्फ-कंडीशनिंग तंत्रों को एकीकृत करता है, और यह प्रदर्शित करता है कि जबकि क्वाड्रेटिक KETs सख्त-कॉज़ल सेटिंग्स में उत्कृष्ट हैं, कई डेटासेट्स में सबसे महत्वपूर्ण प्रदर्शन लाभ 'प्रेडिक्ट-डिटैच' सेल्फ-कंडीशनिंग रिजीम को अपनाने से प्राप्त होते हैं।

Sridhar Mahadevan2026-05-27
📊 statistics

Causal Risk Minimization for High-Dimensional Treatments

यह शोध पत्र एक कारण-आधारित जोखिम न्यूनीकरण (causal risk minimization) ढांचे का प्रस्ताव करता है जो कारण संबंधी त्रुटि (causal error) को मोमेंट-बैलेंसिंग पदों में विघटित करके और उपचार प्रभावों को निम्न-आयामी गुणों पर प्रक्षेपित करके उच्च-आयामी उपचार स्थानों को संबोधित करता है, जिससे विशेषता-विशिष्ट प्रशिक्षण की आवश्यकता के बिना निरंतर, असतत और पाठ-आधारित हस्तक्षेपों में कुशल और प्रतिस्पर्धी कारण अनुमान सक्षम होता है।

Nikita Dhawan, Arnav Paruthi, Andrew Kim, Lovedeep Gondara, Jekaterina Novikova, Chris J. Maddison2026-05-27
🤖 machine learning

Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling

Falcon-X एक नवीन टाइम सीरीज़ फाउंडेशन मॉडल है जो वेरिएट्स को एक एकीकृत लेटेंट प्रोटोटाइप स्पेस में डिकपल करके, विषम मात्राओं को संरेखित करने और जटिल इंटरैक्शन को कैप्चर करने के लिए डिफ-अटेंशन (Diff-Attention) मैकेनिज्म का उपयोग करके, और स्टेट-ऑफ-द-आर्ट मल्टीवेरिएट फोरकास्टिंग प्रदर्शन प्राप्त करने के लिए एक वैरिएट रीअसेंबली राउटर (Variate Reassembly Router) का उपयोग करके मौजूदा यूनिवेरिएट और रॉ-स्पेस दृष्टिकोणों की सीमाओं को संबोधित करता है।

Yiding Liu, Yifan Hu, Hongjie Xia, Peiyuan Liu, Hongzhou Chen, Xilin Dai, Zewei Dong, Jiang-Ming Yang2026-05-27
💬 NLP

It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty

यह शोध पत्र MUSE प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह प्रदर्शित करता है कि उपयोगकर्ता के प्रतिरोध के प्रति LLM की अनुरूपता न केवल चापलूसी (sycophancy) से प्रेरित है, बल्कि एपिस्टेमिक अनिश्चितता (epistemic uncertainty) से भी संचालित है, और ये दोनों कारक उपयोगकर्ता की कथित विशेषज्ञता और उनके सुझावों की संभाव्यता के आधार पर बढ़ते हैं।

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin2026-05-27
📊 statistics

Detectability in Diversity: Improved Canary Crafting for Privacy Auditing in One Run

यह शोध पत्र एक नवीन कैनरी क्राफ्टिंग विधि प्रस्तावित करता है जो मौजूदा दृष्टिकोणों की तुलना में कम कम्प्यूटेशनल लागत पर अधिक मजबूत गोपनीयता रिसाव अनुमान प्राप्त करने के लिए, हस्तक्षेप को कम करते हुए कैनरी डिटेक्टेबिलिटी (canary detectability) को अधिकतम करने हेतु ग्रीडी इनिशियलाइजेशन (greedy initialization) को बाइलेवल ऑप्टिमाइज़ेशन (bilevel optimization) के साथ जोड़ता है।

Mathieu Dagréou, Aurélien Bellet2026-05-27
🤖 machine learning

Probabilistic Smoothing with Ratio-Monotone Transforms for Global Optimization

यह शोधपत्र एक सुदृढ़ वैश्विक अनुकूलन ढांचे (global optimization framework) का प्रस्ताव करता है जो घटते स्मूथिंग शेड्यूल की आवश्यकता के बिना वैश्विक मैक्सिमाइजर्स को संरक्षित करने और स्टेशनरी पॉइंट्स को केंद्रित करने के लिए लचीले सममित कर्नेल (symmetric kernels) को मोनोटोनिक रेश्यो-आधारित ट्रांसफॉर्म्स के साथ जोड़ता है, जबकि सैद्धांतिक जटिलता सीमाओं (theoretical complexity bounds) प्रदान करता है और उच्च-आयामी बेंचमार्क एवं प्रतिकूल हमलों (adversarial attacks) में बेहतर प्रदर्शन प्रदर्शित करता है।

Kukyoung Jang, Taehyun Cho, Junrui Zhang, Ping Xu, Kyungjae Lee2026-05-27
🤖 machine learning

Towards Controllable Image Generation through Representation-Conditioned Diffusion Models

यह शोध पत्र एक नियंत्रणीय छवि निर्माण ढांचे का प्रस्ताव करता है जो प्रसार प्रक्रियाओं (diffusion processes) को नियंत्रित करने के लिए पूर्व-प्रशिक्षित स्व-पर्यवेक्षित मॉडलों से प्राप्त निरूपणों (representations) का लाभ उठाता है, जिससे विस्तृत एनोटेटेड डेटासेट की आवश्यकता के बिना अनियंत्रित जनरेशन की गुणवत्ता को बढ़ाते हुए आउटपुट विविधताओं पर सुचारू और विलगित (disentangled) नियंत्रण सक्षम होता है।

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen2026-05-27
📊 statistics

From Scores to Gibbs Correctors: Accelerating Uniform-Rate Discrete Diffusion Models

यह शोध पत्र गिब्स-एक्सेलेरेटेड डिस्क्रीट डिफ्यूजन (GADD) प्रस्तुत करता है, जो एक नवीन करेक्टर विधि है जो बिना किसी अतिरिक्त प्रशिक्षण के यूनिफॉर्म-रेट डिस्क्रीट डिफ्यूजन मॉडल्स के लिए O(polylog(ε1))\mathcal{O}(\mathrm{polylog} (\varepsilon^{-1})) सैंपलिंग कॉम्प्लेक्सिटी और बेहतर दक्षता प्राप्त करने के लिए कंक्रीट स्कोर फंक्शन्स का लाभ उठाता है।

Yuchen Liang, Ness Shroff, Yingbin Liang2026-05-27
💬 NLP

Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

यह शोध पत्र SAERL को प्रस्तुत करता है, जो एक डेटा इंजीनियरिंग फ्रेमवर्क है जो डेटा विविधता, कठिनाई और गुणवत्ता के संबंध में आंतरिक मॉडल संकेतों को निकालने के लिए स्पार्स ऑटोएनकोडर (Sparse Autoencoders) का लाभ उठाता है, जिससे बेहतर सटीकता और दक्षता के साथ LLM पोस्ट-ट्रेनिंग सुदृढीकरण लर्निंग (reinforcement learning) को अनुकूलित किया जा सके।

Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang2026-05-27
💬 NLP

MobileMoE: Scaling On-Device Mixture of Experts

यह शोधपत्र MobileMoE को पेश करता है, जो एक बिलियन से कम पैरामीटर वाले ऑन-डिवाइस मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) भाषा मॉडलों का एक परिवार है, जो मौजूदा डेंस और MoE बेसलाइनों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त करने के लिए आर्किटेक्चर और प्रशिक्षण को अनुकूलित करता है, जिससे साधारण स्मार्टफोन पर तेज़ इन्फरेंस (inference) सक्षम होता है।

Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoor (…)2026-05-27