🤖 machine learning

Memisis: Orchestrating and Evaluating Synthetic Data for Tabular Health Datasets

मेसिसिस (Memisis) एक एकीकृत उपकरण है जो सिंथेटिक सारणीबद्ध स्वास्थ्य डेटा (synthetic tabular health data) के सृजन को ऑर्केस्ट्रेट और मूल्यांकन करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो उपयोगकर्ताओं को उच्च-स्तरीय लक्ष्य निर्दिष्ट करने में सक्षम बनाता है जबकि गोपनीयता, उपयोगिता और निष्पक्षता सुनिश्चित करने के लिए कई सिंथेसाइज़र और मेट्रिक्स के माध्यम से वर्कफ़्लो को स्वचालित रूप से प्रबंधित करता है।

Nitish Nagesh, Mahdi Bagheri, Arshia Harish Puthran, Pengbao Zhou, Muhjaazee Love, Aadi Sharma, Ian Harris, Amir M. Rahm (…)2026-05-19
💻 computer science

MV-Gate: Insider Threat Detection via Multi-View Behavioral Statistics and Semantic Modeling

MV-Gate एक मल्टी-व्यू फ्रेमवर्क है जो सांख्यिकीय नियमितताओं (statistical regularities) को एक विसंगति-जागरूक गेटिंग तंत्र (anomaly-aware gating mechanism) के माध्यम से सिमेंटिक सीक्वेंस मॉडलिंग के साथ एकीकृत करके इनसाइडर थ्रेट डिटेक्शन को बढ़ाता है, जिससे उन क्रमिक और कम दृश्यता वाले खतरों की प्रभावी ढंग से पहचान की जा सकती है जिन्हें पारंपरिक डीप लर्निंग दृष्टिकोण अक्सर चूक जाते हैं।

Kaichuan Kong, Dongjie Liu, Xiaobo Jin, Guanggang Geng2026-05-19
🤖 machine learning

AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models

यह शोध पत्र AURORA को पेश करता है, जो हेल्थकेयर फाउंडेशन मॉडल्स के लिए एक नवीन फ्रेमवर्क है जो प्रेडिक्शन सटीकता, वितरण बदलावों (distribution shifts) के प्रति मजबूती और सिमेंटिक स्पष्टता में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करने के लिए लेटेंट रिप्रेजेंटेशन्स को ऑर्थोगोनल सिमेंटिक सबस्पेस में विघटित करता है ताकि कॉन्टेक्स्टुअल डिसेंटैंगलमेंट और ज्योमेट्रिक इंटरप्रिटेबिलिटी प्राप्त की जा सके।

Yuanyun Zhang, Shi Li2026-05-19
📊 statistics

Feature Learning in Linear-Width Two-Layer Networks: Two vs. One Step of Gradient Descent

यह शोध पत्र लीनियर-विड्थ टू-लेयर नेटवर्क्स में फीचर लर्निंग को यह प्रदर्शित करके अभिलक्षित करता है कि ग्रेडिएंट डिसेंट का दूसरा चरण, विशेष रूप से पुन: उपयोग किए गए बैचों के साथ, वेट अपडेट्स के शार्प स्पेक्ट्रल विश्लेषण के माध्यम से उच्च सूचना घातांक (information exponents) वाली लक्षित फलनों (target functions) के अनुरूप कई दिशाओं को सीखने के लिए सिंगल-स्टेप अपडेट्स की रैंक-वन सीमाओं को पार कर लेता है।

Behrad Moniri, Hamed Hassani2026-05-19
💻 computer science

Uncertainty-Calibrated Recommendations for Low-Active Users

यह शोध पत्र एक एकीकृत, उत्पादन-तैयार (production-ready) ढांचे को प्रस्तुत करता है जो रिटेंशन और संतुष्टि में सुधार के लिए कम-सक्रिय उपयोगकर्ताओं (Low-Active Users) हेतु जोखिम-भयभीत डिबूटिंग (risk-averse deboosting) और कंटेंट विविधता बढ़ाने के लिए उच्च-सक्रिय उपयोगकर्ताओं (High-Active Users) हेतु जोखिम-सहिष्णु अन्वेषण (risk-seeking exploration) को लागू करने के लिए मॉडल अनिश्चितता का लाभ उठाता है—जो एक प्रमुख लाइवस्ट्रीमिंग प्लेटफॉर्म पर महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Bob Junyi Zou, Sai Li, Tianyun Sun, Wentao Guo, Qinglei Wang2026-05-19
🔬 physics

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

यह शोध पत्र HYDROAGENT को प्रस्तुत करता है, जो एक सिम्युलेटर-ग्राउंडेड सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक छोटे ओपन-वेट मॉडल को मानव-विशेषज्ञ स्तर के हाइड्रोलॉजिकल मॉडल अंशांकन (calibration) को प्राप्त करने के लिए फाइन-ट्यून करता है, जो यह प्रदर्शित करता है कि भौतिक विज्ञान के अनुप्रयोगों के लिए डोमेन-विशिष्ट ग्राउंडिंग, जेनेरिक फ्रंटियर LLMs को स्केल करने की तुलना में अधिक प्रभावी है।

Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong2026-05-19
⚡ electrical engineering

GenTS: A Comprehensive Benchmark Library for Generative Time Series Models

यह शोध पत्र GenTS को प्रस्तुत करता है, जो एक व्यापक और विस्तार योग्य ओपन-सोर्स बेंचमार्क लाइब्रेरी है जिसे विशेष रूप से विविध कार्यों में जनरेटिव टाइम सीरीज़ मॉडल्स के प्रीप्रोसेसिंग, मॉडलिंग और मूल्यांकन के लिए एक एकीकृत ढांचा प्रदान करके मौजूदा टाइम सीरीज़ टूल्स की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है।

Chenxi Wang, Xiaorong Wang, Peiyang Li, Yi Wang2026-05-19
📊 statistics

A Unified Framework for Data-Free One-Step Sampling via Wasserstein Gradient Flows

यह शोध पत्र वॉसरस्टीन ग्रेडिएंट फ्लो (Wasserstein gradient flows) का उपयोग करते हुए अननॉर्मलाइज्ड डिस्ट्रीब्यूशन से डेटा-मुक्त एक-चरणीय सैंपलिंग के लिए एक एकीकृत सैद्धांतिक ढांचा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि विभिन्न f-डाइवर्जेंस ऑब्जेक्टिव्स एक सामान्य वेलोसिटी फील्ड संरचना साझा करते हैं जो केवल इस बात में भिन्न है कि वे कम-कवर किए गए क्षेत्रों में द्रव्यमान (mass) को कैसे पुनर्वितरित करते हैं, साथ ही यह दृष्टिकोण लॉग-वैरिएंस डाइवर्जेंस (Log-Variance divergence) तक विस्तार करता है और मल्टीमॉडल बेंचमार्क पर KDE-आधारित कार्यान्वयन के माध्यम से इस सिद्धांत को मान्य करता है।

Chenguang Wang, Tianshu Yu2026-05-19
🤖 machine learning

One Model, Two Roles: Emergent Specialization in a Shared Recurrent Transformer

यह शोध पत्र यह प्रदर्शित करता है कि एक साझा-भार वाला आवर्ती (recurrent) ट्रांसफॉर्मर स्वतः ही विशिष्ट कार्यात्मक भूमिकाएँ—विशेष रूप से एक प्रतिबद्ध प्रस्ताव अवस्था (committed proposal state) और एक अनिश्चित मध्यवर्ती अवस्था (uncertain intermediate state)—विकसित कर सकता है, जब इसे अपडेट प्रकारों के बीच अंतर करने के लिए एक स्पष्ट संकेत प्रदान किया जाता है, जैसे कि असममित इनपुट इंजेक्शन या एक अलग स्तर टोकन।

Jucheng Shen, Barbara Su, Anastasios Kyrillidis2026-05-19
🤖 machine learning

Content-Style Identification via Differential Independence

यह शोध पत्र कंटेंट-स्टाइल डिफरेंशियल इंडिपेंडेंस (CSDI) प्रस्तुत करता है, जो एक नवीन संरचनात्मक स्थिति है जो उनके सूक्ष्म परिवर्तनों के बीच ऑर्थोगोनैलिटी (orthogonality) को लागू करके जनरेटिव मॉडल्स में कंटेंट और स्टाइल कारकों की आइडेंटिफिएबिलिटी (identifiability) सुनिश्चित करती है, जिससे पूर्ववर्ती इंडिपेंडेंस और स्पैरसिटी धारणाओं की सीमाओं को पार करते हुए काउंटरफैक्चुअल जनरेशन जैसे उच्च-आयामी कार्यों के लिए स्केलेबल ट्रेनिंग सक्षम होती है।

Subash Timilsina, Hoang-Son Nguyen, Sagar Shrestha, Xiao Fu2026-05-19