💬 NLP

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

यह शोध पत्र चेतावनी देता है कि अवलोकन संबंधी डेटा (observational data) पर प्रशिक्षण के कारण LLM-सिम्युलेटेड प्रयोगों में "यूजर ड्रिफ्ट" (user drift) की समस्या होती है, जो कन्फाउंडिंग बायस (confounding bias) को जन्म देती है, और इस समस्या का पता लगाने के लिए नेगेटिव कंट्रोल आउटकम्स (negative control outcomes) का उपयोग करने तथा इसे कम करने के लिए परिष्कृत पर्सोना विनिर्देशों (refined persona specifications) का प्रस्ताव करता है।

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour2026-05-21
📊 statistics

Adaptive Test for Jump

यह शोध पत्र उच्च-आवृत्ति वाले सेमीमार्टिंगल्स (semimartingales) के लिए एक अनुकूली जंप टेस्ट का प्रस्ताव करता है जो विश्लेषणात्मक अंशांकन (analytical calibration), सघन और विरल जंप विकल्पों के तहत सुसंगत शक्ति, और माइक्रोस्ट्रक्चर शोर के प्रति मजबूती प्राप्त करने के लिए कॉची कॉम्बिनेशन नियम (Cauchy combination rule) के माध्यम से ऐत-साहलिया-जैकोड (Aït-Sahalia–Jacod) और ली-मायकलैंड (Lee–Mykland) सांख्यिकीओं को संयोजित करता है।

Huifang Man, Long Feng2026-05-21
📊 statistics

Missing data and cluster graphs: cluster-level missingness vs variable-level missingness

यह शोध पत्र मोटे संरचनात्मक सूचना (coarse structural information) से रिकवरेबिलिटी (recoverability) का विश्लेषण करने के लिए क्लस्टर-आधारित मिसिंगनेस ग्राफ्स के दो वर्गों को प्रस्तुत करता है, जो संयुक्त वितरण (joint distributions) और कारण प्रभावों (causal effects) को पुनः प्राप्त करने के लिए ग्राफिकल स्थितियों को स्थापित करता है ताकि यह स्पष्ट किया जा सके कि वैध अनुमान के लिए क्लस्टर-स्तरीय मिसिंग डेटा कब पर्याप्त है बनाम कब अधिक सूक्ष्म-स्तरीय मॉडलिंग की आवश्यकता होती है।

Willow Scott, Eugenio Valdano, Charles Assaad2026-05-21
📊 statistics

A continuous-time Markov chain framework for population size estimation from multi-list data: accounting for absorbing lists and asymmetric interactions

यह शोध पत्र मल्टी-लिस्ट डेटा से जनसंख्या के आकार का अनुमान लगाने के लिए एक निरंतर-समय मार्कोव चेन ढांचे को प्रस्तुत करता है जो दिशात्मक अंतःक्रियाओं और अवशोषक सूचियों, जैसे कि मृत्यु रिकॉर्ड, को प्रभावी ढंग से संभालता है, और सिमुलेशन तथा वास्तविक दुनिया के महामारी विज्ञान और ड्रग उपयोग डेटासेट के माध्यम से यह प्रदर्शित करता है कि इन कारकों को ध्यान में रखना पक्षपाती अनुमानों से बचने के लिए अत्यंत महत्वपूर्ण है।

Ophélie Schaller, Andrew Titman, Rachel McCrea2026-05-21
📊 statistics

TCARD: Nearly Balanced Two-Level Designs with Treatment Cardinality Constraints with an Application to LLM Prompt Engineering

यह शोध पत्र TCARD को प्रस्तुत करता है, जो उपचार कार्डिनैलिटी (treatment cardinality) बाधाओं के तहत लगभग संतुलित टू-लेवल प्रायोगिक डिजाइनों के निर्माण के लिए एक ढांचा है, जो LLM प्रॉम्प्ट इंजीनियरिंग जैसे अनुप्रयोगों के लिए डिजाइनों को अनुकूलित करने हेतु एक मॉडल-मुक्त बैलेंस्ड कन्करेंस डेविएशनेशन (Balanced Concurrence Deviation) मानदंड और एक कुशल कोऑर्डिनेट-एक्सचेंज एल्गोरिदम का प्रस्ताव करता है।

Kexin Xie, Ryan Lekivetz, Xinwei Deng2026-05-21
📈 economics

Testing the identification of causal effects in observational data

यह शोध पत्र एक मशीन लर्निंग-आधारित परीक्षण का प्रस्ताव करता है जो एक सशर्त स्वतंत्रता स्थिति (conditional independence condition) के लिए है, जो यदि संतुष्ट हो जाती है, तो एक उपकरण चर (instrumental variable) को एक साथ मान्य करती है और अवलोकनात्मक डेटा में उपचार प्रभावों की अनकन्फाउंडेडनेस (unconfoundedness) की पुष्टि करती है, जो प्रजनन क्षमता के महिला श्रम आपूर्ति पर प्रभाव के अध्ययन में इसके अनुप्रयोग को प्रदर्शित करता है जहाँ परीक्षण यह सुझाव देता है कि उपकरण अमान्य है।

Martin Huber, Jannis Kueck2026-05-20
🔢 mathematics

Sharp variance estimator and causal bootstrap in stratified randomized experiments

यह शोध पत्र स्ट्रैटिफाइड रैंडमाइज्ड प्रयोगों में औसत उपचार प्रभावों (average treatment effects) के लिए परिमित-नमूना अनुमान (finite-sample inference) में सुधार करने हेतु एक शार्प वेरिएंस एस्टिमेटर और दो रैंडमाइजेशन-आधारित कॉज़ल बूटस्ट्रैप विधियों का प्रस्ताव करता है, जो छोटे नमूना आकार या विषम परिणामों (skewed outcomes) के मामलों में रूढ़िवादी नेमन-प्रकार के अनुमानकों (Neyman-type estimators) और सामान्य सन्निकटन (normal approximations) की सीमाओं को संबोधित करता है।

Haoyang Yu, Ke Zhu, Hanzhong Liu2026-05-20
🔢 mathematics

High-dimensional analysis of ridge regression for non-identically distributed data with a variance profile

यह शोध पत्र एक वेरिएंस प्रोफाइल वाले स्वतंत्र लेकिन गैर-समान रूप से वितरित डेटा के लिए उच्च-आयामी रिज रिग्रेशन विश्लेषण का विस्तार करता है, जो प्रेडिक्टिव रिस्क और डिग्रीज़ ऑफ फ्रीडम के लिए नियतात्मक समकक्ष (deterministic equivalents) प्रदान करता है और साथ ही यह भी प्रकट करता है कि ऐसे प्रोफाइल 'डबल डिसेंट' घटना के उद्भव या संशोधन को कैसे प्रभावित करते हैं।

Jérémie Bigot, Issa-Mbenard Dabo, Camille Male2026-05-20
📊 statistics

Feature aware covariance estimation, with application to mixtures of chemical exposures

यह शोध पत्र सीमित-नमूना पर्यावरणीय एक्सपोजर डेटा के लिए रासायनिक गुणों का लाभ उठाकर ओवर-श्रिंकेज (over-shrinkage) की समस्याओं और डेटा कोलैप्सिंग (data collapsing) के सूचना नुकसान से बचने के लिए बेयसियन फैक्टर एनालिसिस के एक फीचर-अवेयर कोवेरिएंस रिग्रेशन विस्तार का प्रस्ताव करता है ताकि कोवेरिएंस अनुमान में सुधार किया जा सके।

Elizabeth Bersson, Kate Hoffman, Heather M. Stapleton, David B. Dunson2026-05-20
📊 statistics

Modeling nonstationary spatial processes with normalizing flows

यह शोध पत्र उच्च-आयामी डोमेन में गैर-स्थिर (nonstationary), अनिसोट्रोपिक (anisotropic) स्थानिक प्रक्रियाओं को मॉडल करने के लिए न्यूरल ऑटोरेग्रेसिव फ्लो का उपयोग करने वाले एक नवीन ढांचे को प्रस्तुत करता है, जो सिमुलेशन और 3D आर्गो फ्लोट्स (Argo Floats) डेटा के वास्तविक अनुप्रयोग के माध्यम से मौजूदा विधियों की तुलना में बेहतर प्रतिनिधित्व क्षमता प्रदर्शित करता है।

Pratik Nag, Andrew Zammit-Mangion, Ying Sun2026-05-20