📊 statistics

An Empirical Comparison of Statistical Methods for Estimating EQ-5D Health State Utilities in Rheumatoid Arthritis Clinical Trials for Economic Modelling

Cette étude compare empiriquement les modèles mixtes linéaires, les équations d'estimation généralisées et les modèles mixtes à deux parties pour estimer les utilités EQ-5D dans les essais sur la polyarthrite rhumatoïde, concluant que bien que les modèles mixtes à deux parties produisent des estimations d'utilité plus faibles, le choix de la méthode a un impact minimal sur les conclusions globales de l'efficience thérapeutique.

Jiajun Yan, Eleanor Pullenayegum, Shun Fu Lee, Feng Xie2026-07-30
📊 statistics

Bayesian Inference for Multi-Source Binary Data with Selection and Measurement Error

Cet article introduit un cadre de modélisation bayésienne qui traite conjointement les erreurs de classification et de sélection dans des données binaires multi-sources, démontrant, par des simulations et une analyse empirique, que si l'erreur composite peut être identifiée de manière robuste, sa décomposition précise en composantes spécifiques nécessite des indicateurs valides, des variables auxiliaires et des a priori informatifs.

Santiago Gómez-Echeverry, Arnout van Delden, Ton de Waal, Dimitris Pavlopoulos2026-07-30
📊 statistics

A General Framework for Stability Assessment of Non-Deterministic Prediction Models

Cet article propose un cadre général pour quantifier la stabilité des modèles de prédiction non déterministes à travers des résultats métriques, catégoriels et ordinaux en introduisant des mesures de stabilité basées sur les données et sur les modèles qui surmontent les limites des méthodes existantes, telles que leur incapacité à traiter des objets de test individuels et leur sensibilité à la composition des données.

Thomas Martin Lange, Armin Otto Schmitt, Felix Heinrich2026-07-30
📊 statistics

A Sequential Tour-Based Mode Choice Framework with GPS-based Data: Integrating Machine-Learning-Derived Features into Mixed Logit and MNL Models

Cette étude développe un cadre de choix de mode basé sur des tours séquentiels pour Sydney en utilisant des données GPS et des caractéristiques dérivées de l'apprentissage automatique, démontrant que les modèles Logit Mixte améliorent significativement la prédiction pour les composantes de tours interdépendantes et que le cadre reste robuste à l'incertitude d'estimation en amont, validant ainsi l'utilisation d'entrées simulées pour la prévision pratique de la demande de transport.

Mostafa Rahimi, Maliheh Tabasi, Abdul Rawoof Pinjari, Taha Hossein Rashidi2026-07-30
📊 statistics

Ablation Study of Class Imbalance Techniques for Credit Default Prediction with SHAP-based Explainability Analysis

Cette étude démontre que sur les tâches de prédiction de défaut de crédit, le paramètre intégré `scale_pos_weight` d'XGBoost surpasse de manière significative la technique traditionnelle de rééchantillonnage SMOTE en termes de rappel, soulignant que la stratégie optimale pour gérer le déséquilibre des classes dépend du classifieur spécifique utilisé plutôt que d'une méthode de rééchantillonnage universelle.

Atharv Tiwari2026-07-30
📊 statistics

Clinical Risk-Weighted Evaluation of ICU Mortality Prediction Models on MIMIC-IV

Cet article propose le Clinical Risk-Weighted Score (CRWS), une nouvelle métrique qui découple les pénalités pour les faux négatifs et les faux positifs afin de mieux refléter les priorités cliniques, démontrant par une analyse de MIMIC-IV qu'elle modifie de manière significative le classement des modèles et révèle des avantages cliniques plus importants pour les algorithmes les plus performants par rapport au score F1 traditionnel.

Aman Chandra H, Abhijna Shivaprakash, Amrutha Sachin Nagvekar, Spandana Sujay, Nagaraja J2026-07-29
📊 statistics

Recovering Parametric Inference for Skewed, Small-Sample, and Heteroscedastic Data: The Coefficient-of-Variation Screen and the Log-Scale Variance Ratio (ρ)

Cet article propose un cadre pratique utilisant des statistiques de résumé pour détecter l'asymétrie et l'hétéroscédasticité via le coefficient de variation et le rapport de variance à échelle logarithmique, permettant ainsi aux chercheurs de récupérer une inférence paramétrique valide et plus puissante pour les données cliniques à petits échantillons où les tests de normalité traditionnels échouent et où les tests t standards sont déficients.

William J. Dwyer2026-07-28
📊 statistics

T_root: A Comprehensive Closed-Form Statistic for Independence in Sparse and Heterogeneous Contingency Tables

Le document introduit TrootT_{root}, une nouvelle statistique sous forme fermée et sans paramètre qui permet d'obtenir un calibrage de taille précis et une puissance robuste pour tester l'indépendance dans les tableaux de contingence à travers une large gamme de sparsité et d'hétérogénéité marginale, unifiant et surpassant efficacement les méthodes existantes telles que le chi carré de Pearson et la statistique de Cressie-Read tout en fournissant une solution déterministe sans recours aux permutations ou au bootstrap.

William J. Dwyer2026-07-28
📊 statistics

The Generalized Moment-Transmuted Cauchy Distribution: A Heavy-Tailed Family with Controllable Finite Moments

Cet article introduit la distribution de Cauchy généralisée par transmutation de moment (GMTC), un modèle à queue épaisse flexible qui surmonte la limitation de la distribution de Cauchy classique concernant l'inexistence des moments en incorporant un paramètre de forme pour contrôler le comportement des queues et assurer des moments finis, tout en fournissant une analyse complète de ses propriétés, de ses méthodes d'estimation et de ses applications pratiques.

STHITADHI DAS2026-07-28