📊 statistics

Interpreting feature importance under spatial heterogeneity: Evidence from urban development stages and regional migration

Cet article démontre que dans les systèmes spatialement hétérogènes tels que la migration urbaine, les classements d'importance des caractéristiques dérivés de l'apprentissage automatique sont instables à travers les différentes étapes de développement et ne révèlent pas intrinsèquement la direction ou l'uniformité de l'influence d'un prédicteur, nécessitant une validation spatiale distincte pour les applications politiques.

dongwoo kim2026-07-31
📊 statistics

When a Winning Forecast Does Not Identify an Action: An Evidence-Budget Algorithm for Distributional Decisions

Cet article introduit la Procédure d'Identification de Décision à Évidence Finie (FEDIP), un cadre d'audit modulaire qui révèle comment les données de validation finies échouent souvent à identifier de manière unique une action optimale parmi des modèles distributionnels concurrents, démontrant ainsi la nécessité de fonctions de perte économique explicites pour résoudre la dispersion des actions que la sélection standard basée sur le score néglige.

Min Huang, Mingyan Liu, Xiaoer Li2026-07-31
📊 statistics

A Gaussian-Based Refinement Algorithm for Estimating Usual Energy Intake from FAO Food Balance Sheets: Validation Across Six Countries

Cette étude introduit et valide un algorithme de raffinement basé sur une distribution gaussienne qui estime avec succès les distributions de l'apport énergétique habituel de la population à partir des balances alimentaires en traitant les valeurs déclarées comme des bornes supérieures, démontrant une précision significativement améliorée par rapport aux méthodes existantes de la FAO lorsqu'elles sont comparées aux enquêtes nationales de consommation alimentaire dans six pays.

Omar A. Alhumaidan2026-07-31
📊 statistics

An Empirical Comparison of Statistical Methods for Estimating EQ-5D Health State Utilities in Rheumatoid Arthritis Clinical Trials for Economic Modelling

Cette étude compare empiriquement les modèles mixtes linéaires, les équations d'estimation généralisées et les modèles mixtes à deux parties pour estimer les utilités EQ-5D dans les essais sur la polyarthrite rhumatoïde, concluant que bien que les modèles mixtes à deux parties produisent des estimations d'utilité plus faibles, le choix de la méthode a un impact minimal sur les conclusions globales de l'efficience thérapeutique.

Jiajun Yan, Eleanor Pullenayegum, Shun Fu Lee, Feng Xie2026-07-30
📊 statistics

Normative Translation and Pre-Screening to Overcome Domain Collapse and Epistemic Shielding in Non-Compensatory Composite Indicators

Cet article propose un cadre méthodologique unifié combinant une fonction CES à ancrage normatif global avec un mécanisme de pré-sélection par équivalence de certitude afin de résoudre l'effondrement du domaine computationnel et de prévenir le « piège du bouclier épistémique » dans les indicateurs composites non compensatoires, permettant ainsi des audits de qualité des données longitudinales précis tout en mettant explicitement en garde contre l'utilisation de l'indice pénalisé pour l'allocation budgétaire transversale.

Shahryar Ghiasi2026-07-30
📊 statistics

Bayesian Inference for Multi-Source Binary Data with Selection and Measurement Error

Cet article introduit un cadre de modélisation bayésienne qui traite conjointement les erreurs de classification et de sélection dans des données binaires multi-sources, démontrant, par des simulations et une analyse empirique, que si l'erreur composite peut être identifiée de manière robuste, sa décomposition précise en composantes spécifiques nécessite des indicateurs valides, des variables auxiliaires et des a priori informatifs.

Santiago Gómez-Echeverry, Arnout van Delden, Ton de Waal, Dimitris Pavlopoulos2026-07-30
📊 statistics

A General Framework for Stability Assessment of Non-Deterministic Prediction Models

Cet article propose un cadre général pour quantifier la stabilité des modèles de prédiction non déterministes à travers des résultats métriques, catégoriels et ordinaux en introduisant des mesures de stabilité basées sur les données et sur les modèles qui surmontent les limites des méthodes existantes, telles que leur incapacité à traiter des objets de test individuels et leur sensibilité à la composition des données.

Thomas Martin Lange, Armin Otto Schmitt, Felix Heinrich2026-07-30
📊 statistics

A Sequential Tour-Based Mode Choice Framework with GPS-based Data: Integrating Machine-Learning-Derived Features into Mixed Logit and MNL Models

Cette étude développe un cadre de choix de mode basé sur des tours séquentiels pour Sydney en utilisant des données GPS et des caractéristiques dérivées de l'apprentissage automatique, démontrant que les modèles Logit Mixte améliorent significativement la prédiction pour les composantes de tours interdépendantes et que le cadre reste robuste à l'incertitude d'estimation en amont, validant ainsi l'utilisation d'entrées simulées pour la prévision pratique de la demande de transport.

Mostafa Rahimi, Maliheh Tabasi, Abdul Rawoof Pinjari, Taha Hossein Rashidi2026-07-30
📊 statistics

Ablation Study of Class Imbalance Techniques for Credit Default Prediction with SHAP-based Explainability Analysis

Cette étude démontre que sur les tâches de prédiction de défaut de crédit, le paramètre intégré `scale_pos_weight` d'XGBoost surpasse de manière significative la technique traditionnelle de rééchantillonnage SMOTE en termes de rappel, soulignant que la stratégie optimale pour gérer le déséquilibre des classes dépend du classifieur spécifique utilisé plutôt que d'une méthode de rééchantillonnage universelle.

Atharv Tiwari2026-07-30