📊 statistics

Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration

Distribird est une application web agentique qui automatise la création de distributions a priori informées par la littérature pour le calibrage de modèles bayésiens en déployant un pipeline multi-agents pour extraire, pondérer et ajuster des données scientifiques, offrant ainsi une alternative traçable et vérifiée en termes de validité aux distributions a priori uniformes couramment utilisées ou aux bases de référence de LLM à simple prompt non fondées.

Patrik P. Süli, György Eigner, Roland Hollós2026-08-18
📊 statistics

Validating the Crystal Ball: Retrospective Evaluation and Uncertainty-Aware Forecasting of Severe Housing Cost Burden in New York City

Cet article valide rétrospectivement un modèle d'apprentissage automatique pour les charges de logement à New York, révélant une sous-estimation systématique due à des hypothèses économiques statiques et recalibrant par la suite le cadre avec des méthodes tenant compte de l'incertitude afin de générer des prévisions plus robustes et basées sur des scénarios pour 2025–2028.

Nakib Uddin Ahmed, Azizur Rahman, Mehjabin Ferdous, Kadirur Rahman Chowdhury2026-08-18
📊 statistics

Matrix Variate Skew-Normal Distribution and Related Finite Mixtures: Modeling and Clustering of Asymmetric Data

Cet article propose une nouvelle distribution normale asymétrique à variables matricielles et son modèle de mélange fini afin de capturer efficacement l'asymétrie et d'effectuer le partitionnement de données à valeurs matricielles, offrant une flexibilité et une performance accrues par rapport aux modèles symétriques traditionnels grâce à des estimateurs dérivés et un algorithme ECM.

Shiva Kumar Kurva, Kiruthika C2026-08-18
📊 statistics

Seemingly Unrelated Cointegrating Regressions with Autoregressive Distributed Lag Dynamics: Estimation, Bounds Testing, and Cross-Equation Inference

Cet article propose un cadre de modèle de retards échelonnés autorégressifs apparemment non liés (SUR-ARDL) pour les panels à petit N qui améliore l'efficacité de l'estimation et la puissance des tests de cointégration en exploitant les corrélations d'erreurs entre équations tout en évitant les distorsions d'échantillon fini des estimateurs de la matrice de covariance de long terme, comme le démontrent des preuves théoriques, des simulations de Monte Carlo et une application au lien entre énergie renouvelable et croissance dans les pays de l'ASEAN.

Muhammad Afnan Arif, Fumitaka Furuoka2026-08-18
📊 statistics

A Closed-Loop Framework for Knowledge-Based Causal Model Refinement Using Process Mining and Human-AI Governance

Cet article propose un cadre collaboratif humain-IA en boucle fermée qui affine de manière itérative des modèles causaux fondés sur la connaissance (DAG) en intégrant l'exploration de processus de journaux d'événements empiriques à l'adjudication d'experts afin d'améliorer l'exactitude et la transparence de l'inférence causale dans les maladies chroniques complexes.

Eduardo Illueca Fernandez, Kaile Chen, Carlos Fernandez Llatas, Fernando Seoane, Farhad Abtahi2026-08-14
📊 statistics

Matched-Calibration of Changepoint Detectors for Biopharmaceutical Quality Monitoring

Cette étude démontre que lorsque des détecteurs de points de rupture pour la surveillance de la qualité biopharmaceutique sont comparés sous des taux de faux positifs et des ablations d'espace de recherche appariés, une pénalité standard basée sur la variance surpasse les alternatives robustes à travers diverses tailles d'échantillons et distributions, révélant que les préférences antérieures pour les méthodes robustes étaient dictées par des conditions expérimentales non contrôlées plutôt que par une supériorité intrinsèque.

Halil İbrahim Özdemir, Berfin Dogan, Pemra Ozbek2026-08-14
📊 statistics

Choosing Among Randomized Design Families for Implementation Strategy Trials: A Question-Driven Framework with Practical Tools and Exemplars

Cet article présente un cadre pratique, fondé sur des questions directrices, ainsi que les outils d'accompagnement pour guider les chercheurs dans la sélection de la famille de plans randomisés la plus appropriée — tels que les essais cliniques par grappes parallèles, les essais en escalier (stepped-wedge), factoriels ou adaptatifs — pour les études de stratégies de mise en œuvre, en fonction de leurs objectifs décisionnels spécifiques plutôt que de leurs préférences méthodologiques.

Jonah K. Amponsah, Shellie D. Ellis, Felice Resnik2026-08-14
📊 statistics

Robust Log-Contrast Regression for High-Dimensional Compositional Microbiome Data with Outliers

Cet article propose un cadre de régression robuste par contraste logarithmique qui combine la perte de Huber et la pénalité Lasso pour gérer les valeurs aberrantes et assurer la parcimonie dans les données de microbiote compositionnelles de haute dimension, tout en fournissant des garanties théoriques et un algorithme ADMM de Gauss-Seidel symétrique efficace pour la mise en œuvre.

Xuke Hua, Yunhai Xiao, Xin Xin2026-08-14
📊 statistics

Manual versus Data-Driven Specification in Hybrid Discrete Choice Models} - A Benchmark of MNL, RUMBoost, and Penalized Multinomial Logistic Tree Regression (PMLTR)

Cet article introduit la Régression par Arbre Logistique Multinomiale Pénalisée (PMLTR) en tant que modèle hybride qui équilibre le pouvoir prédictif des méthodes fondées sur les données comme RUMBoost avec l'interprétabilité des modèles MNL classiques, démontrant à travers une évaluation comparative approfondie que si la spécification manuelle reste compétitive, les approches purement fondées sur les données excellent en matière de prédiction tandis que la PMLTR offre de manière unique des utilités lisibles essentielles pour l'optimisation et l'inférence.

Simon Rienks, Fiona Sauerbier, Knut Haase2026-08-14