📊 statistics

Interpreting feature importance under spatial heterogeneity: Evidence from urban development stages and regional migration

Questo articolo dimostra che in sistemi spazialmente eterogenei come la migrazione urbana, le classifiche di importanza delle caratteristiche derivate dal machine learning sono instabili attraverso i diversi stadi di sviluppo e non rivelano intrinsecamente la direzione o l'uniformità dell'influenza di un predittore, rendendo necessaria una separata validazione spaziale per le applicazioni politiche.

dongwoo kim2026-07-31
📊 statistics

When a Winning Forecast Does Not Identify an Action: An Evidence-Budget Algorithm for Distributional Decisions

Questo articolo introduce la Finite-Evidence Decision Identification Procedure (FEDIP), un framework di audit modulare che rivela come i dati di validazione finiti spesso falliscano nell'identificare univocamente un'unica azione ottimale tra modelli distribuzionali concorrenti, dimostrando così la necessità di funzioni di perdita economica esplicite per risolvere la dispersione delle azioni che la selezione basata sul punteggio standard trascura.

Min Huang, Mingyan Liu, Xiaoer Li2026-07-31
📊 statistics

A Gaussian-Based Refinement Algorithm for Estimating Usual Energy Intake from FAO Food Balance Sheets: Validation Across Six Countries

Questo studio introduce e valida un algoritmo di raffinamento basato sulla distribuzione gaussiana che stima con successo le distribuzioni dell'introito energetico abituale della popolazione a partire dalle Bilance Alimentari, trattando i valori riportati come limiti superiori, dimostrando un'accuratezza significativamente superiore rispetto ai metodi esistenti della FAO se confrontato con le indagini dietetiche nazionali in sei paesi.

Omar A. Alhumaidan2026-07-31
📊 statistics

An Empirical Comparison of Statistical Methods for Estimating EQ-5D Health State Utilities in Rheumatoid Arthritis Clinical Trials for Economic Modelling

Questo studio confronta empiricamente i modelli a effetti misti lineari, le equazioni di stima generalizzate e i modelli misti a due parti per stimare le utilità EQ-5D nei trial sull'artrite reumatoide, riscontrando che, sebbene i modelli misti a due parti producano stime di utilità inferiori, la scelta del metodo ha un impatto minimo sulle conclusioni complessive di costo-efficacia.

Jiajun Yan, Eleanor Pullenayegum, Shun Fu Lee, Feng Xie2026-07-30
📊 statistics

Normative Translation and Pre-Screening to Overcome Domain Collapse and Epistemic Shielding in Non-Compensatory Composite Indicators

Questo articolo propone un quadro metodologico unificato che combina una funzione CES con traduzione ancorata a una norma globale e un meccanismo di pre-screening dell'equivalente della certezza per risolvere il collasso del dominio computazionale e prevenire la "trappola dello scudo epistemico" negli indicatori composti non compensativi, consentendo così audit accurati della qualità dei dati longitudinali e avvertendo esplicitamente contro l'uso dell'indice penalizzato per l'allocazione dei finanziamenti trasversali.

Shahryar Ghiasi2026-07-30
📊 statistics

Bayesian Inference for Multi-Source Binary Data with Selection and Measurement Error

Questo articolo introduce un framework di modellazione bayesiana che affronta congiuntamente gli errori di classificazione errata e di selezione in dati binari multi-fonte, dimostrando attraverso simulazioni e analisi empirica che, sebbene l'errore composito possa essere identificato in modo robusto, la sua decomposizione accurata in componenti specifiche richiede indicatori validi, variabili ausiliarie e prior informativi.

Santiago Gómez-Echeverry, Arnout van Delden, Ton de Waal, Dimitris Pavlopoulos2026-07-30
📊 statistics

A General Framework for Stability Assessment of Non-Deterministic Prediction Models

Questo articolo propone un quadro generale per quantificare la stabilità dei modelli di predizione non deterministici attraverso esiti metrici, categorici e ordinali, introducendo misure di stabilità basate sui dati e basate sul modello che superano i limiti dei metodi esistenti, quali la loro incapacità di gestire singoli oggetti di test e la loro sensibilità alla composizione dei dati.

Thomas Martin Lange, Armin Otto Schmitt, Felix Heinrich2026-07-30
📊 statistics

A Sequential Tour-Based Mode Choice Framework with GPS-based Data: Integrating Machine-Learning-Derived Features into Mixed Logit and MNL Models

Questo studio sviluppa un framework sequenziale di scelta del mezzo di trasporto basato sui tour per Sydney utilizzando dati GPS e caratteristiche derivate dal machine learning, dimostrando che i modelli Mixed Logit migliorano significativamente la previsione per le componenti interdipendenti dei tour e che il framework rimane robusto rispetto all'incertezza di stima a monte, convalidando così l'uso di input simulati per la previsione pratica della domanda di trasporto.

Mostafa Rahimi, Maliheh Tabasi, Abdul Rawoof Pinjari, Taha Hossein Rashidi2026-07-30
📊 statistics

Ablation Study of Class Imbalance Techniques for Credit Default Prediction with SHAP-based Explainability Analysis

Questo studio dimostra che nei compiti di previsione del default creditizio, il parametro integrato `scale_pos_weight` di XGBoost supera significativamente la tradizionale tecnica di resampling SMOTE in termini di recall, evidenziando che la strategia ottimale per gestire lo sbilanciamento delle classi dipende dal classificatore specifico utilizzato piuttosto che da un metodo di resampling universale.

Atharv Tiwari2026-07-30