📊 statistics

Automated auditing of statistical quality in university theses: why lexical rules fail and what a language layer adds

Questo studio dimostra che l'audit automatizzato basato su regole della qualità statistica nelle tesi universitarie performa peggio del caso a causa di fondamentali limitazioni lessicali, ma l'integrazione di uno strato di modello linguistico migliora significativamente l'accordo con il giudizio esperto mantenendo un'alta richiamata e un basso costo.

Milton Vladimir Mamani Calisaya, Charles Ignacio Mendoza Mollocondo, Vladimiro Ibañez Quispe, Jesus Pari Flores2026-08-28
📊 statistics

Grade 4-to-5 Joint Mathematics–Science Benchmark Transitions in Nine Systems: A Descriptive Common-Severity Analysis Using TIMSS 2023 Longitudinal Data

Questo studio utilizza i dati longitudinali TIMSS 2023 di nove sistemi per stimare e standardizzare la probabilità congiunta che gli studenti passino da un livello inferiore a uno superiore rispetto sia ai benchmark di matematica che di scienze, rivelando significative variazioni specifiche per ogni sistema e dimostrando che, sebbene la standardizzazione della severità comune chiarisca la dipendenza dal target, i risultati rimangono descrittivi piuttosto che causali.

Jonas A. Mandalunes2026-08-28
📊 statistics

When the adjustment fails: population-denominator sensitivity in coverage-adjusted PISA trends

Questo articolo dimostra che i trend del quartile superiore corretti per la copertura di PISA sono altamente sensibili alla scelta del denominatore della popolazione, rivelando discrepanze significative tra i dati riportati e le stime delle World Population Prospects che sottolineano la necessità di una trasparenza nella segnalazione della provenienza e di cautela quando i pesi sintetici innescano aggiustamenti.

Jonas A. Mandalunes, Danica Jane S. Mandalunes2026-08-28
📊 statistics

Measurement-bounded predictive inference in international large-scale assessment: how the plausible-value ceiling governs attainable accuracy and the stability of predictor rankings in PISA 2022

Questo studio dimostra che il limite di precisione della misurazione inerente ai valori plausibili di PISA 2022 limita fondamentalmente l'accuratezza predittiva raggiungibile e destabilizza le classifiche dei predittori attraverso i domini e i sistemi educativi, rendendo necessario che i confronti sulle prestazioni e le interpretazioni dei modelli siano fondati su tali limiti di misurazione computabili.

Jonas A. Mandalunes2026-08-28
📊 statistics

Spatiotemporal Dynamics and Optimal Control of a Two-Stage Infection-Age Structured Epidemic Model with Nonlocal Diffusion, Chemotactic Avoidance, and Intermittent Control Strategies

Questo articolo stabilisce un nuovo modello epidemico a due stadi basato sull'età dell'infezione che incorpora la diffusione non locale, l'evitamento chemiotattico e l'immunità decadente per dimostrare la stabilità globale degli equilibri e sviluppare un quadro di controllo ottimo a due livelli con strategie intermittenti che, convalidato dai dati di Berlino, dimostra la superiorità degli interventi spazialmente mirati rispetto agli approcci uniformi.

Yuhao zhou2026-08-28
📊 statistics

Dense Truths, Sparse Estimators: Making Lasso Work for Dense-Signal Logistic Regression

Questo articolo contesta la convenzionale preferenza per la regressione Ridge in contesti ad alta dimensionalità con segnale denso, dimostrando che la scarsa prestazione di Lasso deriva da una sintonizzazione subottimale piuttosto che da difetti intrinseci, e introduce un nuovo selettore di penalità posteriore-predittiva che consente a Lasso di raggiungere un'accuratezza predittiva comparabile o superiore a quella della regressione Ridge, mantenendo al contempo le sue cruciali capacità di selezione delle variabili.

Jason Liao2026-08-28
📊 statistics

An Examination of the Performance of Variance Estimators in International Large-Scale Assessments

Questo studio di simulazione Monte Carlo valuta le prestazioni dei stimatori della varianza BRR, JK2 e Bootstrapping nelle valutazioni internazionali su larga scala, riscontrando che, mentre JK2 offre una precisione superiore per le statistiche lisce come le medie, il Bootstrapping e il BRR sono più accurati per le statistiche non lisce, e che gli aggiustamenti Fay e la gestione della non risposta influenzano significativamente l'affidabilità dello stimatore.

Umut Atasever, Sabine Meinck, Diego Cortes2026-08-27
📊 statistics

Inverse Target Trial Emulation: A Method to Simulate Realistic Observational Data

Questo articolo introduce l'Inverse Target Trial Emulation (ITTE), un framework bayesiano che genera dataset osservazionali realistici a partire da dati di trial controllati randomizzati inducendo sistematicamente bias di confondimento e legati al tempo, consentendo così la valutazione e il confronto rigorosi delle strategie analitiche per correggere tali bias nella ricerca sanitaria non randomizzata.

Luca Benetti, Gianluca Baio, Anna Heath2026-08-27
📊 statistics

What does Retraction Watch's "computer-generated content" reason capture? A metadata analysis of 9,161 retractions

Questa analisi dei metadati di 9.161 ritiri rivela che la motivazione "contenuto generato dal computer" in Retraction Watch è pesantemente concentrata in un singolo editore e fortemente associata ai paper mill, ma tali schemi riflettono pratiche di co-coding piuttosto che fornire prove definitive sulla reale presenza di IA generativa negli articoli ritirati.

Jonas Mandalunes2026-08-27