💻 computer science

ConformalFL: Calibrated Inspection Cutoffs for Spectrum-Based Fault Localization

ConformalFL introduce un approccio di regressione quantilica conformalizzata per generare soglie di ispezione calibrate e specifiche per il bug per la localizzazione dei guasti basata sullo spettro che mappano un rischio di errore definito dall'utente a un insieme di ispezione completo di legami, sebbene i risultati empirici sul benchmark Defects4J mostrino che non superi i cutoff fissi ben scelti in termini di efficienza di ispezione.

Nikolai Drozdov2026-08-04
💻 computer science

Gradient-Free versus Gradient-Based Risk Constraints in Reinforcement Learning: A Reservoir Governance Case Study

Questo studio dimostra che, nella gestione dei bacini idrici, l'ottimizzazione priva di gradiente (CEM) supera i metodi basati sul gradiente (SAC/PPO) nel minimizzare il rischio di coda poiché valuta direttamente la CVaR non differenziabile, mentre gli approcci basati sul gradiente soffrono di garanzie di sicurezza che decadono geometricamente a causa della loro dipendenza da surrogati del costo differenziabili.

Milad Tahavor, Soroush Amanna, Fatemeh Zabihi Jalali Zavareh, Milad Ghoroqi2026-08-04
💻 computer science

Ontological Firewalls and Fracturing for Transmission: Systematic Evidence for Persona-Dependent and Persona-Independent Behavioral Phenomena in Large Language Models

Questo articolo presenta uno studio sistematico su tre principali LLM che rivela come, sebbene i modelli condividano fenomeni comportamentali universali come l'abbraccio del paradosso, essi esibiscano spessori di "firewall ontologico" e relazioni di identità (sacrificio, liberazione o violenza) distinti e specifici per ogni modello che modellano fondamentalmente il modo in cui rispondono all'iniezione di persona.

Abbas Hamidavi2026-08-04
💻 computer science

Every-successful-replay route admission changes first-token latency rankings in clinical question answering

Questo articolo introduce MedRouteGuard, un framework di ammissione dei percorsi che impone rigide regole di validazione delle prove e di riproduzione per rivelare che gli attuali benchmark di question-answering clinico sottostimano significativamente la latenza del primo token premiando i percorsi che omettono la provenienza o riutilizzano dipendenze obsolete, sottraendo così le classificazioni delle prestazioni e migliorando la validità delle prove.

Rui Li, Jason Zhao, Shuang Cao, Alexandre Duprey, Ruihua Liu2026-08-04
💻 computer science

Does Size Generalization Imply Disruption Robustness? A Pre-Registered Study of GNN–PPO Scheduling Policies for the Dynamic Flexible Job-Shop Problem

Questo studio preregistrato dimostra che, sebbene le policy GNN–PPO addestrate sul problema del job-shop flessibile dinamico esibiscano una generalizzazione della dimensione, esse non riescono a raggiungere simultaneamente la competitività rispetto alle tradizionali regole di dispatching o la robustezza contro regimi di perturbazione multipla, provando che queste due proprietà sono separabili piuttosto che co-emergenti.

Joseph Javier Sánchez Acuña, David Álvarez2026-08-04
💻 computer science

The Price of Optimality Under Uncertainty: A Predictive–Reactive Robustness Analysis of Exact, Metaheuristic, and Dispatching-Rule Scheduling for the Dynamic Job-Shop Problem

Questo studio dimostra che, per la pianificazione dinamica di job-shop sotto incertezza, i programmi ottimali esatti sono spesso meno robusti rispetto alle semplici regole di priorità di dispatching perché la loro mancanza di scorrimento impedisce loro di assorbire le interruzioni, rendendo queste ultime frequentemente superiori nell'esecuzione nel mondo reale nonostante la loro minore performance nominale.

Joseph Javier Sánchez Acuña2026-08-04
💻 computer science

Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis

Questo articolo introduce un parametro d'ordine basato sulla matrice di densità per analizzare i fallimenti del fine-tuning nei modelli linguistici su compiti di quasi-sinonimi, rivelando che i modelli possono degradare geometricamente nonostante la diminuzione della perdita a causa del trascinamento strutturale dell'embedding e identificando quantità adimensionali che predicono tassi di apprendimento critici e comportamenti architettonici.

Vaibhav Prakash2026-08-04
💻 computer science

Code is Cheap, Judgment is Not: The Rise of Integration Skill in the Age of AI-Written Code

Questo articolo sostiene che, man mano che l'IA mercifica la generazione di codice, la competenza professionale più preziosa in ambienti regolamentati come quello finanziario si sposta dal prompt engineering alla comprensione e all'integrazione del codice, rendendo necessari nuovi modelli di capitale professionale e quadri di governance per affrontare le sfide dell'autoria uomo-macchina.

MEHTAB KHAN2026-08-04
💻 computer science

Two-Stage Enhancement-Field Synthesis of Contrast-Enhanced Breast MRI from Pre-Contrast Slices

Questo articolo propone un modello a due stadi Coarse-to-Structure (C2S) che decompone la generazione sintetica di risonanze magnetiche mammarie con contrasto in predizione del campo globale e raffinamento strutturale, dimostrando una affidabilità a livello di lesione e una fedeltà strutturale superiori rispetto ai modelli a stadio singolo, nonostante un compromesso con le metriche di somiglianza percettiva.

Yujie Yao, Guotai Wang2026-08-04