💻 computer science

What Makes a Programming Problem Hard for a Language Model? An Empirical Study of Item Difficulty Across Code LLMs on Two Benchmarks

Questo articolo presenta uno studio empirico che dimostra come la difficoltà dei problemi nei benchmark di generazione di codice sia una metrica stabile e trasferibile, guidata dalle caratteristiche delle specifiche (come gli esempi e la lunghezza del prompt) su HumanEval e dalla complessità della soluzione su MBPP, offrendo approfondimenti critici per il miglioramento del benchmarking, della valutazione automatica e della progettazione di strumenti educativi man mano che i punteggi aggregati dei modelli si saturano.

TANZIM ISLAM KHAN2026-07-13
💻 computer science

Detecting ovarian endometriomas from ultrasound using vision transformers and cross-modality transfer learning

Questo articolo presenta un modello di apprendimento automatico pionieristico che rileva gli endometriomi ovarici da immagini ecografiche utilizzando vision transformer e transfer learning cross-modalità, raggiungendo alte prestazioni nonostante la scarsità e lo squilibrio dei dati, dimostrando al contempo la trasferibilità delle caratteristiche di basso livello tra le modalità di imaging medico.

Matthew Watson, Miliani Fraser-Fletcher, Tom Willshare, Molly Jowsey, Noura Al Moubayed2026-07-13
💻 computer science

Intelligent Root Cause Analysis and Incident Diagnostics for Microsoft Fabric and Power BI through Telemetry Correlation and Kusto Query Language

Questo articolo presenta un framework intelligente di analisi della causa radice per Microsoft Fabric e Power BI che utilizza la correlazione della telemetria multi-livello e l'inferenza basata sul Kusto Query Language per migliorare significativamente l'accuratezza e la velocità della diagnosi degli incidenti rispetto ai metodi manuali tradizionali.

Shujath Baig Mirza2026-07-13
💻 computer science

Human–AI collaboration in deductive coding of classroom dialogue: prompt engineering and collaboration patterns

Questo studio impiega la ricerca basata sul design per dimostrare che un assistente alla codifica GPT personalizzato, quando integrato con prompt strutturati e un flusso di lavoro collaborativo incentrato sull'uomo, supporta efficacemente la codifica deduttiva del dialogo in classe, evidenziando al contempo che una collaborazione uomo-IA di successo dipende dall'interazione dinamica tra l'architettura dei prompt, la sequenza del flusso di lavoro e la posizione del ricercatore nei confronti dell'IA.

Luwei Bai, Dongkeun Han, Sara Hennessy2026-07-13
💻 computer science

When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models

Questo articolo analizza sistematicamente il condizionamento contestuale nei modelli visione-linguaggio attraverso diverse architetture e dataset, rivelando che mentre il prompting a livello di dominio è costantemente vantaggioso, il condizionamento contestuale completo per singola immagine comporta un'elevata varianza e rischi di overfitting, con la sua utilità guidata principalmente dalla scala del modello e dall'accuratezza di base.

Alaa Alahmadi2026-07-13
💻 computer science

Mining AI-Assisted Course Design Workflows at Production Scale

Questo articolo presenta il primo studio su scala produttiva della progettazione di corsi assistita dall'IA, estraendo da un dataset che preserva la privacy di CourseFactory quattro superfici di workflow, dimostrando che i modelli di triage della qualità strutturale e di routing dagli item agli assignment migliorano significativamente l'efficienza e l'accuratezza della revisione, confermando al contempo che il testo dei prompt trattenuto non aggiunge alcun segnale misurabile.

Aleksandr Volkov, Taras Pustovoy, Dmitriy Istomin, Viacheslav Istomin, Tatiana Otbetkina2026-07-13
💻 computer science

Recovery Dynamics and Persistent Structural Excursion in Disrupted World Models

Questo studio dimostra che, sebbene le traiettorie di successo e quelle fallimentari in un modello del mondo perturbato esibiscano dinamiche di recupero distinte — quali una minore entropia del percorso e meno escursioni strutturali — tali schemi dell'intera traiettoria non possono essere predetti in modo affidabile a partire dai prefissi iniziali, distinguendo così le sfide della rilevazione dei regimi, del monitoraggio del recupero e della predizione di singoli rollout.

Jeffery Scott Allbright2026-07-13
💻 computer science

H. Dilpriya's Momentum (HDM) : A Multi-Strategy Gradient-Aligned Optimizer with Adaptive Per-Parameter Corrections, Cosine-Annealed Scheduling, and Convergence Guarantees for Deep Neural Networks

Questo articolo introduce l'H. Dilpriya's Momentum (HDM), un nuovo ottimizzatore multi-strategia che combina correzioni adattive per parametro con lo scheduling a coseno-annealing per ottenere rigorose garanzie di convergenza e un allineamento del gradiente allo stato dell'arte, dimostrando prestazioni superiori sia su problemi sintetici mal condizionati che su benchmark di deep learning come MNIST e CIFAR-10.

Janaka Ishan Senarathna2026-07-13