← Ultimi articoli
📄 otolaryngology

Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals

Questo studio dimostra che gli attuali modelli linguistici di grandi dimensioni non riescono a raggiungere un'affidabilità inter-valutatore paragonabile a quella dei professionisti medici nell'estrazione di informazioni cliniche strutturate dalle cartelle cliniche otorinolaringoiatriche, suggerendo che siano più adatti per l'estrazione iniziale dei dati che richiede la verifica umana piuttosto che per l'impiego clinico autonomo.

Autori originali: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C.
Pubblicato 2026-08-24
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Barrett, L., Joshi, N., North, A. S., Dimitrov, L., Maughan, E. F., Ross, T., Pankhania, R., Paramjothy, K., Minty, I., Farache-Trajano, L., Smith, S. L., Mason, K. A., Bhargava, E. K., Donnelly, C., Fatoum, H., Padiyar, A., Kader, Z., Chan, C. H. K., Schilder, A. G., Mehta, N.

Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo

Gli ospedali odierni generano un vasto oceano di documenti scritti. Ogni visita del paziente, ogni risultato di un test e ogni decisione terapeutica viene catturato in note digitali note come cartelle cliniche elettroniche. Questi documenti sono ricchi di dettagli, contenenti il linguaggio specifico che i medici usano per descrivere i sintomi, diagnosticare le condizioni e pianificare le cure. Per decenni, trasformare queste storie non strutturate in dati organizzati e ricercabili è stato un compito difficile, che spesso richiedeva a esseri umani di leggere e riscrivere le informazioni a mano. Recentemente, è emerso un nuovo tipo di programma informatico chiamato modello linguistico di grandi dimensioni (large language model). Questi sistemi sono addestrati su enormi quantità di testo e possono leggere, comprendere e riassumere il linguaggio umano con una fluidità sorprendente. Hanno dimostrato di poter rispondere a domande mediche e superare esami di abilitazione, portando molti a chiedersi se possano anche leggere le cartelle cliniche dei pazienti ed estrarre automaticamente i fatti vitali al loro interno.

Questa domanda non riguarda solo il risparmio di tempo; riguarda la sicurezza e l'accuratezza. Se un computer deve aiutare i medici a gestire l'assistenza ai pazienti, deve trovare le informazioni corrette senza inventare nulla o tralasciare dettagli critici. Un nuovo studio si è posto l'obiettivo di testare direttamente questa capacità. I ricercatori hanno raccolto quasi cento veri record di pazienti provenienti da cliniche di otorinolaringoiatria e hanno chiesto sia a medici umani che a sette diversi modelli linguistici di grandi dimensioni di leggerli. Il compito era estrarre fatti specifici, come l'età del paziente, i suoi sintomi, la sua diagnosi e i trattamenti ricevuti. Per garantire che tutti parlassero la stessa lingua, i ricercatori hanno richiesto che ogni informazione fosse tradotta in un codice standardizzato utilizzato dagli ospedali in tutto il mondo. Ciò ha permesso un confronto preciso di quanto bene le macchine si siano destrecciate rispetto agli umani.

I risultati hanno rivelato un chiaro divario tra l'esperienza umana e l'intelligenza artificiale attuale. Quando i quattordici medici dello studio hanno letto gli stessi record, sono stati d'accordo tra loro sulle informazioni estratte l'81 percento delle volte. Questo alto livello di accordo ha dimostrato che i medici interpretavano le note in modo coerente. Tuttavia, quando i modelli informatici sono stati confrontati con i medici, l'accordo è sceso significativamente a circa il 66 percento. In altre parole, le macchine non erano ancora affidabili quanto gli umani nell'identificare gli stessi fatti dallo stesso testo. Lo studio ha testato modelli di diverse dimensioni, da sistemi massicci con centinaia di miliardi di connessioni a modelli più piccoli che potevano girare su computer locali. Nessuno di essi ha raggiunto il livello di coerenza mostrato dai professionisti medici.

Le prestazioni variavano a seconda del tipo di informazione che veniva estratta. I modelli sono stati piuttosto bravi a trovare trattamenti e risultati di test, che sono spesso scritti in modi chiari e standardizzati. Erano meno efficaci con segni e diagnosi, che spesso richiedono una comprensione più profonda del contesto clinico. Interessante notare che i computer tendevano a trovare più informazioni rispetto ai medici, in particolare riguardo ai fattori di rischio. Mentre i medici si concentrano spesso sul problema immediato, i modelli sembravano segnalare ogni possibile rischio menzionato nel testo. Ciò suggerisce che le macchine non stanno solo copiando il comportamento umano, ma stanno elaborando il testo in modo diverso, cogliendo talvolta dettagli che un essere umano potrebbe trascurare, ma potenzialmente segnalando anche cose che non sono clinicamente rilevanti.

Nonostante queste differenze, le macchine hanno dimostrato di poter essere strumenti utili se utilizzate correttamente. Lo studio ha rilevato che, quando i modelli identificavano un'informazione, erano solitamente corretti, con un tasso di precisione del 97 percento. Ciò significa che raramente inventavano fatti che non erano presenti. Tuttavia, tralasciavano alcune informazioni circa il 15 percento delle volte. Questo schema indica un ruolo specifico per questi strumenti nel futuro: sono più adatti ad agire come un primo passaggio, scansionando rapidamente le cartelle cliniche per estrarre i candidati probabili da sottoporre alla revisione del medico. La decisione finale e la verifica dovrebbero comunque provenire da un essere umano. I ricercatori hanno concluso che, sebbene questi modelli siano potenti, non sono ancora pronti per lavorare da soli in un contesto clinico. Devono essere visti come assistenti che possono aiutare a organizzare il flusso di dati medici, a condizione che un esperto umano sia sempre presente per controllare il loro lavoro.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →