Large Language Models for Pulmonary Embolism Health Education: A Four- Model Comparison of Reliability, Quality, and Readability
Questo studio confronta quattro modelli linguistici di grandi dimensioni sull'educazione sanitaria relativa all'embolia polmonare, riscontrando che, sebbene Copilot e Perplexity abbiano dimostrato una affidabilità e un reperimento delle fonti superiori, nessuno dei modelli ha soddisfatto gli standard di leggibilità raccomandati per l'educazione del paziente, evidenziando la necessità di una supervisione professionale.
Articolo originale sotto licenza CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina Internet come una gigantesca e frenetica biblioteca in cui chiunque può entrare e porre una domanda. In passato, se avessi chiesto informazioni su una condizione medica spaventosa, avresti potuto ricevere una pila di vecchi libri, un articolo di giornale confuso o un'indiscrezione assurda da uno sconosciuto. Recentemente, però, è arrivato un nuovo tipo di bibliotecario: il Large Language Model (LLM). Immaginali come robot super intelligenti e instancabili che hanno letto quasi tutto ciò che è scritto su Internet e possono conversare con te in un linguaggio semplice e naturale. Sono bravissimi a scrivere storie, risolvere problemi matematici e persino a rispondere a domande sulla salute.
Ma ecco la parte complicata: quando si tratta di problemi di salute seri, essere un bravo narratore non basta. Serve un bibliotecario che conosca i fatti, che ammetta quando non è sicuro e che spieghi le cose in modo abbastanza semplice da essere compreso da una persona stanca e preoccupata. Una di queste condizioni spaventose è l'Embolia Polmonare (EP). È come un ingorgo stradale nei polmoni causato da un coagulo di sangue, e può essere molto pericolosa. Poiché è una questione così seria, le persone spesso corrono su Google per trovare risposte. Questo articolo pone una grande domanda: se chiedessi consiglio a quattro diversi bibliotecari IA su un'EP, ti darebbero tutti lo stesso buon consiglio? O alcuni sembrerebbero sicuri di sé ma sarebbero sbagliati, o darebbero risposte troppo difficili da leggere?
La Grande Sfida tra le IA: Chi è il Miglior Bibliotecario della Salute?
In questo studio, i ricercatori dell'Ospedale Popolare della Contea di Xinfeng hanno deciso di mettere alla prova i quattro chatbot più popolari. Hanno scelto ChatGPT, Gemini, Microsoft Copilot e Perplexity AI. Per rendere la sfida equa, non hanno chiesto ai robot domande strane o inventate. Invece, hanno analizzato ciò che le persone cercano realmente su Google in un periodo di cinque anni. Hanno trovato le 31 domande più comuni che le persone pongono sull'Embolia Polmonare — cose come "Quali sono i sintomi?", "Come viene trattata?" e "È pericolosa durante la gravidanza?".
Quindi, hanno inserito queste esatte 31 domande in ciascuno dei quattro modelli di IA. Poiché c'erano quattro modelli e 31 domande, i ricercatori hanno ottenuto 124 risposte diverse da valutare. Hanno agito come insegnanti severi, utilizzando quattro diversi "pagelle" per controllare le risposte:
- Affidabilità: L'IA ha ammesso ciò che sapeva e ciò che non sapeva? Ha mostrato i suoi compiti (fonti)?
- Qualità: Il consiglio era equilibrato e utile?
- Leggibilità: Il linguaggio era abbastanza semplice da essere compreso da uno studente di terza media? (I medici di solito raccomandano che le informazioni sanitarie abbiano questa semplicità affinché tutti possano comprenderle).
- Fluidità Generale: Il testo scorreva bene?
I Risultati: Le "Buone" Notizie e le "Cattive" Notizie
Ecco il colpo di scena: Tutti e quattro i modelli di IA hanno risposto a ogni singola domanda. Nessuno di loro è andato in crash o si è rifiutato di parlare. Tutti sono suonati sicuri di sé e hanno scritto frasi chiare e fluide. Se leggessi solo il primo paragrafo, sembravano tutti esperti molto utili.
Tuttavia, quando i ricercatori hanno guardato più da vicino, le differenze erano enormi.
Il punteggio delle "Fonti" (Benchmark JAMA):
Immaginate un saggio in cui ricevete punti per aver elencato le vostre fonti. Due modelli, Copilot e Perplexity, sono stati gli unici ad sforzarsi di mostrare il proprio lavoro. Hanno fornito citazioni (link a dove hanno preso le informazioni). Gli altri due, ChatGPT e Gemini, hanno fornito principalmente risposte senza mostrare da dove provenissero. Infatti, ChatGPT e Gemini hanno ottenuto un punteggio di 0 per la visualizzazione delle fonti, mentre Copilot e Perplexity hanno ottenuto un punteggio leggermente superiore (circa 1 su 4). Ciò significa che se aveste voluto verificare se l'IA stesse dicendo la verità, potreste farlo solo con i primi due.
Il punteggio di "Affidabilità" (DISCERN):
Questo punteggio verifica se il consiglio è equilibrato e sicuro.
- Copilot e Perplexity hanno ottenuto una mediana di 41.
- ChatGPT ha ottenuto 35.
- Gemini ha ottenuto 33.
Su una scala in cui 63 è "eccellente" e 16 è "molto scarso", tutti e quattro i modelli si sono collocati nell'intervallo tra "scarso" e "sufficiente". Anche i "vincitori" (Copilot e Perplexity) non hanno raggiunto il livello "buono". Erano discreti, ma non ottimi.
Il problema della "Leggibilità":
È qui che la trama diventa un po' frustrante. L'American Medical Association afferma che i consigli sanitari dovrebbero essere scritti con un livello di lettura adatto a un ragazzo di 12 anni (6th grade) in modo che chiunque, indipendentemente dal proprio livello di istruzione, possa capire.
- I ricercatori hanno controllato le risposte utilizzando sei diverse formule matematiche per misurare quanto fosse difficile leggere il testo.
- Nessuno dei quattro modelli ha superato il test.
- Le risposte più semplici erano comunque scritte con un livello di lettura da scuola superiore (9th grade - circa 14-15 anni) per ChatGPT.
- Le risposte più difficili erano scritte con un livello da università (16th grade - circa 18-19 anni) per Copilot!
- Il punteggio "Flesch Reading Ease" (dove un numero più alto indica maggiore facilità) era intorno a 35 o 48 per tutti. Per superare il test, avrebbero dovuto avere un punteggio di 80 o superiore.
Fondamentalmente, i robot IA stavano scrivendo in un linguaggio troppo complicato per la persona media che deve leggere velocemente, specialmente quando è spaventata e preoccupata per un'emergenza medica.
Il Verdetto: Non Lasciate che il Robot Guidi l'Auto
Lo studio ha scoperto che, sebbene questi modelli di IA siano bravi a sembrare intelligenti e a organizzare le informazioni, non sono pronti a sostituire un medico.
- Copilot e Perplexity sono stati gli studenti "migliori" perché hanno mostrato le loro fonti e avevano una struttura leggermente migliore, ma usavano ancora troppe parole difficili.
- ChatGPT e Gemini sono stati un po' peggio nel mostrare le fonti, anche se suonavano altrettanto fluidi.
- Fondamentalmente, lo studio ha rilevato che nessun modello combinava fatti affidabili, fonti chiare E un linguaggio semplice.
Gli autori concludono che questi strumenti di IA sono come un utile co-pilota, ma non dovrebbero mai essere loro a guidare l'auto. Possono aiutare a spiegare cos'è una malattia o quali domande porre al medico, ma non possono diagnosticarti, dirti se sei al sicuro o decidere il tuo trattamento. Se usi un'IA per informazioni sulla salute, devi ricordare che potrebbe essere sicura di sé ma errata, e che potrebbe essere troppo difficile da leggere. Il piano migliore è usare l'IA per avere un punto di partenza, ma poi far controllare il lavoro da un vero medico umano.
In breve: i bibliotecari IA sono educati e veloci, ma stanno ancora imparando a parlare il linguaggio "umano" e a dimostrare di non stare inventando le cose. Finché non miglioreranno, abbiamo bisogno di mantenere un essere umano nel processo.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.