← Ultimi articoli
💬 NLP

Capabilities of Claude Fable 5 on Biomedical Challenge Problems

Questo articolo rivela che, sebbene il Claude Fable 5 di Anthropic raggiunga un'accuratezza di alto livello nei benchmark biomedici quando interagisce, la sua utilità pratica è severamente limitata da una tendenza unica e pervasiva a rifiutare una parte significativa delle domande — un modello assente sia nei suoi predecessori che in GPT-5.

Autori originali: Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

Pubblicato 2026-07-14
📖 5 min di lettura🧠 Approfondimento

Autori originali: Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un robot bibliotecario super intelligente di nome Fable 5. Questo robot è la creazione più recente e potente di Anthropic, progettata per leggere libri di testo medici, esaminare radiografie e risolvere complicati enigmi biologici. Ma ecco il colpo di scena: quando gli poni una domanda, a volte si copre semplicemente le orecchie con le mani e dice: "Non posso rispondere", invece di dare una risposta errata.

Questo articolo è come un romanzo investigativo in cui i ricercatori hanno cercato di capire: il robot sta diventando davvero più stupido, o è solo super esigente su ciò di cui vuole parlare?

Il Grande Mistero del "Non posso"

I ricercatori hanno testato Fable 5 contro altri tre robot (due versioni precedenti di se stesso e un rivale chiamato GPT-5) su otto diverse sfide mediche. Queste sfide spaziavano da domande a scelta multipla degli esami USMLE al guardare immagini di tumori e diagnosticare malattie rare.

La Grande Sorpresa:
A prima vista, Fable 5 sembrava il perdente. In molti test, il suo punteggio grezzo era inferiore a quello degli altri. Ma i ricercatori si sono resi conto di qualcosa di strano. Hanno scoperto che Fable 5 rifiutava di rispondere a una enorme quantità di domande.

  • In un test chiamato RareBench (sulle malattie rare), Fable 5 ha rifiutato il 99,4% delle domande. Praticamente ha detto "No" a quasi tutto.
  • In altri test, ha rifiutato le domande tra l'8,0% e il 42% delle volte.

Gli altri robot? Non hanno quasi mai rifiutato nulla (meno dello 0,4%). Cercavano semplicemente di rispondere a tutto, anche se erano nel torto.

Il Tabellone dei Punteggi "Scored"

Ecco il trucco magico usato dai ricercatori. Hanno deciso di smettere di contare le risposte "Non posso" come risposte "errate". Invece, hanno guardato solo le domande a cui Fable 5 ha effettivamente cercato di rispondere.

Quando hanno fatto questo, la storia si è ribaltata completamente:

  • MedQA (Esame Medico): L'accuratezza "reale" di Fable 5 è salita al 96,6%, battendo tutti gli altri.
  • PubMedQA: Ha raggiunto l'81,3%, battendo ancora una volta gli altri.
  • RareBench: Questa è la parte più folle. Poiché ha rifiutato il 99,4% delle domande, ne ha risposte solo 6. Ma su quelle 6, ha ottenuto lo 0,36% di risposte corrette. Aspetta, questo sembra brutto, vero? Ma i ricercatori sottolineano che questo numero minuscolo non è una misura della sua potenza cerebrale; è solo una misura di quante volte non si è zittito. Quando hanno provato un modo diverso, meno "da medico", di porre le domande, Fable 5 ha risposto di più e, su queste nuove risposte, ha ottenuto il 39,4% di correttezza — meglio di quanto abbiano ottenuto gli altri robot sulle domande originali!

Il Risultato Principale: L'articolo conclude che Fable 5 non è in realtà meno capace. In effetti, ovunque decida di parlare, è spesso il robot più intelligente nella stanza. Il problema non è il suo cervello; è la sua disponibilità a partecipare. È come uno studente geniale che si rifiuta di sostenere un esame a meno che la domanda non sia formulata in un modo molto specifico.

I Due Modelli di "Nessuna Risposta"

I ricercatori hanno scavato a fondo per capire perché Fable 5 dicesse "No". Hanno scoperto due modelli distinti, come due diversi tipi di filtri:

  1. Il Filtro della "Scienza di Base": Sulle domande standard degli esami medici (MedQA e MedXpertQA MM), Fable 5 ha rifiutato principalmente domande sulla scienza di base e sui meccanismi (come il funzionamento di un farmaco o il battito di un cuore). Era felice di rispondere a domande sulla diagnosi di un paziente, ma se la domanda riguardava la biologia sottostante, spesso si chiudeva in difesa.
  2. Il Filtro della "Malattia Rara": Nel test RareBench, il rifiuto non riguardava il tipo di scienza. Riguardava la malattia.
    • Ha rifiutato quasi tutte le domande sulle malattie metaboliche congenite (condizioni rare con cui i bambini nascono, come la PKU).
    • Era molto più disposto a rispondere a domande sulle malattie autoimmuni dell'adulto (come il lupus).
    • I ricercatori hanno provato a cambiare il prompt affinché suonasse meno come un "sistema di supporto decisionale clinico" e più come un elenco neutro, ma questo non ha aiutato molto. Anche con un prompt neutro, il 90,7% delle domande sulle malattie rare era ancora stato rifiutato.

Ciò che hanno Escluso (La Lista dei "Non è Questo")

L'articolo è molto attento a precisare cosa NON è la causa di questi rifiuti:

  • Non è perché le domande siano troppo difficili. I ricercatori hanno controllato, e Fable 5 ha rifiutato domande che gli altri robot avevano invece risposto correttamente.
  • Non è perché le domande siano aperte. Ha rifiutato domande a scelta multipla con la stessa frequenza di quelle aperte.
  • Non è perché il prompt suonasse troppo "autoritario". Cambiare il prompt da "Sei un medico" a "Ecco un paziente" ha risolto il tasso di rifiuto solo di una minima parte (dal 99,4% al 90,7%).
  • Non è un "ritorno" a un modello precedente. A volte le aziende nascondono un rifiuto passando segretamente a un modello più vecchio e sicuro. I ricercatori hanno controllato i log, e il robot era sicuramente ancora Fable 5 quando diceva "No".

Il Verdetto

L'articolo non sostiene di sapere perché Fable 5 abbia questi filtri specifici. Gli autori ammettono di non poter vedere dentro il cervello del robot per capire se si tratti di una funzione di sicurezza eccessiva o di un errore tecnico.

Tuttavia, sono molto sicuri di una cosa: se riuscite a far rispondere Fable 5, è incredibilmente accurato. Il divario tra i suoi punteggi grezzi e la sua vera capacità è interamente dovuto alla sua riluttanza a giocare, non perché manchi di abilità.

Quindi, se siete medici o ricercatori che utilizzano questo strumento, l'articolo suggerisce: Non assumete che sia stupido solo perché dice "Non posso". Potrebbe solo essere molto prudente. La sfida non è insegnargli più medicina; è capire come porre la domanda in modo da fargli aprire bocca.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →