Reliability, Faithfulness, and the Limits of Post-hoc Explanations of Opaque Scientific Models
L'articolo sostiene che, sebbene l'affidabilità e la fedeltà siano condizioni necessarie per interpretare i modelli di apprendimento automatico scientifico, esse non siano di per sé sufficienti a validare affermazioni riguardanti i veri meccanismi strutturali dei fenomeni sottostanti senza una corroborazione esterna.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Il quadro generale: Il detective della "Scatola Nera"
Immaginate che degli scienziati stiano cercando di comprendere un complesso fenomeno naturale (come il funzionamento di una malattia o il modo in cui una stella brucia). Costruiscono un modello informatico super intelligente (un'IA) per prevedere cosa accadrà. Il modello è incredibilmente accurato: ottiene la risposta corretta quasi ogni volta. Questa è l'Affidabilità (Reliability).
Ma il modello è una "scatola nera". Non sappiamo come abbia ottenuto quelle risposte. Così, gli scienziati usano strumenti speciali (come SHAP o LIME) per sbirciare all'interno e chiedere: "Quali indizi hai usato per prendere questa decisione?". Lo strumento fornisce una risposta, come ad esempio: "Il modello ha osservato l'età del paziente e il colore della sua pelle". Questa è la Fedeltà (Faithfulness).
L'argomento principale del documento:
Gli autori sostengono che anche se il modello è perfettamente affidabile (sempre corretto) e la spiegazione è perfettamente fedele (dice la verità su ciò che il modello ha fatto), non si può comunque concludere che il modello comprenda effettivamente come funziona il mondo reale.
Si può sapere cosa ha fatto la macchina, ma non si sa se l'ha fatto per i motivi giusti.
La catena in tre fasi
Il documento descrive una catena logica che gli scienziati spesso cercano di utilizzare, che appare così:
- Il Mondo Reale (Il Fenomeno): La cosa reale che stiamo studiando (ad esempio, una vera malattia).
- Il Modello: L'IA che predice la malattia.
- La Spiegazione: Lo strumento che ci dice cosa stava pensando l'IA.
L'errore: Gli scienziati spesso assumono che:
- "Il Modello corrisponde al Mondo Reale (Affidabilità)."
- "La Spiegazione corrisponde al Modello (Fedeltà)."
- Pertanto: "La Spiegazione corrisponde al Mondo Reale."
Il documento afferma: Questa logica è interrotta. Alla catena manca un collegamento cruciale.
Analogia 1: Lo studente che impara a memoria vs Il genio
Immaginate uno studente che sostiene un test di matematica.
- Affidabilità: Lo studente ottiene tutte le risposte corrette. È un perfetto predittore delle risposte esatte.
- Fedeltà: Un supervisore osserva lo studente e riferisce esattamente ciò che lo studente ha fatto. Il rapporto dice: "Lo studente ha risolto i problemi guardando l'ultima cifra del numero della domanda e indovinando la risposta basandosi su un modello nel libretto del test".
La trappola:
Se guardate solo l'Affidabilità (punteggio perfetto) e la Fedeltà (il rapporto onesto del supervisore), potreste pensare: "Wow, questo studente ha un metodo brillante per risolvere i problemi!".
Ma in realtà, lo studente sta solo barando usando un trucco che funziona solo su questo specifico test. Non ha imparato la matematica (la struttura del fenomeno); ha solo trovato una scorciatoia che funziona per caso in questo contesto.
Il documento sostiene che i modelli di IA spesso fanno questo. Trovano "scorciatoie" (come guardare lo sfondo di una foto invece della malattia) che le rende accurate, ma queste scorciatoie non rappresentano il modo in cui funziona realmente il mondo.
Analogia 2: I due orologi
Immaginate di avere due orologi.
- Orologio A è un orologio reale, di alta qualità, con ingranaggi che corrispondono al movimento del sole.
- Orologio B è un orologio rotto che capita di essere fermo esattamente sull'ora in cui si trova il sole, ma solo perché qualcuno lo ha impostato così.
Entrambi gli orologi mostrano l'ora corretta (Affidabilità).
Se scattate una foto all'interno di entrambi gli orologi, ottenete una descrizione fedele dei loro interni (Fedeltà).
- L'interno dell'Orologio A mostra ingranaggi che girano.
- L'interno dell'Orologio B mostra una lancetta ferma.
Se sapete solo che entrambi gli orologi segnano l'ora giusta e avete una descrizione fedele dei loro interni, non potete comunque sapere quale dei due stia effettivamente seguendo il sole correttamente. Uno dei due è solo fortunato.
Il documento afferma che l'Affidabilità e la Fedeltà sono come controllare se gli orologi segnano l'ora giusta e descrivere i loro interni. Nessuno di questi controlli vi dice se l'orologio è effettivamente collegato al sole (il meccanismo reale).
Lo scenario "Perfetto" non aiuta
Potreste pensare: "E se il modello fosse perfetto? E se non commettesse mai un errore?".
Il documento dice: Anche in quel caso, non importa.
Immaginate un modello che predice una malattia perfettamente il 100% delle volte.
- Scenario 1: Il modello ha appreso la reale causa biologica (la struttura "giusta").
- Scenario 2: Il modello ha appreso un pattern strano e invisibile nei dati (come l'ospedale in cui è stato trattato il paziente) che per caso correla con la malattia, ma non ne è la causa.
Entrambi i modelli sono affidabili al 100%.
Entrambi i modelli hanno spiegazioni fedeli al 100% (vi dicono esattamente cosa hanno osservato).
Ma nello Scenario 2, la spiegazione vi sta mentendo sulla causa della malattia, anche se sta dicendo la verità sul modello. Il modello è corretto riguardo al risultato, ma errato riguardo alla ragione.
La Conclusione: Cosa possiamo fare realmente?
Il documento conclude che non possiamo usare queste spiegazioni per fare affermazioni forti su come funziona realmente il mondo (i meccanismi) limitandoci a guardare il modello e la sua spiegazione.
- Ciò che la catena PUÒ fare: Può fornire idee o ipotesi. Può dire: "Ehi, il modello pensa che questa caratteristica sia importante. Forse dovremmo andare a investigare quella caratteristica nel mondo reale".
- Ciò che la catena NON PUÒ fare: Non può provare che quella caratteristica sia effettivamente la causa.
Per conoscere la verità, gli scienziati hanno bisogno di aiuto esterno. Devono portare altre conoscenze, condurre esperimenti nel mondo reale o utilizzare teorie esistenti per verificare se la "scorciatoia" del modello è in realtà un meccanismo reale. Il modello e la sua spiegazione da soli non sono sufficienti per colmare il divario tra "il computer ha ragione" e "comprendiamo l'universo".
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.