Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits
Questo articolo introduce Baobab, un framework di apprendimento neuro-simbolico che compila ontologie complete OWL 2 DL in diagrammi decisionali sentenziali differenziabili per addestrare reti di percezione sotto supervisione parziale, superando efficacemente le scorciatoie di ragionamento e raggiungendo prestazioni Bayes-ottimali in compiti di logica descrittiva non-Horn.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Nel vasto panorama dell'intelligenza artificiale, due tradizioni distinte competono da tempo per far sì che le macchine comprendano il mondo. Una tradizione, nota come deep learning, eccelle nel riconoscere modelli nei dati grezzi, come identificare un gatto in una fotografia o leggere un numero scritto a mano. Impara regolando milioni di manopole interne finché non ottiene la risposta corretta, ma lo fa senza una chiara comprensione delle regole che governano il mondo. L'altra tradizione, radicata nella logica e nella rappresentazione della conoscenza, costruisce sistemi che ragionano con regole rigide, come un'enciclopedia digitale che sa che un "barboncino" è un tipo di "cane" e che i "cani" sono "mammiferi". Questo sistema è preciso e affidabile, ma spesso fatica a connettersi con la realtà disordinata e non strutturata di immagini e suoni. Per anni, i ricercatori hanno cercato di fondere questi due approcci, creando sistemi "neuro-simbolici" capaci sia di vedere che di ragionare. La sfida è stata che i linguaggi logici più potenti utilizzati per descrivere la conoscenza complessa sono incredibilmente difficili da tradurre nel linguaggio matematico che le reti neurali usano per apprendere.
Un team di ricercatori della King Abdullah University of Science and Technology ha sviluppato un nuovo metodo chiamato Baobab che colma con successo questo divario per un tipo specifico e altamente complesso di sistema logico. Hanno creato un compilatore che prende una descrizione logica dettagliata di un mondo — completa di regole su come le cose si relazionano, quante cose possono esistere e come le categorie si sovrappongono — e la traduce in una struttura che una rete neurale può usare per apprendere. A differenza dei tentativi precedenti che semplificavano troppo le regole logiche o le abbandonavano del tutto, questo metodo preserva l'intera complessità delle regole originali. I ricercatori hanno testato il loro sistema chiedendo a una rete neurale di guardare immagini di cifre scritte a mano e di capire non solo i numeri, ma anche proprietà logiche nascoste, come se un numero sia primo o pari, basandosi esclusivamente su un insieme di regole logiche fornite alla macchina. Il sistema ha imparato a identificare questi concetti nascosti con un'elevata precisionità, anche quando le immagini stesse non fornivano indizi diretti su di essi.
Il nucleo di questo traguardo risiede nel modo in cui i ricercatori hanno gestito il processo di traduzione. Hanno preso una base di conoscenza logica, che è essenzialmente una collezione di affermazioni su come i concetti si relazionano tra loro, e l'hanno compilata in un tipo specifico di diagramma di circuito. Questo diagramma funge da filtro, controllando se le previsioni fatte dalla rete neurale abbiano senso secondo le regole logiche. Se la rete prevede che un numero sia sia pari che primo (il che è vero solo per il numero due), il circuito lo permette. Se prevede che un numero sia sia pari che dispari, il circuito rifiuta tale possibilità. Eseguendo questo controllo milioni di volte, il sistema può guidare la rete neurale nell'apprendere le corrette relazioni logiche, anche quando le immagini che vede non etichettano esplicitamente tali relazioni. I ricercatori hanno dimostrato che questa traduzione è matematicamente solida, il che significa che il circuito riflette accuratamente le regole logiche originali senza perdere alcuna informazione o introdurre errori.
Uno dei risultati più significativi dello studio riguarda un problema comune in questi sistemi ibridi noto come "scorciatoia di ragionamento" (reasoning shortcut). Quando a una macchina viene assegnato un compito con molteplici risposte corrette possibili, spesso trova un modo per risolvere il problema scegliendo una sola risposta e ignorando le altre, bypassando efficacemente il sistema logico. Ad esempio, se una regola consente diverse configurazioni di una scena, una rete neurale standard potrebbe bloccarsi su una singola configurazione e non riconoscere che esistono altre configurazioni valide. I ricercatori hanno scoperto che il loro nuovo metodo, combinato con una tecnica specifica di semina della rete con tutte le possibili configurazioni valide, può superare questa scorciatoia. Inveve di collassare su una singola risposta potenzialmente errata, il sistema ha imparato a mantenere una distribuzione di probabilità su tutte le possibilità corrette, raggiungendo un livello di accuratezza che nessun metodo precedente aveva raggiunto per questo tipo di logica complessa.
Il team ha dimostrato la potenza del loro approccio utilizzando due dataset distinti. In un esperimento, hanno utilizzato immagini di cifre scritte a mano dal dataset MNIST. Hanno impostato un sistema logico in cui le cifre erano collegate in una catena, tale per cui se un numero era seguito da un altro, doveva sussistere una specifica relazione. Alla rete neurale venivano mostrate coppie di immagini, ma non veniva mai detto loro quali fossero i numeri effettivi. Invece, ricevevano alcuni indizi logici, come sapere che un numero era pari e l'altro era primo. Attraverso il circuito logico, la rete ha imparato a inferire l'identità esatta delle cifre con un'accuratezza quasi perfetta, passando da un tasso di indovinare casuale del 25 percento al 99 percento. In un secondo esperimento, hanno applicato lo stesso metodo a un dataset di immagini sintetiche di pizze. Il sistema ha imparato a identificare categorie nascoste di pizze, come "vegetariana" o "piccante", basandosi sui condimenti visibili nell'immagine e sulle regole logiche che definiscono tali categorie, superando nuovamente i sistemi che non utilizzavano il circuito logico.
I ricercatori hanno anche dimostrato che il loro metodo funziona con la versione completa e complessa del linguaggio logico utilizzato nei database biomedici e nel Semantic Web, che include caratteristiche come regole su quanti elementi possono essere connessi e regole sulla direzione delle relazioni. I tentativi precedenti di utilizzare reti neurali con questo livello di complessità dovevano semplificare così tanto le regole da farle perdere il loro significato. Baobab, tuttavia, ha gestito l'intera complessità senza semplificazioni. Il team ha verificato la correttezza del proprio compilatore utilizzando un sistema di prova formale, un controllo matematico rigoroso che assicura che la traduzione dalla logica al circuito sia impeccabile. Hanno anche confrontato il loro sistema con i metodi esistenti e hanno scoperto che una parte significativa delle regole logiche utilizzate nei loro esperimenti non poteva essere gestita dai vecchi metodi, che erano limitati a forme di logica più semplici e meno espressive.
Una parte critica dello studio ha riguardato l'affrontare il problema delle molteplici risposte valide. In molti scenari reali, l'informazione fornita non è sufficiente a determinare un'unica soluzione univoca. Ad esempio, se una regola afferma che una persona è o maschio o femmina, e sappiamo che è sposata con qualcuno del sesso opposto, ci sono comunque due possibilità valide per il genere della coppia. Le reti neurali standard spesso falliscono qui, scegliendo arbitrariamente una delle possibilità e trattandola come l'unica verità. I ricercatori hanno scoperto che, utilizzando un mix di diversi percorsi logici, ciascuno corrispondente a una possibilità valida, il loro sistema può rappresentare tutte le risposte corrette simultaneamente. Ciò ha permesso al sistema di fornire una probabilità calibrata per ogni esito, riflettendo la vera incertezza dei dati invece di forzare una falsa certezza. Questa capacità è essenziale per applicazioni in campi come la medicina, dove comprendere l'intervallo di possibili diagnosi è importante quanto identificare una singola diagnosi.
Il lavoro ha anche evidenziato i limiti pratici di tali sistemi. Sebbene il metodo sia potente, la dimensione del circuito logico cresce rapidamente all'aumentare della complessità del problema. In un test che coinvolgeva un'ontologia completa di tipi di pizza, i ricercatori hanno scoperto che compilare l'intero set di regole in un circuito richiedeva più memoria di quella disponibile su un computer standard, costringendoli a utilizzare un sottoinsieme semplificato delle regole per l'addestramento finale. Ciò suggerisce che, sebbene il metodo sia teoricamente solido ed efficace per molti problemi, scalare verso le basi di conoscenza più grandi e complesse richiederà ulteriori progressi ingegneristici. Tuttavia, la riuscita applicazione al dataset semplificato della pizza e al compito di riconoscimento delle cifre dimostra che l'approccio è vitale ed efficace per dati reali.
Le implicazioni di questa ricerca vanno oltre il semplice miglioramento del riconoscimento delle immagini. Offre una via affinché l'intelligenza artificiale possa integrare la ricca conoscenza strutturata presente nei database scientifici direttamente nel processo di apprendimento. Ciò significa che i futi sistemi di IA potrebbero apprendere dalle immagini pur aderendo contemportaneamente alle regole rigorose e verificate della biologia, della chimica o della fisica. Garantendo che le previsioni della macchina siano sempre coerenti con la conoscenza scientifica stabilita, questo approccio potrebbe portare a un'IA più affidabile e degna di fiducia, particolarmente in settori ad alto rischio dove gli errori possono avere gravi conseguenze. I ricercatori hanno reso il loro codice e i loro strumenti disponibili al pubblico, invitando altri a costruire su questa base ed esplorare fin dove può spingersi questa integrazione tra logica e apprendimento.
In definitiva, lo studio dimostra che il divario tra riconoscimento di pattern e ragionamento logico può essere colmato senza sacrificare i punti di forza di nessuno dei due approcci. Traducendo le complesse regole logiche in un formato che le reti neurali possano elaborare, i ricercatori hanno creato un sistema che impara non solo dai dati, ma dalla struttura stessa della conoscenza. La capacità di recuperare concetti nascosti, evitare scorciatoie di ragionamento e gestire l'intera complessità dei moderni linguaggi logici segna un passo avanti significativo nella ricerca di macchine che comprendano veramente il mondo che osservano. I risultati suggeriscono che, con gli strumenti giusti, l'intelligenza artificiale può andare oltre il semplice riconoscimento di pattern per ragionare realmente sulle relazioni e le regole che li governano.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.