Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits
Dit artikel introduceert Baobab, een neuro-symbolisch leersframework dat volledige OWL 2 DL-ontologieën compileert naar differentieerbare Sentential Decision Diagrams om perceptienetwerken onder partiële supervisie te trainen, waardoor reasoning-shortcuts effectief worden overwonnen en Bayes-optimale prestaties worden bereikt in niet-Horn beschrijvingslogica-taken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het uitgestrekte landschap van kunstmatige intelligentie hebben twee verschillende tradities lang met elkaar gestreden om machines de wereld te laten begrijpen. De ene traditie, bekend als deep learning, blinkt uit in het herkennen van patronen in ruwe gegevens, zoals het identificeren van een kat in een foto of het lezen van een handgeschreven cijfer. Het leert door miljoenen interne knoppen aan te passen totdat het het juiste antwoord krijgt, maar doet dit zonder een duidelijk begrip van de regels die de wereld beheersen. De andere traditie, geworteld in logica en kennisrepresentatie, bouwt systemen die redeneren met strikte regels, zoals een digitale encyclopedie die weet dat een "poedel" een type "hond" is en dat "honden" "zoogdieren" zijn. Dit systeem is precies en betrouwbaar, maar heeft vaak moeite om verbinding te maken met de rommelige, ongestructureerde realiteit van beelden en geluiden. Jarenlang hebben onderzoekers geprobeerd deze twee benaderingen te versmelten, om "neuro-symbolische" systemen te creëren die zowel kunnen zien als redeneren. De uitdaging was dat de krachtigste logische talen die worden gebruikt om complexe kennis te beschrijven, ongelooflijk moeilijk te vertalen zijn naar de wiskundige taal die neurale netwerken gebruiken om te leren.
Een team onderzoekers aan de King Abdullah University of Science and Technology heeft een nieuwe methode ontwikkeld genaamd Baobab, die erin slaagt deze kloof te overbruggen voor een specifieke, zeer complexe vorm van een logisch systeem. Ze creëerden een compiler die een gedetailleerde logische beschrijving van een wereld — compleet met regels over hoe dingen met elkaar verband houden, hoeveel dingen er kunnen bestaan en hoe categorieën overlappen — neemt en deze vertaalt naar een structuur die een neuraal netwerk kan gebruiken om te leren. In tegenstelling tot eerdere pogingen die ofwel de logische regels te veel vereenvoudigden of ze volledig loslieten, behoudt deze methode de volledige complexiteit van de oorspronkelijke regels. De onderzoekers testten hun systeem door een neuraal netwerk te vragen naar afbeeldingen van handgeschreven cijfers te kijken en niet alleen de getallen te ontdekken, maar ook verborgen logische eigenschappen zoals of een getal priem of even is, uitsluitend op basis van een reeks logische regels die aan de machine zijn verstrekt. Het systeem leerde deze verborgen concepten met een hoge nauwkeurigheid te identificeren, zelfs wanneer de afbeeldingen zelf geen directe aanwijzingen over hen boden.
De kern van deze prestatie ligt in de manier waarop de onderzoekers het vertalingsproces hebben afgehandeld. Ze namen een logische kennisbasis, wat in essentie een verzameling beweringen is over hoe concepten met elkaar verband houden, en compileerden deze tot een specifiek type schakeling. Dit diagram fungeert als een filter dat controleert of de voorspellingen van het neurale netwerk logisch kloppen volgens de regels. Als het netwerk voorspelt dat een getal zowel even als priem is (wat alleen waar is voor het getal twee), staat de schakeling dit toe. Als het voorspelt dat een getal zowel even als oneven is, wijst de schakeling deze mogelijkheid af. Door deze controle miljoenen keren uit te voeren, kan het systeem het neurale netwerk begeleiden om de juiste logische relaties te leren, zelfs wanneer de afbeeldingen die het ziet de relaties niet expliciet labelen. De onderzoekers bewezen dat deze vertaling wiskundig sluitend is, wat betekent dat de schakeling de oorspronkelijke logische regels nauwkeurig reflecteert zonder informatie te verliezen of fouten te introduceren.
Een van de meest significante bevindingen van de studie betreft een veelvoorkomend probleem in deze hybride systemen, bekend als een "redeneer-afkorting" (reasoning shortcut). Wanneer een machine een taak krijgt met meerdere mogelijke juiste antwoorden, vindt hij vaak een manier om het probleem op te lossen door slechts één antwoord te kiezen en de anderen te negeren, waardoor het logische systeem effectief omzeilt. Bijvoorbeeld, als een regel verschillende configuraties van een scène toestaat, kan een standaard neuraal netwerk zich vastzetten op één enkele configuratie en niet herkennen dat andere geldige configuraties ook bestaan. De onderzoekers ontdekten dat hun nieuwe methode, wanneer gecombineerd met een specifieke techniek om het netwerk te voorzien van alle mogelijke geldige configuraties, deze afkorting kan overwinnen. In plaats van in te storten op een enkele, potentieel foutieve reactie, leerde het systeem een waarschijnlijkheidsverdeling over alle correcte mogelijkheden te behouden, waarmee het een nauwkeurigheid bereikte die geen enkele eerdere methode voor dit type complexe logica had bereikt.
Het team demonstreerde de kracht van hun aanpak met behulp van twee verschillende datasets. In één experiment gebruikten ze afbeeldingen van handgeschreven cijfers uit de MNIST-dataset. Ze stelden een logisch systeem op waarbij cijfers aan elkaar gekoppeld waren in een keten, zodanig dat als één getal wordt gevolgd door een ander, een specifieke relatie moet gelden. Het neurale netwerk kreeg paren afbeeldingen te zien, maar kreeg nooit de werkelijke getallen te weten. In plaats daarvan kreeg het een paar logische aanwijzingen, zoals weten dat één getal even is en de andere priem. Door de logische schakeling leerde het netwerk de exacte identiteit van de cijfers te achterhalen met bijna perfecte nauwkeurigheid, waarbij het steeg van een willekeurige gokratio van 25 procent naar 99 procent. In een tweede experiment pasten ze dezelfde methode toe op een dataset van synthetische pizza-afbeeldingen. Het systeem leerde verborgen categorieën van pizza's te identificeren, zoals "vegetarisch" of "pittig", op basis van de zichtbare toppings in de afbeelding en de logische regels die deze categorieën definiëren, waarbij het wederom de systemen overtrof die geen gebruik maakten van de logische schakeling.
De onderzoekers toonden ook aan dat hun methode werkt met de volledige, complexe versie van de logische taal die wordt gebruikt in biomedische databases en het Semantic Web, inclusclusief kenmerken zoals regels over hoeveel items aan elkaar verbonden kunnen zijn en regels over de richting van relaties. Eerdere pogingen om neurale netwerken met dit niveau van complexiteit te gebruiken, moesten de regels zo sterk vereenvoudigen dat ze hun betekenis verloren. Baobab hanteerde echter de volledige complexiteit zonder vereenvoudiging. Het team verifieerde de juistheid van hun compiler met behulp van een formeel bewijs systeem, een rigoureuze wiskundige controle die garandeert dat de vertaling van logica naar schakeling foutloos is. Ze vergeleken hun systeem ook met bestaande methoden en ontdekten dat een aanzienlijk deel van de logische regels die in hun experimenten werden gebruikt, niet door die oudere methoden kon worden afgehandeld, die beperkt waren tot eenvoudigere, minder expressieve vormen van logica.
Een cruciaal onderdeel van de studie betrof het aanpakken van het probleem van meerdere geldige antwoorden. In veel realistische scenario's is de informatie niet voldoende om een unieke oplossing te bepalen. Bijvoorbeeld, als een regel stelt dat een persoon ofwel man of vrouw is, en we weten dat diegene getrouwd is met iemand van het andere geslacht, zijn er nog steeds twee geldige mogelijkheden voor de geslachten van het paar. Standaard neurale netwerken falen hier vaak door willevend een van de mogelijkheden te kiezen en die als de enige waarheid te behandelen. De onderzoekers ontdekten dat door gebruik te maken van een mengeling van verschillende logische paden, elk overeenkomend met een geldige mogelijkheid, hun systeem alle correcte antwoorden tegelijkertijd kon vertegenwoordigen. Dit stelde het systeem in staat om een gekalibreerde waarschijnlijkheid voor elke uitkomst te bieden, wat de werkelijke onzekerheid in de data reflecteert in plaats van een valse zekerheid af te dwingen. Deze capaciteit is essentieel voor toepassingen in velden zoals de geneeskunde, waar het begrijpen van het bereik van mogelijke diagnoses even belangrijk is als het identificeren van een enkele diagnose.
Het werk benadrukte ook de praktische grenzen van dergelijke systemen. Hoewel de methode krachtig is, groeit de omvang van de logische schakeling snel naarmate de complexiteit van het probleem toeneemt. In een test waarbij een volledige ontologie van pizzatypen werd gebruikt, ontdekten de onderzoekers dat het compileren van de volledige set regels naar een schakeling meer geheugen vereiste dan beschikbaar was op een standaardcomputer, waardoor ze gedwongen waren een vereenvoudigde subset van de regels te gebruiken voor de uiteindelijke training. Dit suggereert dat hoewel de methode theoretisch sluitend en effectief is voor veel problemen, het opschalen naar de grootste, meest complexe kennisbases verdere technische vooruitgang zal vereisen. Desalniettemin bewijst de succesvolle toepassing van de vereenvoudigde pizza-dataset en de taak van cijferherkenning dat de aanpak levensvatbaar en effectief is voor real-world data.
De implicaties van dit onderzoek reiken verder dan alleen betere beeldherkenning. Het biedt een pad voor kunstmatige intelligentie om de rijke, gestructureerde kennis uit wetenschappelijke databases direct te integreren in het leerproces van neurale netwerken. Dit betekent dat toekomstige AI-systemen kunnen leren van afbeeldingen terwijl ze tegelijkertijd voldoen aan de strikte, geverifieerde regels van biologie, chemie of natuurkunde. Door ervoor te zorgen dat de voorspellingen van de machine altijd consistent zijn met de gevestigde wetenschappelijke kennis, kan deze aanpak leiden tot meer betrouwbare en vertrouwenswaardige AI, vooral in hoog-risico gebieden waar fouten ernstige gevolgen kunnen hebben. De onderzoekers hebben hun code en tools publiekelijk beschikbaar gesteld, in een uitnodiging aan anderen om voort te bouwen op deze fundering en te onderzoeken hoe ver deze integratie van logica en leren kan gaan.
Uiteindelijk toont de studie aan dat de kloof tussen patroonherkenning en logisch redeneren kan worden gedicht zonder de sterke punten van beide benaderingen op te offeren. Door complexe logische regels te vertalen naar een formaat dat neurale netwerken kunnen verwerken, hebben de onderzoekers een systeem gecreëerd dat niet alleen leert van data, maar van de structuur van kennis zelf. Het vermogen om verborgen concepten te herstellen, redeneer-afkortingen te vermijden en de volledige complexiteit van moderne logische talen te hanteren, markeert een belangrijke stap voorwaarts in de zoektocht naar machines die de wereld die zij observeren werkelijk begrijpen. De resultaten suggereren dat kunstmatige intelligentie, met de juiste instrumenten, verder kan gaan dan het simpelweg herkennen van patronen naar het werkelijk redeneren over de relaties en regels die ze beheersen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.