Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits
Dieses Paper stellt Baobab vor, ein neuro-symbolisches Lernframework, das vollständige OWL 2 DL-Ontologien in differenzierbare Sentential Decision Diagrams kompiliert, um Perzeptionsnetzwerke unter partieller Supervision zu trainieren, wodurch Reasoning-Shortcuts effektiv überwunden und eine Bayes-optimale Performance bei Nicht-Horn-Description-Logic-Aufgaben erreicht wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der weiten Landschaft der künstlichen Intelligenz konkurrieren seit langem zwei unterschiedliche Traditionen darum, Maschinen das Verständnis der Welt zu vermitteln. Eine Tradition, bekannt als Deep Learning, zeichnet sich dadurch aus, Muster in Rohdaten zu erkennen, wie etwa das Identifizieren einer Katze in einem Foto oder das Lesen einer handgeschriebenen Zahl. Sie lernt durch das Justieren von Millionen interner Regler, bis sie die richtige Antwort erhält, tut dies jedoch ohne ein klares Verständnis der Regeln, die die Welt regeln. Die andere Tradition, die in der Logik und Wissensrepräsentation verwurzelt ist, baut Systeme auf, die mit strengen Regeln schlussfolgern, vergleichbar mit einem digitalen Lexikon, das weiß, dass ein „Pudel“ eine Art von „Hund“ ist und dass „Hunde“ „Säugetiere“ sind. Dieses System ist präzise und zuverlässig, hat aber oft Schwierigkeiten, eine Verbindung zur chaotischen, unstrukturierten Realität von Bildern und Klängen herzustellen. Jahrelang haben Forscher versucht, diese beiden Ansätze zu verschmelzen, um „neuro-symbolische“ Systeme zu schaffen, die sowohl sehen als auch schlussfolgern können. Die Herausforderung bestand darin, dass die leistungsfähigsten logischen Sprachen, die komplexes Wissen beschreiben, unglaublich schwierig in die mathematische Sprache zu übersetzen sind, die neuronale Netze zum Lernen verwenden.
Ein Team von Forschern an der King Abdullah University of Science and Technology hat eine neue Methode namens Baobab entwickelt, die diese Lücke für einen spezifischen, hochkomplexen Typ von logischen Systemen erfolgreich schließt. Sie entwickelten einen Compiler, der eine detaillierte logische Beschreibung einer Welt – einschließlich Regeln darüber, wie Dinge miteinander in Beziehung stehen, wie viele Dinge existieren können und wie sich Kategorien überschneiden – in eine Struktur übersetzt, die ein neuronales Netz zum Lernen nutzen kann. Im Gegensatz zu früheren Versuchen, die die logischen Regeln entweder zu stark vereinfachten oder ganz aufgaben, bewahrt diese Methode die volle Komplexität der ursprünglichen Regeln. Die Forscher testeten ihr System, indem sie ein neuronales Netz baten, Bilder handgeschriebener Ziffern zu betrachten und nicht nur die Zahlen zu identifizieren, sondern auch verborgene logische Eigenschaften wie die Frage, ob eine Zahl prim oder gerade ist, basierend ausschließlich auf einem der Maschine bereitgestellten Satz logischer Regeln. Das System lernte, diese verborgenen Konzepte mit hoher Genauigkeit zu identifizieren, selbst wenn die Bilder selbst keine direkten Hinweise darauf gaben.
Der Kern dieser Leistung liegt darin, wie die Forscher den Übersetzungsprozess handhabten. Sie nahmen eine logische Wissensbasis, die im Wesentlichen eine Sammlung von Aussagen darüber ist, wie Konzepte zueinander in Beziehung stehen, und kompilierten sie in eine spezifische Art von Schaltkreisdiagramm. Dieses Diagramm fungiert als Filter, der überprüft, ob die Vorhersagen des neuronalen Netzes im Einklang mit den logischen Regeln stehen. Wenn das Netzwerk vorhersagt, dass eine Zahl sowohl gerade als auch prim ist (was nur für die Zahl zwei zutrifft), lässt das Schaltbild dies zu. Wenn es vorhersagt, dass eine Zahl sowohl gerade als als auch ungerade ist, weist das Schaltbild diese Möglichkeit ab. Durch das Durchlaufen dieser Prüfung Millionen Male kann das System das neuronale Netz dazu leiten, die korrekten logischen Beziehungen zu lernen, selbst wenn die Bilder, die es sieht, diese Beziehungen nicht explizit kennzeichnen. Die Forscher bewiesen, dass diese Übersetzung mathematisch fundiert ist, was bedeutet, dass das Schaltbild die ursprünglichen logischen Regeln exakt widerspiegelt, ohne Informationen zu verlieren oder Fehler einzuführen.
Eine der bedeutendsten Erkenntnisse der Studie betrifft ein häufiges Problem in diesen Hybridsystemen, das als „Schlussfolgerungs-Abkürzung“ (Reasoning Shortcut) bekannt ist. Wenn einer Maschine eine Aufgabe mit mehreren möglichen korrekten Antworten gegeben wird, findet sie oft einen Weg, das Problem zu lösen, indem sie einfach eine einzige Antwort wählt und die anderen ignoriert, wodurch sie das logische System effektiv umgeht. Wenn beispielsweise eine Regel mehrere verschiedene Konfigurationen einer Szene zulässt, könnte ein Standard-Neuronales-Netz auf eine einzige Konfiguration festlegen und daran scheitert, zu erkennen, dass andere gültige Konfigurationen existieren. Die Forscher entdeckten, dass ihre neue Methode, kombiniert mit einer spezifischen Technik, das Netzwerk mit allen möglichen gültigen Konfigurationen zu „impfen“, diesen Shortcut überwinden konnte. Anstatt auf eine einzige, potenziell falsche Antwort zu kollabieren, lernte das System, eine Wahrscheinlichkeitsverteilung über alle korrekten Möglichkeiten aufrechtzuerhalten, und erreichte damit ein Genauigkeitsniveau, das zuvor mit keiner anderen Methode für diese Art von komplexer Logik erreicht wurde.
Das Team demonstrierte die Leistungsfähigkeit seines Ansatzes anhand zweier unterschiedlicher Datensätze. In einem Experiment verwendeten sie Bilder handgeschriebener Ziffern aus dem MNIST-Datensatz. Sie gestalteten ein logisches System, in dem Ziffern in einer Kette verknüpft waren, sodass eine spezifische Beziehung gelten musste, wenn eine Zahl von einer anderen gefolgt wurde. Das neuronale Netz wurde mit Paaren von Bildern konfrontiert, aber nie mit den tatsächlichen Zahlen benannt. Stattdessen erhielt es einige wenige logische Hinweise, wie etwa die Information, dass eine Zahl gerade und die andere prim ist. Durch den logischen Schaltkreis lernte das Netzwerk, die exakte Identität der Ziffern mit nahezu perfekter Genauigkeit zu inferieren, wobei es von einer Zufallswahrscheinlichkeit von 25 Prozent auf 99 Prozent anstieg. In einem zweiten Experiment wandten sie dieselbe Methode auf einen Datensatz synthetischer Pizza-Bilder an. Das System lernte, verborgene Kategorien von Pizzen zu identifizieren, wie etwa „vegetarisch“ oder „scharf“, basierend auf den sichtbaren Belägen im Bild und den logischen Regeln, die diese Kategorien definieren, und übertraf dabei erneut Systeme, die keinen logischen Schaltkreis verwendeten.
Die Forscher zeigten auch, dass ihre Methode mit der vollständigen, komplexen Version der logischen Sprache funktioniert, die in biomedizinischen Datenbanken und dem Semantic Web verwendet wird, einschließlich Merkmalen wie Regeln darüber, wie viele Elemente miteinander verbunden sein können und Regeln über die Richtung von Beziehungen. Frühere Versuche, neuronale Netze mit diesem Grad an Komplexität zu verwenden, mussten die Regeln so stark vereinfachen, dass sie ihre Bedeutung verloren. Baobab hingegen bewältigte die volle Komplexität ohne Vereinfachung. Das Team verifizierte die Korrektheit ihres Compilers mithilfe eines formalen Beweissystems, einer rigorosen mathematischen Prüfung, die sicherstellt, dass die Übersetzung von der Logik zum Schaltkreis fehlerfrei ist. Sie verglichen ihr System auch mit bestehenden Methoden und stellten fest, dass ein erheblicher Teil der in ihren Experimenten verwendeten logischen Regeln von den älteren Methoden nicht verarbeitet werden konnte, da diese auf einfachere, weniger expressive Formen der Logik beschränkt waren.
Ein kritischer Teil der Studie bestand darin, das Problem der multiplen gültigen Antworten anzugehen. In vielen realen Szenarien reichen die Informationen nicht aus, um eine einzige eindeutige Lösung zu bestimmen. Wenn beispielsweise eine Regel besagt, dass eine Person entweder männlich oder weiblich ist, und wir wissen, dass sie mit jemandem des anderen Geschlechts verheiratet ist, gibt es dennoch zwei gültige Möglichkeiten für das Geschlecht des Paares. Standardmäßige neuronale Netze scheitern hier oft, indem sie willkürlich eine der Möglichkeiten wählen und diese als die einzige Wahrheit behandeln. Die Forscher fanden heraus, dass ihr System durch die Verwendung einer Mischung aus verschiedenen logischen Pfaden, die jeweils einer gültigen Möglichkeit entsprechen, alle korrekten Antworten gleichzeitig darstellen kann. Dies ermöglichte es dem System, eine kalibrierte Wahrscheinlichkeit für jedes Ergebnis zu liefern, was die wahre Unsicherheit in den Daten widerspiegelt, anstatt eine falsche Gewissheit zu erzwingen. Diese Fähigkeit ist für Anwendungen in Bereichen wie der Medizin essenziell, wo das Verständnis des Spektrums möglicher Diagnosen ebenso wichtig ist wie die Identifizierung einer einzelnen Diagnose.
Die Arbeit hob auch die praktischen Grenzen solcher Systeme hervor. Obwohl die Methode leistungsstark ist, wächst die Größe des logischen Schaltkreises rapide an, sobald die Komplexität des Problems steigt. In einem Test, der eine vollständige Ontologie von Pizza-Typen beinhaltete, stellten die Forscher fest, dass die Kompilierung des vollständigen Regelsatzes in einen Schaltkreis mehr Speicher erforderte, als auf einem Standardcomputer verfügbar war, was sie dazu zwang, einen vereinfachten Teilbereich der Regeln für das endgültige Training zu verwenden. Dies deutet darauf hin, dass die Methode zwar theoretisch fundiert und effektiv für viele Probleme ist, die Skalierung auf die größten und komplexesten Wissensbasen jedoch weitere ingenieurtechnische Fortschritte erfordern wird. Dennoch beweist die erfolgreiche Anwendung auf den vereinfachten Pizza-Datensatz und die Ziffernerkennung, dass der Ansatz für reale Daten lebensfähig und effektiv ist.
Die Auswirkungen dieser Forschung reichen über eine bessere Bilderkennung hinaus. Sie bietet einen Weg, wie künstliche Intelligenz die reichhaltigen, strukturierten Informationen aus wissenschaftlichen Datenbanken direkt in den Lernprozess neuronaler Netze integrieren kann. Dies bedeutet, dass zukünftige KI-Systeme aus Bildern lernen können, während sie gleichzeitig den strengen, verifizierten Regeln der Biologie, Chemie oder Physik folgen. Indem sichergestellt wird, dass die Vorhersagen der Maschine immer konsistent mit etabliertem wissenschaftlichem Wissen sind, könnte dieser Ansatz zu zuverlässigeren und vertrauenswürdigeren KI-Systemen führen, insbesondere in Hochrisikofeldern, in denen Fehler schwerwiegende Folgen haben können. Die Forscher haben ihren Code und ihre Werkzeuge der Öffentlichkeit zugänglich gemacht und laden andere dazu ein, auf diesem Fundament aufzubauen und zu erforschen, wie weit diese Integration von Logik und Lernen gehen kann.
Letztendlich zeigt die Studie, dass die Kluft zwischen Mustererkennung und logischem Schlussfolgern geschlossen werden kann, ohne die Stärken des jeweils anderen Ansatzes zu opfern. Durch die Übersetzung komplexer logischer Regeln in ein Format, das neuronale Netze verarbeiten können, haben die Forscher ein System geschaffen, das nicht nur von Daten lernt, sondern von der Struktur des Wissens selbst. Die Fähigkeit, verborgene Konzepte zu rekonstruieren, Schlussfolgerungs-Shortcuts zu vermeiden und die volle Komplexität moderner logischer Sprachen zu handhaben, markiert einen bedeutenden Schritt nach vorn bei dem Bestreben, Maschinen zu bauen, die die Welt, die sie beobachten, wirklich verstehen. Die Ergebnisse legen nahe, dass die künstliche Intelligenz mit den richtigen Werkzeugen über das bloße Erkennen von Mustern hinausgehen kann und tatsächlich über die Beziehungen und Regeln schlussfolgern kann, die sie regieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.