Syntactic Simplification of OWL Class Expressions
Dit artikel introduceert CES, een nieuw algoritme geïmplementeerd in het OWLAPY-framework dat complexe OWL-klasse-expressies syntactisch vereenvoudigt door herschrijfregels toe te passen om de verbositeit te verminderen en de efficiëntie van redeneren te verbeteren, terwijl de formele semantiek behouden blijft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het uitgestrekte, onderling verbonden web van digitale kennis vertrouwen computers op gestructureerde kaarten die ontologieën worden genoemd om de wereld te begrijpen. Deze kaarten worden niet getekend met inkt en papier, maar zijn opgebouwd uit logische beweringen die definiëren wat dingen zijn en hoe ze met elkaar samenhangen. Stel je een bibliothecaris voor die miljoenen boeken moet sorteren, niet alleen op titel, maar volgens een complex pakket regels dat hun inhoud, auteur en geschiedenis beschrijft. Om dit te doen, gebruikt de bibliothecaris een precieze taal waarin elk concept wordt gedefinieerd door ideeën te combineren met logische verbindingsstukken, vergelijkbaar met het bouwen van een zin uit woorden. Wanneer deze definities echter te lang of te verstrengeld raken, heeft de bibliothecaris moeite om ze te lezen, en doet de computer er veel te lang over om de instructies te verwerken. Dit is de centrale uitdaging waar onderzoekers voor staan bij het werken met de Web Ontology Language, een standaardinstrument voor het organiseren van informatie op het internet. Hoewel de taal krachtig genoeg is om ingewikkelde details van biologie, techniek en geschiedenis te beschrijven, zorgt de complexiteit die de taal juist nuttig maakt er vaak voor dat definities onnodig woordrijk en moeilijk interpreteerbaar zijn voor mensen.
Een team van computerwetenschappers aan de Universiteit van Paderborn in Duitsland heeft een nieuwe methode ontwikkeld om deze complexe definities te ontwarren zonder de betekenis te veranderen. Ze creëerden een hulpmiddel genaamd de Class Expression Simplifier, of CES, die fungeert als een bekwame redacteur voor deze logische beweringen. De onderzoekers vertrokken vanuit de observatie dat wanneer computers nieuwe concepten leren uit data, ze vaak definities produceren die opgezwollen zijn met redundante onderdelen. Deze definities zeggen misschien twee keer hetzelfde, of bevatten onnodige voorwaarden die de uiteindelijke betekenis niet veranderen, maar de stelling wel veel langer maken. Het doel van het team was om deze overtollige rommel weg te strippen. Ze ontwierpen een algoritme dat systematisch deze logische definities scant, op zoek naar patronen waarbij onderdelen kunnen worden verwijderd of gecombineerd. Als een definitie bijvoorbeeld een voorwaarde bevat die al door een ander deel van de stelling wordt gedekt, verwijdert het hulpmiddel de duplicaten. Als een definitie een tegenstrijdigheid bevat die het onmogelijk maakt voor iets om erin te passen, herkent het hulpmiddel dit en vereenvoudigt het naar een basisconcept van "niets".
Het proces werkt door een reeks strikte regels toe te passen die ervoor zorgen dat de vereenvoudigde versie exact hetzelfde is als de originele in termen van wat het beschrijft, ook al ziet het er op papier anders uit. De onderzoekers testten hun hulpmiddel op twee specifieke datasets: één gerelateerd aan de studie van hoe stoffen kanker veroorzaken en een andere gericht op hoe chemicaliën het DNA beïnvloeden. Ze genereerden tweehonderd complexe definities met behulp van een leersysteem dat bekend staat om het produceren van zeer lange en ingewikkelde resultaten. Toen ze deze definities door hun nieuwe vereenvoudiger haalden, waren de resultaten opmerkelijk. In veel gevallen verminderde het hulpmiddel de lengte van de definities met wel tachtigzes procent. Dit was niet slechts een cosmetische verandering; de kortere definities stelden computers in staat om aanzienlijk sneller bijpassende informatie te vinden. In sommige tests daalde de tijd die een computer nodig had om relevante gegevens op te halen met negentig procent. Het hulpmiddel zelf was ook efficiënt en had gemiddeld minder dan een seconde nodig om zelfs de meest complexe definities te verwerken, waarbij de langste slechts ongeveer één en een derde seconde nodig had om op te schonen.
De onderzoekers benadrukken dat hun aanpak puur gaat over de structuur van de taal, en niet over de onderliggende betekenis. Om de juistheid van de nieuwe definities te verifiëren, evalueerden zij de correctheid empirisch door een 'reasoner' te gebruiken om de verzamelingen instanties die werden opgehaald voor de originele en de vereenvoudigde expressies te vergelijken, waarmee de equivalentie werd bevestigd. Dit betekent dat het hulpmiddel veilig kan worden gebruikt in elke situatie waarin deze logische definities worden gecreëerd, waarbij het fungeert als een laatste stap om de output te polijsten voordat deze aan een mens wordt gepresenteerd of in een groter systeem wordt gebruikt. Hoewel het hulpmiddel zeer effectief is voor de typen definities waarop het is getest, merken de auteurs op dat het het beste werkt op de soort verbale definities die door bepaalde leersystemen worden geproduceerd. Ze erkennen dat de volgorde waarin de regels worden toegepast soms het uiteindelijke resultaat kan veranderen, en zij suggereren dat toekomstige versies verschillende manieren kunnen verkennen om deze regels te prioriteren om nog betere resultaten te behalen. Voor nu demonstreert het werk dat door zorgvuldig onnodige woorden uit de taal van de logica te verwijderen, we de systemen die onze digitale kennis aandrijven leesbaarder kunnen maken voor mensen en efficiënter voor machines.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.