Automated Big Data Quality Assessment using Knowledge Graph Embeddings
Dit artikel stelt een nieuw geautomatiseerd kader voor de kwaliteitsbeoordeling van big data voor dat gebruikmaakt van kennisgrafiek-embeddings om contextbewuste kwaliteitsregels en -dimensies te voorspellen, waardoor gewogen, op maat gemaakte beoordelingsplannen worden gegenereerd die de beperkingen van traditionele strikte matching-methoden overwinnen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek met boeken hebt, maar ze zijn allemaal geschreven in verschillende talen, op verschillende soorten papier en over volledig uiteenlopende onderwerpen. Voordat je de informatie erin kunt vertrouwen, moet je controleren of de boeken compleet zijn, of de pagina's niet gescheurd zijn en of de verhalen logisch zijn. Dit is Datakwaliteitsbeoordeling.
In het verleden was het controleren van deze boeken als het inhuren van een team bibliothecarissen om elke pagina met de hand te lezen. Maar met "Big Data" is de bibliotheek zo enorm en groeit zo snel dat menselijke bibliothecarissen niet meer kunnen bijbenen. Ze raken moe, maken fouten en kunnen niet snel genoeg lezen.
De auteurs van dit artikel wilden een slimme robotbibliothecaris bouwen die automatisch de kwaliteit van deze boeken kan controleren. Echter, hun vorige robot (BIGQA genaamd) had een gebrek: hij was wat te star. Hij probeerde een boek in zijn geheugen te vinden dat een exact overeenkomst was met het nieuwe boek dat hij vasthield. Als het nieuwe boek een iets andere kaft had of een paar extra hoofdstukken, raakte de robot in de war of miste hij belangrijke details.
Hieronder wordt uitgelegd hoe hun nieuwe, verbeterde oplossing werkt, via eenvoudige analogieën:
1. Het "Slimme Geheugen" (Het Kennisnetwerk)
Stel je het brein van de robot voor als een gigantisch, onderling verbonden web van post-it's, een Kennisnetwerk (Knowledge Graph) genaamd.
- Aan de ene kant van het web staan post-it's die verschillende soorten data beschrijven (zoals "logbestanden van stralingsdetectoren" of "socialmediaberichten").
- Aan de andere kant staan post-it's die de "regels" voor kwaliteitscontrole beschrijven (zoals "controleren op ontbrekende getallen" of "controleren op dubbele invoer").
- In het oude systeem zocht de robot gewoon naar een post-it die exact hetzelfde zei als de nieuwe data. Als hij geen exacte overeenkomst vond, gaf hij het op of gokte hij op basis van de dichtstbijzijnde match, waardoor hij vaak details miste.
2. De "Magische Vertaler" (Kennisnetwerk-Embeddings)
De nieuwe oplossing maakt gebruik van een speciale technologie genaamd Kennisnetwerk-Embeddings. Stel je dit voor als een magische vertaler die de complexe post-it's omzet in simpele getallen (vectoren).
- In plaats van alleen te zoeken naar een exacte woordovereenkomst, begrijpt de vertaler de betekenis en het verband tussen dingen.
- Hij weet dat "een batterijniveau" en "een sensorlocatie" met elkaar verbonden zijn, zelfs als ze niet precies op dezelfde manier zijn geschreven als een eerder voorbeeld.
- Hij kan naar een nieuwe, rommelige dataset kijken en zeggen: "Ah, dit lijkt een beetje op de stralingsdata, maar het heeft ook enkele kenmerken van de weersdata. Laten we de beste regels van beide combineren om dit nieuwe boek te controleren."
3. De "Gewogen Score" (Invoegen van Getallen)
Een belangrijke innovatie in dit artikel is het invoegen van numerieke randattributen.
- Stel je voor dat de verbindingen tussen de post-it's gewichten hebben, zoals een draaiknop.
- Sommige regels zijn zeer belangrijk (zwaar gewicht) en sommige zijn minder belangrijk (licht gewicht).
- De nieuwe robot gokt niet alleen welke regels hij moet gebruiken; hij berekent hoeveel hij elke regel moet vertrouwen. Hij kiest een specifieke "score" of gewicht toe aan elke controle die hij besluit uit te voeren. Dit creëert een sterk aangepaste, gedetailleerde controlelijst voor de specifieke dataset waar het om gaat.
De Realiteitstest: De Stralingsdetectoren
Om te bewijzen dat hun robot werkte, testten de auteurs deze op echte data van stralingsdetectoren (geleverd door de Libanese Commissie voor Atoomenergie).
- De Oude Robot (BIGQA): Hij vond een vergelijkbare stralingsdataset in zijn geheugen en kopieerde die controlelijst. Omdat de nieuwe data echter een paar extra sensoren had (zoals een batterijniveaumonitor) die niet in de oude controlelijst werden genoemd, miste de robot het controleren van die delen. Het was een onvolledige controle.
- De Nieuwe Robot (De Voorgestelde Oplossing): Hij gebruikte zijn "magische vertaler" om de unieke mix van kenmerken van de nieuwe data te begrijpen. Hij genereerde een omvattende controlelijst die regels bevatte voor elk onderdeel van de nieuwe data, inclusief de batterijniveaus en sensor-ID's die de oude robot had gemist. Hij kende ook een betrouwbaarheidsscore toe aan elke controle.
De Conclusie
Het artikel beweert dat ze door het gebruik van deze "magische vertaler" (Kennisnetwerk-Embeddings) en het toevoegen van "gewogen scores" aan de verbindingen, automatisch een veel nauwkeurigere en completere kwaliteitscontrolelijst voor big data kunnen maken.
- Waarom het beter is: Het heeft geen exacte overeenkomst nodig om te werken; het begrijpt context en nuance.
- De Ruil: De auteurs erkennen dat omdat de robot complexe wiskunde gebruikt om deze verbindingen te maken, het voor mensen soms moeilijker is om precies te zien waarom de robot een specifieke regel heeft gekozen (een beetje als een "zwarte doos"). Ook vereist het trainen van deze slimme robot veel rekenkracht en tijd.
Kortom, ze zijn overgestapt van een robot die alleen "op zoek gaat naar een tweeling" naar een robot die "het familiegezicht herkent", zodat er geen belangrijke details ongecontroleerd blijven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.