Automated Big Data Quality Assessment using Knowledge Graph Embeddings
Dieser Beitrag schlägt ein neuartiges automatisiertes Framework zur Bewertung der Datenqualität vor, das Knowledge-Graph-Embeddings nutzt, um kontextbewusste Qualitätsregeln und -dimensionen vorherzusagen und dadurch gewichtete, maßgeschneiderte Bewertungspläne zu generieren, die die Einschränkungen traditioneller strikter Abgleichsmethoden überwinden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben eine riesige Bibliothek von Büchern, die jedoch alle in verschiedenen Sprachen verfasst sind, auf unterschiedlichen Papierarten gedruckt wurden und sich über völlig verschiedene Themen handeln. Bevor Sie den Informationen im Inneren vertrauen können, müssen Sie prüfen, ob die Bücher vollständig sind, ob die Seiten nicht zerrissen sind und ob die Geschichten einen Sinn ergeben. Dies ist die Datenqualitätsbewertung.
In der Vergangenheit war das Überprüfen dieser Bücher so, als würde man ein Team von Bibliothekaren einstellen, um jede einzelne Seite von Hand zu lesen. Doch mit „Big Data" ist die Bibliothek so riesig und wächst so schnell, dass menschliche Bibliothekare nicht mehr mithalten können. Sie werden müde, machen Fehler und können nicht schnell genug lesen.
Die Autoren dieses Papers wollten einen intelligenten Roboter-Bibliothekar bauen, der automatisch die Qualität dieser Bücher überprüfen kann. Ihr vorheriger Roboter (BIGQA genannt) hatte jedoch einen Fehler: Er war etwas zu starr. Er versuchte, in seinem Gedächtnis ein Buch zu finden, das eine exakte Übereinstimmung mit dem neuen Buch darstellte, das er hielt. Wenn das neue Buch ein leicht anderes Cover hatte oder ein paar zusätzliche Kapitel enthielt, geriet der Roboter in Verwirrung oder übersah wichtige Details.
Hier ist, wie ihre neue, verbesserte Lösung funktioniert, erklärt durch einfache Analogien:
1. Das „intelligente Gedächtnis" (Der Wissensgraph)
Stellen Sie sich das Gehirn des Roboters als ein riesiges, vernetztes Netz aus Haftnotizen vor, das Wissensgraph genannt wird.
- Auf der einen Seite des Netzes befinden sich Notizen, die verschiedene Datentypen beschreiben (wie „Strahlungssensor-Protokolle" oder „Social-Media-Beiträge").
- Auf der anderen Seite gibt es Notizen, die die „Regeln" für die Qualitätsprüfung beschreiben (wie „auf fehlende Zahlen prüfen" oder „auf doppelte Einträge prüfen").
- Im alten System suchte der Roboter einfach nach einer Haftnotiz, die exakt dasselbe sagte wie die neuen Daten. Wenn er keine exakte Übereinstimmung fand, gab er auf oder riet basierend auf der nächsten Übereinstimmung, wobei er oft Details verpasste.
2. Der „magische Übersetzer" (Wissensgraph-Embeddings)
Die neue Lösung verwendet eine spezielle Technologie namens Wissensgraph-Embeddings. Stellen Sie sich dies als einen magischen Übersetzer vor, der die komplexen Haftnotizen in einfache Zahlen (Vektoren) verwandelt.
- Anstatt nur nach einer exakten Wortübereinstimmung zu suchen, versteht der Übersetzer die Bedeutung und die Beziehung zwischen den Dingen.
- Er weiß, dass „ein Batteriestand" und „ein Sensorstandort" zusammenhängen, auch wenn sie nicht genau so geschrieben sind wie ein vorheriges Beispiel.
- Er kann einen neuen, unordentlichen Datensatz betrachten und sagen: „Ah, das sieht ein bisschen wie die Strahlungsdaten aus, hat aber auch einige Merkmale der Wetterdaten. Lassen Sie mich die besten Regeln aus beiden kombinieren, um dieses neue Buch zu prüfen."
3. Der „gewichtete Score" (Einbringen von Zahlen)
Eine Schlüsselinnovation in diesem Paper ist das Einbringen numerischer Kanteneigenschaften.
- Stellen Sie sich vor, die Verbindungen zwischen den Haftnotizen haben Gewichte, wie einen Drehregler.
- Einige Regeln sind sehr wichtig (schweres Gewicht), und einige sind weniger wichtig (leichtes Gewicht).
- Der neue Roboter rät nicht nur, welche Regeln zu verwenden sind; er berechnet, wie sehr er jeder Regel vertrauen soll. Er weist jedem Check, den er durchführen möchte, einen spezifischen „Score" oder ein Gewicht zu. Dies erstellt eine hochgradig angepasste, detaillierte Checkliste für den jeweiligen vorliegenden Datensatz.
Der Realwelttest: Die Strahlungssensoren
Um zu beweisen, dass ihr Roboter funktionierte, testeten die Autoren ihn an realen Daten von Strahlungssensoren (bereitgestellt von der Libanesischen Atomenergiekommission).
- Der alte Roboter (BIGQA): Er fand einen ähnlichen Strahlungssatz in seinem Gedächtnis und kopierte diese Checkliste. Da die neuen Daten jedoch ein paar zusätzliche Sensoren hatten (wie einen Batteriestand-Monitor), die in der alten Checkliste nicht erwähnt wurden, übersah der Roboter das Überprüfen dieser Teile. Es war eine unvollständige Prüfung.
- Der neue Roboter (die vorgeschlagene Lösung): Er nutzte seinen „magischen Übersetzer", um die einzigartige Mischung der Merkmale der neuen Daten zu verstehen. Er generierte eine umfassende Checkliste, die Regeln für jeden Teil der neuen Daten enthielt, einschließlich der Batteriestände und Sensor-IDs, die der alte Roboter verpasst hatte. Er wies zudem jedem Check einen Vertrauensscore zu.
Das Fazit
Das Paper behauptet, dass sie durch die Verwendung dieses „magischen Übersetzers" (Wissensgraph-Embeddings) und das Hinzufügen von „gewichteten Scores" zu den Verbindungen automatisch eine viel genauere und vollständigere Qualitätscheckliste für Big Data erstellen können.
- Warum es besser ist: Es benötigt keine exakte Übereinstimmung, um zu funktionieren; es versteht Kontext und Nuancen.
- Der Kompromiss: Die Autoren geben zu, dass es, da der Roboter komplexe Mathematik verwendet, um diese Verbindungen herzustellen, für Menschen manchmal schwieriger ist, genau zu sehen, warum der Roboter eine bestimmte Regel gewählt hat (ein bisschen wie eine „Black Box"). Außerdem erfordert das Training dieses intelligenten Roboters viel Rechenleistung und Zeit.
Kurz gesagt, sie sind von einem Roboter, der nur „nach einem Zwilling sucht", zu einem Roboter übergegangen, der „die Familienähnlichkeit versteht", wodurch sichergestellt wird, dass keine wichtigen Details ungeprüft bleiben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.