← Neueste Arbeiten
💻 computer science

Real-Time Acoustic Keylogging: A Convolutional Neural Network Based Approach

Dieses Paper präsentiert ein neuartiges Echtzeit-akustisches Keylogging-System, das ein faltendes neuronales Netzwerk nutzt, welches auf Log-Mel-Spektrogrammen trainiert wurde, um eine hochgenaue Tastaturanschlag-Inferenz mit geringer Latenz (0,35 Sekunden) und robuster Leistung selbst unter Bedingungen begrenzter Trainingsdaten zu erreichen.

Ursprüngliche Autoren: Joshua Edgley, Aikaterini Kanta, Athanasios Paraskelidis

Veröffentlicht 2026-09-18
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Joshua Edgley, Aikaterini Kanta, Athanasios Paraskelidis

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Jedes Mal, wenn eine Person auf einer Standard-Computertastatur tippt, erzeugt sie ein winziges, unterscheidbares Geräusch. Für das menschliche Ohr verschmelzen diese Klicks und Klacks zu einem gleichmäßigen Rhythmus, der nicht mehr voneinander zu unterscheiden ist. Doch die Physik der Maschine erzählt eine andere Geschichte. Jede Taste erzeugt, abhängig von ihrer Position und dem spezifischen Mechanismus darunter, eine einzigartige akustische Signatur. Genau wie ein Fingerabdruck eine Person identifiziert, können diese subtilen Variationen im Klang eine bestimmte Taste identifizieren. Dieses Phänomen bildet die Grundlage für eine Sicherheitsbedrohung, die als akustisches Keylogging bekannt ist. Im Gegensatz zu traditionellen Hacking-Methoden, die die Installation einer Schadsoftware auf dem Computer eines Opfers erfordern, beruht dieser Angriff darauf, Geräusche von außen zu erfassen. Da die Mikrofone in modernen Smartphones und Laptops immer empfindlicher werden, ist das Potenzial für einen Angreifer, diese Klänge aufzunehmen und ein Passwort oder eine vertrauliche Nachricht zu rekonstruieren, von einer theoretischen Möglichkeit zu einem praktischen Problem geworden.

Forscher der University of Portsmouth machten sich daran zu untersuchen, wie machbar dieser Angriff ist, wenn er in Echtzeit geschieht und nicht erst im Nachhinein. Während frühere Studien gezeigt hatten, dass Maschinen lernen können, diese Geräusche zu unterscheiden, stützten sie sich oft auf die Analyse vollständiger Aufnahmen von Tippvorgängen, nachdem diese abgeschlossen waren. Dieser Ansatz ließ eine entscheidende Frage offen: Könnte ein System einer Person beim Tippen zuhören, jede Taste identifizieren, während sie gedrückt wird, und dies schnell genug tun, um für einen Angreifer während des laufenden Tippvorgangs nützlich zu sein? Um dies zu beantworten, baute das Team ein Prototyp-System, das darauf ausgelegt war, ein Live-Listening-Szenario nachzuahmen. Sie verwendeten ein Standard-Smartphone, um die Geräusche einer mechanischen Tastatur aufzunehmen, und speisten dieses Audio dann in ein spezialisiertes Computerprogramm ein. Dieses Programm, das auf einer Art künstlicher Intelligenz namens Convolutional Neural Network basiert, wurde darauf trainiert, die visuellen Muster von Schallwellen zu erkennen, indem es das Audio in Bilder umwandelt, die der Computer analysieren kann.

Die Experimente des Teams zeigten, dass ein solches System tatsächlich in der Lage ist, in Echtzeit zu operieren. In ihren Tests verarbeitete das System das Audio und identifizierte die getippten Tasten mit einer durchschnittlichen Verzögerung von nur 0,3,5 Sekunden nach jedem Tastendruck. Diese Geschwindigkeit ist schnell genug, um für die meisten praktischen Zwecke als unmittelbar zu gelten. Als die Forscher das System mit gängigen Passwörtern testeten, rekonstruierte es die getippten Sequenzen mit hoher Genauigkeit und stellte oft die gesamte Zeichenfolge korrekt wieder her. Das System machte gelegentlich Fehler, aber diese Fehler waren selten zufällig; wenn die Maschine falsch rät, wählte sie fast immer eine Taste, die sich physisch neben der korrekten Taste auf der Tastatur befand. Dies deutet darauf darauf hin, dass das System Schwierigkeiten hatte, zwischen zwei sehr ähnlichen Klängen zu unterscheiden, anstatt völlig zu versagen.

Die Studie hob jedoch auch signifikante Schwachstellen hervor, die Nutzer schützen könnten. Der Erfolg des Systems hing stark von der Umgebung ab, in der es trainiert wurde. Als die Forscher Hintergrundgeräusche einführten, wie etwa das Geplapper und Summen eines belebten Büros, sank die Fähigkeit des Systems, Tasten zu identifizieren, drastisch. Ähnlich verhielt es sich, wenn das Aufnahmegerät auch nur ein kurzes Stück von der Tastatur entfernt bewegt wurde oder wenn der Tipper seine Geschwindigkeit oder den Druck änderte, litt die Genauigkeit. Die auffälligste Erkenntnis war, dass das System sich nicht leicht an eine andere Tastatur anpassen konnte. Ein Modell, das auf eine spezifische mechanische Tastatur trainiert wurde, versagte fast vollständig, wenn es aufgefordert wurde, einer anderen Marke zuzuhören, was darauf hindeutet, dass der Angriff auf sehr spezifische Hardwareeigenschaften angewiesen ist.

Besonders besorgniserregend für Sicherheitsexperten war die Entdeckung, dass das System keine riesigen Datenmengen benötigt, um zu lernen. Die Forscher fanden heraus, dass die künstliche Intelligenz mit nur vier Aufnahmen jeder gedrückten Taste effektiv trainiert werden konnte. Diese geringe Anforderung bedeutet, dass ein Angreifer nicht Wochen damit verbringen muss, Daten zu sammeln, um ein funktionierendes Werkzeug aufzubauen; eine kurze, gezielte Aufnahmesitzung könnte ausreichen. Trotz dieser Fähigkeiten kam die Studie zu dem Schluss, dass die Bedrohung nicht unbesiegbar ist. Die Forscher schlugen mehrere praktische Verteidigungsmaßnahmen vor, wie etwa das Tippen in geräuschvollen Umgebungen, das Variieren der Tippgeschwindigkeit oder die Verwendung von Software, die Passwörter automatisch ausfüllt, um physische Tastendrücke ganz zu vermeiden. Während die Technologie, Tastenschläge in Echtzeit mitzuhören, zweifellos vorhanden ist, legt die Studie nahe, dass einfache Änderungen im Verhalten und in der Umgebung diesen Angriff effektiv stören können, wodurch eine potenzielle Schwachstelle in ein beherrschbares Risiko verwandelt wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →