← Neueste Arbeiten
🤖 machine learning

Vendor-Conditioned Contrastive Learning for Predicting Organizational Cyber Threat Targets

Dieser Beitrag stellt TRACE vor, ein auf CySecBERT basierendes kontrastives Lernframework, das durch vendor-spezifische Bedingungen und einen groß angelegten, multi-quelligen Korpus aus 352.866 Beiträgen einen State-of-the-Art-Genauigkeitswert bei der Vorhersage von Zielen für Cyberbedrohungen in Organisationen erreicht und gleichzeitig Robustheit gegenüber zeitlichen Verteilungsverschiebungen demonstriert.

Ursprüngliche Autoren: Benjamin M. Ampel

Veröffentlicht 2026-05-15
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Benjamin M. Ampel

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich das Untergrund-Internet als einen riesigen, chaotischen Basar vor, in dem Hacker sich versammeln, um Geheimnisse, Werkzeuge und Baupläne zum Eindringen in Computer zu handeln. Diese „Hacker-Foren" sind täglich mit Tausenden von Beiträgen gefüllt. Die große Frage für Sicherheitsexperten lautet: Wen versuchen diese Hacker anzugreifen? Zielen sie auf Banken, Videospielunternehmen oder Krankenhaussysteme ab?

Diese Arbeit stellt ein neues Werkzeug namens TRACE (Temporal Representation and Classification of Exploits) vor, das wie ein superkluger Detektiv funktioniert, um diese Frage zu beantworten. Hier ist die Funktionsweise, aufgeschlüsselt in einfache Konzepte:

1. Das Problem: Die Sprache der Hacker ändert sich

Stellen Sie sich Hacker-Slang als sich schnell entwickelndes Dialekt vor. Genau wie Jugendliche heute andere Wörter verwenden als vor 20 Jahren, ändern Hacker die Art und Weise, wie sie ihre Werkzeuge beschreiben. Ein Modell (ein Computerprogramm), das auf alten Forum-Beiträgen trainiert wurde, könnte bei neuen Beiträgen verwirrt sein, weil sich der Wortschatz verschoben hat.

Wenn Sie einen Detektiv an Kriminalberichten aus den 2010er-Jahren schulen, könnte er ein Verbrechen aus dem Jahr 2025 übersehen, weil die Kriminellen neue Codes verwenden. Die Arbeit argumentiert, dass die meisten früheren Tools scheiterten, weil sie dieses „Zeitreise"-Problem nicht berücksichtigten. Sie funktionierten gut mit alten Daten, strauchelten jedoch, wenn sie mit neuen, zukünftigen Daten konfrontiert wurden.

2. Die Daten: Eine massive Zeitkapsel

Um TRACE zu entwickeln, durchsuchten die Forscher nicht nur ein paar Foren. Sie gruben in einer massiven „Zeitkapsel" mit 8,7 Millionen Beiträgen aus 35 verschiedenen Quellen (wie Hacker-Foren, Fehlerdatenbanken und Darknet-Märkten) über einen Zeitraum von 30 Jahren (von 1990 bis 2026).

Aus diesem Berg an Text reinigten und organisierten sie 129.126 spezifische Beiträge, die eindeutig ein Zielunternehmen oder eine Branche erwähnten. Sie sortierten diese in sieben „Eimer" (Kategorien) ein, wie zum Beispiel:

  • CMS / Open Source (wie WordPress oder Linux)
  • Unternehmenssoftware (wie große Unternehmenswerkzeuge)
  • Gaming
  • Netzwerktechnik
  • Und andere.

3. Die Lösung: TRACEs „Zwei-Gehirn"-Ansatz

TRACE basiert auf einem vortrainierten KI-Gehirn namens CySecBERT, das bereits viel über Cybersecurity-Jargon weiß. Die Forscher gaben ihm jedoch ein spezielles Upgrade mittels Contrastive Learning (kontrastives Lernen).

Stellen Sie sich dieses Upgrade als ein Sortierspiel vor:

  • Das Ziel: Die KI muss erraten, zu welchem „Eimer" (Branche) ein Hacker-Beitrag gehört.
  • Der Trick: Die Forscher sagten der KI: „Bevor du den Eimer errätst, stelle sicher, dass du Beiträge zuerst nach dem Hersteller (dem Firmennamen) gruppiert hast."
    • Wenn zwei Beiträge „Microsoft" erwähnen, wird die KI gezwungen, ihre internen „mentalen Fingerabdrücke" sehr ähnlich zu gestalten, selbst wenn sie über verschiedene Produkte sprechen.
    • Wenn zwei Beiträge „Google" und „Microsoft" erwähnen, wird die KI gezwungen, ihre Fingerabdrücke sehr unterschiedlich zu gestalten.

Warum hilft das?
Stellen Sie sich vor, Sie versuchen, einen Haufen durcheinandergeratener Socken zu sortieren. Wenn Sie nur auf die Farbe (die Branche) schauen, könnten Sie verwirrt sein, weil einige Socken ähnlich sind. Aber wenn Sie sie zuerst nach Marke (dem Hersteller) gruppieren, lernen Sie die spezifischen Muster dieser Marke. Sobald die KI die „Markenmuster" von Microsoft oder Apple versteht, wird sie viel besser darin, die Branche zu erraten, zu der sie gehören, selbst wenn sich die Sprache im Laufe der Zeit ändert.

4. Der Test: Die „Zukunft"-Herausforderung

Die Forscher testeten TRACE nicht nur an zufälligen Daten. Sie richteten einen Zeitreise-Test ein:

  • Training: Die KI studierte Beiträge aus der Zeit vor 2022.
  • Test: Anschließend wurde die KI gebeten, Ziele für Beiträge aus 2024 und darüber hinaus vorherzusagen.

Das ist wie ein Schüler, der mit einem Lehrbuch aus dem Jahr 2020 unterrichtet wird und dann eine Abschlussprüfung auf Basis von Nachrichten aus dem Jahr 2025 erhält. Die meisten anderen Methoden bestanden diesen Test nicht, weil sie mit der neuen Sprache nicht umgehen konnten.

5. Die Ergebnisse: Ein neuer Champion

TRACE überrannte die Konkurrenz.

  • Die Punktzahl: Es erreichte eine Genauigkeit von 97 % (speziell ein makroskopischer F1-Score von 97,00 %) bei den zukünftigen Daten.
  • Die Konkurrenz: Es schlug 17 andere Methoden, darunter Standard-Maschinenlernmodelle und andere fortschrittliche KI-Transformer.
  • Das Geheimnis: Die Arbeit ergab, dass die Art des Wörterbuchs, das die KI verwendete, wichtiger war als die Architektur der KI. Eine KI, die speziell auf Hacker-Texte trainiert wurde (CySecBERT), war einem auf allgemeines Englisch trainierten Modell weit überlegen. Darüber hinaus gab der „Hersteller-Sortier"-Trick (kontrastives Lernen) einen signifikanten Schub, insbesondere für seltene Kategorien wie Gaming, wo die Genauigkeit um fast 20 % verbessert wurde.

Zusammenfassung

Kurz gesagt stellt die Arbeit TRACE vor, ein Werkzeug, das durch die Analyse von Forum-Beiträgen vorhersagt, welche Organisationen Hacker ins Visier nehmen. Es funktioniert besser als frühere Tools, weil es:

  1. Einen massiven, 30-jährigen Datensatz echten Hacker-Gesprächs verwendet.
  2. Einen „herstellerbedingten" Trick einsetzt, um der KI beizubringen, erst unternehmensspezifische Muster zu erkennen.
  3. Beweist, dass es die Zukunft bewältigen kann, indem es erfolgreich Ziele auf Daten aus Jahren vorhersagt, die es noch nie gesehen hatte.

Das Ergebnis ist ein System, das Sicherheitsteams hilft, schnell zu verstehen: „Hey, Hacker sprechen gerade über unsere Branche", was es ihnen ermöglicht, sich zu verteidigen, bevor ein Angriff stattfindet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →