← Neueste Arbeiten
💬 NLP

Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection

Diese Arbeit zeigt, dass die Nutzung von Large Language Models zur Generierung von zusätzlichem Hintergrundkontext und dessen Einbindung mittels Embedding-Konkatenation die Erkennung von implizitem Hassrede sowohl in textuellen als auch in multimodalen Szenarien signifikant verbessert und dabei Zero-Context-Baselines sowie bestehende Entity-Linking-Ansätze übertrifft.

Ursprüngliche Autoren: Joshua Wolfe Brook, Ilia Markov

Veröffentlicht 2026-09-11
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Joshua Wolfe Brook, Ilia Markov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Internet ist ein riesiger, lärmender Marktplatz menschlichen Ausdrucks, auf dem die gefährlichsten Worte oft jene sind, die nicht schreien. Während es für einen Computer relativ einfach ist, offensichtliche Beleidigungen oder direkte Drohungen zu erkennen, verbirgt sich eine andere Art von Toxizität direkt vor den Augen aller. Dies ist impliziter Hassrede: Feindseligkeit, die auf Ironie, kulturellen Codes oder einem gemeinsamen Verständnis der Welt beruht, um ihre Botschaft zu vermitteln. Ein Satz, der für sich genommen harmlos erscheint, kann zu einem giftigen Angriff werden, wenn er durch die Linse eines spezifischen Ereignisses, eines historischen Bezugs oder eines Insider-Witzes einer Gemeinschaft betrachtet wird. Jahrelang haben Forscher versucht, Computern beizubringen, diese verborgenen Bedeutungen zu sehen, doch sie stießen auf ein grundlegendes Problem: Die Maschinen fehlt das Hintergrundwissen, das Menschen als selbstverständlich voraussetzen. Sie können die Wörter lesen, aber sie kennen nicht die Geschichte dahinter.

Um dies zu lösen, beschloss ein Team von Forschern der Vrije Universiteit Amsterdam, ihren Computermodellen einen Tutor zu geben. Sie wandten sich an große Sprachmodelle – dieselben leistungsstarken KI-Systeme, die Aufsätze schreiben oder Gespräche führen können – und baten sie, etwas Spezifisches zu tun. Anstatt die KI als Richter darüber entscheiden zu lassen, was hasserfüllt ist, nutzten sie sie als Faktenchecker und Historikerin. Für jeden Social-Media-Post, den das System analysierte, wurde die KI gebeten, einen kurzen Absatz mit Hintergrundkontext zu generenieren. Wenn ein Post eine obskure politische Gruppe oder ein virales Meme erwähnte, erklärte die KI, wer sie waren und wofür sie standen, und füllte so effektiv die Lücken des Weltwissens, die ein Standard-Computerprogramm übersehen würde. Die Forscher testeten dann vier verschiedene Wege, diese neuen Informationen in ihr Erkennungssystem einzuspeisen, wobei sie untersuchten, ob es ausreichte, die Fakten einfach neben den Post zu kopieren, oder ob der Computer den Post und die Fakten separat verarbeiten musste, um die wahre Absicht zu verstehen.

Die Ergebnisse dieses Experiments waren klar und messbar. Als die Forscher ihre Methode an einem Datensatz von tausenden Tweets testeten, die implizite Hassrede enthielten, schnitt das System, das den KI-generierten Hintergrundkontext nutzte, signifikant besser ab als Modelle, die sich nur auf den rohen Text verließen. Der erfolgreichste Ansatz beinhaltete eine spezifische Technik, bei der der Computer eine digitale Repräsentation des ursprünglichen Posts und eine separate Repräsentation der generierten Hintergrundgeschichte erstellte und dann diese zwei unterschiedlichen Informationsteile kombinierte. Diese Methode verbesserte die Fähigkeit des Systems, hasserfüllte Inhalte korrekt zu identifizieren, um bis zu drei Prozentpunkte im Vergleich zu einem System ohne jeglichen Kontext. Die Verbesserung war noch dramatischer, als die Forscher dieselbe Logik auf eine andere Art von Inhalten anwandten: Internet-Memes. Memes kombinieren Bilder und Text und verlassen sich oft auf visuelle Hinweise, die für eine Maschine genauso verwirrend sind wie kodierte Sprache für einen Menschen. Auf einem Datensatz von frauenfeindlichen Memes verbesserte das kontextgestützte System seine Genauigkeit um bis zu sechs Prozentpunkte.

Der Weg zu einer besseren Erkennung war jedoch nicht ohne Tücken. Die Forscher fanden heraus, dass das bloße Hinzufügen von mehr Wörtern zu einem Post nicht immer half; tatsächlich verwirrte es den Computer manchmal. Wenn die KI eine lange, detaillierte Erklärung für einen Post generierte, der bereits eindeutig hasserfüllt war, verwässerte die zusätzliche Information manchmal die ursprüngliche Botschaft, was dazu führte, dass das System den Hass übersah. Umgekehrt passierte es, dass die KI, wenn sie eine Hintergrundgeschichte für einen harmlosen Post generierte, gelegentlich Verbindungen zu hasserfüllten Ideen erfand, die gar nicht existierten, was dazu führte, dass das System unschuldige Inhalte fälschlicherweise als gefährlich einstufte. Dies geschah, weil die KI in ihrem Bestreben, hilfreich zu sein, manchmal eine neutrale Phrase oder eine Warnung über eine Gruppe überinterpretierte oder als Unterstützung von Hass deutete. Die Studie zeigte, dass die Bereitstellung von Hintergrundwissen zwar ein mächtiges Werkzeug ist, aber mit Vorsicht gehandhabt werden muss. Die effektivste Methode bestand nicht darin, den Post und den Kontext zu einem einzigen Textblock zu verschmelzen, sondern sie bis zum Ende der Analyse getrennt zu halten, damit der Computer die ursprüngliche Botschaft gegen die neuen Informationen abwägen konnte, ohne dass der eine den anderen übertönte.

Die Arbeit stellte auch eine gängige Annahme auf dem Gebiet infrage: dass die leistungsstärkste künstliche Intelligenz diejenige sein sollte, die das endgültige Urteil fällt. Die Forscher testeten, ob das große Sprachmodell den Post einfach lesen und entscheiden könnte, ob er hasserfüllt sei, indem es selbst als Klassifizierer fungiert. Obwohl die KI darin sehr gut war, insbesondere bei den visuellen Memes, übertraf sie nicht das spezialisierte Erkennungssystem, das die KI nur zur Generierung von Hintergrundfakten nutzte. Dies deutet darauf hin, dass der beste Ansatz derzeit eine Partnerschaft ist: das große Sprachmodell als dynamische Bibliothek zu nutzen, um relevante Fakten abzurufen, und dann ein einfacheres, fokussierteres System zu verwenden, das die endgültige Entscheidung basierend auf diesen Fakten trifft. Dieser modulare Ansatz ermöglicht es dem System, die spezifischen Muster von Hassrede in einem Datensatz zu lernen und dennoch Zugriff auf das enorme Weltwissen zu haben, das impliziten Hass verständlich macht.

Letztlich zeigt die Studie, dass Kontext nicht nur eine hilfreiche Ergänzung zur Erkennung von Hassrede ist, sondern eine Notwendigkeit, um die subtile, kodierte Sprache des modernen Internets zu verstehen. Indem sie die Generierung von Hintergrundinformationen als einen separaten Schritt von dem Akt der Klassifizierung behandelten, schufen die Forscher ein System, das präziser und robuster ist. Sie zeigten, dass der Schlüssel zum Ergreifen von verborgenem Hass nicht nur darin liegt, die Wörter zu lesen, sondern darin, die Welt zu verstehen, die diese Wörter beschreiben. Obwohl das System nicht perfekt ist und immer noch mit der feinen Linie zwischen harmloser Ironie und echtem Hass kämpft, bietet die Untersuchung eine klare Richtung für die Zukunft. Während sich die künstliche Intelligenz weiterentwickelt, wird die Fähigkeit, relevanten Kontext zu generieren und zu integrieren, wahrscheinlich zum Standard für jedes System werden, das damit beauftragt ist, Online-Räume vor den heimtückischsten Formen menschlicher Ausdrucksweise zu schützen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →