← Neueste Arbeiten
💻 computer science

Context-Aware LLM Evaluators for Content Moderation Judgments in a Low-Resource Setting

Diese Studie zeigt, dass, während kontextsensitive Prompting-Verfahren und der Abruf früherer Entscheidungen die Leistungsfähigkeit von Large Language Model-Evaluatoren für die Moderation deutscher Zeitungsforen verbessern können, die Wahl der Modellkapazität entscheidender ist als die Prompting-Strategie, wobei das größte Modell über supervised Systeme bei seltenen Löschkategorien ohne die Notwendigkeit annotierter Trainingsdaten übertrifft.

Ursprüngliche Autoren: Felix Krejca, Tobias Kietreiber, Michael Wiegand, Sebastian Neumaier

Veröffentlicht 2026-08-26
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Felix Krejca, Tobias Kietreiber, Michael Wiegand, Sebastian Neumaier

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In den geschäftigen digitalen Marktplätzen des Internets, wo täglich Millionen von Kommentaren gepostet werden, ist eine stille Krise der Skalierbarkeit entstanden. Menschliche Moderatoren, die geschulten Fachkräfte, die einst jeden Beitrag lasen, um zu entscheiden, was bleibt und was geht, sind überfordert. Das schiere Volumen der Inhalte hat es für Menschen unmöglich gemacht, Schritt zu halten, doch die Regeln dafür, was einen schädlichen oder themenfremden Post ausmacht, sind oft subtil und hängen stark von der spezifischen Konversation und den Normen der jeweiligen Community ab. Um dies zu lösen, haben sich Forscher der großen Sprachmodelle zugewandt, einer Art künstlicher Intelligenz, die in der Lage ist, menschenähnliche Texte zu verstehen und zu generieren. Diesen Modellen wird zunehmend die Aufgabe übertragen, als Richter zu fungieren, indem sie Posts etikettieren und Moderationsentscheidungen treffen, die einst das exklusive Domän der Menschen waren. Es bleibt jedoch eine kritische Frage: Kann eine Maschine wirklich die Nuancen eines hitzigen Online-Arguments verstehen, oder muss sie das Gesamtbild sehen, um ein faires Urteil zu fällen?

Diese Frage trieb ein Team von Forschern österreichischer Universitäten dazu, zu untersuchen, wie gut diese künstlichen Richter abschneiden, wenn man ihnen unterschiedliche Mengen an Informationen zur Verfügung stellt. Sie konzentrierten sich auf eine spezifische, anspruchsvolle Umgebung: die Kommentarspalten einer deutschsprachigen Zeitung. In diesem Setting erfordert die Entscheidung, ob ein Kommentar themenfremd, diskriminierend oder einfach nur eine persönliche Geschichte ist, mehr als nur das Lesen der Wörter auf dem Bildschirm; es erfordert das Verständnis des Kontextes des Artikels, auf den geantwortet wird, und der Historie der Konversation, in deren Teil der Kommentar ist. Die Forscher wollten wissen, ob die Gabe der künstlichen Intelligenz mehr Kontext – wie den vollständigen Zeitungsartikel oder den gesamten Antwortverlauf – ihr helfen würde, die Entscheidungen menschlicher Experten nachzuahmen. Sie testeten auch einen anderen Ansatz: Anstatt dem Modell mehr Text zum Lesen zu geben, könnte man ihm Beispiele zeigen, wie Menschen in der Vergangenheit ähnliche Kommentare beurteilt haben?

Um die Antworten zu finden, nutzte das Team eine riesige Sammlung von über einer Million Posts aus der österreichischen Zeitung Der Standard, die einen kleineren, sorgfältig annotierten Satz von fast 12.000 Kommentaren enthielt, die von professionellen menschlichen Moderatoren bewertet worden waren. Sie testeten drei verschiedene Modelle künstlicher Intelligenz unterschiedlicher Größe, die von einem kleineren, schnelleren Modell bis hin zu einem viel größeren, komplexeren Modell reichten. Für jedes Modell führten sie eine Reihe von Experimenten durch, bei denen sie die bereitgestellte Information im Prompt änderten. In einigen Fällen sah das Modell nur den einzelnen Kommentar in Frage. In anderen Fällen sah es den Kommentar plus die Schlagzeile des Artikels, den vollständigen Text des Artikels oder den gesamten Thread der vorherigen Antworten. Sie testeten auch eine Methode, bei der dem Modell zwei kurze, abgerufene Beispiele dafür gezeigt wurden, wie Menschen ähnliche Kommentare in der Vergangenheit beurteilt hatten – eines, das online geblieben war, und eines, das entfernt worden war.

Die Ergebnisse zeichneten ein nuanciertes Bild davon, wie diese digitalen Richter denken. Die Forscher fanden heraus, dass Kontext zwar hilft, aber nicht auf die Weise, wie man es erwarten würde. Einfach mehr Text in das System zu „dumpen“, garantiert keine besseren Ergebnisse. Tatsächlich führte das Hinzufügen des vollständigen Nachrichtentextes bei einigen Arten von Urteilen, wie etwa dem Erkennen diskriminierender Sprache oder unangemessener Beleidigungen, dazu, dass das Modell verwirrt wurde und seine Leistung schlechter wurde. Das Modell schnitt besser ab, wenn es die Konversationshistorie sah – die Antworten und den Fluss der Diskussion –, denn dort liegt oft die wahre Bedeutung eines Kommentars. Für andere Kategorien, wie die Entscheidung, ob ein Kommentar themenfremd ist, war das Sehen des ursprünglichen Artikels jedoch essenziell. Es gab keine einzelne „beste“ Menge an Informationen, die für jede Situation funktionierte; die richtige Menge an Kontext hing völlig davon ab, was das Modell gerade beurteilt wurde.

Die vielleicht überraschendste Entdeckung war, dass das Zeigen vergangener menschlicher Entscheidungen an das Modell genauso effektiv war wie das Zeigen des vollständigen Artikels und der Konversationshistorie, jedoch mit einem großen Vorteil: Es war viel kürzer und schneller. Als die Forscher dem Modell zwei kurze Beispiele dafür gaben, wie Menschen ähnliche Kommentare in der Vergangenheit beurteilt hatten, performte das Modell fast so gut wie, wenn es den gesamten Zeitungsartikel und den gesamten Antwortthread erhalten hätte. Diese Retrieval-Methode war auch zuverlässiger; sie verbesserte die Leistung des Modells über alle Kategorien hinweg, während das Hinzufügen von mehr Text die Leistung manchmal verschlechterte. Es stellte sich heraus, dass das Sehen dessen, wie ein Mensch ein ähnliches Problem in der Vergangenheit gelöst hatte, eine leistungsstarke Abkürzung war, die es dem Modell ermöglichte, die Standards der Community zu lernen, ohne ganze Seiten an Hintergrundtext lesen zu müssen.

Die Größe des Modells der künstlichen Intelligenz erwies sich als der entscheidendste Faktor von allen. Das größte Modell mit 31 Milliarden Parametern war das einzige, das konsistent die Urteilsschwelle der menschlichen Experten erreichen konnte, indem es ausgewogene Entscheidungen traf, die weder zu streng noch zu nachgiebig waren. Die kleineren Modelle hatten signifikante Schwierigkeiten. Das kleinste Modell mit nur einer Milliarde Parametern verbesserte sich oft nicht durch mehr Kontext oder Beispiele und performte mit diesen manchmal sogar schlechter. Das mittelgroße Modell konnte so eingestellt werden, dass es fast jeden Kommentar als problematisch markierte – es erfasste fast alles, löste aber auch viele Fehlalarme aus. Dies deutet darauf hin, dass kleinere Modelle zwar als erster Filter nützlich sein könnten, um offensichtliche Probleme abzufangen, aber noch nicht bereit sind, den menschlichen Urteilsprozess allein zu ersetzen. Nur die größten Modelle demonstrierten die notwendige Fähigkeit, die subtilen Grenzen der Community-Normen zu verstehen.

Im Vergleich zu früheren Computersystemen, die speziell auf diese Daten trainiert wurden, zeigte der neue Ansatz eine deutliche Stärke in den Bereichen, die am wichtigsten für die Sicherheit sind. Die künstlichen Richter waren signifikant besser darin, die seltenen, schädlichen Posts zu identifizieren, die zur Entfernung führen, wie etwa diskriminierende oder themenfremde Inhalte, und übertrafen damit ältere Systeme, die auf tausenden von Beispielen trainiert worden waren. Die älteren, trainierten Systeme waren jedoch immer noch besser darin, konstruktive Inhalte wie persönliche Geschichten oder gut argumentierte Punkte zu identifizieren. Dieser Unterschied unterstreicht eine wesentliche Realität: Der neue Ansatz funktioniert am besten dort, wo menschliche Trainingsdaten knapp und teuer in der Erstellung sind. Für die seltenen, schwierigen Fälle, die die Sicherheit einer Community definieren, kann der künstliche Richter, geleitet durch einige kluge Beispiele, eine bessere Arbeit leisten als ein System, das auf begrenzten Daten trainiert wurde. Aber für die häufigen, positiven Interaktionen behalten die alten Methoden den Vorsprung.

Letztendlich legt die Studie nahe, dass die Zukunft der Inhaltsmoderation nicht darin besteht, Menschen durch eine einzige, perfekte Maschine zu ersetken, sondern darin, die richtigen Werkzeuge für den richtigen Job zu finden. Die Forschung zeigt, dass die beste Strategie für Redaktionen und Online-Communities darin besteht, die größten verfügbaren Modelle zu nutzen und sich auf eine Methode zu verlassen, die ihnen zeigt, wie Menschen in ähnlichen Situationen geurteilt haben, anstatt sie mit endlosem Text zu überfordern. Dieser Ansatz ermöglicht eine skalierbare, zuverlässige Moderation selbst in Sprachen und Communities, in denen es keine massive Datenbank mit gelabelten Beispielen zum Trainieren gibt. Er bietet einen Weg nach vorn, auf dem die Technologie das Volumen des Internets bewältigen kann, während sie gleichzeitig die subtile, kontextabhängige Natur der menschlichen Konversation respektiert – vorausgesetzt, das richtige Modell wird gewählt und die richtigen Informationen werden gegeben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →