← Neueste Arbeiten
💬 NLP

Shieldstral

Shieldstral ist ein kompaktes, 3B-Parameter starkes, richtlinienadaptives multimodales Sicherheitsklassifizierungsmodell, das diverse Inhaltsmoderationsaufgaben in einem binären Frage-Antwort-Rahmenwerk vereint und es ihm ermöglicht, durch einen massiven, kuratierten Datensatz von 54,1 Millionen Beispielen deutlich größere Modelle zu erreichen oder zu übertreffen.

Ursprüngliche Autoren: Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan

Veröffentlicht 2026-07-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich das Internet wie eine riesige, geschäftige digitale Stadt vor. In dieser Stadt chatten Millionen von Menschen, teilen Fotos und stellen Fragen. Aber genau wie eine echte Stadt braucht auch sie Regeln, um sicher zu bleiben. Manchmal sagen Menschen gemeine Dinge, teilen gefährliche Geheimnisse oder posten Bilder, die dort nicht hingehören. Um dies zu verhindern, verwenden wir „Leitplanken“ – spezielle Computerprogramme, die wie Türsteher fungieren und jede Nachricht und jedes Bild prüfen, bevor es die Öffentlichkeit erreicht.

Lange Zeit waren diese Türsteher etwas starr. Sie waren wie Sicherheitskräfte mit einem einzigen, unveränderlichen Regelbuch: „Wenn du ein Messer siehst, halte an. Wenn du ein Schimpfwort siehst, halte an.“ Aber die reale Welt ist chaotisch. Ein Bild eines Messers kann in einem Chat über psychische Gesundheit beängstigend sein, aber in einem Videospiel-Tutorial oder einer Geschichtsstunde über Schwerter völlig in Ordnung. Die alten Wächter konnten den Kontext oder den Grund hinter der Frage nicht verstehen; sie sahen nur das Objekt und gerieten in Panik. Wissenschaftler haben versucht, intelligentere Wächter zu bauen, die in der Lage sind, den spezifischen Regeln des Raumes zuzuhören, in dem sie sich befinden, anstatt einfach nur bei allem „STOPP!“ zu schreien. Dies ist die Herausforderung der „richtlinienadaptiven“ Sicherheit: KI beizubringen, zu verstehen, dass das, was in einer Situation sicher ist, in einer anderen gefährlich sein kann.

Hier kommt Shieldstral ins Spiel, eine neue Art von digitalem Türsteher, der versucht, das Spiel zu verändern. Anstatt ein riesiger, langsamer und teurer Roboter zu sein, ist Shieldstral ein winziges, flinkes 3-Milliarden-Parameter-Modell (denken Sie an ein sehr kompaktes, intelligentes Gehirn). Die Forscher hinter ihm haben entdeckt, dass man kein massives Gehirn braucht, um ein guter Wächter zu sein, wenn man ihm beibringt, auf die richtige Art und Weise zu denken.

Das ist der magische Trick: Anstatt die KI dazu zu trainieren, eine lange Liste von „schlechten Dingen“ auswendig zu lernen (wie ein Schüler, der ein Wörterbuch verbotener Wörter auswendig lernt), haben das Team und die KI ein einfaches Ja/Nein-Spiel spielen lassen. Sie gaben der KI eine spezifische Frage, wie zum Beispiel: „Zeigt dieses Bild eine Person, die gemobbt wird?“ oder „Versucht dieser Text, den Computer zu täuschen?“ und baten sie, mit einem einfachen „Ja“ oder „Nein“ zu antworten.

Das mag zu einfach klingen, aber es ist brillant. Da die KI keine feste Liste auswendig lernt, kann sie jede Frage beantworten, die man ihr stellt. Wenn Sie ein Cybersicherheitstool betreiben, können Sie fragen: „Versucht dieser Code, eine Bank zu hacken?“ Wenn Sie ein Schulforum betreiben, können Sie fragen: „Ist dieser Text ein Mobbing gegen einen Schüler?“ Shieldstral hört auf Ihre spezifische Frage und gibt einen Score basierend darauf ab. Es ist, als hätte man einen Wächter, der nicht nur auf Ihr Gesicht schaut, sondern tatsächlich zuhört, warum Sie da sind, bevor er entscheidet, ob Sie eintreten dürfen.

Um dieses winzige Modell so intelligent zu machen, mussten die Forscher es mit einer riesigen Menge an Nahrung füttern – etwa 54,1 Millionen Beispiele! Sie haben die Daten nicht einfach wahllos aus dem Internet auf sie geworfen. Sie waren sehr sorgfältige Köche. Sie nahmen ungeordnete Daten von überall her (einige mit strengen Regeln, einige mit lockeren Regeln) und wandelten sie alle in dasselbe „Frage + Antwort“-Format um. Sie entwickelten sogar eine spezielle Trainingsmethode namens „kontrastives Lernen“. Stellen Sie sich vor, Sie zeigen der KI zwei fast identische Geschichten: eine, in der eine Figur gemein ist, und eine, in der sie nur Spaß macht. Die KI muss den winzigen Unterschied zwischen den beiden basierend auf der spezifischen Frage lernen. Dies hilft ihr, das Nuancierte zu verstehen, anstatt nur die Oberfläche zu erfassen.

Die Ergebnisse sind ziemlich verrückt. Obwohl Shieldstral winzig ist (nur 3 Milliarden Parameter), schnitt es genauso gut oder sogar besser ab als einige der größten Sicherheitsmodelle, die 7 Mal größer sind (etwa 20 Milliarden Parameter). Bei Tests, bei denen die KI auf neue, spezifische Regeln reagieren musste, die sie zuvor noch nie gesehen hatte, erzielte Shieldstral beeindruckende 91,3 %. Es übertraf auch die Konkurrenz bei multimodalen Aufgaben (Prüfung von sowohl Text als auch Bildern) mit einem Durchschnittswert von 83,8 %.

Das Paper legt nahe, dass dieser Ansatz – Sicherheit in ein flexibles Frage-Antwort-Spiel zu verwandeln und auf einer riesigen, sorgfältig kuratierten Mischung aus Daten zu trainieren – es kleinen Modellen ermöglicht, weit über ihr Gewicht hinaus zu schlagen. Es beweist, dass man kein riesiges, teures Gehirn braucht, um ein guter Wächter zu sein; man muss es nur lernen, den Regeln des Raumes zuzuhören. Shieldstral zeigt, dass ein kleines, anpassungsfähiges Modell die großen, starren Modelle erreichen oder sogar schlagen kann, was es möglich macht, überall eine sicherere, intelligentere und effizientere KI zu haben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →