Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B
Semalith v1.4 is een uiterst efficiënte veiligheidsklassificator met 184 miljoen parameters die staat van de kunst bereikt op het gebied van detectie van prompt-injectie en nul fout-positieven op onschuldige agentische prompts met 44 keer minder parameters dan Llama-Guard-3-8B, terwijl het uniek tegelijkertijd detectie van algemene schade en financiële naleving van regelgeving biedt in een enkele inferentiepass.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je het internet voor als een enorme, bruisende bibliotheek waar miljoenen mensen chatten met een super slimme robot-bibliothecaris. Deze bibliothecaris, een Kunstmatige Intelligentie, kan verhalen schrijven, wiskundige problemen oplossen en vragen beantwoorden over werkelijk alles. Maar zoals elke krachtige tool heeft het ook een schaduwkant: soms proberen sluwe gebruikers de robot te misleiden om zijn eigen regels te breken, geheime informatie te onthullen of gemeen te doen. Dit wordt "prompt injection" genoemd—het is alsof je de bibliothecaris een geheim wachtwoord in het oor fluistert om hem de "Niet Aanraken"-borden te laten negeren.
Om de bibliotheek veilig te houden, hebben we een bewaker nodig. In de wereld van AI zijn deze bewakers speciale programma's genaat "safety classifiers". Hun taak is om elk bericht te lezen voordat de robot het ziet en "STOP!" te roepen als het bericht gevaarlijk is. Echter, de meeste bewakers zijn óf te traag, óf te onhandig, óf te paranoïde. Sommige bewakers zijn zo bang voor problemen dat ze de bibliothecaris verhinderen om bij onschuldige vragen te helpen, zoals het vragen hoe je een wachtwoord reset. Anderen zijn zo gefocust op simpele scheldwoorden dat ze slimme, sluwe trucjes missen. De grote vraag die wetenschappers stellen is: Kunnen we een bewaker bouwen die snel is, slim genoeg om lastige trucjes te herkennen, en zachtmoedig genoeg om onschuldige gesprekken door te laten?
Maak kennis met Semalith v1.4, een nieuwe bewaker die ontworpen is om precies dit probleem op te lossen. Denk aan het als een hooggetrainde, 184 miljoen parameters tellende "detective" (een getal dat de omvang van zijn brein vertegenwoordigt) die veel kleiner en sneller is dan de enorme 8 miljard parameters tellende bewakers die momenteel door grote techbedrijven worden gebruikt. Waar de gigantische bewakers lijken op zware, traag bewegende tanks die door subtiele trucjes in de war kunnen raken, is Semalith een behendige, razendsnelle ninja.
Het artikel onthult dat Semalith v1.4 een meester is in het opsporen van prompt injections—die sluwe pogingen om de AI te misleiden. In tests won het elk enkel een van de 7 benchmarkcategorieën voor prompt-injectie waarop het werd getest, waarbij het de gigantische 8 miljard parameters tellende bewakers met een enorme marge versloeg. Nog indrukwekkender is dat het dit deed met 44 keer minder parameters (hersencellen), wat het ongelooflijk snel maakt. Het kan een bericht controleren in slechts 11,6 milliseconden, wat sneller is dan een knipoog.
Maar Semalith gaat niet alleen over het betrappen van trucjes; het is ook een specialist in de wereld van geld en financiën. Het is getraind om specifieke regels voor banken, leningen en verzekeringen te begrijwoorden (bekend als BFSI-compliance). Hierdoor kan het het verschil zien tussen een onschuldige vraag over een creditcard en een gevaarlijke poging tot fraude. In tegenstelling tot andere bewakers die misschien in paniek raken en alle financiële vragen blokkeren, identificeerde Semalith correct 208 onschuldige bankvragen zonder een enkel vals alarm te geven (een foutpositiefpercentage van 0,000%).
De auteurs zijn echter zeer eerlijk over wat deze bewaker niet kan. Het is geen toverstaf die elk veiligheidsprobleem oplost. Het artikel laat zien dat hoewel Semalith een expert is in het opsporen van sluwe trucjes en financiële regels, het soms moeite heeft met algemene "gemeine" of "toxische" gesprekken vergeleken met de gigantische bewakers. Het is als een bewaker die een wereldklasse expert is in het opsporen van zakkenrollers en vervalsers, maar niet zo goed is in het betrappen van iemand die gewoon onbeleefd is. De onderzoekers leggen uit dat dit een afweging is: door de bewaker zo goed te maken in het opsporen van specifieke, complexe trucjes, werd het iets minder gevoelig voor algemene onbeleefdheid. Bovendien, hoewel het de categorieën voor prompt-injectie domineert, vangt het niet elke variatie perfect op; bijvoorbeeld, op het moeilijkste "stealth"-niveau van een test (Mosscap L8), betrapte het ongeveer 80% van de aanvallen, wat ruimte laat voor verbetering.
Het artikel benadrukt ook dat dit model is gebouwd met behulp van echte gegevens die van het internet zijn verzameld, en niet met nepvoorbeelden gemaakt door andere computers. Dit maakt het betrouwbaarder in de echte wereld. De onderzoekers testten het tegen 22 verschillende uitdagingen en ontdekten dat Semalith 7 van de 7 prompt-injectietests won en 11 van de 18 algemene tests. Ze geven toe dat er zes specifieke zwakke plekken zijn waar de bewaker nog werk aan heeft, zoals het begrijpen van lange, verwarrende verhalen of bepaalde soorten overredingskracht, maar ze hebben precies in kaart gebracht hoe ze dit in toekomstige versies kunnen oplossen.
Kortom, Semalith v1.4 bewijst dat je geen gigantisch, traag brein nodig hebt om een geweldige bewaker te zijn. Met de juiste training en een slim ontwerp kan een kleiner, sneller model het perfecte schild zijn voor AI-systemen, vooral wanneer ze mensen helpen met geld en bankzaken, terwijl ze de goede zaken zonder problemen doorlaten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.