← Nieuwste papers
🤖 AI

A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification

Dit artikel presenteert een reproduceerbaar, licentiebewust kennisdistillatie-recept dat kleine, CPU-efficiënte veiligheidsclassificatoren traint om de prestaties van grotere, op GPU georiënteerde guard-modellen te evenaren op adversariële tekst, terwijl het aantal valse alarmen bij onschadelijke prompts aanzienlijk vermindert door middel van per-klasse herbalancering.

Oorspronkelijke auteurs: Edson Rodrigues da Cruz Filho, Paulo Ricardo Ferreira Neves, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielse
Gepubliceerd 2026-08-25
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Edson Rodrigues da Cruz Filho, Paulo Ricardo Ferreira Neves, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn krachtige instrumenten die kunnen schrijven, redeneren en converseren, maar ze zijn niet inherent veilig. Zonder een filter zouden ze schadelijke instructies, haatzaaiende uitlatingen of gevaarlijk advies kunnen genereren. Om dit te voorkomen, plaatsen ontwikkelaars een veiligheidslaag voor deze modellen, een toegewezen systeem dat als een poortwachter fungeert. Deze poortwachter leest elk bericht en beslist of het een beleid overtreedt. Momenteel zijn de beste poortwachters massieve computerprogramma's die gespecialiseerde, dure grafische hardware vereisen om snel te kunnen draaien. Als je ze probeert uit te voeren op een standaard computerprocessor, worden ze pijnlijk traag en doen ze er enkele seconden over om één vraag te beantwoorden. Dit creëert een probleem voor veel toepassingen die op gewone, betaalbare hardware moeten draaien of directe reacties vereisen. De vraag die onderzoekers stelden, was of het mogelijk is om deze massieve veiligheidssystemen terug te brengen naar een omvang die past op een gewone computer, zonder hun vermogen om gevaar te detecteren te verliezen.

Een team van onderzoekers zette zich scharrel om dit op te lossen door een nieuwe methode te ontwikkelen om kleinere veiligheidssystemen te trainen. Ze begonnen met een zeer groot, krachtig veiligheidsmodel waarvan zij vertrouwden op de nauwkeurigheid. Dit grote model fungeerde als een leraar, die een enorme collectie van ongeveer 97.000 verschillende prompts las en deze labelde in zeven specifieke categorieën van schade, zoals fysiek geweld, haatzaaiende uitlatingen of gevaarlijk advies. De onderzoekers trainden vervolgens een vloot van veel kleinere modellen om de oordelen van de leraar na te bootsen. Deze kleinere modellen werden ontworpen om licht genoeg te zijn om op standaard computerprocessors te draaien. Het team was zorgvuldig om ervoor te zorgen dat hun trainingsdata juridisch bruikbaar was voor commerciële producten, waarbij de data in twee groepen werd gesplitst: één die gebruikt kon worden voor publieke software en een andere die uitsluitend gereserveerd was voor onderzoek. Dit stelde hen in staat om precies te meten hoeveel de juridische beperkingen kostten in termen van prestaties.

De resultaten toonden aan dat de kleinere modellen inderdaad effectieve veiligheidswachters konden leren zijn. Wanneer ze werden getest op moeilijke, adversariële tekst die bedoeld was om het systeem te misleiden, presteerde het kleinste generatieve model net zo goed als de massieve leraar, waarbij het diens vermogen om gevaar te detecteren evenaarde. Nog verrassender was dat het kleine generatieve model beter was in het vermijden van valse alarmen. Terwijl de grote leraar soms per ongeluk onschuldige berichten blokkeerde, maakte het kleine generatieve model deze fout minder vaak; het markeerde slechts 3,8 procent van de veilige prompts als gevaarlijk, vergeleken met 4,8 procent voor de grote leraar. Echter, de andere kleine modellen, zoals de encoders en ondiepe netwerken, waren daadwerkelijk slechter dan de leraren in het vermijden van deze valse alarmen. De meest efficiënte oplossing was echter geen generatief model, maar een gespecialiseerde encoder, een type systeem dat specif

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →