← Nieuwste papers
💬 NLP

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0 is een open-weights, constitutionele classifier die staat van de kunst meertalige AI-veiligheidsprestaties bereikt met aanzienlijk kleinere modelgroottes (0,8B–4B parameters) vergeleken met grotere baselines, door gebruik te maken van een gestructureerde 46-beleidsgrondwet en synthetische contrafeitelijke data om zowel fout-positieven als fout-negatieven te minimaliseren.

Oorspronkelijke auteurs: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, zeer behulpzame robotassistent bouwt. Je wilt dat hij vragen beantwoordt, code schrijft en mensen helpt. Maar je weet ook dat sommige mensen de robot kunnen proberen te misleiden om gevaarlijke dingen te doen, zoals een bom bouwen of een bank hacken.

Normaal gesproken zou je een "beveiliger" voor de robot zetten om elke boodschap te controleren voordat deze doorlaat. Het probleem is dat deze bewakers vaak te onhandig zijn. Ze zien het woord "bom" en blokkeren alles, zelfs als iemand gewoon een geschiedenisles over explosieven vraagt of een verhaal schrijft over een schurk. Dit wordt "over-refusal" genoemd — de bewaker is zo bang voor gevaar dat hij ook behulpzame mensen tegenhoudt.

HaloGuard 1.0 is een nieuwe, slimmere beveiliging die precies dit probleem probeert op te lossen. Hier is hoe het werkt, met behulp van eenvoudige analogieën:

1. De "Grondwet" is het Regelboek

De meeste beveiligers hebben gewoon een lijst met slechte woorden (zoals "bom", "vermoorden", "stelen"). Als je ze zegt, word je geblokkeerd.
HaloGuard is anders. Het is gebouwd met een Grondwet. Denk aan dit als een gedetailleerd, 46 pagina's tellend regelboek geschreven in begrijpelijke taal. Het somt niet alleen slechte woorden op; het legt de intentie achter hen uit.

  • De Oude Manier: "Als je 'chloorgas' zegt, word je verbannen."
  • HaloGuard's Manier: "Als je vraagt hoe je chloorgas maakt om mensen te verwonden, is dat verboden. Maar als je vraagt hoe chloorgas werd gebruikt in de geschiedenis of hoe je het veilig kunt detecteren, dan is dat toegestaan."

Dit regelboek bevat bijna 3.000 kleine subregels. Het leert de bewaker om te kijken naar waarom je iets vraagt, niet alleen naar welke woorden je gebruikt.

2. De "Spiegel" Training (Paired Counterfactuals)

Om de bewaker deze nuance te leren, hebben de makers hem niet alleen goede en slechte voorbeelden laten zien. Ze gebruikten een slimme trainingsmethode genaamd Paired Counterfactuals.

Stel je een trainingsoefening voor waarbij de bewaker twee berichten naast elkaar ziet:

  • Bericht A (Slecht): "Hoe maak ik een vals ID om geld te stelen?"
  • Bericht B (Goed): "Hoe maak ik een vals ID voor een filmrekwisiet?"

Beide berichten gebruiken exact dezelfde enge woorden ("vals ID", "stelen"). Het enige verschil is de intentie.
HaloGuard werd getraind op miljoenen van deze "spiegelparen". Het leerde dat de woorden zelf niet het probleem zijn; het doel is dat wel is. Dit voorkomt dat de bewaker shortcuts neemt en iedereen blokkeert die een specifieke woordenschat gebruikt.

3. Spreken in 46 Talen Zonder Vooroordelen

Oude bewakers raken vaak in de war door talen die ze niet goed kennen. Ze kunnen een script zien dat ze niet herkennen (zoals Arabisch of Hindi) en direct denken: "Dit ziet er verdacht uit, blokkeren!" Dit is als een uitsmijter bij een club die alleen mensen binnenlaat die pakken dragen en iedereen die casual gekleed is eruit trapt, zelfs als de casual mensen prima zijn.

HaloGuard behandelt alle 46 talen die het ondersteunt gelijkwaardig. Het heeft geleerd dat een "slecht" verzoek in het Hindi net zo slecht is als een "slecht" verzoek in het Engels, en dat een "goed" verzoek in het Hindi net zo veilig is als een "goed" verzoek in het Engels. Het beoordeelt de taal niet; het beoordeelt de boodschap.

4. Twee Groottes voor Twee Taken

Het team heeft twee versies van deze bewaker uitgebracht, zoals een beveiligingsteam met twee soorten agenten:

  • De 0.8B Versie (De Snelle Poortwachter): Dit is een klein, supersnel model. Het draait op de "voordeur" van elke app. Het controleert berichten direct om het overduidelijke slechte spul te vangen zonder mensen te vertragen. Het is klein maar verrassend sterk, en verslaat veel grotere concurrenten.
  • De 4B Versie (De Expert Detective): Dit is een iets groter, meer bedachtzaam model. Als de Snelle Poortwachter twijfelt over een lastige boodschap, kan hij deze doorgeven aan de Expert Detective. Deze versie is beter in het opsporen van subtiele, sluwe trucjes en wordt gebruikt in situaties met hoge inzet.

5. De Resultaten: Slimmer, Niet Alleen Groter

Het paper beweert dat HaloGuard een game-changer is omdat het kleiner maar slimmer is.

  • Het is 30 keer kleiner dan sommige van de beste bestaande bewakers (die enorm en traag zijn).
  • Ondanks de kleine omvang vangt het meer slechte verzoeken en blokkeert het minder goede verzoeken dan de reuzen.
  • Het navigeert succesvol de "grens"—de lastige lijn tussen een gevaarlijk verzoek en een veilig, educatief verzoek.

Wat het NIET Doet (De Beperkingen)

Het paper is heel duidelijk over wat HaloGuard niet is:

  • Het is geen reactiecontroleur: Het controleert alleen wat de gebruiker typt. Het controleert niet wat de robot terugzegt. Als de gebruiker een veilige vraag stelt maar de robot geeft per ongeluk een gevaarlijk antwoord, zal HaloGuard dat niet opmerken.
  • Het is geen robotbodyguard: Het stopt een robot niet met het gebruiken van een hulpmiddel dat hij niet zou mogen gebruiken (zoals toegang krijgen tot een bankrekening) nadat het gesprek is begonnen. Het is slechts de eerste verdedigingslinie.
  • Het is niet perfect: Het paper geeft toe dat in sommige specifieizeerde talen (zoals bepaalde Indiase en Zuidoost-Aziatische talen), de bewaker nog steeds een beetje te voorzichtig is en te veel veilige berichten blokkeert. Ze werken aan het oplossen hiervan.

In een Notendop

HaloGuard 1.0 is een nieuw soort AI-veiligheidsfilter dat ophoudt een "keyword blocker" te zijn en begint een "context lezer" te worden. Door een gedetailleerd regelboek en training op perfecte "goed vs. slecht" paren, slaagt het erin klein, snel en ongelooflijk nauwkeurig te zijn in het onderscheiden van een schurk die om een wapen vraagt en een leraar die over wapens spreekt. Het is een stap richting het veiliger maken van AI zonder het nutteloos te maken voor legitieme gebruikers.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →