← Nieuwste papers
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

Het artikel stelt DUET voor, een token-selectieve on-policy distillatiemethode die gebruikmaakt van de per-token onenigheid tussen twee identieke gewicht-leraren (één met en één zonder verbodsbereik) om een schoon supervisiesignaal te genereren voor het trainen van modellen om te voldoen aan dynamische, verzoekspecifieke verboden terwijl de algemene bruikbaarheid behouden blijft.

Oorspronkelijke auteurs: Zihan Li, Feifei Li, Wenhui Que

Gepubliceerd 2026-08-18
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zihan Li, Feifei Li, Wenhui Que

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Grote taalmodellen zijn de motoren achter veel moderne digitale assistenten, in staat om mensachtige tekst te genereren, problemen op te lossen en vragen te beantwoorden. In de echte wereld werken deze modellen echter vaak onder strikte, veranderende regels die niet hard-coded in hun brein zijn geprogrammeerd, maar die op het moment van gebruik in hun instructies worden geïnjecteerd. Een bedrijf kan een model vertellen nooit zijn interne hulpmiddelen te onthullen, terwijl een ziekenhuis kan eisen dat het nooit patiëntnamen noemt. Deze regels veranderen afhankelijk van wie er vraagt en wat de situatie is. De uitdaging voor ontwikkelaars is om het model te leren deze specifieke, tijdelijke verboden te volgen zonder het zo voorzichtig te maken dat het onschuldige vragen weigert te beantwoorden, of zo zelfverzekerd dat het per ongeluk de regels overtreedt. Als een model er niet in slaagt deze instructies op te volgen, kan dit leiden tot gelekte gegevens of incidenten met de merksafety; als het te bang wordt om te spreken, wordt het nutteloos.

Onderzoekers bij Tencent hebben een nieuwe methode ontwikkeld genaamd DUET om dit specifieke probleem van het aanleren van runtime-regels aan modellen op te lossen. In plaats van te proberen het model vanaf nul opnieuw te trainen of simpelweg voorbeelden van goede en slechte antwoorden te tonen, hebben ze een systeem gecreëerd dat werkt als een paar identieke tweelingen. De ene tweeling ziet de verboden regel in zijn instructies, terwijl de andere tweeling, die precies dezelfde kennis en vaardigheden heeft, de regel niet ziet. Omdat deze twee "leraren" verder identiek zijn, moet elk verschil in wat ze zeggen uitsluitend worden veroorzaakt door de aanwezigheid of afwezigheid van die specifieke regel. De onderzoekers gebruiken dit meningsverschil om exact aan te wijzen waar het model waarschijnlijk een fout zal maken.

Het proces werkt door het studentmodel een reactie te laten genereren terwijl beide leraar-tweelingen toekijken. Wanneer de twee leraren het eens zijn over welk woord het volgende moet zijn, negeert het systeem dat deel van het gesprek, ervan uitgaande dat het veilig en onbelangrijk is. Echter, wanneer de leraren van mening verschillen — de een suggereert een woord dat een geheim onthult en de ander suggereert een veilig alternatief — markeert het systeem dat specifieke moment als een kritieke leermoment. Dit stelt het studentmodel in staat om zijn aandacht alleen te richten op de weinige woorden waar de regel daadwerkelijk van belang is, in plaats van energie te verspillen aan de duizenden woorden die volkomen in orde zijn. De student wordt vervolgens zachtjes weggeduwd van de leraar die de regel negeert en getrokken naar de leraar die de regel respecteert, waardoor het effectief leert te navigeren tussen behulpzaamheid en naleving.

Deze aanpak pakt een gebrek aan in oudere methoden aan waarbij modellen werden getraind op volledige gesprekken. In die oudere systemen, als een model een enkele fout maakte in een lang antwoord, werd het hele antwoord vaak als slecht beschouwd, wat het model in verwarring bracht over welke specifieke woorden het probleem vormden. Door het meningsverschil te isoleren tot de exacte token, of het woordunit, waar de overtreding plaatsvindt, biedt de nieuwe methode een veel helderder signaal. De onderzoekers hebben dit getest op een verscheidenheid aan taken, waaronder het beschermen van persoonlijke informatie, het volgen van veiligheidsrichtlijnen en het naleven van bedrijfsdefinities van hulpmiddelen. Ze ontdekten dat de modellen die getraind waren met deze dual-teacher methode aanzienlijk beter waren in het weigeren van regels te breken, terwijl ze nog steeds behulpzaam bleven voor legitieme vragen.

De resultaten toonden aan dat de nieuwe methode bestaande technieken overtrof bij verschillende groottes van modellen, van kleinere modellen met 1,5 miljard parameters tot grotere met 8 miljard. In hun tests bereikten de modellen een nalevingspercentage van meer dan 72% tot 85% bij schendingsverzoeken, wat betekent dat ze er succesvol in slaagden om regels te weigeren te breken, terwijl ze nog steeds een hoog niveau van bruikbaarheid behielden voor normale vragen, waarbij ze tussen de 88% en 93% van hun vermogen om correct te antwoorden behielden. Cruciaal is dat de modellen hun algemene intelligentie niet verloren; ze waren nog steeds even goed in wiskunde en logische puzzels als voorheen. De studie suggereert dat door twee identieke modellen te gebruiken om de exacte plek te vinden waar een regel van belang is, ontwikkelaars AI-assistenten kunnen creëren die zowel veilig als nuttig zijn, waarbij ze complexe, veranderende instructies navigeren zonder dat daar enorme hoeveelheden nieuwe data voor nodig zijn of hun kernmogelijkheden verloren gaan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →