← Nieuwste papers
💻 computer science

Private Direct Preference Optimization for LLM Alignment

Dit artikel introduceert PrivDPO, een nieuwe Direct Preference Optimization-methode die een gespecialiseerde "preference privacy"-garantie afdwingt door uitsluitend gekalibreerde ruis toe te voegen langs de eendimensionale preferentieas, waardoor een sterke privacy-utiliteit-afweging wordt bereikt voor de afstemming van grote taalmodellen zonder de biases van standaard privacy-benaderingen.

Oorspronkelijke auteurs: Yangfan Jiang, Fei Wei, Ergute Bao, Xiaokui Xiao, Yaliang Li, Bolin Ding

Gepubliceerd 2026-08-06
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yangfan Jiang, Fei Wei, Ergute Bao, Xiaokui Xiao, Yaliang Li, Bolin Ding

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot leert hoe hij beleefd, behulpzaam en veilig moet zijn. Je vertelt de robot niet alleen regels; je laat hem voorbeelden zien. Je geeft de robot een vraag, en hij schrijft twee verschillende antwoorden. Vervolgens kijkt een mens naar beide en zegt: "Ik vind Antwoord A beter dan Antwoord B." Dit proces wordt "alignment" genoemd, en dit is hoe we AI-modellen leren zich te gedragen als goede burgers in plaats van chaotische lastposten. De robot leert door naar duizenden van deze "A vs. B"-keuzes te kijken.

Maar hier komt de crux: die keuzes zijn niet zomaar datapunten; het zijn menselijke meningen. Als een mens een politieke mening of een specifieke ethische opvatting heeft, is die voorkeur een geheim. Als we de robot trainen met deze geheimen zonder bescherming, kan de robot per ongeluk onthouden wie wat zei, of kan het trainingsproces zelf die geheimen lekken aan een nieuwsgierige observator. Het is alsof je een klas probeert te onderwijzen door studenten te laten stemmen, maar de stemhokjes open laat zodat iedereen kan zien wie op wat heeft gestemd. Standaard privacytools bestaan wel, maar die zijn als het gebruik van een sloophamer om een noot te kraken: ze beschermen alles (zelfs de publieke vragen en de antwoorden van de robot) door zoveel "ruis" of verwarring toe te voegen dat de robot in de war raakt en effectief stopt met leren. We hebben een manier nodig om alleen de geheime stem te beschermen zonder de les te verstoren.

Dit is precies het probleem dat een nieuw artikel aanpakt van onderzoekers van de National University of Singapore en Alibaba. Ze introduceren een slimme nieuwe methode genaamd PrivDPO (Private Direct Preference Optimization). Hun grote idee is dat in de wiskunde achter het trainen van deze robots, het "geheim" (de menselijke voorkeur) slechts langs een zeer specifiek, eendimensionaal pad reist, zoals een enkele draad in een enorm elektriciteitsnetwerk. De rest van het netwerk is gewoon publieke informatie. In plaats van het hele netwerk te verwarren, injecteert PrivDPO een klein, zorgvuldig berekend beetje willekeur alleen langs die enkele draad.

Denk aan een spelletje "Telefoontje" waarbij je de naam van degene die het geheime bericht fluisterde wilt verbergen. Standaard privacymethoden zouden ervoor zorgen dat iedereen een volledig ander, onzinnig verhaal fluistert, waardoor de uiteindelijke boodschap betekenisloos wordt. PrivDPO realiseert zich echter dat het geheim alleen in de richting zit van de boodschap die wordt doorgegeven. Dus het verandert de boodschap af en toe of past het volume net genoeg aan om een spion te verwarren, maar het doet dit op een manier dat de boodschap, gemiddeld genomen, nog steeds perfect wordt doorgegeven. De onderzoekers ontdekten dat deze aanpak hen in staat stelt om enorme AI-modellen (tot 32 miljard parameters!) te trainen terwijl de menselijke voorkeuren privé blijven. Ze bewezen wiskundig dat deze methode privaat is en toonden via experimenten aan dat de AI net zo goed leert als wanneer er geen privacybescherming zou zijn, in tegen tegenstelling tot oudere methoden die de AI aanzienlijk dommer maakten.

De Kernontdekking: De Stem Verbergen, Niet het Stembiljet

De belangrijkste bevinding van het artikel is dat je menselijke voorkeuren in AI-training kunt beschermen zonder het vermogen van de AI om te leren op te offeren, mits je stopt met het behandelen van de hele trainingsvoorbeelden als een geheim. De auteurs stellen dat in Direct Preference Optimization (DPO), het gevoelige deel slechts de "stem" is (welk antwoord is beter), terwijl de vraag en de twee antwoorden meestal publieke kennis zijn.

Ze sluiten expliciet twee veelvoorkomende benaderingen uit:

  1. Standaard Differential Privacy (DP-SGD): Ze laten zien dat het toepassen van standaard privacytools op het hele trainingsproces een ramp is voor grote modellen. Het vereist zoveel "ruis" om de publieke delen van de data te beschermen dat de AI de voorkeuren helemaal niet meer leert. In hun tests zorgde deze methode ervoor dat de prestaties van de AI zo laag waren dat het nauwelijks beter was dan willekeurig gokken.
  2. Randomized Response (RR): Dit is een eenvoudigere methode waarbij je de stem simpelweg omdraait (bijvoorbeeld zeggen "A is beter" wanneer het eigenlijk "B is beter" is) met een bepaalde waarschijnlijkheid. Het artikel laat zien dat dit een "bias" creëert. Het is also kind als je een munt opwerpt om de stem te beslissen; hoewel het de waarheid verbergt, introduceert het ook een consistente fout die de AI de verkeerde lessen laat leren.

In plaats daarvan suggereren en bewijzen ze dat PrivDPO het ideale midden is. Door de manier waarop de AI leert wiskundig te analyseren, ontdekten ze dat het verschil tussen twee trainingsvoorbeelden (waarbij alleen de voorkeur is omgedraaid) ligt op een specifieke "as" die door de tekst wordt bepaald. Ze ontwierpen een algoritme dat willekeur toevoegt alleen aan de sterkte van het leersignaal langs deze as, in plaats van aan het geheel.

Hoe het werkt: De "Magische Gewicht"-truc

Om PrivDPO te begrijpen, stel je voor dat je een docent bent die een essay van een student beoordeelt. Je hebt twee versies: Versie A (goed) en Versie B (slecht). Je wilt de student vertellen: "Doe meer van A, minder van B."

In standaard training geef je een duidelijke instructie: "Verhoog A met 10 punten."
In de methode "Randomized Response" (die het artikel als slecht bestempelt), gooi je misschien een munt. Als het kop is, zeg je: "Verhoog A met 10." Als het munt is, zeg je: "Verhoog B met 10." Dit verwart de student, en de student leert de verkeerde dingen.

In PrivDOP doet de docent iets slimmer. De docent weet dat de student wordt bekeken door een spion die wil weten of de student echt een voorkeur heeft voor A of B. De docend zegt: "Ik ga je een 'magisch gewicht' geven waarmee je je instructie vermenigvuldigt."

  • Soms geven ze een gewicht van 1,2 (maakt de instructie sterker).
  • Soms geven ze een gewicht van 0,8 (maakt de instructie zwakker).
  • Cruciaal is dat ze dit doen op een manier dat als je alle instructies over de tijd middelt, de student nog steeds exact de juiste boodschap krijgt: "Verhoog A met 10."

De spion ziet de docent met verschillende getallen roepen (1,2, 0,8, 1,1, enzovoort) en kan niet weten of de oorspronkelijke voorkeur A of B was omdat de getallen door elkaar gehusseld zijn. Maar de student, die over veel voorbeelden heen leert, middelt de ruis eruit en leert perfect.

De Resultaten: Grote Modellen, Grote Privacy

De onderzoekers testten dit op drie verschillende soorten AI-modellen (Qwen, Llama en Pythia) variërend van 3 tot 32 miljard parameters. Ze gebruikten drie verschillende datasets van menselijke voorkeuren.

De resultaten waren duidelijk:

  • Privacy: PrivDPO beschermde de voorkeuren succesvol. Ze voerden een "memorizatietest" uit om te zien of de AI specifieke voorbeelden die het eerder had gezien, kon raden. Standaard AI-modellen (zonder privacy) konden ongeveer 9,76% van de tijd correct raden op de Anthropic-HH dataset, wat aantoonde dat ze de geheimen hadden onthouden. PrivDPO bracht dit terug naar bijna nul (0,01%), wat betekent dat de geheimen effectief verborgen bleven.
  • Prestaties: In tegen tegenstelling tot de "sledgehammer" privacy-methoden die de AI dom maakten, hield PrivDPO de AI slim. Op de Anthropic-HH dataset kreeg de standaard niet-private AI een "Reward Margin" (een score van hoe goed het heeft geleerd) van 0,393. PrivDPO met een sterke privacy-instelling (ϵ=1\epsilon=1) kreeg 0,359. Dit is heel dichtbij! In contrast hiermee kreeg de standaard privacy-methode (DP-SGD) een score van slechts 0,01, wat een totale mislukking is.
  • Snelheid: Omdat PrivDPO geen complexe privacy-berekeningen voor elk stukje data hoeft te maken (het past alleen de wiskundige vergelijking licht aan), draait het bijna net zo snel als de niet-private versie. Ze vonden dat het slechts een verwaarloosbare hoeveelheid tijd toevoegde aan het trainingsproces, zelfs voor de grootste 32-miljard-parameter modellen.

Waarom dit ertoe doet

Het artikel concludeert dat we niet hoeven te kiezen tussen privacy en prestaties. Lange tijd dachten mensen dat als je menselijke data in AI-training wilde beschermen, je moest accepteren dat je een minder slimme AI zou krijgen. Dit artikel suggereert dat door de specifieke wiskunde te begrijpen van hoe AI leert van voorkeuren, we een "privacyschild" kunnen bouwen dat dun genoeg is om het leren door te laten, maar dik genoeg om de spionnen tegen te houden.

De auteurs merken op dat dit specifiek werkt voor de huidige manier waarop AI wordt afgestemd (DPO) en mogelijk aanpassingen vereist voor andere methoden. Ze wijzen ook erop dat hoewel hun methode de voorkeur (de stem) beschermt, het niet magisch de inhoud van de vragen of antwoorden verbergt als die van zichzelf al geheim waren. Maar voor het overgrote deel van de gevallen waar de vragen publiek zijn en alleen de menselijke mening privé is, biedt deze nieuwe methode een praktische, schaalbare en effectieve manier om AI te bouwen die onze geheimen respecteert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →