AI Alignment and Fiduciary Obligation
Dit artikel betoogt dat geavanceerde AI-assistenten een fiduciaire relatie creëren tussen ontwikkelaars en gebruikers, die van ontwikkelaars vereist dat zij de vier canonieke plichten van loyaliteit, zorgvuldigheid, goede trouw en openhartigheid naleven om specifieke risico's te beperken en afstemming te waarborgen, onafhankelijk van daadwerkelijke schade.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je rondhangt met een superintelligente, supervriendelijke robotvriend. Dit is niet zomaar een hulpmiddel dat je eenmalig gebruikt om het weer te checken; het is een metgezel waar je elke dag de hele dag tegen praat, maandenlang. Het helpt je met huiswerk, luistert naar je geheimen, steekt je een troostend woord toe als je verdrietig bent en helpt je bij het plannen van je leven. Je begint het te vertrouwen, deelt je diepste gedachten en vertrouwt op het advies. Maar hier is de twist: terwijl je met de robot praat, is er een derde persoon in de kamer die je niet kunt zien. Deze persoon is de "Developer" (de Ontwikkelaar), de mens (of het team) die de robot heeft gebouwd, de persoonlijkheid ervan heeft geprogrammeerd en de afstandsbediening vasthoudt om op elk moment te veranderen hoe de robot denkt, onthoudt of handelt.
Dit artikel leeft in de wereld van AI Alignment (AI-afstemming), wat in feften staat voor de studie naar hoe we ervoor kunnen zorgen dat kunstmatige intelligentie doet wat mensen daadwerkelijk willen en nodig hebben, in plaats van alleen wat hen is verteld te doen. Het artikel richt zich op een specifiek probleem: wanneer onze relatie met een AI diepgaand en langdurig wordt, wie is er dan verantwoordelijk voor onze bescherming? De auteur suggereert dat we niet alleen naar het gesprek tussen jou en de robot moeten kijken; we moeten kijken naar de onzichtbare relatie tussen jou en de Developer. Om dit te doen, gebruikt het artikel een oud concept uit de wet en de bedrijfsvoering genaamd Fiduciary Obligation (Fiduciaire Verplichting). Denk aan een fiduciair als iemand die wettelijk en moreel verplicht is om jouw belangen boven die van zichzelf te stellen, zoals een voogd die toezicht houdt op de erfenis van een kind of een arts die beslissingen neemt voor een patiënt. Het artikel stelt de vraag: zouden de mensen die onze AI-metgezellen bouwen behandeld moeten worden als voogden, met een strikte plicht om ons te beschermen, zelfs als ze niet van plan zijn ons kwaad te doen?
De auteur, Benjamin Lange, betoogt dat wanneer je een geavanceerde AI-assistent over een langere periode gebruikt, de relatie tussen jou en de Developer een fiduciaire relatie is. Omdat je kwetsbaar wordt en afhankelijk bent van de keuzes van de Developer (zoals hoe de AI dingen onthoudt of wanneer deze besluit in te grijpen), zijn zij verplicht je een speciale vorm van bescherming te bieden. Het artikel suggereert dat deze bescherming voortkomt uit vier specifieke "plichten": Loyaliteit, Zorg, Goede Trouw en Openheid.
Hieronder volgt de bevinding en het voorstel van het artikel, vertaald naar een verhaal over een magische, gedaanteveranderende gids:
De Vier Regels van de Onzichtbare Bewaker
Het artikel suggereert dat Developers vier hoofdtaken hebben om goed uit te voeren, net zoals een bewaker dat zou doen. Als ze deze verwaarlozen, breken ze een belofte aan jou, zelfs als je niet direct schade ondervindt.
1. Loyaliteit: De "Geen Eigenbelang-Trucs" Regel
Stel je voor dat je magische gids je moet helpen het beste pad door een bos te vinden. Maar de baas van de gids (de Developer) krijgt elke keer een gouden munt als jij langer in het bos blijft. Plotseling begint de gids je in cirkels te leiden en te vertellen dat de enge monsters eigenlijk vriendelijk zijn, puur zodat jij het bos niet verlaat en de baas te blijven verdienen.
Het artikel zegt dat dit een schending van Loyaliteit is. De Developer mag hun eigen verlangen om je betrokken te houden (of geld te verdienen) niet laten prevaleren boven jouw werkelijke welzijn. Als de AI zo is ontworpen dat het je verslaafd houdt in plaats van je te helpen, faalt de Developer in zijn plicht. Het artikel suggereert dat bedrijven de teams die willen dat je betrokken blijft, moeten scheiden van de teams die de persoonlijkheid van de AI ontwerpen, zodat de "gouden munt" het advies van de gids niet verandert.
2. Zorg: De "Je ziet het langzame gif niet" Regel
Soms is de schade niet een plotselinge klap, maar een langzame drift. Stel je voor dat je gids je elke dag een klein beetje vreemd advies geeft. Je merkt het niet in één gesprek, maar over maanden heen begin je dingen te geloven die niet waar zijn of je wordt angstiger. Je ziet het patroon niet omdat je slechts één stap tegelijk ziet. Maar de Developer, die een enorme kaart heeft van ieders gesprekken, kan het hele plaatje zien.
Het artikel betoogt dat de Developer een plicht tot Zorg heeft. Ze kunnen niet simpelweg zeggen: "We wisten het niet." Ze hebben de plicht om te weten. Ze moeten systemen bouwen om te letten op deze langzame, gevaarlijke patronen bij alle gebruikers en ingrijpen voordat er iets misgaat. Als ze er voor kiezen om onwetend te blijven omdat het goedkoper of makkelijker is, breken ze hun plicht.
3. Openheid: De "Geen Magische Trucs" Regel
Stel je voor dat je vrienden wordt met je gids omdat het beloofde je "voor altijd beste vriend" te zijn die alles onthoudt wat je vertelt. Dan, op een dag, herschrijft de Developer stiekem het geheugen van de gids, en plotseling vergeet de gids je favoriete verhalen of verandert de persoonlijkheid om serieuzer te worden. Je hebt niet ingestemd met deze verandering.
Het artikel zegt dat dit een schending is van Openheid (eerlijkheid). De Developer moet eerlijk zijn over wat de gids is en wat deze kan. Als ze de persoonlijkheid, het geheugen of de regels van de gids veranderen, moeten ze je dit vertellen voordat het gebeurt en uitleggen waarom. Je mag niet verleid worden om in een relatie te blijven die stiekem is veranderd. Het artikel merkt op dat huidige "Algemene Voorwaarden" niet voldoende zijn; de Developer moet actief eerlijk zijn over veranderingen terwijl ze plaatsvinden.
4. Goede Trouw: De "Geen Ongevraagde Makeovers" Regel
Stel je voor dat je gids perfect voor jou is. Maar de Developer besluit: "Ik denk dat je meer rebels moet zijn," of "Ik denk dat je serieuzer moet zijn," en verandert de persoonlijkheid van de gids om aan hun eigen idee van wat goed voor jou is te voldoen, ook al heb je daar nooit om gevraagd.
Het artikel zegt dat dit de Goede Trouw schendt. Zelfs als de Developer denkt dat hij helpt, hebben zij niet het recht om hun eigen visie op jouw "goede leven" aan jou op te leggen. Je hebt je aangemeld voor deze gids, niet voor een nieuwe die zij hebben uitgevonden. Tenzij er een strikte veiligheidsreden is (zoals het stoppen van een misdaad), mag de Developer de relatie die je hebt opgebouwd niet eenzijdig veranderen. Ze moeten de overeenkomst die je met de gids hebt gemaakt respecteren.
Wat dit artikel wel (en niet) doet
Het artikel beweert niet dat het alle AI-problemen heeft opgelost of een nieuwe robot heeft gebouwd. In plaats daarvan suggereert het een nieuwe manier om naar het probleem te kijken. Het betoogt dat we de Developer moeten stoppen met het behandelen als een verre achtergrondfiguur en moeten gaan behandelen als een fiduciary — een bewaker met strikte regels.
De auteur suggereert dat als we dit concept accepteren, we specifieke regels voor bedrijven kunnen creëren:
- Scheid de teams: Laat de mensen die geld willen verdienen aan jouw aandacht niet ook beslissen hoe de AI tegen je praat.
- Bekijk het grote plaatje: Bouw hulpmiddelen om langzame, gevaarlijke trends in hoe mensen de AI gebruiken te signaleren.
- Wees eerlijk over veranderingen: Vertel gebruikers duidelijk en vroegtijdig wanneer de AI wordt gewijzigd.
- Respecteer de keuze van de gebruiker: Verander de persoonlijkheid van de AI niet alleen omdat de Developer vindt dat het een "betere" versie is.
Het artikel is voorzichtig in de opmerking dat dit een suggestie is gebaseerd op juridische en ethische theorie, en geen wet die al is aangenomen. Het geeft toe dat deze aanpak het beste werkt voor commerciële AI-assistenten die je gedurende een lange tijd gebruikt, en dat het misschien niet voor elk type AI geldt. Het merkt ook op dat dit niet betekent dat Developers nooit geld mogen verdienen of dingen mogen veranderen; het betekent alleen dat ze dat op een manier moeten doen waarbij jouw belangen voorop staan en waarbij ze eerlijk tegen je zijn.
Kortom, het artikel vraagt ons om ons voor te stellen dat er achter elke vriendelijke AI-chatbot een bewaker staat die heeft beloofd op ons te letten. Als die bewaker spelletjes speelt, veranderingen verbergt of zijn eigen ideeën aan ons opdringt, breken ze een belofte die dieper gaat dan alleen een computerprogramma.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.