Effective Segregation of Duties in Agentic Enterprise Authorization: Evaluating Shared-Dependence Risk in Maker–Checker Controls
Dit artikel introduceert het concept van Effectieve Scheiding van Taken (SoD) om onderscheid te maken tussen nominale identiteitsscheiding en werkelijke onafhankelijke verificatie in AI-gestuurde autorisatie, waarbij via een grootschalige P2P-benchmark wordt aangetoond dat effectieve risicobeperking rust op bewijsbemiddeling en heterogene controlemodellen in plaats van loutere onderscheidendheid van actoren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van grote organisaties, van banken tot overheidsinstanties, bestaat er een fundamentele regel voor het waarborgen van de veiligheid: één persoon mag niet de macht hebben om een transactie zowel te starten als af te ronden. Dit principe, bekend als de scheiding van functies, zorgt ervoor dat als één persoon een fout maakt of probeert onbehoorlijk te handelen, een tweede persoon dit opmerkt voordat er iets schadelijks gebeurt. Decennialang vertrouwde dit systeem op twee verschillende mensen die elkaars werk controleerden. Tegenwoordig worden veel van deze taken echter overgedragen aan kunstmatige intelligentie-agenten. Dit zijn softwareprogramma's die documenten kunnen lezen, beslissingen kunnen nemen en zelfs financiële overboekingen kunnen uitvoeren. De vraag waar beveiligingsexperts voor staan, gaat niet langer alleen over het hebben van twee verschillende AI-programma's, maar over de vraag of die twee programma's werkelijk onafhankelijk zijn. Als beide agenten vertrouwen op dezelfde onderliggende technologie, dezelfde bronnen van informatie of dezelfde manier van denken, kunnen ze precies dezelfde fout op hetzelfde moment maken, waardoor de veiligheidscontrole nutteloos wordt.
Een recente studie zette zich af om exact dit scenario te testen. Onderzoekers creëerden een gesimuleerde omgeving gebaseerd op echte inkoopregels, waarbij een AI-agent die optreedt als "maker" een aankoop voorstelt, en een tweede AI-agent die optreedt als "checker" beslist of hij het goedkeurt. Het doel was om te zien hoe vaak de checker er niet in slaagde een slecht voorstel te stoppen. Het team testte verschillende manieren om deze twee agenten op te zetten. In sommige gevallen gebruikten beide agenten hetzelfde type AI-model. In andere gevallen gebruikten ze verschillende modellen. Ze testten ook of de checker de redenering van de maker mocht zien of dat de checker rechtstreeks naar de ruwe feiten moest kijken, en of de checker moest vertrouwen op de informatie die de maker had benadrukt of dat de checker toegang kon krijgen tot de originele, ongefilterde gegevens.
De resultaten waren onomstotelijk. Wanneer het systeem werd opgezet met het hoogste niveau van gedeelde afhankelijkheid — waarbij beide agenten hetzelfde AI-model gebruikten, de checker de redenering van de maker kon zien en de checker alleen de door de maker geselecteerde informatie zag — faalde het veiligheidssysteem meer dan zestig procent van de tijd. In deze situaties stemde de tweede agent simpelweg in met de fouten van de eerste agent, waardoor onveilige transacties konden doorgaan. Echter, toen de onderzoekers de opstelling veranderden om deze gedeelde afhankelijkheden te verminderen, verbeterden de resultaten spectaculair. Door een ander AI-model voor de checker te gebruiken, de redenering van de maker te verbergen en de checker directe toegang te geven tot de originele brongegevens, daalde het foutpercentage tot net boven de dertien procent. Dit betekent dat het hebben van twee verschillende AI-agenten op zichzelf niet genoeg is; de manier waarop ze verbonden zijn en welke informatie ze zien, is veel belangrijker dan hun identiteit.
De studie keek ook naar hoe vaak het systeem goede werk in de weg zat. Een veiligheidscontrole die elk voorstel afwijst, zelfs de veilige, is nutteloos omdat het de bedrijfsvoering stopt. De onderzoekers ontdekten dat de verbeterde opstellingen dit probleem niet veroorzaakten. De systemen die meer slechte voorstellen onderschepten, weigerden niet significant meer goede voorstellen. Dit suggereert dat het mogelijk is om AI-veiligheidscontroles te bouwen die zowel strikt als efficiënt zijn, mits ze zijn ontworpen om de specifieiek vormgegeven valstrikken te vermijden die ervoor zorgen dat ze samen falen.
Een van de meest significante bevindingen ging over de manier waarop informatie tussen de twee agenten stroomt. De grootste verbetering kwam voort uit het feit dat de checker directe toegang kreeg tot het oorspronkelijke bewijs in plaats van te vertrouwen op een samenvatting die door de maker werd verstrekt. Wanneer de maker optrad als tussenpersoon voor de gegevens, was het foutpercentage veel hoger. Dit geeft aan dat de eerste agent onbedoeld, of opzettelijk, de zeer belangrijke details kan wegfilteren die nodig zijn om een fout te ontdekken. Door de tussenpersoon uit te schakelen en de tweede agent de rauwe feiten te laten zien, werd het systeem veel betrouwbaarder. Op dezelfde manier hielp het verbergen van de geschreven uitleg van de eerste agent voor de tweede agent om fouten te verminderen, wat suggereert dat de tweede agent soms werd beïnvloed door de zelfverzekerdheid of logica van de eerste agent in plaats van zich aan de feiten te houden.
De onderzoekers testten ook wat er gebeurt wanneer twee verschillende soorten AI-modellen aan elkaar worden gekoppeld. Ze ontdekten dat het gebruik van een ander model voor de checker de kans aanzienlijk verkleinde dat beide op hetzelfde slechte voorstel zouden falen. Ze merkten echter voorzichtig op dat dit resultaat specifiek was voor de gebruikte combinatie van modellen. Het garandeert niet dat elke twee verschillende AI-modellen altijd goed samen zullen werken, maar het bewijst wel dat het mengen van modellen een krachtige strategie is om de keten van gedeelde fouten te doorbreken. De studie benadrukte ook een praktische uitdaging: een van de combinaties van verschillende modellen was gevoeliger voor technische storingen die de antwoorden onleesbaar maakten. Dit herinnerde de onderzoekers eraan dat veiligheid niet alleen over intelligentie gaat, maar ook over betrouwbaarheid. Als een veiligheidscontrole geen duidelijk antwoord kan produceren, kan het zijn werk niet doen.
Uiteindelijk verandert dit werk de manier waarop we over veiligheid in geautomatiseerde systemen moeten denken. Het laat zien dat de oude regel van "twee verschillende mensen" niet automatisch vertaalt naar "twee verschillende AI-agenten". Als de twee agenten te veel op elkaar lijken in hoe ze denken, wat ze zien of hoe ze zijn gebouwd, zullen ze waarschijnlijk samen falen. Echte veiligheid vereist een doelbewuste ontwerp die de tweede agent dwingt om het probleem vanuit een andere hoek te bekijken, met andere instrumenten en andere informatie. De studie concludeert dat organisaties niet simpelweg kunnen aannemen dat hun AI-veiligheidscontroles werken omdat ze twee agenten hebben. Ze moeten de werkelijke prestaties van die controles meten, om er zeker van te zijn dat de tweede agent werkelijk onafhankelijk is en in staat is om de fouten van de eerste te ontdekken. Alleen door veiligheid te behandelen als een meetbare uitkomst in plaats van een structurele label, kunnen we deze krachtige nieuwe instrumenten vertrouwen met onze meest gevoelige beslissingen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.