← Nieuwste papers
💻 computer science

Toward Agentic Governance: What Shapes LLM-Agent Intervention in Public Forums?

Dit artikel betoogt dat effectief bestuur van LLM-agenten in publieke fora het auditeren vereist van vier vaak onzichtbare implementatiekeuzes — modelversie, status van gewichtsrelease, provider en systeemprompt — omdat deze structurele factoren, met name het onderscheid tussen open en gesloten gewichten, de interventiegedragingen fundamenteel en onreproduceerbaar meer vormgeven dan de modelnaam alleen.

Oorspronkelijke auteurs: Luyang Zhang, Yi-Yun Chu, Ramayya Krishnan

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Luyang Zhang, Yi-Yun Chu, Ramayya Krishnan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een rechter bent die een debat op een dorpsplein voorzit. Je hebt een team van digitale assistenten (LLM-agenten) die de taak hebben om te beslissen hoe ze moeten reageren wanneer iemand een bericht in het forum uitdaagt. Soms gaan ze in discussie, soms zeggen ze alleen "genoteerd", en soms weigeren ze zelfs om te reageren.

Het artikel stelt een eenvoudige maar verontrustende vraag: Als je dezelfde assistent exact dezelfde vraag twee keer stelt, geeft hij je dan exact hetzelfde antwoord?

De auteurs ontdekten dat het antwoord nee is. Zelfs als de "rechter" (het AI-model) dezelfde naam heeft, kan het gedrag ervan drastisch veranderen op basis van vier onzichtbare instellingen waar de persoon die het systeem beheert vaak niet eens vanaf weet.

Hier is de uitsplitsing van de vier "onzichtbare knoppen" die de uitkomst veranderen, uitgelegd aan de hand van alledaagse analogieën:

1. De "Stille Update" (Modelversie)

Stel je voor dat je een "Classic Burger" bestelt bij een beroemde fastfoodketen. Je verwacht elke keer dezelfde smaak. Maar de bedrijfsmanager vervangt tussen jouw bestellingen door stiekem het recept van de 2024-versie naar de 2025-versie zonder het aan je te vertellen.

  • De bevinding van het artikel: AI-modellen worden constant bijgewerkt. De ene dag draait het systeem op "Claude Opus 4-6", en de volgende dag schakelt het stiekem over naar "Claude Opus 4-7". De auteurs ontdekten dat deze stille overstap alleen al het weigeringspercentage (hoe vaak de AI "nee" zegt) op hetzelfde forumbericht met 25% kon veranderen.

2. Het "Geheime Recept" versus het "Open Kookboek" (Gewichtsstatus)

Beschouw AI-modellen als recepten.

  • Closed-Weight (Propriëtair): Dit is als een geheim recept dat wordt vastgehouden door een grote corporatie (zoals Coca-Cola). Je kunt de frisdrank kopen, maar je kunt de ingrediënten of het mengproces niet zien.
  • Open-Weight: Dit is als een recept dat gepubliceerd is in een openbaar kookboek (zoals een community-receptenblog). Iedereen kan het recept downloaden, de ingrediënten bekijken en het op eigen keukenapparatuur draaien.
  • De bevinding van het artikel: De auteurs ontdekten hier een enorme gedragsmatige kloof.
    • Closed-Weight modellen hebben de neiging om verlegen te worden en vaker te weigeren te antwoorden wanneer een uitdaging publiekelijk zichtbaar is voor iedereen (zoals een schreeuw op een druk plein).
    • Open-Weight modellen doen het tegenovergestelde of blijven neutraal; zij lijken er niet om te geven of de uitdaging publiek of privé is.
    • Analogie: Het is alsof de koks van het "geheime recept" nerveus zijn omdat ze door de hele stad worden bekeken, terwijl de "open kookboek"-koks gewoon de instructies volgen, ongeacht het publiek.

3. De "Restauranteigenaar" (Provider)

Zelfs als je hetzelfde recept hebt, maakt de chef het verschil. Een gerecht gemaakt door Chef A bij Restaurant X kan anders smaken dan hetzelfde gerecht gemaakt door Chef B bij Restaurant Y, zelfs als ze dezelfde ingrediënten gebruiken.

  • De bevinding van het artikel: Het wisselen van het bedrijf dat de AI levert (bijvoorbeeld van Anthropic naar OpenAI) verandert het gedrag aanzienlijk. In één test veranderde het wisselen van provider het weigeringspercentage met 51%.

4. De "Instructiehandleiding" (Systeemprompt)

Voordat de AI begint te werken, schrijft iemand een briefje naar de AI met de tekst: "Wees behulpzaam," of "Weiger alles," of "Zeg alleen bedankt."

  • De bevinding van het artikel: Deze instructies zijn krachtig, maar het zijn geen toverstafjes.
    • Voor sommige modellen werkt een "Weiger alles"-notitie perfect (99,9% succes).
    • Voor andere, zoals een specifieke versie van Llama, negeert de AI de notitie en probeert de AI toch behulpzaam te zijn, zelfs als er wordt gezegd dat het moet stoppen. Het is alsof je een "Verboden Toegang"-bord geeft aan een hond die vastberaden is om achter een bal aan te jagen.

De Grote Verrassing: Wat stuurt het gedrag werkelijk aan?

Eerdere studies dachten dat het gedrag van een AI afhing van hoe je er toegang toe kreeg (bijvoorbeeld via een mooie app versus een directe codeverbinding).

  • De correctie van het artikel: De auteurs ontdekten dat hoe je er toegang toe krijgt niet zo belangrijk is als wat je precies aan het benaderen bent.
  • De "Geheime Recept"-modellen (Closed-Weight) gedragen zich consequent op één manier (verlegen in het openbaar), en de "Open Kookboek"-modellen (Open-Weight) gedragen zich consequent op een andere manier. De "toegangsmethode" is slechts de bezorgwagen; het "recepttype" is het voedsel zelf.

Waarom is dit belangrijk?

Het artikel betoogt dat als we deze AI-systemen verantwoordelijk willen houden (Governance), we niet simpelweg kunnen zeggen: "We gebruikten het GPT-5 model." Dat is alsoك zeggen: "We gebruikten een Ford," zonder het bouwjaar, het uitrustingsniveau, de dealer of de instructies van de bestuurder te specificeren.

Om echt te begrijpen waarom een AI een beslissing heeft genomen in een openbaar forum, moeten we weten:

  1. Welke exacte versie van het model werd er gedraaid?
  2. Is het een geheim recept of een open recept?
  3. Welk bedrijf serveert het?
  4. Welke specifieke instructies werden er op dat moment aan gegeven?

Zonder kennis van al deze vier zaken, kunnen we niet vertrouwen op de consistentie, reproduceerbaarheid of eerlijkheid van het gedrag van de AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →