← Nieuwste papers
🤖 AI

Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing

Dit position paper betoogt dat om de veilige en betrouwbare inzet van mechanistische interpreteerbaarheid in situaties met een hoog belang mogelijk te maken, de gemeenschap een gestandaardiseerd auditsysteem moet vaststellen met een samenwerkend beoordelingsplatform, door experts geverifieerde richtlijnen en brongebaseerde tracking om methodologische inconsistenties op te lossen en bevindingen te valideren.

Oorspronkelijke auteurs: Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amirali Abdullah

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amirali Abdullah

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Waarom we een "Regelboek" nodig hebben voor AI-detectivewerk

Stel je Mechanistic Interpretability (MI) voor als een team detectives dat probeert uit te zoeken hoe een gigantische, zwarte doos-robot (een neuraal netwerk) denkt. Ze kijken in de tandwielen en circuits van de robot om te verklaren waarom hij bepaalde beslissingen neemt.

Het probleem is volgens dit paper dat, hoewel deze detectives interessante aanwijzingen vinden, ze geen standaardmethode hebben om te controleren of hun werk daadwerkelijk correct is. Op dit moment kan de ene detective zeggen: "De robot denkt zo vanwege Tandwiel A," terwijl een ander zegt: "Nee, het komt door Tandwiel B." Beiden lijken hun werk goed te hebben gedaan, maar ze spreken elkaar tegen. Zonder een manier om hun methoden te auditeren (te controleren), kunnen we hun bevindingen niet genoeg vertrouwen voor het gebruik in levensgevaarlijke situaties, zoals medische diagnoses of zelfrijdende auto's.

De auteurs roepen de gemeenschap op om een nieuw systeem te bouwen om deze experimenten te auditeren, niet slechts één keer, maar continu.


De Driedelige Oplossing

Het paper stelt een driestappenplan voor om dit op te lossen, wat zij vergelijken met het bouwen van een betere bibliotheek en een beter pakket aan regels.

1. De "Levende Bibliotheek" (Continue Reviewing)

Het Probleem: Op dit moment, als een onderzoeker een experiment probeert en het mislukt, of als ze een klein detail vinden dat de conclusie verandert, kunnen ze dat vaak niet formeel publiceren in een wetenschappelijk artikel. Die waardevolle informatie gaat verloren in privé-e-mails, Discord-chats of Twitter-threads. Het is alsof je halve puzzelstukjes weggooit omdat ze nog niet in het plaatje op de doos passen.

De Oplossing: De auteurs willen een Collaboratief Platform bouwen (zoals een gespecialiseerde, super georganiseerde Wikipedia of GitHub voor AI-onderzoek).

  • Hoe het werkt: Onderzoekers kunnen hier alles uploaden: mislukte experimenten, gedeeltelijke resultaten, negatieve bevindingen of kleine correcties.
  • De Analogie: Denk aan dit als een "bouwplaats" voor kennis. In plaats van te wachten tot een gebouw voor 100% voltooid is voordat het aan het publiek wordt getoond, kan iedereen de blauwdrukken, de fouten en de reparaties zien terwijl ze gebeuren. Dit stelt de gemeenschap in staat om het werk "live te reviewen", door op elk moment opmerkingen en verbeteringen toe te voegen, in plaats van alleen te wachten op een eindexamen (peer review).

2. Het "Gemeenschappelijk Regelboek" (Richtlijnen)

Het Probleem: Omdat er geen standaardmethode is om deze experimenten te controleren, gebruiken experts misschien verschillende instrumenten om hetzelfde te meten, wat leidt tot verwarrende resultaten. Het is alsof de ene chef een kop meel meet met een koffiemok en de andere met een wijnglas; de cake zal er anders uitzien en niemand weet waarom.

De Oplossing: De auteurs suggereren dat de eerder genoemde "Levende Bibliotheek" gebruikt moet worden om een door de gemeenschap verfijnde Gids te schrijven.

  • Hoe het werkt: Terwijl mensen experimenten bespreken en beoordelen op het platform, zullen ze patronen herkennen. Ze zullen het eens worden over de "best practices" (bijv. "Test dit altijd op deze specifieke manier" of "Vertrouw dit resultaat nooit zonder X te controleren").
  • De Analogie: Stel je een groep chefs voor die constant elkaars gerechten proeven en over de recepten debatteren. Uiteindelijk schrijven ze een "Gouden Standaard Kookboek" waar iedereen het over eens is. Dit is geen rigide regel die creativiteit in de weg staat; het is een checklist om ervoor te zorgen dat niemand per ongeluk de taart verbrandt. Het zorgt ervoor dat wanneer iemand zegt: "Deze AI is veilig," zij dezelfde strikte stappen hebben gevolgd als de rest.

3. De "Traceerbare Kaart" (Brongebaseerde Audit)

Het Probleem: Soms klinkt een bewering goed, maar rust deze op een wankele aanname uit het verleden. Als die oude aanname onjuist is, stort de hele nieuwe bewering in. Momenteel is het moeilijk om deze verbindingen te traceren.

De Oplossing: De auteurs stellen een systeem voor dat de afhankelijkheden van elke bewering in kaart brengt.

  • Hoe het werkt: Dit systeem werkt als een digitale detective die een bewering terug naar haar wortels volgt. Het vraagt: "Hangt deze conclusie af van Experiment A? Hangt Experiment A af van Aanname B?"
  • De Analogie: Denk aan een kaartenhuis. Als je de onderste kaart (de aanname) eruit trekt, stort de hele toren in. Dit systeem plaatst een sensor op elke kaart. Als de onderste kaart onwaar wordt bewezen, stuurt het systeem direct een waarschuwing naar iedereen die de kaarten erboven vasthoudt, met de boodschap: "Let op, je toren is nu instabiel!" Het gebruikt AI-agenten om dit traceren automatisch te doen, waarbij wordt gecontroleerd of de logica standhoudt.

Waarom dit doen?

Het paper betoogt dat zonder deze systemen, AI-interpreteerbaarheid een "wild west" zal blijven waar iedereen een bewering kan doen die slim klinkt, maar die niet goed is getest.

  • Voor Veiligheid: Als we AI in ziekenhuizen of op de weg willen gebruiken, kunnen we geen "interpretatie-illusies" veroorloven (beweringen die juist lijken, maar het niet zijn).
  • Voor Vertrouwen: Door het proces open, continu en controleerbaar te maken, kunnen belanghebbenden (zo zoals artsen of toezichthouders) de interne verklaringen van de AI daadwerkelijk vertrouwen.

Wat het paper niet zegt

Het is belangrijk om te vermelden wat dit paper niet doet:

  • Het levert nog niet het definitieve regelboek; het vraagt de gemeenschap om het samen te bouwen.
  • Het beweert niet dat AI momenteel veilig of onveilig is; het zegt dat we een betere manier nodig hebben om te controleren of het veilig is.
  • Het suggereert niet dat strikte regels de creativiteit zullen doden. In plaats daarvan betoogt het dat duidelijke, minimale richtlijnen onderzoekers juist helpen om geen tijd te verspillen aan slechte experimenten.

Samenvatting

De auteurs vragen de AI-onderzoeksgemeenschap om experimenten niet langer te behandelen als eenmalige goocheltrucs, maar als engineeringprojecten. Ze willen een gedeelde werkruimte creëren waar mislukkingen worden gedeeld, regels in realtime worden gedebatteerd en bijgewerkt, en elke bewering terug naar de bron wordt getraceerd. Dit zal AI-interpreteerbaarheid transformeren van een rommelige, informele hobby naar een betrouwbare, controleerbare wetenschap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →