NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims
Dit position paper betoogt dat NeurIPS reproduceerbaarheidsnormen moet verplichten voor veiligheidsclaims inzake grensvlak-AI, en stelt een drie-traps onthullingskader voor om de huidige "evidentiële omkering" aan te pakken, waarbij de meest ingrijpende veiligheidsbeweringen het minst verifieerbaar zijn vanwege achtergehouden artefacten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin een bedrijf een ongelooflijk krachtige nieuwe machine bouwt. Voordat ze deze aan het publiek verkopen, publiceren ze een rapport met de boodschap: "Maak je geen zorgen, deze machine is veilig. Het zal niemand kwaad doen."
Het probleem, volgens dit paper, is dat het bedrijf vaak weigert je te laten zien hoe ze de machine hebben getest. Ze geven je de einduitslag (bijvoorbeeld "99% veilig!") maar verbergen de testvragen, de scoringsregels en de instellingen van de machine. Ze zeggen: "Vertrouw ons, we hebben het gecontroleerd."
De auteurs van dit paper betogen dat de NeurIPS-conferentie (een grote bijeenkomst voor computerwetenschappers) de regels moet veranderen. Ze zeggen: "Als je een veiligheidsclaim wilt publiceren over een superkrachtige AI, moet je het bewijzen. Als je je werk niet kunt tonen, kun je de grote claim niet doen."
Hier is een uiteenzetting van hun voorstel met behulp van eenvoudige analogieën:
1. Het probleem: De "evidentiële inversie"
Normaal gesproken geldt in de wetenschap: hoe groter en belangrijker een claim is, hoe meer bewijs je nodig hebt om deze te onderbouwen.
- Normale wetenschap: Als een wetenschapper zegt: "Ik heb een nieuwe planeet gevonden", moet hij de telescoopdata tonen zodat anderen ook kunnen kijken.
- AI-veiligheid (het probleem): Als een bedrijf zegt: "Deze AI is veilig genoeg om het elektriciteitsnet te besturen", verbergen ze vaak de data.
De auteurs noemen dit een "evidentiële inversie". Het is alsof een goochelaar beweert dat zijn truc onschadelijk is, maar weigert iemand het kaartspel te laten zien. Het paper betoogt dat dit een falen van de wetenschap is, niet slechts een gebrek aan transparantie.
2. De oplossing: Een drie-traps "verkeerslichtsysteem"
De auteurs weten dat het soms gevaarlijk is om de "kaarten" (de testdata) te tonen. Als je precies laat zien hoe je een beveiligingssysteem kunt kraken, kunnen kwaadaardige actoren leren hoe ze dat moeten doen.
Daarom stellen ze een drie-trapsysteem (zoals een verkeerslicht) voor voor hoeveel informatie moet worden gedeeld:
🟢 Trap 1 (Groen licht - Publiek):
- Wanneer: De testdata is veilig om aan iedereen te tonen.
- Regel: Je moet alles publiceren: de vragen die je aan de AI stelde, de code die je gebruikte en de resultaten. Iedereen kan de test opnieuw uitvoeren.
- Resultaat: Volledig vertrouwen. De claim is volledig onderbouwd.
🟡 Trap 2 (Geel licht - Gecontroleerd):
- Wanneer: Het publiek tonen van de data zou gevaarlijk zijn (bijvoorbeeld omdat het mensen leert te hacken), maar een vertrouwd expert zou het veilig kunnen bekijken.
- Regel: Je publiceert de data niet voor het publiek. In plaats daarvan geef je het door aan een geheime panel van vertrouwde, onafhankelijke experts (zoals een privé-beveiligingsclearance). Zij controleren het werk achter gesloten deuren en geven een "duim omhoog" of "duim omlaag".
- Resultaat: De claim is onderbouwd, maar met een notitie die zegt: "We hebben dit privé gecontroleerd, maar je kunt de ruwe data niet zien."
🔴 Trap 3 (Rood licht - Beperkt):
- Wanneer: Zelfs een geheim panel kan de data niet bekijken omdat het te gevaarlijk is (bijvoorbeeld omdat de test het creëren van een simulatie van een biologisch wapen omvat).
- Regel: Je kunt het paper nog steeds schrijven, maar je mag de grote claim niet doen dat de AI "veilig genoeg is om vrij te geven". Je kunt alleen zeggen: "We hebben geprobeerd dit te testen, maar de data is te gevoelig."
- Resultaat: De claim is "correct geschaald". Je kunt het paper niet gebruiken om te rechtvaardigen dat de AI aan de wereld wordt vrijgegeven.
3. De "Claim-inventaris" (De kassabon)
Om ervoor te zorgen dat bedrijven niet bedriegen, stelt het paper een nieuw formulier voor dat auteurs moeten invullen, genaamd een Claim-inventaris.
- Denk hierbij aan een kassabon in een winkel.
- De auteur moet elke veiligheidsclaim die hij maakt, opschrijven.
- Naast elke claim moeten ze een vakje aankruisen: "Hebben we de data getoond? Hebben we een geheim panel gevraagd om het te controleren? Of is het te gevaarlijk om te tonen?"
- Als ze "Te gevaarlijk" aankruisen maar geen goede reden hebben, wordt het paper afgewezen of wordt de claim verzwakt.
4. Waarom NeurIPS?
De auteurs kozen NeurIPS omdat het de "Olympische Spelen" van AI-onderzoek is.
- Momenteel publiceren bedrijven graag hun veiligheidsrapporten bij NeurIPS, omdat dit hun claims wetenschappelijke legitimiteit geeft. Het zorgt ervoor dat het publiek en overheden hen vertrouwen.
- Het paper betoogt: "Als je de gouden medaille wilt (publicatie bij NeurIPS), moet je je aan de regels houden. Je kunt niet zomaar zeggen dat je veilig bent; je moet het bewijzen, hetzij publiek, hetzij aan een vertrouwd scheidsrechter."
5. Hoe bedrog te voorkomen
De auteurs verwachten dat sommige bedrijven het systeem zullen proberen te manipuleren (bijvoorbeeld door te claimen dat hun data "te gevaarlijk" is, alleen om het te verbergen).
- De oplossing: Ze stellen een Federatief Beoordelingssysteem voor. Stel je een groep verschillende "beveiligingsclearances" voor (zoals verschillende nationale veiligheidsinstituten of onafhankelijke laboratoria). Als een bedrijf zegt dat hun data te gevoelig is voor NeurIPS, controleert een neutrale expert uit deze groep het.
- Als de expert zegt: "Nee, dit is eigenlijk niet zo gevaarlijk, je moet het tonen", dan moet het bedrijf het tonen. Als ze weigeren, wordt het paper afgewezen.
Samenvatting
Het paper is een oproep tot actie voor de AI-gemeenschap: Stop met "Vertrouw ons" te accepteren als bewijs van veiligheid.
Als je claimt dat een krachtige AI veilig is, moet je het volgende doen:
- Laat je werk aan iedereen zien.
- Laat een vertrouwd, onafhankelijk scheidsrechter je werk in het geheim controleren.
- Als je dat niet kunt doen, geef toe dat je niet hebt bewezen dat het veilig is, en gebruik je paper niet om te rechtvaardigen dat de AI wordt vrijgegeven.
Het doel is niet om AI-ontwikkeling te stoppen; het is om ervoor te zorgen dat wanneer we zeggen "Dit is veilig", we eigenlijk de bonnen hebben om het te bewijzen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.