← Nieuwste papers
🤖 machine learning

Rethinking Evaluation Paradigms in IBP-based Certified Training

Dit artikel stelt een nieuw evaluatieparadigma voor voor IBP-gebaseerde gecertificeerde training dat gebruikmaakt van geautomatiseerde multi-objective hyperparameteroptimalisatie om Pareto-fronten van natuurlijke versus gecertificeerde nauwkeurigheid te construeren, waardoor significante onderinstelling in eerder werk wordt onthuld en eerlijke, onbevooroordeelde vergelijkingen mogelijk worden gemaakt die een nieuwe state of the art vaststellen.

Oorspronkelijke auteurs: Konstantin Kaulen, Hadar Shavit, Holger H. Hoos

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Konstantin Kaulen, Hadar Shavit, Holger H. Hoos

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Veiligheid vs. Snelheid" Dilemma

Stel je voor dat je een robot traint om een auto te besturen. Je wilt twee dingen:

  1. Natuurlijke Nauwkeurigheid: De robot rijdt perfect op normale, zonnige dagen.
  2. Gecertificeerde Robuustheid: De robot heeft een wiskundige garantie dat hij niet crasht als er een klein, vreemd foutje optreedt (zoals een sticker op een stopbord die de camera in de war brengt).

Het probleem is dat deze twee doelen meestal met elkaar in strijd zijn. Als je de robot superveilig maakt tegen foutjes, kan hij op normale dagen onhandig worden. Als je hem een geweldige bestuurder maakt op normale dagen, kan hij gemakkelijk worden misleid door foutjes.

Jarenlang hebben onderzoekers geprobeerd de "perfecte" robot te vinden die een balans vindt tussen deze twee. Maar de manier waarop ze hun robots hebben getest, was gebrekkig.

Het Probleem: Een Boek Beoordelen op Eén Pagina

Tot nu toe zouden onderzoekers de instellingen van hun robot afstemmen om één enkele "beste" instelling te vinden. Ze kozen een specifieke balans tussen veiligheid en snelheid, rapporteerden die cijfers en zeiden: "Kijk, onze robot is de beste!"

De auteurs van dit artikel stellen dat dit is alsof je een restaurant beoordeelt door slechts één gerecht te bestellen. Misschien is het restaurant geweldig in biefstuk, maar verschrikkelijk in pasta. Als je alleen de biefstuk bestelt, denk je dat het het beste restaurant van de stad is. Maar als je de pasta zou proberen, zou je kunnen merken dat ze eigenlijk niet zo goed zijn.

In de wereld van AI kozen onderzoekers slechts één punt op het spectrum van "veiligheid versus snelheid". Dit betekende dat ze het volledige plaatje misten. Sommige methoden zijn geweldig in veiligheid maar slecht in snelheid, terwijl andere het tegenovergestelde zijn. Door slechts naar één punt te kijken, kreeg de wetenschappelijke gemeenschap een misleidend beeld van wie er werkelijk de beste was.

De Oplossing: De "Pareto Frontier" Kaart

De auteurs stellen een nieuwe manier voor om deze robots te evalueren. In plaats van te zoeken naar één "beste" instelling, brengen ze het volledige bereik van mogelijkheden in kaart.

Stel je een kaart voor waarbij de X-as "Rijvaardigheid" is (Natuurlijke Nauwkeurigheid) en de Y-as "Crash-bestendigheid" (Gecertificeerde Nauwkeurigheid).

  • Sommige robots scoren hoog op rijvaardigheid maar laag op crash-bestendigheid.
  • Sommige scoren hoog op crash-bestendigheid maar laag op rijvaardigheid.
  • Sommige zitten in het midden.

De auteurs gebruiken een speciaal computeralgoritme om de rand van de kaart te vinden (de Pareto Front genoemd). Deze rand vertegenwoordigt de best mogelijke afwegingen. Als een robot op deze rand staat, kun je de rijvaardigheid niet verbeteren zonder hem minder crash-bestendig te maken, en vice versa.

Door de volledige rand van verschillende robots te vergelijken, in plaats van slechts één punt, kunnen ze zien wie werkelijk superieur is.

Wat Ze Ontdekten: De "Verborgen Parels"

Toen de auteurs deze nieuwe methode van kaart maken toepasten op bestaande AI-methoden, ontdekten ze twee belangrijke zaken:

1. Eerdere "Winnaars" waren Ondergetuned
Veel van de methoden die voorheen als "state of the art" werden beschouwd, waren in werkelijkheid gewoon slecht afgesteld. De onderzoekers ontdekten dat als je de instellingen correct aanpast (met behulp van hun nieuwe kaart), deze oudere methoden veel beter presteren dan iedereen voor mogelijk hield.

  • Analogie: Het is alsof je ontdekt dat een auto die iedereen als traag beschouwde, eigenlijk 160 km/u kon rijden, maar de vorige eigenaar had het gaspedaal vastgeplakt. Zodra ze het losmaakten, was de auto een raket.

2. Er Is Niet Eén Enkele "Beste" Robot
De studie toonde aan dat er niet één enkele methode is die alles wint.

  • Methode A (SABR) is als een sportwagen: Hij is fantastisch in snel en soepel rijden (hoge natuurlijke nauwkeurigheid), maar biedt een redelijke, zij het niet perfecte, crashbescherming.
  • Methode B (MTL-IBP) is als een tank: Hij is iets langzamer op de open weg, maar biedt de sterkste, wiskundig gegarandeerde crashbescherming.
  • Conclusie: Afhankelijk van wat je nodig hebt (een snelle auto of een tank), moet je een andere methode kiezen. Ze zijn complementair, geen concurrenten.

De Prijs van de Waarheid

De auteurs geven toe dat het maken van deze nieuwe kaart duur is. Het vereist veel rekenkracht om duizenden verschillende instellingen voor elke robot te testen.

  • Analogie: Om de beste route voor een roadtrip te vinden, kun je gewoon één pad gokken. Of je kunt een supercomputer gebruiken om elke mogelijke route, elke verkeerssituatie en elk weersscenario te simuleren. De tweede manier kost meer tijd en elektriciteit, maar het garandeert dat je de werkelijk beste route vindt, en niet slechts een gelukkige gok.

De Kernboodschap

Dit artikel vindt geen nieuwe robot; het vindt een betere liniaal.

Het zegt tegen de wetenschappelijke gemeenschap: "Stop met het kiezen van één willekeurige instelling en de overwinning claimen. Breng de volledige afwegingscurve in kaart. Wanneer je dat doet, zul je zien dat veel van onze oude kampioenen gewoon ondervoorbereid waren, en dat de echte winnaars volledig afhangen van wat je het meest waardeert: snelheid of veiligheid."

Door deze nieuwe, eerlijkere manier van meten te gebruiken, vestigt het artikel een nieuwe standaard voor hoe AI-veiligheid in de toekomst getest moet worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →