Coverage You Can Steer: Online Conformal Calibration for RL-Driven Hardware-Aware NAS
Dit artikel stelt een online conform kalibratiekader voor met behulp van adaptieve feedbackcontrole om distributievrije dekkinggaranties te herstellen in reinforcement learning-gestuurde hardware-bewuste neurale architectuurzoektochten, wat het efficiënt snoeien van 25–50% van de kandidaat-architecturen mogelijk maakt zonder de nauwkeurigheid op te offeren of de doel-foutmarge te schenden, ondanks het niet-uitwisselbare karakter van het zoekproces.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin de kleine computers in je smartwatch, het remsysteem van je auto of een medische sensor dezelfde krachtige kunstmatige intelligentie kunnen draaien die momenteel alleen in enorme datacenters leeft. Dit is de belofte van edge AI: intelligente systemen die lokaal werken, direct en zonder dat er privédata naar de cloud teruggestuurd hoeft te worden. Maar er is een addertje onder het gras. Deze edge-apparaten hebben strikte beperkingen wat betreft de hoeveelheid geheugen die ze bevatten en hoe snel ze informatie kunnen verwerken. Het ontwerpen van een neuraal netwerk — een type computerprogramma dat leert van data — om in deze krappe beperkingen te passen, is als het proberen te bouwen van een wolkenkrabber die ook nog in een schoenendoos moet passen. Het aantal mogelijke ontwerpen is zo enorm, met miljoenen combinaties van lagen, verbindingen en instellingen, dat een menselijke ontwerper ze niet allemaal kan testen.
Om dit op te lossen, gebruiken onderzoekers een methode genaamd neural architecture search, waarbij een computerprogramma automatisch verschillende ontwerpen uitprobeert om de beste te vinden. Het testen van een enkel ontwerp is echter extreem duur en traag; het vereist het trainen van het model op data om te zien hoe goed het werkt. Als een computer duizenden ontwerpen moet trainen om slechts één goed ontwerp te vinden, wordt het proces te kostbaar om praktisch uitvoerbaar te zijn. De uitdaging is dan om te bepalen welke ontwerpen de tijd en het geld waard zijn om te trainen, en welke direct verworpen kunnen worden zonder ooit de volledige test uit te voeren.
Een team van onderzoekers bij Vicomtech in Spanje heeft een nieuwe manier ontwikkeld om dit filterproces betrouwbaar te maken. Ze pakten een probleem aan dat eerdere pogingen stilletjes ondermijnde: het eigen leerproces van de computer veranderde de spelregels terwijl het aan het spelen was. In deze zoeksystemen stelt een "controller" nieuwe ontwerpen voor op basis van wat het tot nu toe heeft geleerd. Naarmate de controller slimmer wordt, veranderen de ontwerpen die het voorstelt. Oudere methoden voor het wegfilteren van slechte ontwerpen gingen ervan uit dat de ontwerpen die aan het begin van de zoektocht werden voorgesteld, statistisch gezien vergelijkbaar waren met de ontwerpen aan het einde. Maar omdat de controller leert en verbetert, is die aanname onjuist. De ontwerpen verschuiven voortdurend, en de oude filters, die waren gekalibreerd op de vroege ontwerpen, begonnen te falen. Ze verspillden ofwel tijd aan het trainen van verschrikkelijke ontwerpen of, erger nog, gooiden per ongeluk het allerbeste ontwerp weg voordat het de kans kreeg om goed getest te worden.
De onderzoekers vervingen dit statische, eenmalige filter door een systeem dat leert en in realtime wordt aangepast. In plaats van één regel in te stellen en te hopen dat deze standhoudt, gebruikt hun nieuwe methode een feedbackloop om de eigen prestaties constant te controleren. Na elk getest ontwerp vraagt het systeem zich af: "Heb ik correct voorspeld dat dit ontwerp goed of slecht zou zijn?" Als het systeem een fout maakte, past het zijn interne drempelwaarde voor wat een "goed" ontwerp is, licht aan. Deze aanpassing vindt continu plaats, waardoor het systeem in staat is de veranderende aard van de zoektocht te volgen. Het resultaat is een filter dat kan worden afgesteld op een specifief veiligheidsniveau. Als een onderzoeker vraagt om een garantie van 90% dat er geen goed ontwerp wordt gemist, levert het systeem precies dat, ongeacht hoe de zoektocht evolueert. Als men vraagt om 95%, levert het dat in plaats daarvan. Deze controle is precies, reproduceerbaar en werkt zelfs wanneer de voorgestelde ontwerpen snel verschuiven.
Het team testte deze aanpak op drie verschillende soorten netwerkarchitecturen en op diverse datasets, waarbij de zoektocht naar modellen die op microcontrollers met zeer beperkt geheugen kunnen draaien, werd gesimuleerd. Ze ontdekten dat hun adaptieve systeem tussen de 25% en 50% van de voorgestelde ontwerpen veilig kon verwerpen zonder ze te trainen, wat een enorme hoeveelheid rekentijd bespaart. Cruciaal was dat deze snoeiing de uiteindelijke kwaliteit van de oplossing niet schaadde. In één specifieke testcase, waar het beste ontwerp een zeldzame, geïsoleerde piek was in een uitgestrekt landschap van middelmatige opties, faalden de oude methoden herhaaldelijk en gooiden ze het beste ontwerp weg. De nieuwe adaptieve methode vond het telkens weer.
De onderzoekers ontdekten ook dat de "slimme" controller die vaak wordt gebruikt om deze ontwerpen te genereren, niet daadwerkelijk de meest efficiënte manier is om de beste architectuur te vinden. Wanneer ze een geavanceerde lerende controller vergeleken met een eenvoudige random search, presteerde de random search in veel gevallen net zo goed, zo niet beter. De controller was goed in het vinden van gemiddelde ontwerpen, maar had de neiging om vast te lopen in lokale gebieden en de zeldzame, perfecte ontwerpen te missen. De echte waarde van de nieuwe methode lag volgens hen niet in de controller zelf, maar in het gekalibreerde filter dat het budget beheerde. Door het adaptieve filter te gebruiken als gids voor waar men vervolgens moet zoeken, in plaats van enkel als poortwachter, konden de onderzoekers de zoektocht direct naar de beste oplossingen sturen. Deze "gekalibreerde optimisme" stelde het systeem in staat om veelbelovende maar onbewezen ontwerpen te verkennen met een bekend risiconiveau, waarbij het beter presteerde dan willekeurig gokken en zelfs complexere planningsalgoritmen in beperkte omgevingen.
De studie onderzocht ook hoe deze filters zich gedragen wanneer de zoektocht een ontwerp laag voor laag opbouwt, in plaats van alles in één keer. Ze ontdekten dat één enkele, globale regel voor filtering vaak niet rekening hield met de specifieke moeilijkheden van verschillende fasen in de constructie. Bijvoorbeeld: een regel die goed werkte voor de vroege, ondiepe delen van een netwerk, kon te los of te strikt zijn voor de diepere, complexere delen. Door hun adaptieve methode afzonderlijk toe te passen op elke fase van de constructie, konden ze ervoor zorgen dat de veiligheidsgarantie bij elke stap standhield, ongeacht hoe diep het netwerk was gegroeid. Deze granulaire controle voorkwam dat het systeem systematische fouten maakte die met een eenheidsworst-benadering onopgemerkt zouden blijven.
Uiteindelijk toont dit werk aan dat in het hoogstaande spel van het ontwerpen van kunstmatige intelligentie voor beperkte apparaten, het belangrijkste instrument niet noodzakelijkerwijs een slimmere voorspeller is, maar een eerlijkere. De oude methoden vertrouwden op aannames over hoe de data zich zou gedragen, aannames die werden doorbroken door de handeling van het leren zelf. De nieuwe methode laat die aannames los. In plaats daarvan vertrouwt het op een continue, distributievrije controle tegen de realiteit, waarbij het zijn vertrouwensniveau moment per moment aanpast. Het bewijst dat je een zoekproces kunt hebben dat zowel efficiënt als veilig is, een proces dat precies weet welk risico het neemt en dat kan worden bijgesteld om meer of minder risico te nemen, simpelweg door aan een knop te draaien. Deze verschuiving van statische regels naar dynamische, zelfcorrigerende controle biedt een robuust pad voor de bouw van de volgende generatie intelligente, beperkte apparaten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.