ONNX-Net: Towards Universal Representations and Instant Performance Prediction for Neural Architectures
Dit artikel introduceert ONNX-Net, een unieke, tekstgebaseerde neurale architectuurrepresentatie gebouwd op de 600k+ monsters van de ONNX-Bench benchmark, die een enkele prestatievoorspeller in staat stelt om direct en accuraat willekeurige neurale architecturen te evalueren over diverse zoekruimtes zonder beperkt te zijn tot specifieke celgebaseerde ontwerpen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van kunstmatige intelligentie zijn de krachtigste instrumenten vaak neurale netwerken, systemen die losjes gebaseerd zijn op het menselijk brein en die leren patronen te herkennen, talen te vertalen of auto's te besturen. Decennialang hebben wetenschappers geprobeerd deze netwerken met de hand te bouwen, waarbij ze de structuur aanpasten zoals een mechanicus een motor afstelt. Maar naarmate deze systemen complexer werden, werd menselijke intuïtie een flessenhals. Dit leidde tot een vakgebied genaamd 'neural architecture search', waarbij computers de taak krijgen om hun eigen netwerken te ontwerpen. Het doel is om machines de beste mogelijke structuur voor een specifieke taak te laten vinden. Echter, dit proces is tegen een muur opgegelopen. Om te weten of een ontwerp goed is, moet de computer het bouwen en vanaf nul trainen, een proces dat dagen of zelfs weken kan duren op enorme supercomputers. Dit maakt de zoektocht ongelooflijk traag en duur, wat de hoeveelheid experimenten beperkt.
Een team van onderzoekers heeft nu een manier voorgesteld om door deze flessenhals heen te breken, niet door snellere computers te bouwen, maar door te veranderen hoe ze over de ontwerpen praten. Ze introduceerden een nieuw systeem genaamd ONNX-Net, dat fungeert als een universele vertaler voor neurale netwerken. In plaats van elk nieuw ontwerp in een rigide, vooraf gedefinieerde doos te dwingen, leest dit systeem de blauwdruk van het netwerk alsof het een eenvoudige zin is. Door complexe technische diagrammen om te zetten in tekstuele beschrijvingen in gewone taal, hebben de onderzoekers een taalmodel getraind om te voorspellen hoe goed een netwerk zal presteren, enkel door die tekst te lezen. Het resultaat is een hulpmiddel dat onmiddellijk de successen van een neuraal netwerkontwerp kan raden zonder het ooit te hoeven bouwen of trainen, wat enorme hoeveelheden tijd en energie bespaart.
Het kernprobleem dat de onderzoekers aanpakten, was dat eerdere pogingen om dit proces te versnellen te nauw waren. Eerdere methoden werkten goed voor netwerken die gebouwd waren uit kleine, herhalende blokken, zoals het stapelen van identieke Lego-steentjes. Maar naarmate wetenschappers flexibelere en complexere netwerken gingen ontwerpen, faalden die oude methoden omdat ze de nieuwe, onregelmatige vormen niet konden begrijpen. Bovendien was de data die gebruikt werd om deze voorspellingsinstrumenten te trainen verspreid over verschillende formaten, wat het onmogelijk maakte om een enkele, slimme voorspeller te creëren die elk type netwerk kon afhandelen. Om dit op te lossen, bouwde het team eerst een enorme, verenigde bibliotheek genaamd ONNX-Bench. Ze verzamelden bijna 650.000 verschillende neurale netwerkontwerpen uit diverse bronnen en zetten ze allemaal om naar één enkel, standaard bestandsformaat dat bekend staat als ONNX. Dit formaat is als een universele taal voor neurale netwerken, in staat om elke structuur te beschrijven, hoe complex of ongebruikelijk ook.
Zodra ze deze enorme collectie gestandaardiseerde ontwerpen hadden, stonden de onderzoekers voor de uitdaging hoe ze deze informatie in een computerprogramma konden voeden. Ze realiseerden zich dat de meest flexibele manier om een netwerk te beschrijven niet via complexe grafieken of matrices was, maar via natuurlijke taal. Ze ontwikkelden een methode om de technische details van elk netwerk — welke operaties het uitvoert, hoe de onderdelen met elkaar verbonden zijn en de specifieke instellingen voor elk onderdeel — om te zetten in een leesbare tekstuele beschrijving. Stel je een netwerk voor als een reeks instructies: "Neem een input, haal deze door een filter, pas vervolgens een correctie toe, en geef ten slotte een resultaat uit." De onderzoekers schreven software om deze instructies voor elk van de 650.000 netwerken in hun bibliotheek te genereren.
Ze gebruikten deze tekst vervolgens om een groot taalmodel te trainen, een type kunstmatige intelligentie dat bekend is met menselijke taal, om te fungeren als een prestatievoorspeller. In plaats van te leren poëzie te schrijven of vragen te beantwoorden, leerde dit model om de technische "zinnen" die de neurale netwerken beschrijven te lezen en de nauwkeurigheid ervan te voorspellen. De training was verrassend efficiënt. Het model leerde nauwkeurige voorspellingen te doen nadat het slechts een fractie van de data had gezien die voor eerdere methoden vereist was. Sterker nog, het behaalde hetzelfde prestatieniveau als oudere systemen met minder dan één procent van de trainingsdata. Dit suggereert dat door de netwerken in een helder, tekstueel formaat te beschrijven, de computer de essentiële kenmerken van een ontwerp veel sneller kan begrijpen dan voorheen.
De echte test voor deze nieuwe aanpak was of het kon generaliseren naar ontwerpen die het nog nooit eerder had gezien. De onderzoekers testten het model door het te trainen op netwerken uit één specifieke familie en het vervolgens te vragen de prestaties van volledig andere netwerken uit andere families te voorspellen. De resultaten waren opmerkelijk. Het model voorspelde de prestaties van deze ongeziene ontwerpen met hoge nauwkeurigheid, een capaciteit die bekend staat als 'zero-shot transfer'. Dit betekent dat het systeem niet opnieuw getraind of aangepast hoefde te worden voor de nieuwe typen netwerken; het paste simpelweg wat het had geleerd van de tekstuele beschrijvingen toe om de nieuwe structuren te begrijpen. Dit is een belangrijke stap voorwaarts, aangezien eerdere tools vaak beperkt waren tot de specifieke typen netwerken waarop ze waren getraind en niet konden adapteren aan nieuwe, complexere ontwerpen.
De onderzoekers verkenden ook precies welke informatie het model nodig had om deze voorspellingen te doen. Ze braken de tekstuele beschrijvingen af in verschillende onderdelen, zoals de namen van de operaties, de vormen van de data die erdoorheen stromen en de specifie door de ontwerper ingestelde parameters. Ze ontdekten dat het opnemen van details over hoe de onderdelen van het netwerk verbonden waren en de vormen van de data de meest cruciale factor voor succes was. Hoewel het model goed presteerde met alleen de basisstructuur, zorgde het toevoegen van deze specifieke details ervoor dat het veel scherpere voorspellingen kon doen. Dit bevestigt dat de tekstgebaseerde aanpak de noodzakelijke details van een netwerkontwerp vastlegt zonder te verdwalen in de ruis van irrelevante codevariaties.
Ondanks deze successen zijn de onderzoekers voorzichtig in het benoemen van de grenzen van hun werk. Het systeem is voornamelijk getraind en getest op netwerken die ontworpen zijn voor beeldherkennings-taken met behulp van een specifieke dataset genaamd CIFAR-10. Hoewel de methode theoretisch in staat is om elk netwerk te behandelen dat in hun standaardformaat kan worden omgezet, zijn de huidige resultaten beperkt tot dit specifieke domein. Het team erkent dat de diversiteit van hun trainingsdata, hoewel groot, nog steeds afkomstig is van bestaande benchmarks en nog niet elk mogelijk type neuraal netwerk of taak dekt. Ze wijzen er ook op dat hoewel hun tekstgebaseerde methode flexibeler is dan eerdere grafiekgebaseerde benaderingen, die oudere methoden nog steeds kunnen uitblinken in zeer specifieke, beperkte scenario's.
De release van deze nieuwe benchmark en het bijbehorende voorspellingsinstrument opent een deur voor een efficiëntere exploratie in kunstmatige intelligentie. Door een manier te bieden om ontwerpen direct te evalueren zonder de zware kosten van training, kunnen onderzoekers nu duizenden ideeën testen in de tijd die het vroeger kostte om er slechts een paar te testen. Het werk suggereert dat de toekomst van het ontwerpen van neurale netwerken niet ligt in het bouwen van snellere hardware, maar in het vinden van betere manieren om de ontwerpen zelf te beschrijven en te begrijpen. De onderzoekers hopen dat door hun instrumenten en data beschikbaar te stellen, ze anderen zullen aanmoedigen om zoekmethoden te bouwen die niet beperkt zijn tot specifieke typen netwerken, maar die kunnen adapteren aan het voortdurend evoluerende landschap van kunstmatige intelligentie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.