← Nieuwste papers
🤖 machine learning

MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

Het artikel presenteert MiCoPro, een end-to-end hardware-software co-design framework dat gebruikmaakt van een hardware-bewust proxy-model en een nieuw optimalisatiealgoritme om efficiënt te zoeken naar mixed-precision kwantisatieschema's, wat de snelle implementatie van edge AI-modellen mogelijk maakt met aanzienlijke latentiereductie en minimale nauwkeurigheidsverlies.

Oorspronkelijke auteurs: Zijun Jiang, Yangdi Lyu

Gepubliceerd 2026-08-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zijun Jiang, Yangdi Lyu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, high-definition film probeert te proppen in een piepkleine, ouderwetse MP3-speler. De film is een "Neuraal Netwerk", een type computerbrein dat leert om katten te herkennen, talen te vertalen of auto's te besturen. Het probleem is dat deze breinen meestal gebouwd zijn met zware, zwevende-kommagetallen (zoals 32-bit of 64-bit), die veel ruimte innemen en veel energie vereisen om te verwerken. Om ze te laten draaien op kleine apparaten zoals smartwatches of drones, gebruiken ingenieurs "Quantization" (kwantisatie). Denk aan dit als het comprimeren van de film: in plaats van miljoenen kleuren te gebruiken, dwing je de afbeelding om slechts een paar grijstinten te gebruiken. Dit maakt het bestand kleiner en sneller af te spelen, maar als je te veel comprimeert, wordt het beeld wazig en herkent de AI de kat niet meer.

Lange tijd probeerden ingenieurs de gehele film naar dezelfde lage kwaliteit te comprimeren, zoals het omzetten van elke scène naar een 4-bit schets. Maar dit is alsoals een actiescène in slow-motion en een rustige dialogescène allemaal met dezelfde lage resolutie te laten zien; het verspilt ruimte aan de rustige delen en verpest de actievolle delen. Een slimmer idee is "Mixed Precision Quantization" (MPQ). Dit is als een slim compressie-algoritme dat de actiescènes in high definition houdt (8-bit), maar de saaie dialoogscènes verkleint tot kleine schetsen (2-bit). De uitdaging is echter om uit te vogelen precies welke scènes je moet verkleinen en met hoeveel. Als je het fout raadt, ziet de film er verschrikkelijk uit. Als je het goed raadt, krijg je een klein bestand dat er nog steeds geweldig uitziet. Dit is de puzzel die de onderzoekers in dit artikel probeerden op te lossen.

Het artikel introduceert een nieuwe toolkit genaamd MiCo (en de geüpgradede versie, MiCoPro) om deze puzzel automatisch op te lossen. In plaats van een mens die handmatig elke laag van een neuraal netwerk probeert aan te passen — wat is als het handmatig bewerken van een 100-urige film frame voor frame — werkt het MiCo-systeem als een super slimme, versnellende editor. Het gebruikt een "proxy model", wat in essentie een kristallen bol is die voorspelt hoe snel een specifieke compressieschema zal draaien op echte hardware zonder het daadwerkelijk uit te voeren.

De onderzoekers ontdekten dat de oude manier van snelheid voorspellen als het tellen van het aantal woorden in een boek is om te raden hoe lang het duurt om het te lezen. Het is een ruwe schatting, maar het negeert of het lettertype klein is, of de lezer moe is, of het boek zwaar is. Het artikel betoogt dat deze oude methode (genaamd "Bit Operations" of BOPs) vaak leidt tot slechte keuzes omdat het de specifieke eigenaardigheden van de hardware niet begrijpt. MiCoPro bout daarente daarentegen een op maat gemaakte "snelheidsmeter" voor elk specifiek apparaat. Het leert hoe verschillende hardware omgaat met verschillende soorten wiskunde, waardoor het de perfecte mix van hoge en lage precisie kan vinden die de AI het snelst laat draaien zonder de nauwkeurigheid te verliezen.

In hun experimenten testte het team dit systeem op diverse AI-modellen, van eenvoudige beeldherkenners tot grotere taalmodellen. Ze ontdekten dat ze door hun nieuwe "Hardware-Aware Proxy" te gebruiken, de tijd die de AI nodig heeft om na te denken (latentie) met wel 40% konden verlagen, terwijl ze minder dan 3% van hun nauwkeurigheid verloren. Het is alsoals een manier vinden om de batterij van je telefoon 40% langer te laten meegaan zonder het scherm minder helder te maken.

Het artikel benadrukt ook dat dit niet alleen een theorie is; ze hebben daadwerkelijk de software gebouwd om een model dat in Python (een populaire programmeertaal) is ontworpen, om te zetten in ruwe, "bare-metal" C-code die direct op chips kan draaien, inclus�of gespecialiseerde versnellers en aangepaste RISC-V processors. Ze lieten zien dat hun methode beter werkt dan eerdere "zoek"-algoritmen, die vaak verdwalen in de enorme hoeveelheid mogelijke combinaties. Door een techniek genaamd "Near-Constraint Sampling" te gebruiken, richt MiCo zijn zoektocht op het "sweet spot" vlak bij de snelheidslimiet, in plaats van tijd te verspillen aan het controleren van opties die te traag of te snel zijn.

Uiteindelijk suggereert het artikel dat om het meeste uit AI op kleine apparaten te halen, we niet alle lagen van een neuraal netwerk hetzelfde moeten behandelen. Door een slimme, hardware-bewuste gids te gebruiken om precisieniveaus te mengen en te matchen, kunnen we AI sneller en efficiënter maken. De auteurs demonstreren dat deze aanpak robuust is, werkend over verschillende soorten chips en modellen, en ze bieden een open-source framework aan zodat anderen het kunnen gebruiken. Hoewel de resultaten gebaseerd zijn op simulaties en specifieke hardwaretests, suggereert het consistente succes in verschillende scenario's dat deze "slimme compressie"-strategie een krachtig hulpmiddel is voor de toekomst van Edge AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →