← Nieuwste papers
⚡ electrical engineering

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow is een compacte 4B-schaal fundamentele modelfamilie die efficiënte, hoog-resolutie tekst-naar-afbeelding generatie en instructiegebaseerde bewerking bereikt door de co-design van een lichtgewicht high-fidelity VAE, een native-resolutie diffusietransformer en systeemniveau-optimalisaties, wat competitieve prestaties levert met ultra-lage latentie op een enkele GPU.

Oorspronkelijke auteurs: Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui
Gepubliceerd 2026-07-22
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robotkunstenaar te bouwen. Jarenlang was de enige manier om deze kunstenaar werkelijk briljant te maken, het bouwen van een brein dat zo massief was dat het een magazijn vol supercomputers nodig had om te draaien. Deze "reusachtige breinen" konden prachtige schilderijen maken of foto's bewerken met ongelooflijk detail, maar ze waren zo zwaar en duur dat alleen een paar grote bedrijven ze zich konden veroorloven. Ze waren als een Ferrari die een heel team aan monteurs vereist om de motor te starten.

Het vakgebied van "generatieve AI" draait volledig om het leren van computers om nieuwe dingen te creëren, zoals afbeeldingen, vanaf nul af aan. Om dit te doen, heeft de computer twee hoofdzaken nodig. Ten eerste heeft hij een tokenizer nodig, wat een soort vertaler is die een rommelige, high-definition foto omzet in een compacte lijst met instructies die de computer kan begrijpen. Ten tweede heeft hij een backbone nodig, de hoofdmotor die de afbeelding daadwerkelijk tekent op basis van die instructies. Het grote probleem is geweest dat de vertaler (de tokenizer) vaak traag en onhandig is, vooral bij grote, gedetailleerde afbeeldingen, waardoor het hele proces traag wordt. De vraag die onderzoekers hebben gesteld is: Kunnen we een robotkunstenaar bouwen die net zo getalenteerd is als de reuzen, maar klein genoeg is om op een enkele laptop te passen, zonder de magie te verliezen?

Maak kennis met Mage-Flow, een nieuw project van het Microsoft Mage Team dat zegt: "Ja, dat kunnen we." In plaats van te proberen een groter brein te bouwen, besloot het team het hele systeem vanaf de grond af aan opnieuw op te bouwen om extreem efficiënt te zijn. Ze creëerden een compacte "kunstenaar" met slechts 4 miljard parameters (een maatstaf voor de grootte), wat piepklein is vergeleken met de 80 miljard parameters tellende reuzen die momenteel het veld domineren.

Dit is hoe ze het deden, met een paar slimme trucjes:

1. De supersnelle vertaler (Mage-VAE)
Beschouw de tokenizer als een vertaler die een foto omzet in een geheime code. Oude vertalers waren als trage, zware koffers; het duurde eeuwen om ze in te pakken en weer uit te pakken, vooral bij afbeeldingen met een hoge resolutie. Mage-Flow introduceerde een nieuwe vertaler genaamd Mage-VAE. Stel je voor dat je in plaats van een zware koffer een magische origami-machine hebt gebouwd. Het kan een complexe foto vouwen tot een klein, net pakketje en het in één razendsnelle stap weer uitvouwen tot een perfect plaatje. Deze nieuwe vertaler is zo efficiënt dat hij hetzelfde werk doet als de oude zware versies, maar ongeveer 22 keer minder energie gebruikt om de afbeelding uit te pakken. Dit betekent dat de robotkunstenaar bijna geen tijd kwijt is aan het wachten tot de vertaler klaar is met zijn werk.

2. Het flexibele canvas (Native-Resolution)
Normaal gesproken dwingen computers wanneer ze afbeeldingen tekenen, elke afbeelding in een rigide raster, alsof je een lange rechthoek en een hoge vierkant in hetzelfde vierkante vak wilt proppen. Dit verspilt ruimte en beperkt de creativiteit. Mage-Flow gebruikt een techniek genaamd Native-Resolution Packing. Stel je een flexibel canvas voor dat rekt en krimpt om precies de vorm te passen van de afbeelding die je wilt tekenen, of het nu een brede filmposter is of een hoge telefoonachtergrond. De computer verspilt geen tijd aan het samendrukken van afbeeldingen in dozen; hij tekent ze precies zoals ze zijn. Dit maakt het trainingsproces veel sneller en stelt de kunstenaar in staat om extreme vormen aan te kunnen zonder in de war te raken.

3. De turbo-motor
Zelfs met een snelle vertaler en een flexibel canvas kan het stap voor stap tekenen van een afbeelding wel even duren. Het team gebruikte een speciale "distillatie"-techniek om Turbo-versies van hun modellen te maken. Beschouw dit als het leren van de kunstenaar om grote sprongen te maken in plaats van kleine, voorzichtige stapjes. Terwijl een standaardkunstenaar misschien 30 stappen nodig heeft om een schilderij af te maken, kan de Turbo-versie het in slechts 4 stappen doen. Ondanks dat er minder stappen worden gezet, blijft de kwaliteit ongelooflijk hoog.

De resultaten
Het team heeft hun nieuwe 4-miljard-parameters kunstenaar getest tegenover de enorme 80-miljard-parameters reuzen. De resultaten waren verrassend. Op een enkele krachtige computerchip (een NVIDIA A100) kon Mage-Flow een afbeelding van hoge kwaliteit met een resolutie van 1024x1024 genereren in slechts 0,59 seconden. Voor het bewerken van een bestaande foto duurde het slechts 1,02 seconde.

Misschien wel het meest indrukwekkende is dat de Turbo-versie een foto in ongeveer een seconde kan bewerken terwijl deze zeer weinig geheugen gebruikt (ongeveer 18 GB), terwijl de reusachtige modellen vaak het dubbele of driedubbele aan geheugen nodig hebben en veel langer nodig hebben om te draaien. Het paper suggereert dat deze aanpak bewijst dat je geen massief, duur brein nodig hebt om hoogwaardige kunst te creëren; je hebt alleen een slim, efficiënt ontwerp nodig.

Het paper liet ook zien dat dit systeem geweldig werkt voor bewerkingen. Je kunt de robot vertellen om "de achtergrond te veranderen naar een strand", "de persoon te verwijderen" of "tekst toe te voegen", en hij doet het getrouw. Ze hebben het zelfs getest op een zeer specifieke taak: het tekenen van wetenschappelijke diagrammen met pijlen en tekst. Het kleine 4-miljard model kon, na een beetje extra training, deze complexe diagrammen bijna net zo goed tekenen als een veel groter, gespecialiseerd model.

Kortom, Mage-Flow suggereert dat de toekomst van AI-kunst niet gaat over het groter en zwaarder maken van dingen. Het gaat over het slimmer, lichter en sneller maken ervan, zodat krachtige beeldgeneratie en bewerking direct op je desktop, of zelfs in je broekzak, kunnen plaatsvinden zonder dat er een supercomputer voor nodig is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →