← Nieuwste papers
💻 computer science

HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models

Het artikel introduceert HQ-DM, een nieuw Quantization-Aware Training-framework dat een enkele Hadamard-transformatie gebruikt om effectief activatie-outliers te mitigeren en gewicht-outlier-amplificatie te voorkomen, waardoor hoogwaardige low-bit kwantisatie (W4A4 en W4A3) voor diffusiemodellen mogelijk wordt met significante verbeteringen in de beeldgeneratiekwaliteit ten opzichte van bestaande state-of-the-art methoden.

Oorspronkelijke auteurs: Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

Gepubliceerd 2026-08-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een digitale kunstenaar probeert te leren hoe hij een meesterwerk moet schilderen, maar in plaats van hem een volledige studio met high-definition penselen te geven, overhandig je hem een klein, laag-resolutie schetsboekje. Dit is de uitdaging waar "diffusiemodellen" voor staan, een type kunstmatige intelligentie dat prachtige afbeeldingen creëert door stap voor stap willekeurige statische ruis om te zetten in heldere plaatjes. Denk hierbij aan een beeldhouwer die begint met een enorm blok marmer en steeds kleine stukjes wegbeitelt totdat er een standbeeld verschijnt. Het probleem is dat dit proces ongelooflijk zwaar is; het vereist enorme computers en veel geheugen, waardoor het moeilijk te draaien is op alledaagse apparaten zoals telefoons of laptops.

Om dit op te lossen, gebruiken wetenschappers een truc genaamd "kwantisatie". Stel je voor dat je een high-definition foto neemt en deze verkleint tot een gepixelde versie die minder ruimte inneemt. In de wereld van AI betekent dit het omzetten van de superprecieze getallen van het model (die veel geheugen gebruiken) naar kleinere, eenvoudigere getallen (die minder bits gebruiken). Maar er is een addertje onder het gras: wanneer je deze getallen te veel verkleint, raakt de AI in de war door "outliers" (uitschieters). Dit zijn zeldzame, extreme waarden in de data die fungeren als een enkele, verblindend heldere ster in een donkere hemel. Als je probeert die ster in een klein, laag-resolutie raster te passen, vervormt het de hele afbeelding, wat ervoor zorgt dat de AI wazige of vreemde beelden produceert. De grote vraag is: hoe verkleinen we het model zonder de details te verliezen die de kunst er goed uit laten zien?

Hier komt een nieuwe studie genaamd HQ-DM met een slimme oplossing. De onderzoekers ontdekten dat de "outliers" die voor problemen zorgen in diffusiemodellen, lijken op eigenwijze gasten op een feestje die in de deuropening staan en de doorgang blokkeren. Eerdere methoden probeerden deze gasten erin te proppen of de meubels te verplaatsen, maar dat maakte de kamer vaak alleen maar rommeliger. Het HQ-DM-team ontdekte een betere manier: ze gebruiken een wiskundig hulpmiddel genaamd een Single Hadamard Transformation. Je kunt dit zien als een magische "mengtechniek". In plaats van te proberen de heldere ster in een klein doosje te dwingen, laten ze de hele hemel ronddraaien zodat het licht van de ster gelijkmatig over het hele canvas wordt verspreid. Plotseling is er geen enkel punt dat te helder is om te verwerken, en kan de AI de getallen gemakkelijk verkleinen zonder de kwaliteit van de afbeelding te verliezen.

Wat deze aanpak bijzonder maakt, is hoe het omgaat met de "gewichten" (het geheugen van het model) versus de "activaties" (de data die door het model beweegt). Oudere methoden probeerden beide te mengen, maar dit creëerde vaak nieuwe heldere punten in het geheugen, wat de situatie verergerde. HQ-DM is slimmer: het mengt alleen de bewegende data (activaties) vlak voordat deze wordt verkleind, waardoor het geheugen onaangetast blijft. Dit is als het herordenen van de gasten in de gang zonder de meubels in de woonkamer te verplaatsen. Hierdoor werkt de methode perfect met standaard computerchips die zijn ontworpen voor snelle, eenvoudige berekeningen, waardoor de AI veel sneller kan draaien.

De resultaten van deze "mengtruc" zijn indrukwekkend. Wanneer de onderzoekers hun methode testten op een populaire beeldgenerator genaamd LDM-4 met de ImageNet-dataset (een collectie van 256×256 pixel afbeeldingen), ontdekten ze dat hun model kon worden verkleind naar zeer kleine formaten zonder zijn artistieke gevoel te verliezen. Specifiek, wanneer ze een zeer agressieve instelling gebruikten waarbij zowel het geheugen als de data werden verkleind naar slechts 4 bits (W4A4), verbeterde hun methode de beeldkwaliteitsscore (Inception Score) met 12,8% vergeleken met de beste vorige methode. Nog dramatischer was dat, toen ze de data verlaagden naar slechts 3 bits (W4A3)—een niveau waarop de meeste andere methoden volledig falen—hun model de score met een verbazingwekkende 467,73% verbeterde.

Het paper laat ook zien dat deze methode efficiënt is. Het kost niet veel extra tijd om het model te trainen, en omdat het goed samenwerkt met standaard computerhardware, kan het ongeveer 1,10 tot 1,14 keer sneller draaien dan eerdere pogingen tot vergelijkbare low-bit kwantisatie. De onderzoekers hebben dit getest op verschillende soorten modellen, inclusief modellen gebaseerd op "Transformers" (een andere AI-architectuur), en ontdekten dat de "mengtruc" daar net zo goed werkte. Kortom, HQ-DM suggereert dat door simpelweg de data te herschikken voordat deze wordt verkleind, we krachtige AI-beeldgeneratoren klein genoeg kunnen maken om op de apparaten die we dagelijks gebruiken te draaien, zonder de schoonheid van de beelden die ze creëren op te offeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →