← Nieuwste papers
💬 NLP

Multi-Bitwidth Quantization for LLMs Using Additive Codebooks

Het artikel introduceert Drop-by-Drop, een nieuw post-training kwantiseringsframework dat gebruikmaakt van additieve codeboeken en Matryoshka-stijl supervisie om een enkel LLM-checkpoint te laten ondersteunen voor adaptieve, multi-bitbreedte inferentie met minimale opslagoverhead, terwijl de competitieve nauwkeurigheid over diverse modelarchitecturen behouden blijft.

Oorspronkelijke auteurs: Liza Babaoglu, Shuangyi Chen, Ashish Khisti

Gepubliceerd 2026-06-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Liza Babaoglu, Shuangyi Chen, Ashish Khisti

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Problek: Eén maat past niet iedereen

Stel je voor dat je een enorme, ongelooflijk gedetailleerde bibliotheek aan kennis hebt (een Large Language Model of LLM). Deze bibliotheek is zo groot dat er een gigantische loods voor nodig is om het op te slaan.

  • De Cloud: Als je deze bibliotheek op een enorme supercomputer in de cloud draait, heb je voldoende ruimte. Je kunt elk boek open laten liggen en de fijnste details lezen.
  • De Telefoon: Als je probeerd dezezelfde bibliotheek op een smartphone of een klein edge-apparaat te draaien, is de loods te groot. Het geheugen (RAM) en de batterij van de telefoon kunnen de volledige omvang niet aan.

De Huidige Oplossing (De "Statische" Aanpak):
Nu, als je deze bibliotheek op verschillende apparaten wilt gebruiken, moet je aparte kopieën van de bibliotheek maken:

  1. Een "Deluxe Editie" voor de supercomputer (hoge kwaliteit, enorme omvang).
  2. Een "Zakformaat Editie" voor de telefoon (gecomprimeerd, lagere kwaliteit).
  3. Een "Reis Editie" voor een tablet (middelgrote omvang).

Dit is inefficiënt. Je moet drie verschillende versies van dezelfde bibliotheek trainen, opslaan en onderhouden. Als je wilt overschakelen van de telefoon naar de tablet, moet je het hele bestand vervangen.

De Nieuwe Oplossing: "Drop-by-Drop"

De auteurs stellen een nieuwe methode voor genaamd Drop-by-Drop. In plaats van drie verschillende bibliotheken te maken, creëren ze één enkele bibliotheek die magisch kan krimpen of groeien afhankelijk van het apparaat waarop hij draait, zonder dat hij opnieuw getraind of vervangen hoeft te worden.

Zie de bibliotheek niet als een stapel boeken, maar als een Russische Matroesjka-pop (nestpop).

  • De Buitenste Schil: De kleinste, meest basale versie. Hij past in je zak maar kent alleen de belangrijkste feiten.
  • De Middelste Laag: Als je de schil opent, vind je een iets grotere pop met meer details.
  • De Binnenste Kern: De volledige pop met elk klein detail.

Met Drop-by-Drop hoef je niet drie verschillende poppen mee te dragen. Je draagt er één.

  • Op een telefoon gebruik je alleen de buitenste schil.
  • Op een tablet open je de schil om de middelste laag te gebruiken.
  • Op een supercomputer open je hem helemaal open om de volledige kern te gebruiken.

Hoe het werkt: Het "Additive Codebook" Recept

Om deze nestpop werkend te krijgen, gebruiken de auteurs een techniek genaamd Additive Quantization (additieve kwantisatie).

Stel je voor dat je een complexe schildering aan iemand probeert te beschrijven via een telefoongesprek.

  1. Standaard Methode: Je stuurt eerst een foto met lage resolutie (wazig) voor de telefoon, en een foto met hoge resolutie voor de computer. Dit zijn twee verschillende bestanden.
  2. Drop-by-Drop Methode: Je stuurt eerst een basis schets.
    • Als de luisteraar een klein scherm heeft, stopt hij daar. Hij heeft een ruwe indruk van de schildering.
    • Als ze een groter scherm hebben, stuur je Laag 2: nog een paar lijnen om de vormen te definiëren.
    • Als ze een enorm scherm hebben, stuur je Laag 3: de definitieve kleuren en details.

De magie is dat Laag 2 en Laag 3 nutteloos zijn zonder Laag 1, maar Laag 1 is perfect op zichzelf. De lagen zijn "additief" — ze stapelen zich op elkaar om een duidelijker beeld te bouwen.

Het Geheim: "Matryoshka" Training

Normaal gesproken, wanneer je een AI traint om gegevens te comprimeren, leert deze om het best mogelijke eindbeeld te maken. Het geeft niet om het feit of de eerste paar lagen er slecht uitzien. Als je voortijdig stopt, is het beeld een puinhoop.

De auteurs introduceerden een speciale trainingsregel genaamd Matryoshka Supervision.

  • De Analogie: Stel je een leraar voor die het essay van een student beoordeelt.
    • Oude Manier: De leraar beoordeelt alleen het uiteindelijke essay van 10 pagina's. Als de student bij pagina 1 stopt, zegt de leraar: "Dat is troep, ik kan dit niet beoordelen."
    • Drop-by-Drop Manier: De leraar beoordeelt de student op elke fase. "Oké, pagina 1 is een goede samenvatting. Pagina 3 voegt goede details toe. Pagina 10 is perfect."
  • Het Resultaat: Omdat de AI werd getraind om ervoor te zorgen dat elke gedeeltelijke versie (1 laag, 2 lagen, 3 lagen) accuraat was, kun je de extra lagen veilig "droppen" wanneer je op een klein apparaat bent, en de resterende lagen werken nog steeds perfect.

Waarom dit ertoe doet (volgens het paper)

  1. Eén Model, Veel Apparaten: Je hoeft slechts één bestand op te slaan en te downloaden. Het apparaat bepaalt hoeveel van het bestand het "uitpakt" op basis van het geheugen.
  2. Geen Her-training: Je hoeft niet voor elke telefoon of tablet een nieuw model te trainen. Het enkele model past zich automatisch aan.
  3. Soepele Overgang: Terwijl je beweegt van een apparaat met een laag vermogen naar een apparaat met een hoog vermogen, verbetert de kwaliteit geleidelijk, in plaats van dat je tussen verschillende, incompatibele modellen springt.
  4. Bewezen Theorie: Het paper gebruikt wiskunde (Informatietheorie) om te bewijzen dat deze "nestende" aanpak theoretisch mogelijk is voor de soorten data die LLM's gebruiken, wat garandeert dat je niet aan efficiëntie verliest door deze lagen toe te voegen.

Samenvatting

Drop-by-Drop verandert een rigide, "one-size-fits-all" AI-model in een flexibel, "slim" model dat kan krimpen om in je broekzak te passen of kan uitbreiden om een supercomputer te vullen, en dat allemaal vanuit één enkel bestand. Dit doet het door de AI te trainen om goed te zijn op elk niveau van detail, en niet alleen op het uiteindelijke, meest gedetailleerde niveau.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →