← Nieuwste papers
🤖 AI

Zamba2-VL Technical Report

Zamba2-VL is een suite van efficiënte vision-language modellen gebouwd op een hybride Zamba2-architectuur die Mamba2 state-space lagen combineert met transformer blocks om competitieve prestaties te behalen ten opzichte van toonaangevende open-weight VLMs, terwijl het aanzienlijk snellere time-to-first-token levert, met name bij kleinere schalen die geschikt zijn voor edge-deployment.

Oorspronkelijke auteurs: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Gepubliceerd 2026-06-02
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Slimmer, Sneller Brein voor Afbeeldingen

Stel je voor dat je een robotassistent hebt die naar een foto moet kijken en er vragen over moet beantwoorden. Meestal zijn deze assistenten gebouwd als een bibliotheek met een enorme, groeiende stapel indexkaarten. Elke keer als ze een nieuw deel van de afbeelding zien, voegen ze een kaartje toe aan de stapel. Als de afbeelding groot of complex is, wordt de stapel zo hoog dat de robot al zijn tijd kwijt is aan het doorzoeken van de kaarten om de volgende te vinden. Dit maakt ze traag en duur in gebruik.

Het Zamba2-VL-team heeft een ander soort robot gebouwd. In plaats van een groeiende stapel kaarten, gaven ze hun robot een compact, snel geheugennotitieblok dat dezelfde grootte behoudt, ongeacht hoeveel het leest. Ze noemen dit een "hybride" model omdat het twee soorten denken combineert:

  1. De Snelle Rijbaan (Mamba2): Deze handelt het grootste deel van het werk af door door lange lijsten met informatie (zoals een hele afbeelding) te lezen met een constante, razendsnelle snelheid zonder vertraging te oplopen.
  2. De Spotlights (Transformer): Dit is een klein, gespecialiseerd hulpmiddel dat alleen wordt gebruikt wanneer de robot moet inzoomen en een specifelijk detail perfect moet onthouden.

Het Probleem Dat Ze Oplosten

Huidige AI-modellen (genaamd Transformers) zijn erg goed in het begrijpen van afbeeldingen, maar ze zijn zwaar. Wanneer je ze een foto met een hoge resolutie voert, breken ze de foto op in duizenden kleine stukjes (tokens). Het model moet een "geheugen" bijhouden van elk stukje dat het tot nu toe heeft gezien. Naarmate de afbeelding groter wordt, explodeert de geheugeneis, waardoor het model traag wordt bij het opstarten en duur is om te draaien op gewone apparaten zoals telefoons of laptops.

Eerdere pogingen om dit op te lossen gebruikten een "puur" snel geheugensysteem (SSM), maar die modellen waren slecht in het vinden van specifieke details in een foto (zoals het aanwijzen van een specifepiek persoon in een menigte). Ze waren snel, maar "dom" wat betre afbeeldingen gaat.

De Zamba2-VL Oplossing

Het Zamba2-VL-team heeft een model gecreëerd dat het beste van twee werelden combineert.

  • De Motor: Ze gebruikten een nieuwe motor genaamd Zamba2. Het is als een hybride auto: hij gebruikt meestal elektrische kracht (de snelle, efficiënte Mamba2-lagen) voor het cruisen, maar hij heeft ook een kleine benzinemotor (de Transformer-lagen) die bijspringt wanneer hij een krachtexplosie nodig heeft om complexe taken aan te pakken.
  • Het Resultaat: Dit model is net zo goed in het begrijpen van afbeeldingen als de grote, zware modellen, maar het is 10 keer sneller bij het opstarten (Time-to-First-Token).

Hoe Ze Het Hadden Opgeleid

Om dit snelle model slim te maken, hebben ze niet zomaar willekeurige plaatjes ertegenaan gegooid. Ze hebben een specifiek "dieet" van trainingsdata samengesteld:

  • Het "OCR"-dieet: Ze merkten op dat het model goed was in algemene afbeeldingen, maar moeite had met tekstzware documenten (zoals grafieken of gescande papieren). Daarom hebben ze het extra porties documentatie- en tekstdata gevoerd om de leesvaardigheid "op te bouwen".
  • De "Aanwijzen"-vaardigheid: Ze leerden het model hoe het naar dingen in een afbeelding kan wijzen. Als je vraagt: "Hoeveel fietsers zijn er?", zegt het model niet alleen "6"; het kan ook daadwerkelijk naar elke fietser wijzen met coördinaten. Dit is alsof je een kind leert om niet alleen appels te tellen, maar ook om elke appel aan te raken terwijl het telt.

De Prestaties: Snel en Accuraat

Het artikel vergelijkt hun nieuwe modellen (beschikbaar in kleine, medium en grote maten: 1.2B, 2.7B en 7B parameters) met de huidige topmodellen van andere bedrijven.

  • Nauwkeurigheid: In tests waarbij het tellen van objecten, het lezen van grafieken en het begrijpen van complexe scènes centraal stonden, presteerde Zamba2-VL net zo goed als de leidende, zware modellen.
  • Snelheid: Hier blinkt het model uit. Dankzij het geheugen van het "compacte notitieblok" begint het ongeveer 10 keer sneller met het beantwoorden van vragen dan de concurrentie.
  • Het Optimale Punt: Het snelheidsvoordeel is het meest spectaculair bij de kleinere modellen (1.2B en 2.7B). Dit zijn de formaten die het meest nuttig zijn voor gebruik op persoonlijke apparaten (zoals een laptop of telefoon), omdat ze lichtgewicht zijn maar nog steeds ongelooflijk capabel.

Samenvatting

Beschouw Zamba2-VL als een sprinter die ook een schaakmeester is. Eerdere snelle modellen waren als sprinters die niet vooruit konden denken, en eerdere slimme modellen waren als schaakmeesters die te langzaam bewogen. Zamba2-VL combineert de snelheid van een sprinter met het strategische geheugen van een schaakmeester, waardoor het complexe afbeeldingen snel kan verwerken zonder dat er een enorme, dure computer nodig is om het te draaien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →