← Nieuwste papers
🤖 AI

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

Dit paper introduceert Xuanwu VL-2B, een industrieel-grade multimodaal basismodel met ongeveer 2 miljard parameters dat via een drie-staps trainingsproces een praktische balans bereikt tussen bedrijfsgerichte aanpassing, gedetailleerde visuele perceptie en kostenefficiënte implementatie, terwijl het tegelijkertijd superieure prestaties levert op contentmoderatie en adversarial OCR-taken vergeleken met bestaande modellen.

Oorspronkelijke auteurs: Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

Gepubliceerd 2026-04-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🏗️ De Bouw van een "Super-Content Moderator": Het verhaal van Xuanwu

Stel je voor dat je een enorme bibliotheek beheert (een sociaal netwerk zoals TikTok of Instagram). Je hebt duizenden mensen die elke seconde nieuwe foto's en teksten uploaden. Je taak is om te zorgen dat er geen gevaarlijke, illegale of vervelende dingen (zoals spam, pornografie of oplichting) in de bibliotheek terechtkomen.

Vroeger gebruikten je "boekenwachten" (AI-modellen) een simpele lijst met regels. Maar de "boosdoeners" werden slimmer. Ze verstopten hun berichten in gekke lettertypes, vervalste afbeeldingen of onleesbare krabbels. De oude wachters zagen het niet meer.

Dit paper introduceert Xuanwu, een nieuwe, slimme "boekenwachter" die speciaal is gebouwd voor deze moeilijke wereld.


1. Het Probleem: De "Alles-kunner" is te traag en te naïef

De huidige AI-modellen (zoals die van Google of Meta) zijn als universele detectives. Ze kunnen alles: ze kunnen wiskunde oplossen, gedichten schrijven en foto's beschrijven. Maar als je ze vraagt om specifiek op te letten voor een heel specifieke, slinkse vorm van spam in een drukke fabriek, raken ze in de war.

  • Het probleem: Ze zijn te groot (te traag voor miljoenen gebruikers) en ze vergeten hun specifieke taken als je ze te veel nieuwe regels leert (een fenomeen dat "catastrophic forgetting" heet).
  • De oplossing: Xuanwu is geen universele detective. Het is een gespecialiseerde agent die is getraind om precies dat ene ding te doen: content moderatie, zelfs als de boosdoener probeert te verstoppen.

2. De Architectuur: De "Compacte Robot"

Xuanwu is niet gebouwd als een gigantische, zware machine. Het is een slanke, efficiënte robot van ongeveer 2 miljard parameters (vergelijkbaar met een middelgrote auto in plaats van een vrachtwagen).

  • De Ogen (InternViT): Dit is het deel dat kijkt. Het is getraind om niet alleen naar de "grote lijnen" te kijken, maar ook naar de minuscule details.
    • Vergelijking: Stel je voor dat je een foto bekijkt. Een normale AI kijkt naar het landschap. Xuanwu kijkt ook naar een vlieg die op een bloem zit en kan lezen wat er op de vleugels geschreven staat, zelfs als de vlieg beweegt of vervormd is.
  • De Hersenen (Qwen3): Dit is het deel dat denkt en begrijpt wat de ogen zien.
  • De Schakelaar (MLP): Een simpele verbinding die zorgt dat de ogen en hersenen perfect samenwerken zonder dat de machine te zwaar wordt.

3. De "Dynamische Lijst" (Hoe het kijkt)

Een groot probleem bij content moderatie is dat spammers hun tekst heel klein maken of de afbeelding vervormen. Als je een foto in een klein vierkantje (448x448 pixels) duwt, verdwijnt de kleine tekst.

Xuanwu gebruikt een slimme truc: Dynamische Tiling.

  • Vergelijking: Stel je voor dat je een enorme poster moet inspecteren. In plaats van de hele poster in één keer klein te maken, knipt Xuanwu de poster in 12 stukjes (zoals een puzzel). Hij bekijkt elk stukje in hoge resolutie én hij houdt ook een klein overzichtje van de hele poster in de gaten. Zo mist hij nooit een klein woordje dat ergens in de hoek verstopt zit.

4. De Training: Van Student tot Expert

Xuanwu is niet zomaar geboren. Het heeft een drie-staps opleiding gevolgd, net als een student die van school naar een stage en dan naar een baan gaat:

  1. Stap 1: Pre-training (De Basis): Het leert de wereld kennen. Het kijkt naar miljoenen foto's en teksten om te begrijpen wat een hond is, wat een auto is en hoe taal werkt.
  2. Stap 2: Mid-training (De Specialisatie): Hier wordt het interessant. Het leert specifiek voor de "fabriek". Het krijgt duizenden voorbeelden van spam, spam-achtige teksten en moeilijke gevallen. Het leert ook om niet zijn algemene kennis te vergeten.
    • Vergelijking: Het is alsof je een student geneeskunde eerst de anatomie leert, en hem daarna speciaal traint om alleen hartziektes te herkennen, zonder dat hij vergeet hoe een been eruitziet.
  3. Stap 3: Post-training (De Meesterklas): Dit is de "finishing touch".
    • SFT (Supervised Fine-Tuning): Mensen geven het de juiste antwoorden op moeilijke vragen. "Kijk, dit is geen foto van een hond, dit is een vals bericht."
    • RL (Versterkingsleer): Hier krijgt het een puntenstelsel. Als het een spam-bericht goed herkent, krijgt het een "sterretje". Als het een fout maakt, krijgt het een "minus". Het leert door te proberen en te verbeteren, net als een kind dat leert fietsen.

5. De Resultaten: Waarom is Xuanwu zo goed?

De auteurs hebben Xuanwu getest tegen andere grote modellen (zoals InternVL en zelfs de dure commerciële modellen van Google).

  • De Test: Ze gaven het duizenden afbeeldingen met sluipende spam: tekst die vervormd is, handgeschreven krabbels, of tekst die verstopt is in een AIGC-gegenereerde afbeelding.
  • Het Resultaat: Xuanwu pakte 82,82% van deze verstopte boodschappen op. De concurrenten (zelfs de dure Google-modellen) haalden maar ongeveer 76%.
  • De Belangrijkste Winst: Xuanwu doet dit met een kleinere, goedkopere machine. Het is sneller, goedkoper om te draaien, en mist minder fouten.

6. De "Chain of Thought" (Het denken hardop)

Een van de coolste dingen is dat Xuanwu niet alleen zegt "Ja, dit is spam". Het legt uit waarom.

  • Vergelijking: Een oude AI zegt: "Gevaar!" en stopt de post. Xuanwu zegt: "Gevaar! Ik heb hier een heel klein woordje gevonden dat 'WeChat' lijkt te spellen, maar dan met rare tekens, verstopt in de rand van de foto. Daarom is dit spam."
    Dit helpt mensen om te controleren of de AI het goed heeft gedaan.

Conclusie

Xuanwu is een bewijs dat je niet altijd de grootste en zwaarste AI nodig hebt om een moeilijke taak te doen. Door slimme architectuur, een slimme training (met veel aandacht voor moeilijke, "adversariële" gevallen) en een focus op details, kun je een industriële, betrouwbare moderator bouwen die goedkoop is, snel werkt en slimmere spammers verslaat.

Het is als het vervangen van een trage, zware tank door een snel, wendbaar jachtvliegtuig dat precies weet waar het moet kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →