← Nieuwste papers
🤖 AI

Scalable Visual Pretraining for Language Intelligence

Dit artikel daagt het tekst-alleen paradigma van pretraining van foundation models uit door aan te tonen dat ongecontroleerde visuele pretraining op ruwe visuele documenten, die rijke informatie zoals figuren en lay-outs behoudt, consequent beter presteert dan tekst-alleen benaderingen en een schaalbare weg biedt naar verbeterde taalintelligentie.

Oorspronkelijke auteurs: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren hoe de wereld werkt. Een lange tijd was het standaardrecept om het een bergen boeken, artikelen en websites te voeren, maar met een addertje onder het gras: voordat de robot ze leest, strippen mensen (of computers) alle plaatjes, de kronkelige wiskundige symbolen, grafieken en de chique paginalay-outs weg, waardoor alles verandert in gewone, saaie tekst. Het is alsof je iemand probeert te leren hoe je een taart bakt door alleen een lijst met ingrediënten op een servetje te geven, terwijl je de foto van de afgewerkte taart, het diagram van de mengkom en de kleurrijke grafiek die laat zien hoe de temperatuur van de oven verandert, weggooit.

Een nieuwe paper uit 2026 suggereert dat deze "alleen tekst"-aanpak een enorm deel van de puzzel mist. De onderzoekers, onder leiding van een team uit Shanghai en Zhejiang, beargumenteren dat door de visuele onderdelen van documenten weg te gooien, we de heel cruciale aanwijzingen weggooien die de robot nodig heeft om echt slim te worden. Ze noemen hun nieuwe methode Visual Pretraining (VP), en het is alsof je de robot leert om de werkelijke pagina's van een tekstboek te lezen, inclusief diagrammen en vergelijkingen, in plaats van alleen de tekstuele beschrijving ervan.

De Grote Ontdekking: Zien is Geloven (en Leren)
Het team testte dit idee op enkele van de slimste AI-modellen die momenteel beschikbaar zijn (zoals Qwen en Llama). Ze namen exact dezelfde stapel wetenschappelijke documenten — denk aan natuurkundige papers, wiskundeboeken en technische rapporten — en verdeelden deze in twee groepen.

  • Groep A (De Oude Manier): Ze zetten de pagina's om in gewone tekst, waarbij alle visuele elementen werden verwijderd.
  • Groep B (De Nieuwe Manier - VP): Ze voerden de ruwe afbeeldingen van de pagina's rechtstreeks aan het model, waardoor het de figuren, tabellen en lay-outs kon "zien" zonder ze eerst in woorden om te zetten.

Het resultaat? De robot die getraind werd op de ruwe afbeeldingen (Groep B) was consequent slimmer dan de robot die getraind werd op platte tekst (Groep A). Sterker nog, op lastige wetenschappelijke en wiskundige benchmarks scoorde de visuele leerling hoger. Zo verbeterde het visuele model bijvoorbeeld zijn score op een moeilijke wiskundetest genaamd AIME aanzienlijk meer dan het tekstmodel. De paper suggereert dat het "informatieverlies" (lossy) proces van het omzetten van een complexe pagina met een diagram naar een reeks woorden, feitelijk de informatie wist die nodig is om complexe problemen op te lossen.

De Efficiëntie-hack: Meer Doen met Minder
Hier komt het echt coole gedeelte: de visuele methode was niet alleen beter; het was ook veel efficiënter. Het tekstgebaseerde model moest ongeveer 80 miljard teksttokens "door kauwen" om te leren van deze documenten. Het visuele model had echter slechts ongeveer 20 miljard visuele tokens nodig om hetzelfde (of betere) resultaten te behalen. Dat is het gebruik van slechts 25% van het databudget!

Denk er maar zo over na: als het tekstmodel probeert een stad te beschrijven door elke straatnaam en elk gebouwadres op te sommen, duurt dat eeuwigheden. Het visuele model kijkt daarentegen gewoon naar een kaart. Het krijgt direct het hele plaatje te zien. De onderzoekers ontdekten dat hoe meer "visuele zaken" (zoals complexe diagrammen en vergelijkingen) een pagina bevatte, hoe groter het voordeel voor het visuele model was. Op pagina's vol met grafieken en formules groeide het voordeel van het visuele model enorm, terwijl ze op pagina's met alleen platte tekst ongeveer gelijk waren.

Geen Spelbedrog, Alleen Pure Visie
Je vraagt je misschien af: "Hadden ze vals gespeeld door de robot plaatjes én de antwoorden te laten zien?" Nee. Ze gebruikten geen speciale "afbeelding-naar-tekst" labels of spiekbriefjes. De robot kreeg simpelweg de opdracht om naar de volgende "patch" van de afbeelding te kijken en te raden hoe die eruit zou zien, vergelijkbaar met hoe het de volgende woorden in een zin raadt.

Verrassend genoeg maakte deze "alleen maar kijken"-training de robot beter in alles, niet alleen in kijken. Het werd ook beter in het begrijpen van tekst en zelfs beter in het verbinden van plaatjes aan woorden tijdens latere tests. De onderzoekers maten dit door te controleren hoe goed de "hersenen" van de robot plaatjes met woorden verbonden, en vonden dat de visuele training de twee concepten veel nauwer met elkaar liet samenvallen, alsof de robot eindelijk begreep dat een plaatje van een kat en het woord "kat" eigenlijk hetzelfde zijn.

Wat Dit Betekent (En Wat Niet)
De auteurs benadrukken dat dit geen toverstaf is die het lezen van tekst vervangt. Tekst is nog steeds geweldig voor het leren van feiten die al duidelijk zijn opgeschreven. Maar voor wetenschappelijke documenten, waarbij de lay-out, de vorm van een vergelijking en de positie van een diagram cruciale betekenis dragen, suggereert de visuele aanpak een nieuwe, schaalbare weg voorwaarts.

Ze geven toe dat ze nog niet alles hebben opgelost. Ze weten bijvoorbeeld niet zeker of dit even goed werkt voor willekeurige foto's van de natuur of video's, aangezien hun tests vooral gericht waren op hoog-densiteit wetenschappelijke PDF's. Maar voor het specifieke geval van het leren van complexe documenten, suggereert de paper dat het de AI laten zien hoe de wereld er werkelijk uitziet — visueel, rommelig en vol diagrammen — de sleutel kan zijn tot het ontsluiten van de ware intelligentie. Het is een verschuiving van "het lezen van de beschrijving van de kaart" naar "daadwerkelijk naar de kaart kijken".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →