← Nieuwste papers
💻 computer science

Winner Team Mia at TextVQA Challenge 2021: Vision-and-Language Representation Learning with Pre-trained Sequence-to-Sequence Model

Het winnende team van de TextVQA Challenge 2021 gebruikte een pre-trained T5-3B generatief model, dat via specifieke pre-trainingstaken (MLM en RPP) werd geoptimaliseerd voor de fusie van visuele en tekstuele informatie, om vragen over tekst in afbeeldingen te beantwoorden.

Oorspronkelijke auteurs: Yixuan Qiao, Hao Chen, Jun Wang, Shanshan Zhao, Yihao Chen, Xianbin Ye, Ziliang Li, Xianbiao Qi, Peng Gao, Guotong Xie

Gepubliceerd 2026-02-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yixuan Qiao, Hao Chen, Jun Wang, Shanshan Zhao, Yihao Chen, Xianbin Ye, Ziliang Li, Xianbiao Qi, Peng Gao, Guotong Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Super-Lezer" met een Fotocamera: Hoe Team Mia computers leert kijken én begrijpen

Stel je voor dat je een foto krijgt van een druk straatbeeld in New York. Ik vraag je: "Welk merk staat er op de koffiebeker van de man met de rode hoed?" Om dit te beantwoorden, moet je drie dingen tegelijk doen: je ogen gebruiken om de man te vinden, je hersenen gebruiken om de tekst op de beker te lezen, en je logica gebruiken om de vraag te koppelen aan wat je ziet.

Voor een computer is dit ontzettend moeilijk. Computers zijn vaak goed in één ding: ze kunnen plaatjes herkennen (zoals een 'hond' of 'auto'), óf ze kunnen tekst lezen (zoals een boek). Maar het combineren van die twee — kijken naar een tekst ín een plaatje en begrijpen wat het betekent — is een enorme uitdaging. Dit noemen we TextVQA.

Team Mia heeft een methode ontwikkeld om computers deze "superkracht" te geven.

1. De Basis: Een Brein met een Gigantisch Geheugen (T5-3B)

In plaats van een computer vanaf nul te leren praten, gebruikten ze een bestaand, superintelligent taalmodel genaamd T5.

De metafoor: Denk aan een student die al een hele bibliotheek heeft gelezen en perfect Nederlands spreekt, maar nog nooit een foto heeft gezien. De student weet alles van taal, maar heeft geen oog voor de visuele wereld. Team Mia gaat deze student nu "visuele training" geven.

2. De Training: De "Blinde Student" Training (Pre-training)

Voordat de computer de echte vragen mocht beantwoorden, moest hij eerst een enorme training doorlopen met 9 miljoen afbeeldingen. Ze gebruikten twee slimme trucjes:

  • Het Tekst-Puzzelspel (MLM): Ze hielden delen van de tekst in de afbeeldingen af en vroegen de computer: "Wat ontbreekt hier?" Dit dwingt de computer om echt naar de letters te kijken in plaats van alleen maar te gokken.
  • De "Waar is het?" Test (RPP): Ze vroegen de computer om de relatie te leggen tussen een object (bijvoorbeeld een auto) en de tekst in de buurt (bijvoorbeeld een nummerbord). Dit is alsof je een kind leert: "Kijk naar die rode auto, de tekst die je daar ziet, dat is zijn kenteken."

De metafoor: Het is alsof je een student traint door hem duizenden foto's te laten zien waarbij hij steeds moet raden welke tekst bij welk object hoort. Zo leert hij de "taal van de wereld" begrijpen.

3. De Fine-tuning: De Examenvoorbereiding

Nadat de computer de basis onder de knie had, kregen ze hem de specifieke vragen van de TextVQA-wedstrijd te zien. Nu hoefde hij alleen nog maar te leren hoe hij de specifieke vragen van mensen moest beantwoorden op basis van wat hij zag.

4. De Laatste Check: De Spellingcontrole (Post-processing)

Soms maakt de computer een klein foutje, zoals "Koffie" schrijven als "Kofie". Om te voorkomen dat hij punten verliest voor een typefout, gebruikten ze een slimme software-tool (fuzzywuzzy) die kijkt naar de bedoeling van het woord.

De metafoor: Het is als een leraar die een antwoord nakijkt. Als de leerling "Appel" schrijft als "Aple", zegt de leraar: "Ik begrijp wat je bedoelt, het is goed!" in plaats van een dik rood kruis te zetten.

De Conclusie: Wat hebben ze geleerd?

Team Mia bewees dat als je een computer een enorm taalgeheugen geeft en hem vervolgens traint met miljoenen plaatjes met tekst, hij een meester wordt in het begrijpen van de wereld.

De belangrijkste lessen:

  1. Groot is beter: Hoe meer plaatjes en tekst je gebruikt, hoe slimmer hij wordt.
  2. Taal is de sleutel: Beginnen met een model dat al kan praten, werkt veel beter dan vanaf nul beginnen.
  3. Kijken is meer dan zien: Het gaat er niet om dat de computer een object ziet, maar dat hij de relatie begrijpt tussen het object en de tekst die erop staat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →