← Nieuwste papers
💬 NLP

WAON: Large-Scale Japanese Image-Text Pair Dataset for Improving Model Performance on Japanese Cultural Tasks

Deze paper introduceert WAON, het grootste Japanse beeld-tekstpaardataset met ongeveer 155 miljoen voorbeelden, en het bijbehorende WAON-Bench-evaluatiekader om de prestaties van visueel-taalmodellen op Japanse culturele taken te verbeteren.

Oorspronkelijke auteurs: Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

Gepubliceerd 2026-04-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kunstenaar bent die wil leren schilderen, maar je hebt alleen maar boeken in het Engels en Frans. Je kunt wel proberen te raden wat er staat, maar je mist de nuances, de lokale verhalen en de specifieke gevoelens van de Japanse cultuur. Dat is precies het probleem waar kunstmatige intelligentie (AI) mee worstelde als het ging om het begrijpen van Japan.

Deze paper introduceert WAON, een oplossing die we kunnen vergelijken met het bouwen van een enorme, super-organiseerde bibliotheek, speciaal voor Japan.

Hier is het verhaal, vertaald naar alledaags taal:

1. Het Probleem: De "Vertaal-fout" en de Schaarste

Tot nu toe hadden AI-modellen twee opties om Japan te leren kennen:

  • Optie A: Ze leerden van een paar kleine Japanse datasets (zoals een klein schoolboekje). Dat was te weinig om echt goed te worden.
  • Optie B: Ze namen een enorm Engels boek, vertaalden het naar het Japans en hoopten dat het klopte. Het probleem? Vertalingen zijn vaak stijf, missen de "ziel" van de taal en brengen de culturele vooroordelen van het Engels mee. Het is alsof je probeert sushi te maken met een recept dat uit de VS komt: het smaakt misschien naar vis, maar het is geen echte sushi.

2. De Oplossing: WAON (De Grote Japanse Bibliotheek)

De onderzoekers hebben WAON gebouwd. Dit is geen vertaling, maar een verzameling van 155 miljoen foto's en teksten die echt op het Japanse internet staan.

Hoe hebben ze dit gedaan? (De "Filter-fabriek")
Stel je voor dat je een gigantische rivier van internet-data (de "Common Crawl") in je tuin hebt. Het water zit vol met modder, afval en dubbele flessen. Je wilt alleen het heldere water.

  1. Het Net uitzetten: Ze haalden alleen de Japanse pagina's uit de rivier.
  2. De Vuilnisbak: Ze gooiden dubbele foto's weg (zoals dezelfde reclamebanner die overal staat) en foto's van slechte kwaliteit (te klein, te vaag).
  3. De Veiligheidscontrole: Ze verwijderden alles wat ongepast of gevaarlijk was (NSFW-filter).
  4. De "Match"-test: Dit is het slimme deel. Ze gebruikten een slimme AI om te kijken of de tekst wel echt bij de foto paste. Als er een foto van een kat stond met de tekst "Ik hou van pizza", werd die weggegooid. Ze wilden alleen foto's waar de tekst perfect bij de afbeelding paste.

Het resultaat? Een schone, enorme verzameling van 155 miljoen Japanse foto's met bijpassende, authentieke teksten.

3. De Test: WAON-Bench (De Eindexamen)

Om te bewijzen dat hun nieuwe bibliotheek werkt, moesten ze een examen maken. De oude examens (zoals de "Recruit-dataset") hadden veel fouten:

  • Onbalans: Er waren 100 vragen over eten, maar maar 1 vraag over gebouwen.
  • Verwarrende vragen: Soms was de foto van een vrouw, maar stond er "Tempel" bij.

De onderzoekers maakten daarom WAON-Bench. Dit is een nieuw, eerlijk examen met 374 categorieën (van dieren en gebouwen tot festivals en eten). Ze hebben elke foto met de hand gecontroleerd door mensen, zodat er geen fouten in zaten. Het is alsof ze een nieuwe, perfecte toets hebben gemaakt in plaats van te vertrouwen op een oude, beschadigde versie.

4. Het Resultaat: De AI die eindelijk "Japans" denkt

Toen ze een AI-model lieten trainen met hun nieuwe WAON-dataset, gebeurde er iets magisch:

  • Beter dan de rest: De AI werd veel beter in het herkennen van Japanse cultuur dan modellen die met de oude datasets waren getraind.
  • Efficiëntie: Ze hadden minder tijd en data nodig om de top te bereiken dan de concurrentie.
  • Wereldwijd: Interessant genoeg werd de AI ook nog steeds goed in het begrijpen van andere culturen (zoals het Westen), maar was ze nu ook een expert in Japan.

De Grootte van het Project

Stel je voor dat je een spreekwoordelijke "ocean" van data hebt. WAON is de grootste "Japanse oceaan" die ooit is gemaakt. Het is groter dan alle andere Japanse datasets die we tot nu toe hadden.

Conclusie

Kortom: De onderzoekers hebben de sleutel gevonden om AI's echt "Japans" te laten denken. In plaats van te vertalen of te gissen, hebben ze de AI laten drinken uit de bron zelf: het echte Japanse internet, schoongemaakt, geordend en getest. Hierdoor kunnen AI's nu eindelijk de subtiliteiten van de Japanse cultuur begrijpen, alsof ze er zelf zijn opgegroeid.

En het beste deel? Ze hebben de blauwdrukken, de bibliotheek en de examenlijst allemaal gratis beschikbaar gesteld, zodat iedereen mee kan bouwen aan deze slimme machines.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →