← Nieuwste papers
💻 computer science

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

Deze paper introduceert Jagle, het grootste tot nu toe beschikbare Japanse multimodale post-training dataset met ongeveer 9,2 miljoen instances, dat door het genereren van nieuwe vraag-antwoordparen uit diverse bronnen in plaats van het hergebruiken van bestaande VQA-datasets, de prestaties van Japanse vision-language modellen aanzienlijk verbetert zonder de Engelse vaardigheden te beïnvloeden.

Oorspronkelijke auteurs: Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

Gepubliceerd 2026-04-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot wilt bouwen die niet alleen tekst kan lezen, maar ook foto's, grafieken en documenten kan "begrijpen". In de wereld van kunstmatige intelligentie noemen we deze robots Vision-Language Models (VLM's).

Tot nu toe was er een groot probleem: deze robots waren als een kind dat alleen Engels had geleerd. Ze waren slim in het Engels, maar als je ze een foto in het Japans gaf, keken ze er verward bij. De reden? Er was simpelweg niet genoeg "leermateriaal" in het Japans.

De auteurs van dit paper hebben een oplossing bedacht die ze Jagle noemen. Hier is hoe het werkt, vertaald naar een simpel verhaal:

1. Het probleem: De lege boekenkast

Stel je voor dat je een school wilt bouwen voor deze robots. In het Engels zijn er enorme bibliotheken vol met oefeningen: duizenden foto's met vragen en antwoorden (bijvoorbeeld: "Wat zie je op deze foto?" of "Wat zegt deze grafiek?").

Maar voor het Japans was die bibliotheek bijna leeg. Er waren wel een paar kleine boekjes, maar niet genoeg om een echte expert van te maken. De oude manier om een bibliotheek te bouwen was: "Haal alle bestaande boekjes bij elkaar en plak ze aan elkaar." Maar dat werkt niet als er geen boekjes zijn om te plakken.

2. De oplossing: Een eigen fabriek bouwen

In plaats van te wachten op bestaande boekjes, hebben de onderzoekers een fabriek gebouwd. Ze hebben geen kant-en-klare oefeningen gebruikt, maar ze hebben ruwe grondstoffen verzameld en die zelf omgezet in oefeningen.

Hoe deden ze dat?

  • De grondstoffen: Ze verzamelden alles wat ze konden vinden: foto's van Japanse straten, PDF-documenten van overheidsinstanties, Wikipedia-artikelen en zelfs oude kranten.
  • De fabrieksarbeiders (AI): Ze gebruikten een andere, zeer slimme AI (een "meester-robot") om deze ruwe beelden en teksten te bekijken en er vragen bij te verzinnen.
    • Voorbeeld: De meester-robot kijkt naar een foto van een politiebureau in Tokio en vraagt zichzelf: "Wat is dit?" en bedenkt het antwoord: "Dit is het hoofdkantoor van de politie van Gunma."
    • Voorbeeld: Ze nemen een grafiek over onroerend goed en laten de robot uitleggen wat de lijnen betekenen.

Op deze manier hebben ze 9,2 miljoen nieuwe oefeningen gemaakt. Dat is een gigantische bibliotheek, speciaal voor het Japans.

3. De resultaten: Van beginner tot expert

Ze hebben een robot (een model van 2,2 miljard parameters) getraind met deze nieuwe "Jagle"-bibliotheek. Het resultaat was opmerkelijk:

  • In het Japans: De robot die met Jagle had geoefend, was veel beter dan de beste robots die we tot nu toe hadden. Hij scoorde zelfs beter dan de populaire InternVL3.5 en kwam heel dicht in de buurt van de superster Qwen3-VL. Het was alsof je een student die net begon, in één keer naar een universitair niveau hebt getild.
  • In het Engels: Hier was de verrassing. Soms denken mensen dat als je een robot leert in een tweede taal, hij zijn eerste taal vergeet (zoals een kind dat twee talen leert en verward raakt). Maar dat gebeurde hier niet. Sterker nog: door de Japanse oefeningen toe te voegen aan de Engelse oefeningen, werd de robot zelfs beter in het Engels!

Waarom werkt dit? (De Metafoor)

Stel je voor dat je een kok bent die alleen Italiaanse gerechten kent. Als je nu ook begint te koken met Japanse ingrediënten (vis, rijst, specerijen), leer je niet alleen Japanse gerechten. Je leert ook nieuwe technieken en smaken die je in je Italiaanse keuken kunt toepassen. Je wordt een veel veelzijdigere kok.

Dat is precies wat Jagle deed: het gaf de robot een breder perspectief, waardoor hij niet alleen in het Japans, maar ook in het Engels slimmer werd.

Conclusie

Deze paper laat zien dat je niet hoeft te wachten tot er genoeg data is. Je kunt zelf data "kweken" door slimme strategieën te gebruiken. Met Jagle hebben ze de weg vrijgemaakt voor slimme robots die de wereld niet alleen in het Engels, maar ook in het Japans (en in de toekomst in andere talen) echt kunnen begrijpen. Ze hebben de code, de data en het getrainde model gratis beschikbaar gesteld, zodat iedereen mee kan bouwen aan deze slimme toekomst.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →