← Nieuwste papers
🤖 AI

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

Dit artikel stelt een nieuwe semantiek-gebaseerde contrastieve leerstrategie voor voor pre-training die gebruikmaakt van multi-modale visuele en contextuele semantiek om diepe visuele representaties voor logografische karakterherkenning te verbeteren, waarmee de prestatiebeperkingen die worden veroorzaakt door ongebalanceerde en zeldzame karakterdatasets effectief worden aangepakt.

Oorspronkelijke auteurs: Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren om elk afzonderlijk karakter in de wereld te herkennen, van de letters in je naam tot de eeuwenoude symbolen die in stenen tabletten zijn gekerfd. Dit is de wereld van computer vision, een tak van kunstmatige intelligentie waarbij machines leren om afbeeldingen te "zien" en te begrijpen. Lange tijd waren deze robots goed in het spotten van eenvoudige dingen zoals katten of auto's, maar ze hebben moeite met logografische karakters — schrijfsystemen waarbij één symbool een heel woord of idee vertegenwoordigt, zoals het Chinese Hanzi of Japanse Kanji. Het probleem is niet alleen dat er duizenden van deze karakters zijn; het is ook dat sommige dagelijks worden gebruikt (zoals "de" of "water"), terwijl andere zo zeldzaam zijn dat ze misschien maar één keer in duizend jaar voorkomen. Het is alsof je een taal probeert te leren waarin je een miljoen exemplaren van het woord "appel" hebt, maar slechts één exemplaar van "zebra". De robot raakt in de war en focust te veel op de veelvoorkomende woorden, waardoor hij de zeldzame vergeet. Om dit op te lossen, gebruiken wetenschappers een techniek genaamd contrastive learning, wat lijkt op een spelletje "zoek de verschillen". De robot krijgt twee plaatjes te zien en krijgt de vraag: "Zijn dit dezelfde?" Als dat zo is, trekt hij ze in zijn brein dichter bij elkaar; als dat niet zo is, duwt hij ze uit elkaar. Maar er is een addertje onder het gras: de robot behandelt meestal elk "verschillend" paar als even verschillend, wat niet goed werkt wanneer sommige verschillen subtiel zijn en andere overduidelijk.

Dit artikel introduceert een slimme nieuwe manier om deze robots te leren hoe ze zeldzame en veelvoorkomende karakters beter kunnen begrijpen door ze een referentiepunt te geven: context. De auteurs, een team van onderzoekers van universiteiten in het VK en China, realiseerden zich dat alleen naar de vorm van een karakter kijken niet genoeg is. In menselijke taal begrijpen we woorden niet alleen door hoe ze eruitzien, maar ook door het gezelschap dat ze houden. Bijvoorbeeld, het woord "boomgaard" doet je denken aan bomen en fruit, terwijl "tuin" je doet denken aan bloemen en paden. Hoewel het verschillende woorden zijn, liggen ze semantisch dicht bij elkaar. De onderzoekers merkten op dat logografische karakters op dezelfde manier werken: een karakter dat op een vis lijkt, betekent vaak "vis", en karakters met vergelijkbare betekenissen delen vaak visuele onderdelen. Ze stelden een methode voor genaamd Semantic-based Contrastive Learning. In plaats van de robot alleen maar te vertellen: "Deze twee zijn verschillend, duw ze uit elkaar," gebruiken ze een taalmodel (een super-slim tekstvoorspeller) om de robot te vertellen hoe verschillend ze zijn. Als twee karakters semantisch dicht bij elkaar liggen (zoals "boomgaard" en "tuin"), krijgt de robot de instructie om ze redelijk dicht bij elkaar te houden, zelfs als ze er anders uitzien. Als ze totaal ongerelateerd zijn, duwt hij ze ver uit elkaar. Dit creëert een "zachte" kaart van relaties in plaats van een rigide zwart-wit lijst.

Het team testte dit idee op verschillende datasets, waaronder handgeschreven Chinese karakters, historische Japanse teksten en echte verkeersborden. Ze ontdekten dat hun nieuwe methode bestaande state-of-the-art technieken aanzienlijk overtrof, vooral wanneer de data rommelig en ongebalanceerd was. Bijvoorbeeld, op een dataset genaamd HWDB1.1 met een ernstige onbalans (waarbij de meest voorkomende klasse 100 keer meer monsters had dan de zeldzaamste), bereikte hun methode een nauwkeurigheid van 83,46% met een standaard ResNet18 backbone, waarmee ze de vorige beste contrastive learning methode (SimCLR) versloegen, die slechts 56,68% bereikte. Zelfs op de meer gebalanceerde K-Kanji dataset haalde hun aanpak 95,30%, waarmee ze de op één na beste methode met een duidelijke marge overtrof. De onderzoekers voerden ook "ablatie-studies" uit (experimenten waarbij ze delen van hun systeem uitschakelden) om te bewijzen dat zowel het visuele leren als de contextuele referentie noodzakelijk waren; het gebruik van slechts één van beide resulteerde in lagere scores. Ze ontdekten ook dat het simpelweg proberen te matchen van de exacte afstand tussen woorden (een methode genaamd MSE) niet zo goed werkte als het matchen van het patroon van relaties (distribution-level alignment). Door de relatie tussen karakters te behandelen als een flexibel, gradueel spectrum in plaats van een vaste regel, leert de robot zelfs de zeldzaamste, meest obscure karakters met veel meer vertrouwen te herkennen. Dit suggereert dat door de manier waarop mensen context begrijpen te lenen, we slimmere, meer gebalanceerde AI kunnen bouwen voor het lezen van de meest complexe schriftvormen ter wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →