← Derniers articles
💻 computer science

ViHistScriptBench: Benchmarking Vietnamese Historical Script and Document–Type Classification in Low–Resource Settings

Cet article présente ViHistScriptBench, un banc d'essai léger et une pipeline d'évaluation conçus pour faire progresser la classification des écritures historiques et des types de documents vietnamiens en fournissant un corpus organisé, des tâches définies et des modèles de référence afin de répondre aux défis posés par la rareté des données et la complexité de la calligraphie.

Auteurs originaux : Nguyễn Tuệ An

Publié 2026-07-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nguyễn Tuệ An

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une immense bibliothèque poussiéreuse remplie de vieux livres vietnamiens. Certains sont écrits en anciens caractères chinois, d'autres dans une écriture vietnamienne unique qui ressemble au chinois mais se prononce en vietnamien, et certains sont des tentatives précoces d'écrire le vietnamien à l'aide de l'alphabet latin que nous utilisons aujourd'hui.

Le problème est que ces livres sont difficiles à lire. L'encre est décolorée, le papier est déchiré et les styles d'écriture sont radicalement différents. Si vous voulez rechercher dans ces livres ou les transformer en texte numérique, vous avez besoin d'un programme informatique (appelé OCR) pour les lire. Mais la plupart des programmes informatiques actuels sont comme des étudiants qui n'ont étudié que l'anglais moderne ; ils sont complètement confus face à ces anciens scripts désordonnés.

Ce document présente un nouvel outil appelé ViHistScriptBench. Considérez cela comme un examen blanc conçu spécifiquement pour entraîner les ordinateurs à lire ces vieux livres vietnamiens.

Voici comment le document le décompose, en utilisant des analogies simples :

1. La « salle de sport » pour ordinateurs (Le Jeu de Données)

Pour entraîner un ordinateur à reconnaître ces scripts, il faut beaucoup d'exemples. Les auteurs ont rassemblé 500 pages provenant d'archives numériques publiques (comme la Bibliothèque Nationale du Vietnam).

  • La Collection : Ils ont choisi des pages qui présentent différentes « saveurs » d'écriture : le chinois pur (Hán), le vietnamien logographique pur (Nôm), un mélange des deux, et le vietnamien précoce basé sur le latin (Quốc Ngữ).
  • Les Étiquettes : Ils n'ont pas simplement jeté les images en un tas. Ils ont engagé des experts pour étiqueter chaque page, disant à l'ordinateur : « Ceci est un manuscrit manuscrit », « Ceci est une impression sur bois », ou « Cette page mélange deux scripts ». C'est comme un professeur qui corrige une pile de copies et écrit des notes au dos.

2. Les Trois Défis (Les Tâches)

Le document propose trois jeux spécifiques pour l'ordinateur :

  • Jeu 1 : Le Détective de Scripts. L'ordinateur regarde une page entière et doit deviner : « Est-ce du chinois, du vietnamien, un mélange, ou du latin ancien ? » C'est comme regarder un menu et deviner s'il est en français, en italien ou un mélange des deux.
  • Jeu 2 : L'Inspecteur de Matériaux. L'ordinateur doit deviner comment la page a été fabriquée. A-t-elle été écrite à la main avec un pinceau ? A-t-elle été gravée dans du bois et estampillée ? Ou est-ce un livre imprimé moderne ? Cela aide l'ordinateur à comprendre la « texture » de la page.
  • Jeu 3 : Le Repéreur de Mélanges. Certaines pages ont une histoire principale dans un script et de petites notes dans la marge dans un autre. L'ordinateur doit détecter si une page est « mixte » ou « pure ».

3. Les Compétiteurs (Les Modèles)

Les auteurs ont testé différents types d'« étudiants » (modèles d'IA) pour voir qui apprend le mieux :

  • Les Classiques (CNN) : Ce sont des étudiants traditionnels qui sont doués pour repérer de petits détails (comme la forme d'une seule lettre) mais qui passent parfois à côté de la vue d'ensemble.
  • Les Modernes (Vision Transformers) : Ce sont des étudiants qui regardent la page entière d'un coup, comprenant comment les colonnes de texte sont liées entre elles.
  • Les Apprenants « Zero-Shot » (CLIP) : Ce sont des étudiants qui n'ont pas étudié ce sujet spécifique mais qui sont très doués pour deviner en se basant sur des connaissances générales. Ils essaient de deviner le script simplement en lisant une description comme « une page avec des caractères chinois ».

4. Les Résultats et les Difficultés

Le document rapporte que les modèles modernes (Vision Transformers) ont obtenu les meilleurs résultats, atteignant environ 90 % de précision. C'est une note de passage, mais ce n'est pas parfait.

Où ont-ils échoué ?
Le document souligne des « pièges » spécifiques qui ont dérouté les ordinateurs :

  • Le Piège des Jumeaux : Le Hán et le Nôm se ressemblent beaucoup. C'est comme essayer de faire la différence entre un frère et une sœur jumeaux sur une photo floue. Les ordinateurs les ont souvent confondus.
  • Le Piège du Bruit : Les vieux livres ont des taches, des trous de vers et de l'encre décolorée. Les ordinateurs ont parfois confondu une tache de café avec une partie d'une lettre.
  • Le Piège de la Direction : Ces vieux livres sont écrits verticalement (de haut en bas). Les ordinateurs habitués à lire du texte anglais horizontal se sont parfois perdus dans la mise en page.
  • Le Piège des Accents : Le vietnamien utilise de nombreux petits signes (diacritiques) pour changer le son d'une lettre. Si l'encre était tachée, l'ordinateur ne pouvait pas dire si un signe était un accent de ton ou juste une tache de saleté.

5. Pourquoi cela compte

Les auteurs ne promettent pas que nous puissions instantanément traduire toute l'histoire du Vietnam aujourd'hui. Au lieu de cela, ils disent : « Voici un test équitable et une ligne de départ. »

Avant cela, les chercheurs essayaient de courir des courses sans piste ni chronomètre. Désormais, avec ViHistScriptBench, tout le monde a les mêmes 500 pages et les mêmes règles. Cela permet aux scientifiques de comparer leurs outils de manière équitable, de voir exactement où ils échouent et de construire de meilleurs « étudiants » pour aider à préserver et à déverrouiller l'histoire écrite du Vietnam.

En bref : Ils ont construit un examen blanc pour aider les ordinateurs à apprendre à lire les livres vietnamiens anciens et désordonnés, nous montrant précisément là où les ordinateurs sont encore confus afin que nous puissions mieux les enseigner.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →