← Últimos artículos
💻 computer science

ViHistScriptBench: Benchmarking Vietnamese Historical Script and Document–Type Classification in Low–Resource Settings

Este artículo presenta ViHistScriptBench, un banco de pruebas ligero y un proceso de evaluación diseñado para avanzar en la clasificación de escrituras históricas y tipos de documentos vietnamitas mediante la provisión de un corpus curado, tareas definidas y modelos de referencia para abordar los desafíos planteados por los datos limitados y la caligrafía compleja.

Autores originales: Nguyễn Tuệ An

Publicado 2026-07-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nguyễn Tuệ An

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante y polvorienta llena de libros antiguos vietnamitas. Algunos están escritos en antiguos caracteres chinos, otros en un guion vietnamita único que se parece al chino pero suena a vietnamita, y otros son intentos tempranos de escribir el vietnamita usando el alfabeto latino que usamos hoy en día.

El problema es que estos libros son difíciles de leer. La tinta se ha desvanecido, el papel está roto y los estilos de escritura son muy diferentes. Si quieres buscar en estos libros o convertirlos en texto digital, necesitas un programa de computadora (llamado OCR) para leerlos. Pero la mayoría de los programas de computadora actuales son como estudiantes que solo estudiaron inglés moderno; se confunden completamente cuando ven estos guiones antiguos y desordenados.

Este artículo presenta una nueva herramienta llamada ViHistScriptBench. Piensa en esto como un examen de práctica diseñado específicamente para entrenar a las computadoras para leer estos libros antiguos de Vietnam.

Así es como el artículo lo desglosa, utilizando analogías sencillas:

1. El "Gimnasio" para Computadoras (El Conjunto de Datos)

Para entrenar a una computadora para reconocer estos guiones, necesitas muchos ejemplos. Los autores reunieron 500 páginas de archivos digitales públicos (como la Biblioteca Nacional de Vietnam).

  • La Colección: Seleccionaron páginas que muestran diferentes "sabores" de escritura: caracteres chinos puros (Hán), logogramas vietnamitas puros (Nôm), una mezcla de ambos, y un temprano vietnamita basado en el alfabeto latino (Quốc Ngữ).
  • Las Etiquetas: No solo lanzaron las imágenes en un montón. Contrataron a expertos para etiquetar cada página, diciéndole a la computadora: "Esto es un manuscrito escrito a mano", "Esto es una impresión de xilografía" o "Esta página mezcla dos guiones". Es como un profesor calificando una pila de papeles y escribiendo notas al dorso.

2. Los Tres Desafíos (Las Tareas)

El artículo establece tres juegos específicos para que la computadora juegue:

  • Juego 1: Detective de Guiones. La computadora mira una página completa y tiene que adivinar: "¿Es chino, vietnamita, una mezcla o un latín temprano?". Es como mirar un menú y adivinar si está en francés, italiano o una mezcla de ambos.
  • Juego 2: Inspector de Materiales. La computadora tiene que adivinar cómo se hizo la página. ¿Fue escrita a mano con un pincel? ¿Fue tallada en madera y estampada? ¿O es un libro impreso moderno? Esto ayuda a la computadora a saber cómo manejar la "textura" de la página.
  • Juego 3: El Detector de Mezclas. Algunas páginas tienen una historia principal en un guion y notas diminutas en el margen en otro. La computadora tiene que detectar si una página es "mixta" o "pura".

3. Los Concursantes (Los Modelos)

Los autores probaron diferentes tipos de "estudiantes" (modelos de IA) para ver quién aprende mejor:

  • Los Clásicos (CNNs): Estos son como estudiantes tradicionales que son buenos detectando pequeños detalles (como la forma de una sola letra) pero a veces pierden de vista el panorama general.
  • Los Modernos (Vision Transformers): Estos son como estudiantes que miran la página completa a la vez, comprendiendo cómo se relacionan las columnas de texto entre sí.
  • Los Aprendices de "Cero Conocimiento Previo" (CLIP): Estos son como estudiantes que no han estudiado este tema específico pero son muy buenos adivinando basándose en el conocimiento general. Intentan adivinar el guion simplemente leyendo una descripción como "una página con caracteres chinos".

4. Los Resultados y las Dificultades

El artículo reporta que los modelos modernos (Vision Transformers) fueron los mejores, obteniendo aproximadamente un 90% de precisión. Esa es una nota aprobatoria, pero no es perfecta.

¿Dónde fallaron?
El artículo destaca "trampas" específicas que confundieron a las computadoras:

  • La Trampa de los Gemelos: Hán y Nôm se ven muy similares. Es como intentar distinguir entre un hermano gemelo y una hermana de una foto borrosa. Las computadoras a menudo los confundían.
  • La Trampa del Ruido: Los libros antiguos tienen manchas, agujeros de gusanos y tinta desvanecida. Las computadoras a veces confundían una mancha de café con parte de una letra.
  • La Trampa de la Dirección: Estos libros antiguos se escriben verticalmente (de arriba a abajo). Las computadoras acostumbradas a leer texto horizontal en inglés a veces se confundían con el diseño.
  • La Trampa de los Acentos: El vietnamita utiliza muchos pequeños signos (diacríticos) para cambiar el sonido de una letra. Si la tinta estaba emborronada, la computadora no podía distinguir si una marca era un acento tonal o simplemente una mota de suciedad.

5. Por qué esto es importante

Los autores no prometen que podamos traducir instantáneamente toda la historia de Vietnam hoy. En su lugar, están diciendo: "Aquí hay una prueba justa y una línea de salida".

Antes de esto, los investigadores intentaban correr carreras sin una pista o un cronómetro. Ahora, con ViHistScriptBench, todos tienen las mismas 500 páginas y las mismas reglas. Esto permite a los científicos comparar sus herramientas de manera justa, ver exactamente dónde fallan y construir mejores "estudiantes" para ayudar a preservar y desbloquear la historia escrita de Vietnam.

En resumen: Construyeron una prueba de práctica para ayudar a las computadoras a aprender a leer libros antiguos y desordenados de Vietnam, mostrándonos exactamente dónde todavía se confunden las computadoras para que podamos enseñárselas mejor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →