← Últimos artículos
💬 NLP

Curation of a Palaeohispanic Dataset for Machine Learning

Este artículo presenta la creación de un conjunto de datos estructurado para el aprendizaje automático, diseñado para superar la falta de recursos y formatos adecuados que limitan el estudio computacional de las lenguas paleohispánicas, cuyo desciframiento sigue siendo incompleto.

Autores originales: Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar

Publicado 2026-04-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que las lenguas paleohispánicas son como recetas de cocina perdidas de una civilización antigua que vivió en la península ibérica antes de que llegaran los romanos. Tenemos los ingredientes (las inscripciones en piedra, cerámica o metal), pero no sabemos exactamente cómo se cocinaban ni qué sabían exactamente.

Los lingüistas han estado intentando descifrar estas recetas durante siglos, pero hasta ahora lo han hecho "a ojo" y con lápiz y papel. El problema es que la información estaba guardada en cajas desordenadas, escritas en papel viejo y con notas al margen confusas, lo que hace muy difícil usar las herramientas modernas de la inteligencia artificial para ayudarles.

Este artículo es como el trabajo de un organizador profesional que decide limpiar, etiquetar y poner en orden todo ese desorden para que una computadora pueda entenderlo.

Aquí te explico cómo lo hicieron, paso a paso, con algunas analogías sencillas:

1. El problema: La biblioteca del caos

Antes, si querías estudiar estas lenguas, tenías que ir a la "Biblioteca Hesperia" (una base de datos real). Pero era como entrar a una biblioteca donde los libros están tirados en el suelo, algunos escritos en español, otros en francés, y las fechas están escritas como "a mediados del siglo III a.C." o "quizás en el año 200".

  • El obstáculo: Las computadoras no entienden "quizás" ni "mediados". Necesitan números exactos y categorías claras. Además, los textos tenían anotaciones de expertos (como "aquí falta una letra" o "esto es una duda") que, aunque útiles para humanos, son ruido para una máquina.

2. La solución: El "Traductor" y el "Ordenador"

Los autores crearon un proceso de dos pasos para transformar este caos en un dataset (un conjunto de datos) listo para la Inteligencia Artificial.

Paso A: Recoger los ingredientes (Recopilación)

Cogieron todas las inscripciones de la base de datos Hesperia. Seleccionaron solo las que son "inscripciones" (textos escritos) y descartaron las que podían ser falsas, aunque las dejaron marcadas por si acaso alguien quiere estudiarlas más tarde.

Paso B: Cocinar el plato (Transformación de datos)

Aquí es donde ocurre la magia. Transformaron la información "humana" en "datos de máquina":

  • De "Lugar" a "Coordenadas GPS":
    En lugar de decir "en la provincia de Valencia", convirtieron el nombre del pueblo en latitud y longitud (como un pin en Google Maps).

    • La analogía: Imagina que en lugar de decirle a un robot "ve al parque", le das las coordenadas exactas. Así, el robot puede calcular la distancia entre dos inscripciones y ver si las lenguas eran parecidas porque vivían cerca.
  • De "Fechas vagas" a "Rangos numéricos":
    Si el texto decía "Comienzos del siglo II a.C.", el sistema lo transformó en un número matemático.

    • La analogía: Es como convertir "hace un rato" en "hace 15 minutos". Si dicen "comienzos", el sistema entiende que es el primer 20% de ese siglo. Así, la computadora puede hacer cálculos de tiempo.
  • De "Texto sucio" a "Texto limpio":
    Los textos originales tenían símbolos raros, notas entre paréntesis y números de línea. Los autores crearon un "filtro" (como un colador de pasta) que quitó todo lo que no era el texto real de la lengua antigua.

    • La analogía: Es como limpiar una foto antigua quitando las manchas de café y los garabatos para que solo se vea la imagen original. También unificaron las palabras que se escribían en varias líneas en una sola línea continua.
  • De "Categorías" a "Códigos":
    Cosas como "Material: Piedra" o "Dirección: De izquierda a derecha" se convirtieron en números simples (ej. Piedra = 1, Cerámica = 2).

    • La analogía: Es como poner etiquetas de colores en cajas. En lugar de leer "Caja de zapatos", la computadora solo ve "Caja Roja".

3. El resultado final: La caja de herramientas

Al final del proceso, tienen un archivo (un CSV) con 1.751 entradas (como 1.751 recetas diferentes) y 36 columnas de información.

  • Ahora, cualquier investigador puede usar Machine Learning (aprendizaje automático) para encontrar patrones que un humano no vería.
  • Podrían preguntar a la computadora: "¿Qué palabras se parecen entre el ibérico y el celtíbero?" o "¿Cómo cambió la escritura a medida que pasaban los años?".

¿Por qué es importante?

Hasta ahora, estudiar estas lenguas era como intentar armar un rompecabezas de 1.000 piezas en la oscuridad. Este trabajo enciende la luz y pone todas las piezas ordenadas por color y forma.

No es la solución final (las lenguas aún no se entienden perfectamente), pero es el primer paso esencial para que, en el futuro, la inteligencia artificial pueda ayudarnos a descifrar completamente estos idiomas perdidos y entender mejor quiénes eran nuestros antepasados.

En resumen: Han convertido un montón de notas antiguas y confusas en un libro de instrucciones digital que cualquier computadora moderna puede leer y analizar para descubrir secretos del pasado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →