← Derniers articles
💬 NLP

Curation of a Palaeohispanic Dataset for Machine Learning

Cet article présente la création d'un jeu de données structuré pour les langues paléo-hispaniques afin de faciliter leur étude par des techniques d'apprentissage automatique, comblant ainsi le manque de ressources numériques adaptées à ce domaine.

Auteurs originaux : Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar

Publié 2026-04-16
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Gonzalo Martínez-Fernández, Jose F Quesada, Agustín Riscos-Núñez, Francisco José Salguero-Lamillar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🏺 Le Grand Puzzle des Langues Oubliées

Imaginez que l'histoire de l'Espagne et du sud de la France avant l'arrivée des Romains est comme un immense puzzle géant, mais dont la moitié des pièces a disparu.

Les linguistes étudient depuis des siècles ces anciennes langues (comme l'Ibère ou le Celtibère) en regardant des inscriptions gravées sur des pierres, de l'argile ou du métal. C'est un travail de détective : ils essaient de comprendre ce que ces gens disaient, comment ils écrivaient et comment leur langue fonctionnait. Le problème ? La plupart de ces études sont faites "à l'ancienne", avec des stylos et des cerveaux, sans l'aide des ordinateurs modernes.

🤖 Pourquoi les ordinateurs ne peuvent pas encore aider ?

Aujourd'hui, l'intelligence artificielle (comme les modèles qui écrivent des textes ou traduisent des langues) est très puissante. Mais pour apprendre, elle a besoin de nourriture : des données propres, bien rangées et faciles à digérer.

Actuellement, les données sur ces langues anciennes sont comme un grenier rempli de trésors, mais en désordre total :

  • Les informations sont écrites dans des fichiers complexes.
  • Les dates sont écrites en phrases complètes ("début du IIIe siècle avant J.-C.").
  • Les noms de lieux sont en espagnol ou en français, mélangés.
  • Il y a des annotations de chercheurs partout, comme du bruit dans une radio.

Si vous donnez ce "grenier en désordre" à un ordinateur, il ne comprendra rien. C'est comme essayer de cuisiner un gâteau avec de la farine, des œufs et des coquilles non cassées, le tout dans un sac poubelle.

🛠️ La Solution : Le "Grand Nettoyage" Numérique

C'est là que cet article intervient. Les auteurs (des chercheurs de l'Université de Séville) ont décidé de faire le ménage. Ils ont pris toutes ces données brutes et les ont transformées en un dataset (une base de données) prêt à l'emploi pour les machines.

Voici comment ils ont fait, avec des analogies simples :

  1. Transformer les lieux en GPS 📍
    Au lieu de laisser le nom d'un village écrit en lettres ("Sagunto"), ils ont remplacé le texte par des coordonnées GPS (latitude et longitude).

    • L'analogie : C'est comme passer d'une adresse écrite "Maison rouge près du vieux chêne" à un point précis sur Google Maps. L'ordinateur peut maintenant calculer la distance entre deux inscriptions et voir des modèles géographiques.
  2. Transformer les dates en nombres 📅
    Les dates étaient écrites en texte ("vers 200 av. J.-C."). Les chercheurs ont créé un système pour transformer cela en nombres mathématiques (par exemple, -200).

    • L'analogie : C'est comme changer une description vague ("il y a longtemps") en un chiffre précis sur une règle. L'ordinateur peut maintenant dire : "Ah, cette inscription est plus récente que celle-là de 50 ans".
  3. Nettoyer le texte comme on épluche une orange 🍊
    Les textes originaux contiennent beaucoup de "peau" inutile pour l'ordinateur : des commentaires des chercheurs, des crochets, des symboles de doute.

    • L'analogie : Ils ont créé une version "nettoyée" du texte où ils ont retiré tout le bruit (les crochets, les notes en espagnol) pour ne garder que le fruit pur : le texte ancien lui-même. Ils ont aussi remplacé les lettres illisibles par un signe "+" pour que l'ordinateur sache qu'il manque un morceau, sans se tromper.
  4. Classer les objets en catégories 📦
    Pour des choses comme le matériau (pierre, argile) ou la technique (gravé, peint), ils ont attribué un numéro à chaque catégorie.

    • L'analogie : Au lieu de dire "C'est une pierre", l'ordinateur voit "Catégorie 2". C'est plus rapide à traiter pour lui.

🎁 Le Résultat : Une Boîte à Outils pour l'Avenir

À la fin de ce travail, les chercheurs ont créé un fichier (un fichier CSV) contenant 1 751 inscriptions bien rangées avec 36 colonnes d'informations.

C'est comme si ils avaient construit une bibliothèque parfaitement organisée pour les robots. Désormais, les chercheurs peuvent utiliser l'intelligence artificielle pour :

  • Deviner comment les mots étaient séparés (car parfois, les mots étaient collés les uns aux autres).
  • Trouver des liens cachés entre les langues.
  • Analyser la grammaire de ces langues mortes.

🌟 En Résumé

Cet article ne propose pas de nouvelles découvertes historiques directes (comme "on a trouvé un nouveau mot"). Il propose quelque chose d'aussi important : il donne les outils pour que l'avenir fasse ces découvertes.

C'est comme passer d'une carte dessinée à la main, floue et difficile à lire, à un système de navigation GPS précis. Grâce à ce travail, l'intelligence artificielle peut enfin aider les linguistes à déchiffrer les secrets des langues oubliées de la péninsule ibérique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →