← Derniers articles
💻 computer science

Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources

Ce document présente le Hub de ressources Swa-bhasha, une plateforme accessible au public offrant une collection complète de données et d'algorithmes pour la translittération du sinhala romanisé vers le sinhala, développée entre 2020 et 2025, ainsi qu'une analyse comparative des outils existants afin de faire progresser le traitement automatique du langage naturel en sinhala.

Auteurs originaux : Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, Pasindu Gamage, Ruvan Weerasinghe, Y. H. P. P. Priyadarshana

Publié 2026-04-28
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, Pasindu Gamage, Ruvan Weerasinghe, Y. H. P. P. Priyadarshana

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez la langue cinghalaise comme un jardin magnifique et complexe. Depuis des décennies, les gens au Sri Lanka tentent d'entrer dans ce jardin en utilisant un ensemble de clés différent : le clavier anglais. Parce qu'ils n'avaient pas de clavier cinghalais à portée de main, ils ont commencé à taper les sons cinghalais en utilisant des lettres anglaises. Ils ont appelé cela « Singlish » (cinghalais romanisé).

Considérez le Singlish comme un code secret ou un dialecte de fautes de frappe. Il est rapide et pratique, mais il est désordonné. Un mot tapé « Adaraya » pourrait signifier « Amour » ou « Aide », selon le contexte. C'est comme si vous tapiez « bat » et que cela pouvait signifier l'animal, l'équipement sportif ou un verbe, et que l'ordinateur ne savait pas lequel vous vouliez dire sans lire toute la phrase.

Ce document est un bulletin de notes et une boîte à outils d'une équipe de chercheurs (l'équipe Swa-bhasha) qui a passé des années à construire un pont pour aider les ordinateurs à comprendre ce code désordonné et à le retransformer en un cinghalais correct et magnifique.

Voici ce qu'ils ont construit, expliqué simplement :

1. Le Problème : Le Jeu de la « Perte en Traduction »

L'équipe a remarqué que, bien que les ordinateurs soient excellents pour traduire l'anglais en français, ils peinent avec le passage du « Singlish » au cinghalais.

  • Le Désordre : Les gens tapent différemment. Certains omettent les voyelles (écrivant « klna » au lieu de « kalana »), d'autres utilisent les règles d'orthographe anglaises, et certains mélangent des mots anglais et cinghalais dans la même phrase.
  • L'Ambiguïté : Le plus gros casse-tête est qu'un mot tapé peut avoir plusieurs significations. L'ordinateur doit agir comme un détective pour déterminer quel sens correspond à l'histoire.

2. La Boîte à Outils : Comment Ils Ont Résolu le Problème

L'équipe n'a pas construit un seul outil ; elle a créé tout un atelier avec différentes machines, devenant plus intelligente à chaque génération.

  • Le Robot du Livre de Règles (Swa Bhasha 1.0) :

    • Fonctionnement : Imaginez un robot qui suit un manuel d'instructions strict. S'il voit un « k », il sait qu'il a besoin d'une voyelle ensuite. Il utilise une recherche « floue » (comme un correcteur orthographique qui devine) pour trouver la correspondance la plus proche dans un dictionnaire.
    • Résultat : C'était correct, mais il avait du mal lorsque les gens enfreignaient les règles (comme omettre les voyelles).
  • Le Détective Hybride (Swa Bhasha 2.0 & Le Modèle N-gramme) :

    • Fonctionnement : Ils ont combiné le Robot du Livre de Règles avec un « Détective Statistique ». Ce détective a examiné des millions de phrases pour apprendre des modèles. Il utilisait un « Trie » (une structure d'arbre intelligente) pour suggérer des mots, comme la saisie prédictive d'un téléphone mais pour le cinghalais.
    • Résultat : Beaucoup mieux pour deviner le bon mot, mais il restait confus face à des phrases très complexes.
  • Le Super-Lecteur (BERT & Transformers) :

    • Fonctionnement : C'est le « Super-Lecteur » de l'équipe. Au lieu de regarder seulement des mots individuels, il lit toute la phrase d'un coup, comprenant le contexte comme le ferait un humain. Ils ont utilisé un puissant modèle d'IA appelé BERT (qui est comme un cerveau ayant lu tout l'internet de textes cinghalais).
    • L'astuce : Lorsque l'IA voyait un mot confus, elle plaçait un « masque » dessus et demandait : « En fonction des mots avant et après celui-ci, quel mot convient le mieux ici ? »
    • Résultat : C'était le champion. Il a résolu les problèmes d'ambiguïté mieux que toute méthode précédente, atteignant une précision quasi parfaite lors des tests.
  • Le Spécialiste du Mélange de Codes :

    • Fonctionnement : Les gens mélangent souvent l'anglais et le cinghalais dans une même phrase (par exemple, « Je suis allé au kade [magasin] »). L'équipe a construit un modèle spécial qui agit comme un traducteur parlant couramment les deux langues, gérant le mélange sans se confondre.

3. La Bibliothèque : Les Données Qu'ils Ont Collectées

On ne peut pas apprendre à un enfant à lire sans livres, et on ne peut pas enseigner à une IA sans données. L'équipe a réalisé qu'il n'existait pas de bons « manuels » pour le Singlish, alors ils ont écrit les leurs.

  • La Bibliothèque « Swa-Bhasha » : Ils ont collecté plus de 7 millions de mots et des milliers de phrases de la vie réelle (comme des commentaires YouTube et des réseaux sociaux). C'est comme rassembler chaque note désordonnée jamais écrite par un Sri Lankais pour enseigner à l'ordinateur comment les gens tapent réellement.
  • Le Test d'« Ambiguïté » : Ils ont créé un quiz spécial où un mot a deux significations. Ils ont testé leur IA dessus pour voir si elle pouvait choisir le bon sens basé sur l'histoire.
  • La Collection « Mélange de Codes » : Ils ont rassemblé des exemples de personnes mélangeant l'anglais et le cinghalais, une habitude très courante qui avait été précédemment ignorée par les chercheurs.

4. Les Résultats : Qui a Gagné la Course ?

L'équipe a testé ses outils contre d'autres méthodes (comme ceux de Google ou les anciens systèmes basés sur des règles).

  • L'Ancienne Méthode : Les anciens systèmes basés sur des règles étaient comme un enseignant rigide ; ils échouaient lorsque les élèves enfreignaient les règles.
  • La Nouvelle Méthode : Les nouveaux modèles « Super-Lecteur » (basés sur BERT) étaient comme un mentor sage. Ils comprenaient le contexte et trouvaient les bonnes réponses presque à chaque fois.
  • Le Score : Lors des tests, leur meilleur modèle a obtenu un score de 91 % (score BLEU) et a fait très peu d'erreurs, tandis que les anciens modèles en commettaient beaucoup plus.

5. Et Après ?

L'équipe travaille actuellement sur une fonctionnalité de texte prédictif. Imaginez un clavier qui ne se contente pas de traduire ce que vous avez tapé, mais qui devine ce que vous allez taper ensuite, même si vous tapez dans un style désordonné et personnel. Ils utilisent une technique d'apprentissage spéciale (Meta-Learning) afin que le clavier puisse apprendre vos habitudes de frappe spécifiques rapidement, sans avoir besoin de stocker vos données privées sur un serveur.

Résumé

L'équipe Swa-bhasha a construit un pont entre la manière désordonnée et informelle dont les Sri Lankais tapent sur des claviers anglais et l'écriture cinghalaise formelle et magnifique. Ils ont commencé par de simples livres de règles, sont passés à des détectifs statistiques, et ont finalement construit une IA « Super-Lecteur » qui comprend le contexte. Ils ont également construit les vastes bibliothèques de données nécessaires pour enseigner ces IA. Leur travail prouve qu'avec les bons outils, même une langue à ressources limitées comme le cinghalais peut être parfaitement comprise par les ordinateurs, même lorsque les gens la tapent à la hâte.

Note Importante : Ce document se concentre strictement sur la technologie de traduction de texte et les données utilisées pour l'entraîner. Il ne prétend pas avoir d'applications médicales, d'utilisations cliniques ou de produits futurs spécifiques au-delà des outils de recherche et du code open-source qu'ils ont publiés.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →