← Derniers articles
🤖 AI

Toten: Knowledge-Based Ontological Tokenization Of Physical Quantities And Technical Notation In Brazilian Portuguese

Cet article introduit TOTEN, un cadre de tokenisation ontologique fondé sur la connaissance pour le portugais brésilien qui remplace les sous-mots dérivés statistiquement par une approche déclarative et pilotée par l'ontologie afin de préserver l'intégrité sémantique et structurelle des quantités physiques et des notations techniques, démontrant une performance supérieure aux bases de référence de l'état de l'art en matière d'atomicité des unités et de reconstruction numérique.

Auteurs originaux : Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

Publié 2026-06-19
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un ordinateur à lire un manuel d'ingénierie complexe écrit en portugais du Brésil. Le manuel est rempli de mesures précises comme « 5.2 kN/m² » (kilonewtons par mètre carré) ou « 1.5 × 10⁻³ m ».

Le Problème : Le Traducteur « Pixelisé »
La plupart des modèles d'IA modernes utilisent une méthode appelée Byte-Pair Encoding (BPE) pour lire le texte. Considérez cela comme un traducteur qui ne parle qu'en fragments minuscules et brisés. Pour économiser de l'espace, ce tokenizer BPE découpe les mots en morceaux arbitraires basés sur la fréquence à laquelle ils apparaissent dans des livres généraux.

  • Si le texte dit « 5.2 kN/m² », un tokenizer BPE standard pourrait le découper en : 5, ., 2, k, N, /, m, ².
  • Pour l'ordinateur, « 5.2 kN/m² » n'est pas un concept unique ; c'est juste un tas aléatoire de huit pièces de puzzle distinctes. L'ordinateur doit deviner plus tard comment les rassembler pour comprendre qu'il s'agit d'une force physique spécifique. C'est comme essayer de comprendre une phrase en regardant les pixels individuels des lettres plutôt que les lettres elles-mêmes.

La Solution : TOTEN (Le « Bibliothécaire Intelligent »)
Les auteurs ont créé un nouveau système appelé TOTEN. Au lieu de deviner comment découper les mots selon des statistiques, TOTEN agit comme un bibliothécaire basé sur la connaissance qui possède un livre de règles strict et formel (une « ontologie ») sur ce que sont réellement les termes d'ingénierie.

Voici comment fonctionne TOTEN, en utilisant des analogies simples :

  1. Le Livre de Règles (L'Ontologie) : Avant de lire un seul mot, TOTEN possède un dictionnaire pré-écrit de règles d'ingénierie. Il sait que « kN » est une unité de force, « m² » est une surface, et « 5.2 » est un nombre. Il ne devine pas ; il connaît les définitions par cœur.
  2. Les Trois Assistants Experts (Les Oracles) : TOTEN n'essaie pas de mémoriser chaque faute de frappe ou symbole possible. Au lieu de cela, il fait appel à trois experts de confiance pour l'aider :
    • Pint : L'expert sur les unités de mesure (sait exactement ce qu'est un « kilowatt »).
    • Base de données Unicode : L'expert sur les symboles et les polices (sait qu'un « 2 » en exposant est un carré, et non juste un chiffre).
    • RSLP : L'expert en grammaire portugaise (sait que « potências » signifie « puissances » dans un contexte technique).
  3. Le Processus de Tri : Lorsque TOTEN voit le texte « 5.2 kN/m² », il ne le découpe pas. Il consulte son livre de règles et ses experts, et il dit : « Ah, tout ceci est un bloc unique et atomique appelé 'Quantité Physique'. » Il enveloppe toute la phrase dans une balise unique et étiquetée, préservant ainsi la signification exacte.

Les Résultats : Pourquoi c'est Important
Les auteurs ont testé TOTEN contre huit autres systèmes de haut niveau (incluant les traducteurs « pixelisés » standards et d'autres outils de détection de nombres) en utilisant un benchmark de 800 cas d'ingénierie et quatre autres collections de textes en portugais du monde réel.

  • Atomicité (Garder les choses entières) : TOTEN a été parfait pour maintenir les quantités physiques comme des unités uniques et ininterrompues. Les autres systèmes les ont souvent décomposées.
  • Reconstruction (Remettre en place) : Lorsque l'ordinateur devait extraire le nombre et l'unité plus tard, TOTEN pouvait le faire correctement 78 % à 90 % du temps. Le meilleur système concurrent n'a réussi qu'environ 63 % à 70 %.
  • Précision : La différence n'était pas seulement un peu meilleure ; elle était statistiquement significative. TOTEN ne s'est pas contenté de deviner ; il a utilisé son livre de règles pour obtenir la bonne réponse de manière cohérente.

L'Essentiel
TOTEN prouve que pour le texte technique et scientifique, vous n'avez pas besoin de vous appuyer sur une « supposition statistique » (qui fonctionne bien pour la conversation décontractée mais échoue en ingénierie). Au lieu de cela, vous pouvez utiliser une approche structurée, basée sur des règles, qui traite les termes techniques comme des objets complets et significatifs.

L'article affirme que cette méthode permet aux ordinateurs de « voir » la structure des nombres et des unités exactement comme les ingénieurs l'entendent, sans les briser en fragments confus. C'est un outil spécialisé conçu spécifiquement pour rendre le texte technique en portugais du Brésil lisible pour les machines, garantissant que « 5.2 kN/m² » est traité comme une idée cohérente et unique plutôt que comme un amas désordonné de caractères.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →