← Últimos artigos
🤖 AI

Toten: Knowledge-Based Ontological Tokenization Of Physical Quantities And Technical Notation In Brazilian Portuguese

Este artigo introduz o TOTEN, um framework de tokenização ontológica baseada em conhecimento para o português brasileiro que substitui subpalavras derivadas estatisticamente por uma abordagem declarativa e orientada por ontologia para preservar a integridade semântica e estrutural de quantidades físicas e notações técnicas, demonstrando desempenho superior em relação aos baselines de estado da arte em atomicidade de unidades e reconstrução numérica.

Autores originais: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

Publicado 2026-06-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um computador a ler um manual de engenharia complexo escrito em português do Brasil. O manual é repleto de medições precisas como "5,2 kN/m²" (quilonewtons por metro quadrado) ou "1,5 × 10⁻³ m".

O Problema: O Tradutor "Pixelado"
A maioria dos modelos de IA modernos utiliza um método chamado Codificação de Par de Bytes (BPE - Byte-Pair Encoding) para ler texto. Pense nisso como um tradutor que fala apenas em fragmentos minúsculos e quebrados. Para economizar espaço, este tokenizador BPE fatia as palavras em pedaços arbitrários baseados na frequência com que aparecem em livros gerais.

  • Se o texto diz "5,2 kN/m²", um tokenizador BPE padrão pode fatiá-lo em: 5, ., 2, k, N, /, m, ².
  • Para o computador, "5,2 kN/m²" não é um conceito único; é apenas um amontoado aleatório de oito peças de um quebra-cabeça separadas. O computador tem que adivinhar mais tarde como juntá-las novamente para entender que se trata de uma força física específica. Isso é como tentar entender uma frase olhando para os pixels individuais das letras, em vez de olhar para as próprias letras.

A Solução: TOTEN (O "Bibliotecário Inteligente")
Os autores criaram um novo sistema chamado TOTEN. Em vez de adivinhar como fatiar palavras com base em estatísticas, o TOTEN atua como um bibliotecário baseado em conhecimento que possui um livro de regras estrito e formal (uma "ontologia") sobre o que os termos de engenharia realmente são.

Veja como o TOTEN funciona, usando analogias simples:

  1. O Livro de Regras (A Ontologia): Antes de ler uma única palavra, o TOTEN possui um dicionário pré-escrito de regras de engenharia. Ele sabe que "kN" é uma unidade de força, "m²" é uma área e "5,2" é um número. Ele não adivinha; ele conhece as definições de cor.
  2. Os Três Assistentes Especialistas (Oráculos): O TOTEN não tenta memorizar cada possível erro de digitação ou símbolo. Em vez disso, ele recorre a três especialistas de confiança para ajudar:
    • Pint: O especialista em unidades de medida (sabe exatamente o que é um "quilowatt").
    • Banco de Dados Unicode: O especialista em símbolos e fontes (sabe que um "2" sobrescrito é um quadrado, não apenas um número).
    • RSLP: O especialista em gramática do português (sabe que "potências" refere-se a potências em um contexto técnico).
  3. O Processo de Classificação: Quando o TOTEN vê o texto "5,2 kN/m²", ele não o fatia. Ele consulta seu livro de regras e os especialistas e diz: "Ah, tudo isso é um único bloco atômico chamado 'Grandeza Física'." Ele envolve toda a frase em uma única etiqueta rotulada, preservando o significado exato.

Os Resultados: Por Que Isso Importa
Os autores testaram o TOTEN contra outros oito sistemas de alto nível (incluindo os tradutores "pixelados" padrão e outras ferramentas de busca de números) usando um benchmark de 800 casos de engenharia e quatro outras coleções de textos do mundo real em português.

  • Atomicidade (Manter as coisas inteiras): O TOTEN foi perfeito em manter as grandezas físicas como unidades únicas e ininterruptas. Os outros sistemas frequentemente as fragmentavam.
  • Reconstrução (Colocar de volta no lugar): Quando o computador precisava extrair o número e a unidade reais posteriormente, o TOTEN conseguia fazer isso corretamente de 78% a 90% das vezes. O melhor sistema concorrente conseguiu apenas cerca de 63% a 70%.
  • Precisão: A diferença não foi apenas um pouco melhor; foi estatisticamente significativa. O TOTEN não apenas adivinhou; ele usou seu livro de regras para obter a resposta correta de forma consistente.

A Conclusão
O TOTEN prova que, para textos técnicos e científicos, você não precisa depender de "adivinhação estatística" (que funciona bem para conversas casuais, mas falha na engenharia). Em vez disso, você pode usar uma abordagem estruturada e baseada em regras que trata termos técnicos como objetos completos e significativos.

O artigo afirma que este método permite que os computadores "vejam" a estrutura de números e unidades exatamente como os engenheiros pretendem, sem quebrá-los em fragmentos confusos. É uma ferramenta especializada projetada especificamente para tornar o texto técnico em português do Brasil legível para máquinas, garantindo que "5,2 kN/m²" seja tratado como uma ideia única e coerente, em vez de uma bagunça jumbled de caracteres.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →