← Últimos artículos
🤖 AI

Toten: Knowledge-Based Ontological Tokenization Of Physical Quantities And Technical Notation In Brazilian Portuguese

Este artículo presenta TOTEN, un marco de tokenización ontológica basada en el conocimiento para el portugués brasileño que reemplaza las subpalabras derivadas estadísticamente por un enfoque declarativo impulsado por la ontología para preservar la integridad semántica y estructural de las cantidades físicas y la notación técnica, demostrando un rendimiento superior sobre los modelos de referencia del estado del arte en atomicidad de unidades y reconstrucción numérica.

Autores originales: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

Publicado 2026-06-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a una computadora a leer un complejo manual de ingeniería escrito en portugués brasileño. El manual está lleno de mediciones precisas como "5.2 kN/m²" (kilonewtons por metro cuadrado) o "1.5 × 10⁻³ m".

El Problema: El Traductor "Pixelado"
La mayoría de los modelos de IA modernos utilizan un método llamado Codificación de Pares de Bytes (BPE, por sus siglas en inglés) para leer texto. Piensa en esto como un traductor que solo habla en fragmentos diminutos y rotos. Para ahorrar espacio, este tokenizador BPE divide las palabras en piezas arbitrarias basadas en la frecuencia con la que aparecen en libros generales.

  • Si el texto dice "5.2 kN/m²", un tokenizador BPE estándar podría dividirlo en: 5, ., 2, k, N, /, m, ².
  • Para la computadora, "5.2 kN/m²" no es un concepto único; es solo un montón aleatorio de ocho piezas de rompecabezas separadas. La computadora tiene que adivinar más tarde cómo volver a unirlas para entender que se trata de una fuerza física específica. Esto es como intentar entender una oración mirando los píxeles individuales de las letras en lugar de las letras mismas.

La Solución: TOTEN (El "Bibliotecario Inteligente")
Los autores crearon un nuevo sistema llamado TOTEN. En lugar de adivinar cómo dividir las palabras basándose en la estadística, TOTEN actúa como un bibliotecario basado en el conocimiento que posee un libro de reglas estricto y formal (una "ontología") sobre lo que los términos de ingeniería son en realidad.

Así es como funciona TOTEN, utilizando analogías simples:

  1. El Libro de Reglas (La Ontología): Antes de leer una sola palabra, TOTEN tiene un diccionario preescrito de reglas de ingeniería. Sabe que "kN" es una unidad de fuerza, "m²" es un área y "5.2" es un número. No adivina; conoce las definiciones de memoria.
  2. Los Tres Asistentes Expertos (Oráculos): TOTEN no intenta memorizar cada posible error tipográfico o símbolo. En su lugar, recurre a tres expertos de confianza para obtener ayuda:
    • Pint: El experto en unidades de medida (sabe exactamente qué es un "kilovatio").
    • Base de Datos Unicode: El experto en símbolos y fuentes (sabe que un "2" en superíndice es un cuadrado, no solo un número).
    • RSLP: El experto en gramática portuguesa (sabe que "potências" significa "potencias" en un contexto técnico).
  3. El Proceso de Clasificación: Cuando TOTEN ve el texto "5.2 kN/m²", no lo fragmenta. Consulta su libro de reglas y a los expertos, y dice: "Ah, todo esto es un bloque único y atómico llamado 'Cantidad Física'". Envuelve toda la frase en una etiqueta única y etiquetada, preservando el significado exacto.

Los Resultados: Por Qué Importa
Los autores probaron TOTEN contra otros ocho sistemas de alto nivel (incluyendo los traductores "pixelados" estándar y otras herramientas de búsqueda de números) utilizando un benchmark de 800 casos de ingeniería y otras cuatro colecciones de texto del mundo real en portugués.

  • Atomicidad (Mantener las cosas completas): TOTEN fue perfecto al mantener las cantidades físicas como unidades únicas e ininterrumpidas. Los otros sistemas a menudo las dividían.
  • Reconstrucción (Volver a armarlas): Cuando la computadora necesitaba extraer el número y la unidad reales más tarde, TOTEN podía hacerlo correctamente del 78% al 90% de las veces. El mejor sistema competidor solo logró entre un 63% y un 70%.
  • Precisión: La diferencia no fue solo un poco mejor; fue estadísticamente significativa. TOTEN no solo adivinó; utilizó su libro de reglas para obtener la respuesta correcta de manera consistente.

La Conclusión
TOTEN demuestra que, para el texto técnico y científico, no es necesario depender de la "adivinación estadística" (que funciona bien para la conversación casual pero falla en la ingeniería). En su lugar, se puede utilizar un enfoque estructurado basado en reglas que trate los términos técnicos como objetos completos y significativos.

El artículo afirma que este método permite que las computadoras "vean" la estructura de los números y las unidades exactamente como los ingenieros pretenden, sin dividirlos en fragmentos confusos. Es una herramienta especializada diseñada específicamente para hacer que el texto técnico en portugués brasileño sea legible para las máquinas, asegurando que "5.2 kN/m²" sea tratado como una idea única y coherente en lugar de un desorden de caracteres.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →