← 최신 논문
🤖 AI

Toten: Knowledge-Based Ontological Tokenization Of Physical Quantities And Technical Notation In Brazilian Portuguese

본 논문은 통계적으로 유도된 서브워드(subword)를 물리량과 기술적 표기법의 의미론적 및 구조적 무결성을 보존하기 위한 선언적이고 온톨로지 기반인 접근 방식으로 대체함으로써, 브라질 포르투갈어를 위한 지식 기반 온톨로지 토큰화 프레임워크인 TOTEN을 소개하며, 단위 원자성 및 수치 재구성 측면에서 최신 베이스라인 모델들보다 우수한 성능을 입증한다.

원저자: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 브라질 포르투갈어로 작성된 복잡한 공학 매뉴얼을 컴퓨터에게 읽는 법을 가르치려 한다고 상상해 보십시오. 이 매뉴얼에는 "5.2 kN/m²"(제곱미터당 킬로뉴턴) 또는 "1.5 × 10⁻³ m"와 같은 정밀한 측정값이 가득합니다.

문제점: "픽셀화된" 번역기
대부분의 현대 AI 모델은 텍스트를 읽기 위해 **바이트 쌍 인코딩(Byte-Pair Encoding, BPE)**이라는 방식을 사용합니다. 이것을 아주 작고 파편화된 조각들로만 말하는 번역가라고 생각해 보십시오. 공간을 절약하기 위해, 이 번역가는 일반적인 책들에 자주 등장하는 빈도에 따라 단어를 임의의 조각들로 잘게 쪼갭니다.

  • 만약 텍스트에 "5.2 kN/m²"라고 적혀 있다면, 표준 BPE 토크나이저는 이를 다음과 같이 쪼갤 수 있습니다: 5, ., 2, k, N, /, m, ².
  • 컴퓨터에게 "5.2 kN/m²"는 하나의 개념이 아니라, 그저 여덟 개의 별개 퍼즐 조각이 무작위로 모인 덩어리일 뿐입니다. 컴퓨터는 나중에 이 조각들을 어떻게 다시 합쳐서 그것이 특정한 물리적 힘이라는 것을 이해할지 추측해야 합니다. 이것은 마치 글자 자체를 보는 것이 아니라 글자의 개별 픽셀 하나하나를 보면서 문장을 이해하려는 것과 같습니다.

해결책: TOTEN (스마트한 사서)
저자들은 TOTEN이라는 새로운 시스템을 만들었습니다. TOTEN은 통계에 기반하여 단어를 어떻게 쪼갤지 추측하는 대신, 공학 용어가 실제로 무엇인지에 대한 엄격하고 공식적인 규칙(온톨로지)을 가진 지식 기반의 사서처럼 행동합니다.

TOTEN이 어떻게 작동하는지 쉬운 비유를 통해 설명하겠습니다:

  1. 규칙집 (온톨로지): 단 한 단어를 읽기 전부터, TOTEN은 공학 규칙이 담긴 미리 작성된 사전집을 가지고 있습니다. 이는 "kN"이 힘의 단위이고, "m²"는 면적이며, "5.2"는 숫자라는 것을 알고 있습니다. 이는 추측하는 것이 아니라, 정의를 이미 숙지하고 있는 것입니다.
  2. 세 명의 전문가 조수 (오라클): TOTEN은 모든 가능한 오타나 기호를 암기하려고 애쓰지 않습니다. 대신, 세 명의 신뢰할 수 있는 전문가에게 도움을 요청합니다.
    • Pint: 단위 측정 전문가 (정확히 "킬로와트"가 무엇인지 압니다).
    • Unicode Database: 기호 및 폰트 전문가 (위첨자 "2"가 단순한 숫자가 아니라 제곱임을 압니다).
    • RSLP: 포르투갈어 문법 전문가 (기술적 맥락에서 "potências"가 "거듭제곱"을 의미함을 압니다).
  3. 분류 과정: TOTEN이 "5.2 kN/m²"라는 텍스트를 보면, 이를 쪼개지 않습니다. 대신 자신의 규칙집과 전문가들을 살펴보고 이렇게 말합니다: "아, 이 전체는 '물리량(Physical Quantity)'이라는 하나의 원자적 블록이구나." 그리고는 이 전체 구절을 하나의 라벨이 붙은 태그로 감싸서, 정확한 의미를 보존합니다.

결과: 이것이 중요한 이유
저자들은 800개의 공학 사례와 4개의 다른 실제 포르투갈어 텍스트 컬렉션을 사용하여 TOTEN을 8개의 다른 최상위 시스템(표준적인 "픽셀화된" 번역기 및 기타 숫자 탐색 도구 포함)과 비교 테스트했습니다.

  • 원자성 (전체를 온전하게 유지하기): TOTEN은 물리량을 단일하고 끊어지지 않는 단위로 유지하는 데 완벽했습니다. 다른 시스템들은 이를 자주 분해했습니다.
  • 재구성 (다시 합치기): 나중에 컴퓨터가 실제 숫자와 단위를 추출해야 할 때, TOTEN은 이를 **78%에서 90%**까지 정확하게 수행할 수 있었습니다. 가장 뛰어났던 경쟁 시스템은 약 **63%에서 70%**만을 달성했습니다.
  • 정확도: 차이는 단순히 조금 더 나은 수준이 아니었습니다. 통계적으로 유의미했습니다. TOTEN은 단순히 추측한 것이 아니라, 규칙집을 사용하여 일관되게 정답을 찾아냈습니다.

핵심 요약
TOTEN은 기술적, 과학적 텍스트의 경우, (일상적인 대화에는 잘 작동하지만 공학에서는 실패하는) "통계적 추측"에 의존하는 대신, 기술 용어를 완전하고 의미 있는 객체로 취급하는 구조화된 규칙 기반 접근 방식을 사용하는 것이 필요함을 입증합니다.

이 논문은 이 방법이 컴퓨터로 하여금 숫자의 구조와 단위를 공학자들이 의도한 그대로 정확하게 "보게" 만들어 주며, 혼란스러운 문자 조각들로 부서지지 않도록 한다는 점을 주장합니다. 이는 브라질 포르투갈어 기술 텍스트를 기계가 읽을 수 있도록 만들기 위해 설계된 특화된 도구이며, "5.2 kN/m²"가 혼란스러운 문자의 덩어리가 아닌 하나의 일관된 아이디어로 처리되도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →