← 최신 논문
💬 NLP

MioFFAn: an Annotation Software for Formula Formalization with LLM Automation Capabilities

이 논문은 인간의 주석 작업과 모듈형 대규모 언어 모델 자동화를 결합하여 수식 정형화를 위한 고품질 데이터셋 구축을 용이하게 하도록 MioGatto 아키텍처를 확장한 오픈 소스 기반의 맞춤형 주석 프레임워크인 MioFFAn을 소개한다.

원저자: Nicolas Sibuet, Horacio Saggion, Riccardo Rossi

게시일 2026-07-28
📖 5 분 읽기🧠 심층 분석

원저자: Nicolas Sibuet, Horacio Saggion, Riccardo Rossi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려는 탐정이라고 상상해 보십시오. 하지만 단서들은 오직 컴퓨터만이 읽을 수 있는 비밀 코드로 쓰여 있고, 이야기는 오직 인간만이 이해할 수 있는 언어로 쓰여 있습니다. 이것이 바로 복잡한 수학으로 가득 찬 논문을 쓰는 과학자들이 매일 겪는 고충입니다. 그들은 세상이 어떻게 작동하는지 설명하기 위해 아름답고 우아한 공식을 사용하지만, 이 공식들은 종-종 수학의 "그림"에 불과합니다. 마치 다리의 그림과 같습니다. 하지만 실제로 다리를 건설하려면, 컴퓨터에는 설계도가 필요합니다. 즉, 기계에게 강철의 응력을 정확히 계산하도록 지시하는 구체적인 명령, 변수, 그리고 논리가 필요합니다. 이 "수학적 그림"을 컴퓨터를 위한 "설계도"로 바꾸는 과정을 **공식 정형화(Formula Formalization)**라고 부릅니다.

문제는 인공지능(AI)으로 구동되는 초지능형 컴퓨터조차 스스로 이 설계도를 읽는 데 매우 서툴다는 점입니다. 컴퓨터가 번역을 배우려면 수천 쌍의 "수학적 그림"과 "컴퓨터 설계도"로 이루어진 거대한 예시 라이브러리가 필요합니다. 하지만 문제는 아직 아무도 이 라이브러리를 구축하지 못했다는 것입니다. 왜냐하면 이를 만드는 과정이 믿기 힘들 정도로 어렵고 지루하기 때문입니다. 인간은 논문에 나온 모든 수학 기호를 컴퓨터 코드로 일일이 다시 써야 하는데, 이 작업은 너무나 지루해서 과학적 발전을 늦추고 있습니다. 이는 마치 로봇에게 요리하는 법을 가르치기 위해 세상의 모든 요리에 대해 재료 하나하나를 손으로 직접 적어 내려가는 것과 같습니다.

여기에서 MioFFAn이라는 새로운 도구가 등장합니다. 이것을 수학을 코드로 번역하는 지루한 작업을 훨씬 빠르고 덜 고통스럽게 만들어 줄 첨단 인터랙티브 노트북이라고 생각하십시오. 연구자들은 단순히 정적인 도구를 만든 것이 아니라, "인간 참여형(human-in-the-loop)" 시스템을 구축했습니다. 이는 소프트웨어가 AI를 사용하여 번역을 추측하되, 인간 전문가에게 확인을 받고 실수를 수정하도록 요청하는 스마트한 비서처럼 작동함을 의미합니다. 이는 로보트가 당신을 대신해 편지 초안을 작성할 수는 있지만, 보내기 전에 당신이 직접 서명하고 사실 관계가 맞는지 확인해야 하는 것과 같습니다. 이러한 협업 방식을 통해 저자들은 우리가 이전보다 훨씬 빠르게 필수적인 수학-코드 예시 라이브러리를 구축할 수 있음을 보여주며, 컴퓨터가 현대 과학을 이끄는 복잡한 수학을 마침내 이해하고 실행할 수 있도록 길을 열어줍니다.

논문의 이야기: 수학과 코드 사이의 다리 놓기

이 논문은 연구자들이 과학 문서를 주석 달기(annotate) 위해 설계된 오픈 소스 소프트웨어인 MioFFAn을 소개합니다. 이 도구의 주요 목표는 공식 정형화(Formula Formalization), 즉 논문에 있는 수학적 표현을 컴퓨터 대수 시스템(computer algebra system)에서 실행 가능한 기호 코드(executable symbolic code)로 바꾸는 과정을 용이하게 하는 것입니다. 저자들은 문서의 텍스트를 스캔하고 읽는 훌륭한 도구(OCR)는 존재하지만, 스캔된 공식을 컴퓨터가 실제로 실행할 수 있는 코드로 바꿀 수 있는 "의미론적 깊이(semantic depth)"는 부족하다고 주장합니다.

이를 해결하기 위해 저자들은 MioGatto라는 기존 도구를 기반으로 MioFFAn을 구축했습니다. 그들은 기존 도구가 단일 수학 기호(예: 문자 xx)를 식별하는 데는 뛰어나지만, 복잡한 기호의 집합(예: 전체 함수 f(x)f(x) 또는 텐서 δui\delta u_i)을 처리하는 데는 매우 취약하며, 실제 과학 분야에 필요한 유연하고 계층적인 주석 작성을 허용하지 않는다는 점을 깨달았습니다. MioFFAn은 다음과 같은 몇 가지 핵심적인 업그레이드를 통해 이를 해결합니다:

  1. 그룹화 및 계층 구조: 단순히 글자 하나를 태깅하는 대신, MioFFAn은 사용자가 공식의 전체 덩어리를 하나의 단위로 선택할 수 있게 합니다. 이는 복잡한 표현을 필요에 따라 더 작은 부분으로 나눌 수 있는 하나의 "그룹"으로 취급합니다.
  2. 맞춤형 규칙: 이 소프트웨어는 카멜레온과 같습니다. 사용자가 서로 다른 과학 분야를 위한 자신만의 "분류 체계(taxonomies, 규칙 및 카테고리)"를 정의할 수 있도록 허용합니다. 예를 들어, 물리학자는 변수를 "벡터"로 태깅해야 할 수도 있고, 생물학자는 이를 "농도"로 태깅해야 할 수도 있습니다. 이 도구는 이러한 요구에 맞춰 적응합니다.
  3. 맥락적 근거 제시(Contextual Grounding): 이는 수학 기호를 문서 내에서 설명되는 텍스트와 연결하는 데 도움을 줍니다. 만약 논문에서 "v를 속도라고 하자"라고 되어 있다면, 이 도구는 해당 문장을 강조 표시하고 이를 공식의 기호 vv와 연결할 수 있도록 도와줍니다.
  4. "인간 참여형" 자동화: 이것이 가장 흥-미로운 부분입니다. 소프트웨어에는 AI(구체적으로는 거대 언어 모델, LLM)가 먼저 주석 작업을 시도하는 기능이 포함되어 있습니다. AI는 공식의 어느 부분이 무엇인지, 변수의 의미는 무엇인지, 그리고 문서의 어디에 정의되어 있는지를 제안합니다. 그러나 인간 사용자가 대체되는 것이 아니라 감독관 역할을 수행합니다. 사용자는 AI의 제안을 검토하고, 오류를 수정하며, 최종 결과를 확정합니다.

저자들은 **유한 요소법(Finite Element Methods, FEM)**이라는 특정 과학 분야를 사용하여 이 시스템을 테스트했습니다. FEM은 자동차 충돌이나 다리의 휘어짐 등을 시뮬레이션하는 데 사용됩니다. 그들은 소프트웨어가 FEM의 특정 수학 규칙을 이해하도록 설정한 다음, "개념 증명(proof-of-concept)" 실험을 수행했습니다. 그들은 소프트웨어에 과학 논문들을 입력하고 AI가 이를 주석 달도록 한 뒤, 인간 전문가가 만든 "골드 스탠다드(gold standard)"와 AI의 작업물을 비교했습니다.

결과는 기대와 현실이 섞여 있었습니다. AI는 어떤 것에는 놀라울 정도로 뛰어났지만, 다른 것들에는 어려움을 겪었습니다. 예를 들어, AI가 원래의 수학 기호(예: 그리스 문자 λ\lambda)를 볼 수 있었을 때, 수학적 구성 요소를 식별하는 능력(약 **57.7%**의 커버리지)은 기호가 긴 텍스트 이름으로 대체되었을 때(36.2%로 하락)보다 훨씬 높았습니다. 그러나 AI는 여전히 완벽하지 않았습니다. AI는 문서 내의 텍스트 정의 위치를 정확히 짚어내는 데 자주 어려움을 겪었으며, 때때로 특정 문장이 아닌 문단 전체를 강조 표시하기도 했습니다.

논문은 현재 AI가 독자적으로 이 작업을 완벽하게 수행할 수 있다는 아이디어를 명시적으로 배제합니다. 저자들은 자동화된 결과가 "이상적인 상태와는 거리가 멀며" 오직 인간 전문가가 빠르게 개선할 수 있는 "기준점(baseline)"으로만 사용되어야 한다고 언급합니다. 그들은 인간의 검토 없이 AI를 완전히 자동화된 엔드 투 엔드(end-to-end) 번역에 사용하는 것은 포착하기 어려운 오류를 초래할 가능성이 높다고 주장합니다.

평가에서 저자들은 "원래의 문자(Original Characters)" 방식(수학 기호를 그대로 유지하는 방식)이 AI가 수학의 구조를 이해하는 데 가장 효과적임을 발견했습니다. 또한 세 가지 다른 AI 모델(NVIDIA의 Nemotron, Google의 Gemma, Alibaba의 Qwen)을 비교했으며, Qwen3-4B-Instruct-2507 모델이 다른 모델들보다 현저히 우수한 성능을 보여, 기호 식별에서 약 33.9%인 차순위 모델에 비해 **57.7%**의 커버리지 비율을 달 chimney 성했다는 것을 확인했습니다.

궁극적으로, 이 논문은 MioFFAn이 더 나은 자동화 전략을 개발하기 위한 강력한 "놀이터(playground)"임을 시사합니다. 이 도구는 수학을 코드로 번역하는 문제를 영원히 해결했다고 주장하는 것이 아닙니다. 대신, 연구자들이 다양한 AI 전략을 테스트하고, 무엇이 작동하는지 확인하며, 시스템을 점진적으로 개선할 수 있는 유연한 프레임워크를 제공합니다. 저자들은 현재의 자동화가 단지 "임시적인(provisional)" 단계일 뿐이지만, 이러한 인간과 AI의 팀워크가 미래의 더 똑똑한 시스템을 훈련하는 데 필요한 고품질 데이터셋을 구축하는 가장 효과적인 방법이라고 결론짓습니다. 그들은 이 도구가 수학-코드 번역의 거대한 공유 라이브러리를 구축하는 데 도움을 주어, 컴퓨터가 과학자들이 세계의 가장 복잡한 문제들을 해결하는 데 도움을 줄 수 있는 미래를 구상하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →