우리가 아주 복잡하고 긴 요리책(보험 약관)을 가지고 있다고 상상해 보세요. 이 요리책에는 "A 재료를 넣고 B 상황이 되면 C라는 맛이 나야 한다" 같은 복잡한 규칙들이 가득합니다.
우리의 목표는 이 요리책을 보고, 컴퓨터가 딱딱 맞춰서 요리할 수 있도록 **'완벽한 디지털 레시피 시스템(온톨로지)'**을 만드는 것입니다.
1. 기존 방식: "눈 감고 한 번에 요리하기" (Baseline)
기존의 AI 방식은 요리사(LLM) 한 명에게 요리책을 통째로 던져주며 "자, 이제 이 내용을 바탕으로 디지털 레시피를 한 번에 다 써내!"라고 시키는 것과 같습니다.
문제점: 요리사가 너무 정신이 없어서 재료를 빼먹거나, 똑같은 재료를 이름만 바꿔서 두 번 적거나(중복), 요리 순서를 엉망으로 적는 실수를 자주 합니다. 한 번 실수하면 고치기도 어렵죠.
2. 이 논문의 새로운 방식: "전문가 팀이 협업하는 주방" (Multi-Agent Approach)
연구진은 요리사 한 명에게 다 맡기는 대신, **역할이 나누어진 '전문가 팀'**을 만들었습니다. 이 팀은 단계별로 '문서(Artifact)'를 주고받으며 일합니다.
🕵️♂️ 도메인 전문가 (Domain Expert): 요리책을 꼼꼼히 읽고 "이 요리에는 어떤 재료(개념)가 필요하고, 어떤 상황(이벤트)이 중요한지" 요약 노트를 만듭니다.
📋 매니저 (Manager): 요약 노트를 보고 "자, 이번 요리에는 'A 패턴'을 사용해서 레시피를 설계하자"라고 구체적인 **'설계 도면(TIP)'**을 그립니다. (이 단계가 가장 중요합니다!)
💻 코더 (Coder): 설계 도면을 보고 실제로 컴퓨터가 읽을 수 있는 디지털 코드(TTL 형식)로 레시피를 작성합니다.
🧐 품질 검사관 (Quality Assurer): 완성된 레시피가 설계 도면과 맞는지, 오타는 없는지, 논리적으로 앞뒤가 맞는지를 검사하고 틀렸으면 다시 고치라고 시킵니다.
🚀 결과: 무엇이 좋아졌나요?
연구진이 실제 보험 약관을 가지고 실험해 본 결과, '전문가 팀(Multi-Agent)' 방식이 훨씬 뛰어났습니다.
설계가 탄탄해졌습니다 (Extensibility & ODP): 단순히 글자를 옮겨 적는 게 아니라, 전문가들이 미리 정해둔 '표준 설계 방식'을 잘 따랐습니다. 덕분에 나중에 새로운 내용이 추가되어도 레시피 시스템을 쉽게 확장할 수 있습니다.
질문에 답을 잘 합니다 (Queryability): "보험금이 언제 지급되나요?" 같은 질문을 컴퓨터에게 던졌을 때, 전문가 팀이 만든 레시피는 훨씬 더 정확하고 논리적인 답변을 내놓았습니다.
💡 핵심 요약 (Takeaway)
이 논문의 핵심 메시지는 이겁니다:
"AI에게 한 번에 다 하라고 시키지 말고, '계획 세우기 → 설계하기 → 코딩하기 → 검사하기'처럼 단계를 나누고 각 단계마다 결과물을 남기게 해라. 그러면 훨씬 똑똑하고 믿을 수 있는 지식 지도가 만들어진다!"
즉, **'생각하며 일하는 구조(Planning-first)'**를 만들어 주는 것이 AI의 성능을 높이는 열쇠라는 것을 증명한 연구입니다.
[기술 요약] 비정형 텍스트로부터의 자동 온톨로지 생성을 위한 멀티 에이전트 LLM 접근법
1. 문제 정의 (Problem Statement)
지식 공학(Knowledge Engineering)에서 비정형 자연어로부터 정형화된 온톨로지(Ontology)를 자동으로 생성하는 것은 매우 어려운 과제입니다. 기존의 대규모 언어 모델(LLM)을 활용한 방식은 다음과 같은 한계점을 가집니다:
모델링 품질 저하: 단일 단계(Single-pass) 생성 방식은 온톨로지 설계 패턴(ODP)을 준수하지 못하거나, 구조적 중복성(Redundancy)이 발생하기 쉽습니다.
복잡한 도메인 대응 능력 부족: 보험 계약서와 같이 법적, 금융적 제약 조건과 시간적 요소가 복잡하게 얽힌 문서를 정밀한 논리 구조로 변환하는 데 한계가 있습니다.
신뢰성 및 감사 가능성 부족: LLM이 생성한 결과물이 왜 그렇게 설계되었는지 추적하기 어렵고, 오류 발생 시 이를 수정하는 반복적 과정이 비효율적입니다.
2. 연구 방법론 (Methodology)
본 논문은 단일 에이전트 기반의 **Baseline(직접 생성 방식)**과 제안하는 **Multi-Agent(멀티 에이전트 방식)**를 비교하는 통제된 실험 연구를 수행했습니다.
A. 핵심 파이프라인 (3단계)
역량 질문(CQ) 생성: 계약서 텍스트로부터 온톨로지가 답해야 할 질문(Competency Questions)과 예상 답안을 추출하여 요구사항을 명확히 정의합니다.
온톨로지 구축: 추출된 CQ를 가이드로 삼아 OWL/TTL 형식의 온톨로지를 생성합니다.
자동 검증: SPARQL 쿼리를 통해 생성된 온톨로지가 질문에 답할 수 있는지 평가합니다.
B. 제안하는 멀티 에이전트 아키텍처 (4개 역할)
단일 모델이 모든 것을 수행하는 대신, 역할을 분리하여 산출물 중심(Artifact-driven) 워크플로우를 구축했습니다:
Domain Expert (도메인 전문가): 텍스트를 분석하여 개념, 관계, 제약 조건을 정리한 **SRD(Semantic Requirements Document)**를 작성합니다.
Manager (매니저): SRD를 바탕으로 어떤 설계 패턴(ODP)을 사용할지, 기존 요소를 어떻게 재사용할지 결정하는 **TIP(Technical Implementation Plan)**를 설계합니다. (설계 우선 원칙)
Coder (코더): TIP를 실제 TTL(Turtle) 코드로 구현합니다.
Quality Assurer (품질 보증): 설계 준수 여부(Architectural Review), 구문 오류(Syntax Check), 논리적 일관성(Semantic Consistency)을 검증하고 오류 발생 시 수정(QA-Coder)을 수행합니다.
C. 다각적 평가 프레임워크
SPARQL 기반 평가: 생성된 온톨로지에 가상 데이터를 넣고, CQ를 SPARQL로 변환하여 실행 가능한지 측정합니다 (실용적 사용성).
RAG 기반 평가: 벡터 검색(RAG)을 통해 온톨로지 그래프 내의 지식 연결성을 측정하여, 쿼리 문법 오류와 별개로 지식 자체가 잘 모델링되었는지(잠재적 지식 커버리지) 확인합니다.
3. 주요 기여 (Key Contributions)
멀티 에이전트 프레임워크 제안: 설계(Planning)와 구현(Coding)을 분리하여 온톨로지 설계 패턴(ODP) 준수율을 높인 아키텍처를 제시했습니다.
자동화된 CQ 기반 평가 체계: SPARQL과 RAG를 결합하여 온톨로지의 논리적 정확성과 지식 접근성을 동시에 측정하는 프레임워크를 구축했습니다.
실패 모드 진단: LLM 기반 온톨로지 생성 시 발생하는 중복성, 문맥 저하, 반복적 수정 루프의 한계점을 체계적으로 분석했습니다.
4. 연구 결과 (Results)
보험 계약서(Equivita, Sentinel)를 대상으로 실험한 결과는 다음과 같습니다:
아키텍처 품질 향상: 멀티 에이전트 방식은 Baseline 대비 ODP 사용률과 확장성(Extensibility)에서 압도적인 성능 향상을 보였습니다. 이는 '설계 우선(Planning-first)' 전략이 효과적임을 입증합니다.
기능적 사용성: RAG 기반 평가에서 멀티 에이전트 방식이 더 높은 지식 커버리지를 기록했습니다. SPARQL 평가에서는 모델링의 복잡성으로 인해 점수가 낮게 나타났으나, 멀티 에이전트 방식이 상대적으로 우세했습니다.
한계점 발견:
중복성 문제: 모델이 전역적인 문맥을 유지하며 기존 요소를 재사용하는 것은 여전히 어렵습니다 (Redundancy 문제).
수정 루프의 불안정성: 오류 수정 과정에서 LLM이 좁은 범위에 집착하거나, 잘못된 문법을 반복 생성하는 '환각 루프(Hallucination loop)' 현상이 관찰되었습니다.
5. 의의 및 결론 (Significance & Conclusion)
본 연구는 **"사후 수정(Repair)보다 사전 계획(Planning)이 온톨로지 품질에 더 결정적인 영향을 미친다"**는 점을 실험적으로 증명했습니다.
단순히 LLM에게 "온톨로지를 만들어라"라고 명령하는 대신, 전문가 역할을 분담하고 중간 산출물(SRD, TIP)을 생성하게 하는 방식이 훨씬 더 구조적이고 신뢰할 수 있는 결과를 만듭니다. 특히 이러한 중간 산출물은 인간 전문가가 생성 과정을 검토하고 개입할 수 있는 **감사 가능성(Auditability)**을 제공하므로, 법률이나 금융과 같은 고위험(High-stakes) 도메인에서 자동화된 지식 공학을 실현하는 데 중요한 이정표를 제시합니다.