← 최신 논문
💻 computer science

DKSE: Automated Extraction of Structured Domain Ontologies from Software Requirement Documents via Large Language Models

이 논문은 중국 금융 부문의 비정형 소프트웨어 요구사항 문서를 기계 판독이 가능하고 출처 추적이 가능한 온톨로지로 자동 변환하기 위해 대규모 언어 모델을 활용하는 Rust 기반 도구인 DKSE를 제시하며, 이는 테스트 생성 및 지식 그래프 구축과 같은 다운스트림 작업에 대한 높은 정확도와 실용적 유용성을 입증한다.

원저자: Yahua Ruan

게시일 2026-08-11
📖 2 분 읽기☕ 가벼운 읽기

원저자: Yahua Ruan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 책이 오직 인간만이 이해할 수 있는 언어로 쓰인 거대하고 고대적인 도서관으로 걸어 들어간다고 상상해 보십시오. 당신은 그 이야기와 규칙, 지침들을 읽을 수 있지만, 로봇에게 특정 사실을 찾아달라고 하거나, 그 지침을 바탕으로 새로운 기계를 만들어 달라고 하거나, 혹은 규칙이 준수되었는지 확인해 달라고 요청하면 로봇은 그저 멍하니 당신을 바라볼 뿐입니다. 로봇은 텍스트의 문단들을 볼 뿐, 자신이 마법을 부리는 데 필요한 구조화된 데이터를 보지 못하기 때문입니다. 이것이 바로 소프트웨어 엔지니어링 세계의 일상적인 현실입니다. 수십 년 동안 기업이 운영되는 방식에 대한 '소스 코드'—즉, 요구사항, 규칙, 프로세스—는 워드 파일이나 PDF 같은 비구조화된 문서 안에 갇혀 있었습니다. 인공지능은 코드를 읽고 쓰는 데는 놀라울 정도로 능숙해졌지만, 무엇을 만들 것인지 알려주는 무질서한 자연어 문서들을 이해하는 데는 어려움을 겪어 왔습니다. 큰 질문은 이것이었습니다: 어떻게 하면 이 인간의 이야기들을 기계가 실제로 생각하고, 구축하고, 검증하는 데 사용할 수 있는 형식으로 바꿀 것인가?

여기에 DKSE(도메인 지식 구조화 엔진, Domain Knowledge Structuring Engine)라는, 초강력 번역가이자 사서 역할을 하는 새로운 도구가 등장했습니다. 이것을 단순히 요구사항 문서를 읽는 것이 아니라, 그 안의 이야기를 이해하고 즉시 완벽하게 조직된 기계 판독 가능 설계도로 다시 쓰는 마법 같은 스캐너라고 생각하십시오. DKSE는 정보를 단순한 텍스트의 벽으로 남겨두는 대신, 여섯 가지의 구체적이고 유용한 카테고리로 세분화합니다: 엔티티(Entity, "고객"이나 "계좌"와 같은 이야기 속 등장인물), 관계(Relation, "고객이 계좌를 소유한다"와 같은 연결 방식), 규칙(Rule, "잔액이 낮으면 거래를 차단한다"와 같은 우주의 법칙), 프로세스(Process, "대출을 승인하는 방법"과 같은 단계별 댄스), API(데이터가 들어오거나 나가는 문과 창문), 그리고 사전(Dictionary, 허용된 단어와 코드의 공식 목록)입니다.

연구진은 이 도구를 약 80,000자의 복잡한 금융 규칙이 담긴 방대한 양의 실제 은행 문서들에 테스트했습니다. 결과는 인상적이었습니다: DKSE는 1,200개 이상의 규칙과 약 600개의 데이터 인터페이스를 포함하여 3,439개의 뚜렷한 구조화된 지식 조각들을 자동으로 추출해 냈습니다. 인간 전문가들이 작업 내용을 검토했을 때, 이는 96%의 정확도를 보였으며, AI가 사실을 지어내는 현상인 "환각(hallucination)"은 전혀 발견되지 않았습니다. 하지만 진짜 마법은 추출 그 자체가 아니라, 그 다음에 일어나는 일입니다. 정보가 이제 구조화되었기 때문에, 팀은 이를 사용하여 다른 AI 모델들을 점검하기 위한 1,214개의 테스트 질문을 즉시 생성했고, 새로운 AI의 두뇌를 가르치기 위해 약 200만 토큰 규모의 방대한 학습 데이터셋을 구축했으며, 심지어 컴퓨터가 사실을 지어내지 않고 정밀한 사실을 검색할 수 있도록 지식 그래프 시스템에 이 데이터를 입력했습니다. 이 논문은 이를 특히 은행 산업을 위한 성공적인 개념 증명(proof-of-concept)으로 제시하며, 우리가 마침내 저 먼지 쌓인 요구사항 문서들을 현대 소프트웨어 개발을 구동하는 살아 숨 쉬는 "두뇌"로 바꿀 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →