Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval
본 논문은 지식 그래프 구축을 가이드하고 멀티 툴 검색 에이전트를 조건화하기 위해 원시 멀티 소스 데이터로부터 실행 가능한 스키마 계약을 자동으로 발견하는 시스템을 제시하며, 이는 구조화되고 추적 가능하며 스키마를 인식하는 증거 통합을 가능하게 함으로써 베이스라인 방법 대비 질의응답 성능을 유의미하게 향상시킨다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 미스터리를 풀려고 노력 중이라고 상상해 보세요. 하지만 단서들은 어질러진 방 안에 흩어져 있습니다. 어떤 단서는 깔끔한 장부(테이블)에 적혀 있고, 어떤 것은 포스트잇(PDF)에 휘갈겨 써져 있으며, 어떤 것은 지저분한 디지털 로그(JSON) 형태이고, 또 어떤 것은 화이트보드 위의 무작위한 메모들입니다.
현재 대부분의 AI 시스템은 그저 손전등 하나를 들고 무작정 모든 것을 읽기 시작하는 탐정과 같습니다. 그들은 단서를 찾아낼 수는 있겠지만, 방의 구조를 이해하지 못하기 때문에 단서들이 어떻게 연결되는지는 놓치기 일쑤입니다. 그들은 장부에 적힌 이름이 포스트잇의 이름과 일치한다는 사실이나, 한 메모가 다른 메모의 '자식(child)' 관계라는 사실을 구분하지 못합니다.
이 논문은 탐정이 조사를 시작하기 전에 먼저 방의 **설계도(blueprint)**를 구축하는 초정밀 설계사(super-organized architect) 역할을 하는 새로운 시스템을 소개합니다.
이 시스템이 어떻게 작동하는지 간단한 단계별로 설명하겠습니다.
1. "자동 설계도" (스키마 발견 - Schema Discovery)
인간이 몇 주 동안 어디에 무엇이 있는지 지도를 그리도록 요청하는 대신, 이 시스템은 가공되지 않은 지저진 데이터를 보고 스스로 규칙을 파악합니다.
- 문제점: AI는 종종 "환각(hallucination)"을 일으킵니다. 데이터에는 "매출(Revenue)"만 있는데도 "이익(Profit)"이라는 열을 마음대로 만들어낼 수 있습니다.
- 해결책: 시스템은 **"폐쇄형 세계 카탈로그(Closed-World Catalog)"**를 생성합니다. 이것은 엄격한 규칙 책과 같습니다. "데이터에 실제로 존재하는 것들에 대해서만 말할 수 있다"라고 규정하는 것입니다. 만약 AI가 새로운 필드를 만들어내려 하면, 시스템은 "안 돼, 그건 카탈로그에 없어"라고 말하며 실제 존재하는 것에만 집중하도록 강제합니다.
- 결과: 시스템은 **"스키마 계약(Schema Contract)"**을 구축합니다. 이는 "이것이 '제품'의 모습이고, 이것이 '거래'의 모습이며, 이들이 어떻게 연결되는지"를 명시하는 공유된 약속입니다.
2. "지식 그래프" 구축 (정돈된 도서관)
설계도가 준비되면, 시스템은 이 설계도를 사용하여 지저분한 데이터를 **지식 그래프(Knowledge Graph)**라고 불리는 깔끔하고 연결된 도서관으로 정리합니다.
- 마법 같은 기능: 단순히 데이터를 쏟아붓는 것이 아니라, 설계도를 사용하여 관계를 파악합니다.
- 식별 키(Identity Keys): 한 파일의 "ID: 123"이 다른 파일의 "ID: 123"과 동일 인물임을 알아냅니다.
- 외래 키(Foreign Keys): 판매 테이블의 "주문 번호 #55"가 고객 테이블의 "고객 번호 #99"에 속해 있다는 것을 깨닫습니다.
- 출처(Provenance): 모든 정보 조각에는 그것이 어떤 원래 문서에서 왔는지를 보여주는 "영수증"이 붙어 있습니다. 즉, AI가 답을 내놓으면, 그 증거를 찾은 정확한 페이지와 줄까지 지목할 수 있습니다.
3. "스마트 탐정" (쿼리 시점의 검색 - Query-Time Retrieval)
당신이 질문을 던지면 (예: "2018년 합병 후 가장 많은 이익을 낸 제품은 무엇인가요?"), 시스템은 그냥 추측하지 않습니다. 시스템은 설계도를 사용하여 답을 찾는 방법을 결정합니다.
- 라우팅(Routing): 시스템은 스스로에게 묻습니다. "스프레드시트에 있는 깔끔한 숫자를 봐야 하나? PDF에 있는 긴 텍스트를 읽어야 하나? 아니면 여러 파일 사이의 연결 고리를 따라가야 하나?"
- 계약: AI는 설계도를 가지고 있기 때문에 어떤 도구를 사용해야 할지 정확히 압니다. 목적 없이 헤매는 것이 아니라, 설계도가 두 파일이 연결되어 있다고 말할 때만 스프레드시트에서 PDF로 직접 뛰어넘으며 가장 빠른 경로를 택합니다.
- 안전망: 만약 질문이 설계도가 알지 못하는 내용(예: 아직 추가되지 않은 새로운 제품)에 관한 것이라면, 시스템은 설계도를 일시적으로 "확장"하여 처리하거나, 가짜 답을 만들어내는 대신 모른다고 인정할 수 있습니다.
왜 기존 방식보다 더 나은가요?
저자들은 이 시스템을 다른 방식들(표준 AI 검색이나 설계도 없이 연결 관계를 추측하려는 시스템들)과 비교 테스트했습니다.
- 결과: "설계도 시스템"은 서로 다른 출처의 정보를 결합해야 하는 복잡한 질문에 답하는 데 있어 현저히 더 뛰어난 성능을 보였습니다.
- 비유:
- 기존 방식 (RAG): 사서에게 키워드를 외쳐서 책을 찾아달라고 하는 것과 같습니다. 사서는 "이익"이라는 단어가 들어간 책을 찾을 수는 있겠지만, 그것이 틀린 책일 수도 있습니다.
- 이 방식: 이미 완벽한 인덱스 카드 시스템을 구축해 놓은 사서가 있는 것과 같습니다. 사서는 어떤 카드가 이익 수치를 가리키는지, 어떤 카드가 합병 날짜를 가리키는지, 그리고 그들을 어떻게 연결하여 정확한 답을 줄 수 있는지를 정확히 알고 있습니다.
핵심 요약
이 논문은 혼란스러운 데이터로부터 엄격하고 실행 가능한 **지도(스키마)**를 질문에 답하기 전에 자동으로 생성함으로써, AI 시스템이 훨씬 더 정확하고 신뢰할 수 있으며, 자신이 답을 찾은 출처를 설명할 수 있게 된다고 주장합니다. 이는 혼란스러운 단서들의 방을 잘 정돈된 도서관으로 바꾸어, 탐정의 업무를 훨씬 쉽게 만들고 결과의 신뢰도를 높여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.