← 최신 논문
🤖 AI

An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation

본 논문은 결정론적 지식을 LLM 추론 엔진으로부터 명시적인 멀티모달 데이터베이스로 분리하는 데이터 우선 온톨로지인 DaoQL을 제안하며, 이러한 아키텍처가 암시적 신경 모델과 비교하여 반사실적 분해 가능성을 유의미하게 향상시키고 환각과 같은 구조적 위험을 완화함을 실증적 검증을 통해 입증한다.

원저자: Zhanbo Li, Shifeng Wu, Xiangjin Meng, Wenjie Cai

게시일 2026-07-21
📖 5 분 읽기🧠 심층 분석

원저자: Zhanbo Li, Shifeng Wu, Xiangjin Meng, Wenjie Cai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 의사들이 질병을 진단하거나 은행가들이 사기를 포착하는 것을 도울 수 있는 초지능 로봇을 만들려고 한다고 상상해 보세요. 이를 위해 보통 당신은 로봇에게 방대한 양의 텍스트를 학습시켜, 로봇이 세상에 대해 "느끼는" 것처럼 패턴을 익히게 합니다. 이것이 현대 AI가 작동하는 방식입니다. 즉, AI는 거대하고 무질서한 숫자들의 웹인 "신경망 가중치(neural weights)" 안에 지식을 저장합니다. 이것은 마치 수십억 권의 책을 암기했지만, 왜 어떤 것이 사실이라고 생각하는지 보여주기 위해 특정 페이지를 가리킬 수 없는 인간의 뇌와 같습니다. 문제는 이 뇌가 일종의 '블랙박스'라는 점입니다. 까다로운 질문을 던지면 AI는 말을 지어낼 수도 있고(환각 현상), 세상이 변했을 때 사실을 쉽게 업데이트할 수 없으며, 그 추론 과정을 설명하기 어렵습니다. 과학자들은 이를 "암묵적 세계 모델(implicit world model)"이라고 부르는데, 이는 세상의 규칙이 명확하게 기록된 것이 아니라 수학 속에 숨겨져 있기 때문입니다.

이를 해결하기 위해 "데이터 우선 온톨로지(data-first ontology)"라는 새로운 아이디어는 규칙을 숨기는 것을 멈추자고 제안합니다. AI가 사실을 추측하게 두는 대신, 모든 사실이 잘 정리된 서류함처럼 특정 주소와 함께 저장되는 명확하고 조직화된 도서관을 제공해야 한다는 것입니다. 이 설정에서 AI는 당신과 대화하고 퍼즐을 풀 줄 아는 똑똑한 사서일 뿐이며, 실제 사실은 도서관의 데이터베이스에 존재합니다. 이 논문은 이러한 종류의 도서관을 구축하려는 DaoQL이라는 시스템을 탐구합니다. 이 논문은 다음과 같이 질문합니다. "생각하는 것(thinking)"과 "아는 것(knowing)"을 분리한다면 어떻게 될까? 사실을 명확한 명시적 데이터베이스에 두고 AI가 단지 그것을 읽기만 하게 한다면, 우리는 로봇을 더 정직하고, 고치기 쉬우며, "만약 ~라면(what if)"이라는 질문에 더 잘 답하게 만들 수 있을까?


논문의 핵심 아이디어: 도서관 vs 블랙박스

이 논문의 저자들은 현재 AI가 작동하는 방식이 학생에게 백과사전 전체를 머릿속에 암기하도록 요구하는 것과 같다고 주장합니다. 만약 당신이 "프랑스의 수도는 어디인가?"라고 묻는다면, 학생은 그 말을 수백만 번 들었기 때문에 정답을 맞힐 수도 있습니다. 하지만 만약 당신이 "만약 어제 프랑스가 수도를 리옹으로 바꿨다면 어떻게 될까?"라고 묻는다면, 학생은 혼란에 빠지거나, 옛 기억을 뒤섞거나, 혹은 그냥 이야기를 지어낼 수도 있습니다. 학생은 다른 것들을 망가뜨리지 않고 기존의 사실을 제거하고 새로운 사실을 삽입하기 위해 자신의 뇌를 쉽게 "편집"할 수 없습니다.

이 논문은 다른 접근 방식을 제안합니다: 명시적 세계 모델(Explicit World Model). 머릿속에 암기된 뇌를 가진 학생 대신, 초정밀하게 정리된 도서관을 가진 로봇을 갖게 된다고 상상해 보세요.

  • 사서 (AI): 이것은 거대언어모델(LLM)입니다. 질문을 이해하고 인간의 언어로 말하는 데 탁월합니다.
  • 도서관 (DaoQL): 이것은 모든 사실이 명확하게 저장되는 특별한 데이터베이스입니다. 여기에는 여섯 가지 구성 요소가 사용됩니다: 존재(Being) (사람이나 제품 같은 대상), 정의(Def) (그 대상이 무엇인지), 유형(Type) (카테고리), 관계(Relation) (사물 간의 연결 방식), 계약(Contract) (그들이 따라야 하는 규칙), 그리고 버전(Version) (변화의 이력).

주요 발견은 "딱딱한 사실"을 이 도서관으로 옮기고 AI가 단지 그것을 읽게 함으로써 시스템이 훨씬 더 신뢰할 수 있게 된다는 점입니다. 논문은 이 설정이 **"결합 가능한 반사실적 분해 가능성(composable counterfactual decomposability)"**을 가능하게 한다고 수학적으로 증명합니다. 이것은 "도서관의 사실 하나를 바꾸면, 로봇이 혼란을 겪거나 새로운 규칙을 만들어내지 않고도 그 변화가 정답에 어떻게 영향을 미치는지 완벽하게 계산할 수 있다"는 말을 멋지게 표현한 것입니다.

실제로 구축하고 테스트한 것

연구팀은 이 아이디어를 테스트하기 위해 DaoQL이라는 시스템을 구축했습니다. 그들은 단순히 말로만 하지 않았습니다. 도서관을 직접 구축하고 실험을 실행하여 얼마나 빠르고 정확한지 확인했습니다.

1. "만약 ~라면" 테스트 (반사실적 질문)
그들은 의료, 금융, 공급망, 법률, 가격 책정의 다섯 가지 영역에 걸쳐 1,250개의 질문으로 대규모 실험을 수행했습니다. 그들은 AI에게 "만 if 이 환자가 다른 알레르기가 있다면?", "만약 이 공급업체가 파산한다면?"과 같은 변화를 상상하도록 요청했습니다.

  • 결과: AI가 단독으로 작동할 때(자신의 기억만을 사용할 때) "만약 ~라면"에 대한 답변을 맞힌 비율은 **45%**에 불_뿐이었습니다. 하지만 AI가 사실 확인을 위해 DaoQL 도서관을 사용했을 때, 정답률은 **94%**까지 치솟았습니다. 이는 엄청난 도약입니다! 도서관은 AI가 추측하는 대신 실제 규칙에 기반해 계산하도록 도왔습니다.

2. 속도 및 효율성
그들은 또한 도서관이 답을 찾는 속도를 테스트했습니다. 공정성을 기하기 위해 단일 컴퓨터에서 DaoQL을 다른 시스템들과 비교했습니다.

  • 그래프 순회(Graph Traversal): 사물 간의 연결(예: "누가 누구를 아는가?")을 찾는 데 단 1.20 밀리초가 걸렸습니다. 이는 인간이 눈을 깜빡이는 것보다 빠릅니다.
  • 유사 항목 검색: 목록에서 유사한 항목을 찾는 데 83.1 마이크로초가 걸렸습니다.
  • 혼합 쿼리: 텍text, 숫자, 연결 관계를 한꺼번에 살펴봐야 하는 복잡한 질문을 던졌을 때, 105.8 마이크로초가 소요되었습니다.

3. 하지 못한 것들 ("아직 미완성" 목록)
이 논문이 해결하지 못한 부분도 아는 것이 중요합니다. 저자들은 매우 솔직하게 밝히고 있습니다.

  • 아직 마법 같은 에이전트는 없음: 그들은 도서관과 "생각하는 부분"을 구축했지만, 아직 "에이전트"(직접 가서 업무를 수행하는 로봇)를 완전히 구축하지는 못했습니다. 그것은 향후 계획입니다.
  • 빌리언 스케일(Billion-scale) 시스템 아님: 그들은 64GB 또는 128GB 메모리를 가진 컴퓨터에서 테스트했습니다. 그들은 이 시스템을 인터넷 전체 규모로 테스트하지 않았음을 인정합니다.
  • 일부 느린 구간: 대부분의 작업은 빨랐지만, 중국어 텍스트를 검색하는 것은 다른 시스템보다 훨씬 느렸으며(테스트에서 약 40배 느림), 이는 그들이 해결해야 할 약점임을 인정했습니다.
  • 롱테일(Long-tail) 문제: 복잡한 사회 네트워크 시뮬레이션(LDBC SNB)을 실행했을 때, 가장 어려운 질문들에 대해서는 시스템이 매우 느려져 밀리초가 아닌 몇 초 또는 몇 분이 걸리기도 했습니다.

이것이 왜 중요한가

이 논문은 신뢰할 수 있는 AI의 미래가 AI의 뇌를 더 크거나 복잡하게 만드는 데 있지 않다고 제안합니다. 대신, AI에게 사실을 저장할 더 명확하고 깨끗한 장소를 제공하는 것이 핵심입니다.

저자들은 "아는 것"(데이터베이스)과 "생각하는 것"(AI)을 분리하면 다음과 같은 시스템을 얻을 수 있음을 보여줍니다:

  • 더 정직함: 사실을 먼저 찾아봐야 하므로 환각 현상이 일어나기 어렵습니다.
  • 수정하기 쉬움: 만약 어떤 사실이 틀렸다면, 도서 전체의 AI 뇌를 다시 훈련할 필요 없이 도서관의 항목만 업데이트하면 됩니다.
  • 설명 가능함: 빵 부스러기 흔적을 따라가듯, 어떤 사실이 어떤 답변을 이끌어냈는지 정확히 추적할 수 있습니다.

논문은 비록 이것이 오늘날 모든 기업이 바로 사용할 수 있는 완성된 제품은 아닐지라도, 이러한 "데이터 우선" 방식의 AI 구축이 수학적으로 타당하며 많은 작업에서 실질적으로 더 빠르다는 것을 입증한다고 결론짓습니다. 이는 단순히 추측하는 것이 아니라, 자신이 말하는 바를 실제로 알고 있는 로봇을 향한 강력한 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →