← 최신 논문
💬 NLP

REAP: Relation-Aware Elicitation and Parsing for Closed-Book Knowledge Base Construction from LLMs

미세 조정 없이 24B 파라미터 Mistral 모델을 기반으로 구축된 REAP 시스템은 구조화된 연쇄 사고(chain-of-thought) 추론, 관계별 질의, 그리고 파라미터 지식을 유효한 JSON 배열로 이끌어내고 파싱하기 위한 추론 기반 공집합 게이트를 채택함으로써 AKBC Shared Task 2026에서 0.62의 macro-F1 점수를 달성하였다.

원저자: Thanh-Dan Bui, Thanh-Trung Do, Tuan-Phong Nguyen

게시일 2026-08-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Thanh-Dan Bui, Thanh-Trung Do, Tuan-Phong Nguyen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 세상의 거의 모든 책을 읽었고, 프랑스의 수도부터 특정 은하계의 별 개수까지 엄청난 양의 사실을 암기한 친구가 있다고 상상해 보세요. 이 친구는 '거대 언 언어 모델(LLM)'입니다. 보통 당신이 "노벨상을 누가 받았지?"와 같은 간단한 질문을 하면, 그들은 빠르게 답을 내놓습니다. 하지만 만약 당신이 그들에게 지금까지 노벨상을 받은 모든 사람의 명단을 작성하라거나, 아주 작은 섬나라와 국경을 접하고 있는 국가가 정확히 어디인지 말해달라고 한다면 어떻게 될까요? 갑자기 작업이 훨씬 어려워집니다. 그 친구는 몇몇 이름을 잊어버리거나, 가짜 수상자를 지어내거나, 심지어 그 섬에 이웃이 있는지조차 헷갈려 할 수도 있습니다.

이것이 바로 '지식 베이스 구축(Knowledge Base Construction)'의 과제입니다. 과학자들은 이 거대하고 사실이 가득한 두뇌를 컴퓨터가 신뢰할 수 있게 사용할 수 있는 조직적인 데이터베이스로 바꾸고자 합니다. 까다로운 점은, 이 친구(AI)에게 찾아볼 도서관이 없다는 것입니다. 그들은 전적으로 자신의 머릿속(그들의 '파라미터')에 의존해야 합니다. 만약 답이 "없음"이라면, 친구는 추측하는 대신 "비어 있음"이라고 말할 줄 알아야 합니다. 만약 답이 긴 목록이라면, 그들은 단 하나의 항목도 빠뜨리지 않고 모든 항목을 정확하게 가져와야 합니다. 이 논문은 이러한 AI 친구들에게 어떻게 올바른 질문을 던져서, 환각(hallucination)을 일으키거나 혼란에 빠지지 않고 완벽하고 조직적인 목록을 얻어낼 것인가라는 문제를 다룹니다.


REAP 시스템: AI 기억력을 향한 탐정의 가이드

REAP(Relation-Aware Elicitation and Parsing)을 만나보세요. REAP을 단순한 질문자가 아니라, 매우 똑똑하지만 때로는 정신없는 목격자(AI 모델)와 함께 일하는 영리한 탐정 팀이라고 생각하십시오. 목표는 무엇일까요? 목격자의 기억으로부터 완벽하고 조직적인 사실 목록을 구축하되, 그들이 이야기를 지어내지 못하게 하는 것입니다.

연구진은 단순히 AI에게 "X와 국경을 접한 모든 국가를 나열해 봐"라고 요청하면, AI가 압도당하거나, 몇 개를 잊어버리거나, 존재하지 않는 국경을 실수로 만들어낼 수 있다는 것을 발견했습니다. 이는 마치 학생에게 교과서의 한 단원을 한 번의 호흡으로 암송하라고 요구하는 것과 같습니다. 학생은 중간에 비틀거릴 수 있습니다. 대신, REAP은 이 작업을 두 단계의 인터뷰 과정처럼 두 개의 뚜렷한 단계로 나눕니다.

1단계: 탐정의 심문 (추론 - Reasoning)
첫 번째 단계에서 REAP은 단순히 답을 요구하지 않습니다. AI에게 말을 하기 전에 생각하도록 요청합니다. 질문의 유형에 따라 탐정은 특별한 전략을 사용합니다:

  • 국경(Borders)의 경우: "누가 접하고 있니?"라고 묻는 대신, AI에게 지리학 전문가처럼 행동하여 작은 이웃 국가를 놓치지 않도록 동, 서, 남, 북 네 방향으로 지도를 스캔하라고 지시합니다.
  • 수상(Awards)의 경우: 만약 AI가 수상자 명단을 작성해야 한다면, 단순히 추측하지 않습니다. 시간을 10년 단위로 나누어 "1970년대에는 누가 받았나? 1980년대에는 누가 받았나?"라고 묻습니다. 이를 통해 AI가 한 시대를 통째로 건너뛰는 것을 방지합니다.
  • "공집합(Empty Set)" 관문: 이것은 매우 중요한 안전장치입니다. 때때로 답은 "아무도 없음"(예: 아직 사망하지 않은 생존 인물, 혹은 상장되지 않은 비상장 기업 등)일 수 있습니다. REAP은 AI가 특정 속성이 존재하지 않을 때 이를 인식하고, 가짜 이름을 지어내는 대신 자신 있게 "목록이 비어 있음"이라고 말하도록 가르칩니다.

2단계: 서기의 정리 (파싱 - Parsing)
AI가 사고 과정을 마치고 지저之处한 사실 목록을 생성하면, 2단계인 서기가 등장하여 노트를 정리합니다. 이 시스템은 답변을 추출하여 완벽한 JSON 리스트(표준 컴퓨터 형식)로 포맷팅하기 위한 엄격한 규칙을 사용합니다. 만약 AI가 혼동하여 리스트 대신 문장을 작성했다면, 서기는 이를 수정하려고 시도합니다. 만약 수정이 불가능하다면, 시스템은 더 단순한 프롬프트를 사용하여 질문을 다시 시도합니다.

연구 결과

연구진은 약 240억 개의 "뇌 세포"(파라미터)를 가진 Mistral-Small-24B-Instruct-2501이라는 특정 AI 모델을 사용하여 이 시스템을 테스트했습니다. 그들은 엄격한 규칙 하에 작업했습니다: 인터넷에서 정보를 검색하지 말 것, AI의 뇌를 변경하지 말 것(파인튜닝 금지), 그리고 파라미터가 320억 개 이하인 모델을 사용할 것.

결과는 꽤 유망했습니다. 어려운 질문들로 구성된 테스트 세트에서 REAP 시스템은 0.62의 macro-F1 점수를 달성했습니다. 이를 설명하자면, 이는 주최 측의 베이스라인 시스템(0.30점)보다 훨씬 뛰어났으며, 동일한 방식을 사용한 Llama나 Gemma와 같은 다른 인기 있는 AI 모델들보다도 우수했습니다.

이 시스템은 특정 유형의 질문에서 가장 빛을 발했습니다:

  • 국가 국경(Country Borders): 0.95의 점수를 기록했는데, 이는 이웃 국가를 나열하는 데 거의 완벽했음을 의미합니다.
  • 증권 거래소(Stock Exchanges): 기업이 어디에서 거래되는지 찾는 데 0.73의 점수를 기록했습니다.
  • 면적(Area): 지리적 영역의 크기를 계산하는 데 0.77의 점수를 기록했습니다.

하지만 시스템이 모든 곳에서 완벽했던 것은 아닙니다. 경기장 수용량(venue capacity) 문제에서는 다소 어려움을 겪었으며(0.23점), 이름이 비슷한 유명 경기장과 작은 지역 경기장을 자주 혼동했습니다. 연구진은 이것이 AI의 내부 기억이 매우 구체적인 숫자나 드문 '롱테일(long-tail)' 사실에 대해서는 항상 정밀하지 못하기 때문이라고 제안합니다.

이것이 의미하는 바 (그리고 의미하지 않는 것)

이 논문은 AI로부터 더 나은 답변을 얻는 열쇠는 단순히 더 큰 뇌를 갖는 것이 아니라, 올바른 질문을 올바른 방식으로 던지는 데 있다는 점을 시사합니다. AI에게 "단계별로 생각하기(Chain-of-Thought reasoning)"를 강제하고, 다양한 사실 유형에 맞는 구체적인 전략을 제공함으로써, 시스템은 더 정확한 정보를 끌어낼 수 있습니다.

그러나 저자들은 이것이 마법의 해결책은 아니라는 점을 주의 깊게 언급합니다. 이 시스템은 여전히 AI가 암기한 것에 전적으로 의존합니다. 만약 AI가 매우 희귀한 개체(작은 섬이나 사소한 상 등)에 대한 사실을 모른다면, 시스템은 그것을 만들어낼 수 없습니다. 또한, AI가 특정 컴퓨터 칩(TPU)에서 실행되기 때문에 결과에 아주 미세한 무작위성이 존재할 수 있지만, 이는 전체적인 그림을 바꿀 정도는 아닙니다.

요약하자면, REAP은 약간의 구조와 많은 인내심이 있다면, 우리는 AI 친구들로부터 훨씬 더 신뢰할 수 있는 사실들을 끌어내어 그들의 혼란스러운 기억을 깔끔하고 사용 가능한 목록으로 바꿀 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →