← 최신 논문
💻 computer science

Knowledge-Constrained Reasoner: Attempting to Enable LLMs to Parse Knowledge for Question Answering

이 논문은 단일 정렬 단계를 통해 필수적인 추론 능력을 대규모 언어 모델에 내재화함으로써, 질의응답을 위한 외부 지식의 엄격하고 정확한 활용을 보장하고 전통적인 전문가 시스템의 신뢰성과 비매개변수적 연속 학습의 유연성을 결합하는 새로운 접근 방식인 지식 제약 추론기(Knowledge-Constrained Reasoner)를 소개한다.

원저자: Zhiqiang Gan

게시일 2026-08-03
📖 6 분 읽기🧠 심층 분석

원저자: Zhiqiang Gan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 똑똑하고 매우 빠른 로봇에게 미스터리를 해결하는 법을 가르치려 한다고 상상해 보세요. 당신에게는 두 가지 주요 방법이 있습니다. 첫 번째 방법은 로봇의 뇌 속에 거대하고 무거운 백과사전을 넣어주는 것과 같습니다. 이것이 초기 "전문가 시스템(expert systems)"이 작동하던 방식입니다. 이들은 믿기지 않을 정도로 엄격하고 규칙을 완벽하게 따랐지만, 매우 경직되어 있었습니다. 만약 그들의 책에 없는 것에 대해 질문하면, 로봇은 얼어붙었습니다. 규칙을 업데이트하려면 전체 책을 다시 써야 했기에 느리고 비용이 많이 들었습니다.

두 번째 방법은 오늘날 우리가 챗봇처럼 대화하는 현대적 AI를 사용하는 방식입니다. 이 모델들은 인터넷 전체를 삼켜버린 초능력 독서가와 같습니다. 이들은 유연하고, 재미있으며, 대화에 능숙합니다. 하지만 까다로운 결함이 하나 있습니다. 방금 배운 것을 잊어버리거나, 새로운 규칙을 건네주며 엄격히 따르라고 요청했을 때 혼란을 겪기도 합니다. 이들은 실제 규칙이 무엇인지에 근거하기보다, 자신이 무엇이 사실이라고 '생각'하는지에 기반해 답을 추측할 수 있습니다. 이는 로봇이 의사, 조종사, 또는 안전 검사관처럼 규칙을 정확히 따르는 것이 생사와 직결되는 상황에서는 큰 문제가 됩니다.

이것이 바로 "검색 증강 생성(Retrieval-Augmented Generation, RAG)"이라는 새로운 아이디어로 이어집니다. 이것을 로봇에게 도서관 카드를 주는 것으로 생각해보세요. 질문을 받으면, 로봇은 답변하기 전에 관련 페이지를 빠르게 찾아 읽습니다. 이는 추측하는 것보다 낫지만, 로봇은 여전히 그 페이지를 '어떻게' 읽을지 결정해야 합니다. 때로는 세부 사항을 무시하기도 하고, 단계를 건너뛰기도 하며, 너무 똑똑한 척하다가 존재하지 않는 규칙을 만들어내기도 합니다. 핵심적인 질문은 과학자들이 던지고 있는 질문입니다. "우리가 로봇에게 단순히 도서관을 읽는 법이 아니라, 자신의 뇌를 새로 쓰지 않고도 매번 완벽하게 규칙을 따르는 숙련된 논리학자가 되는 법을 가르칠 수 있을까?"


지식 제약 추론기(The Knowledge-Constrained Reasoner): AI에게 규칙 준수법을 가르치다

이 논문에서 연구자 Zhiqiang Gan은 "지식 제약 추론기(Knowledge-Constrained Reasoner)"라고 불리는 것을 구축함으로써 그 질문에 답하고자 노력했습니다. 목표는 표준 대규모 언어 모델(LLM)을 엄격하고 논리적인 탐정으로 만드는 것입니다. 즉, 새로운 규칙 세트(예: 새로운 의료 프로토콜이나 군사 지침)를 받았을 때 혼란을 겪거나 허구의 내용을 만들어내지 않고 글자 그대로 따를 수 있게 만드는 것입니다.

이 논문은 새로운 사실을 AI의 기억 속에 억지로 집어넣으려고 하는 대신(이는 기존의 것을 잊게 만듭니다), 단 한 번의 학습 세션을 통해 AI에게 일련의 "메타 기술" 또는 "초능력"을 가르쳐야 한다고 제안합니다. 이것은 강아지를 훈련시키는 것과 비슷합니다. 강아지에게 세상의 모든 가능한 상황에 대한 구체적인 명령을 가르치는 것이 아닙니다. 대신, 듣는다는 개념, 간식을 찾는다는 개념, 그리고 신호를 기다린다는 개념을 가르칩니다. 일단 강아지가 이 개념들을 알게 되면, 이전에 들어본 적 없는 구체적인 명령이라도 그 명령을 어떻게 따라야 하는지 이해하게 됩니다.

다섯 가지 초능력

AI를 훌륭한 규칙 준수자로 만들기 위해, 연구자는 가상의 의사, 군인, 공장 노동자가 등장하는 1,0로 개의 가상 시나리오 데이터셋을 사용하여 네 가지 특정 논리적 "동작"(플러스 추가적인 하나)을 훈련시켰습니다. 이 동작들을 쉽게 설명하면 다음과 같습니다.

  1. 상황적 맥락화 ("이게 나랑 상관있는 일인가?" 확인):
    행동하기 전에, AI는 규칙이 현재 상황에 실제로 적용되는지 확인해야 합니다.

    • 비유: 클럽의 문지기를 상상해 보세요. 규칙이 "신발 착용 금지"라면, 양말만 신고 들어온 사람을 보고 문지기는 "양말이 신발에 포함되는가?"를 결정해야 합니다.
    • 논문의 발견: AI는 사용자의 상황이 규칙의 조건과 정확히 일치하는지 확인하도록 훈련받았습니다. 예를 들어, 규칙은 "심각한" 충돌에 관한 것인데 사용자가 "경미한" 충돌을 겪었다면, 잘못된 규칙을 적용하지 않도록 "아니오"라고 말하는 법을 배웠습니다. 또한, 환자를 위해 가짜 약을 지어내는 대신, 답을 모를 때는 모른다고 인정하는 법을 배웠습니다.
  2. 전방 인과 추론 ("이것이 일어나면 저것이 일어난다" 체인):
    이것은 고전적인 논리입니다: A가 발생하면, B가 반드시 발생해야 합니다.

    • 비유: 도미노 효과와 같습니다. 첫 번째 도미노를 밀면(환자가 열이 나면), 다음 도미노가 넘어집니다(약을 투여한다).
    • 논문의 발견: AI는 상황을 보고, 일치하는 규칙을 찾아낸 뒤, 즉시 올바른 행동으로 넘어가는 법을 배웠습니다.
  3. 후방 인과 추적 ("왜 이런 일이 일어났는가?" 탐정 업무):
    때로는 결과를 보고 원인을 찾아야 할 때가 있습니다.

    • 비유: 방에 들어갔는데 바닥에 깨진 꽃병이 놓여 있습니다. 당신은 집안의 규칙을 살펴보고 다음과 같이 추론해야 합니다: "누가 여기에 들어올 수 있었으며, 그들은 무엇을 하고 있었는가?"
    • 논문의 발견: AI는 결과(예: "로봇 팔에 전원이 차단됨")를 보고, "원자로가 너무 뜨거워지면 전원을 차단한다"라는 규칙을 찾아내어 이를 역추적할 수 있었습니다. AI는 과열이 원인이었음을 성공적으로 파악했습니다.
  4. 논리적 구성 ("모든 것을 수행하기" 목록):
    현실은 복잡합니다. 때로는 하나의 상황이 동시에 여러 규칙을 촉발합니다.

    • 비유: 비디오 게임 캐릭터가 공격을 받으면 체력이 깎임과 동시에 코인을 떨어뜨려야 한다고 가정해 봅시다. 만약 게임이 코인만 떨어뜨리게 만든다면 그것은 버그입니다.
    • 논문의 발견: AI는 진단, 격리 단계, 그리고 당국 보고가 모두 필요한 복잡한 규칙을 처리하는 법을 배웠습니다. AI는 단계를 건너뛰는 것을 멈추고 전체 체크리스트를 수행하기 시작했습니다.
  5. 필터링 ("사실만 골라내기" 필터):
    규칙에 긴 단계들이 나열되어 있어도, 당신에게 필요한 것은 첫 번째 단계뿐일 수 있습니다.

    • 비유: 레시피에 "오븐 예열, 양파 다지기, 베이컨 굽기, 그 후 서빙"이라고 적혀 있다고 합시다. 만약 당신이 "가장 먼저 해야 할 일은?"이라고 묻는다면, AI는 레시피 전체를 쏟아내서는 안 됩니다. 그저 "오븐을 예열하세요"라고 말해야 합니다.
    • 논문의 발견: AI는 불필요한 소음을 무시하고 사용자가 요청한 특정 단계만을 제공하는 법을 배웠습니다.

결과: 효과가 있었는가?

연구자는 이 새로운 "추론기"를 일반적인 방식(특별한 훈련 없이 질문만 하는 방식)의 AI와 비교 테스트했습니다.

  • 표준 방식: 복잡한 규칙을 따르라는 질문을 받았을 때, 일반적인 AI는 약 **75%**의 정답률을 보였습니다. 이들은 자주 혼란스러워하거나, 단계를 건거뛰거나, 그냥 포기하곤 했습니다.
  • 새로운 방식: 단 한 번의 훈련 세션 이후, "지식 제약 추론기"는 약 **88%**의 정답률을 기록했습니다.

논문은 이러한 개선이 실질적이고 유의미하다고 제안합니다. AI는 "타이탄 메카"나 "가상의 금융" 같은 가상의 주제에 관한 규칙일지라도, 주어진 규칙을 훨씬 더 잘 준수하게 되었습니다.

한계점 (그리고 실수한 부분들)

이 논문이 수행하지 못한 점을 명시하는 것도 중요합니다. 이 논문은 AI가 이제 완벽하다는 것을 증명한 것이 아닙니다. 논문은 AI가 여전히 약 **12%**의 사례에서 실수를 저지른다고 명시하고 있습니다.

  • 혼동: AI는 때때로 규칙의 '결과'와 취해야 할 '행동'을 혼동했습니다. 예를 들어, 규칙이 "해커가 침입하면 시장이 붕괴된다"라고 되어 있을 때, 사용자가 "우리는 무엇을 해야 하는가?"라고 물으면, AI는 "우리는 문을 잠가야 한다"라고 말하는 대신 가끔 "시장이 붕괴될 것이다"라고 답했습니다.
  • 정밀도 격차: AI는 때때로 "경미한" 문제와 "심각한" 문제를 혼동하여 잘못된 응급 계획을 사용하는 등 아주 작은 세부 사항을 놓치기도 했습니다.

논문은 단순히 몇 가지 예시를 제공하는 방식(프롬프팅)만으로는 이러한 깊은 논리적 오류를 해결하기에 부족하다고 주장합니다. AI는 단순히 몇 가지 힌트에 기반해 추측하는 것이 아니라, 이러한 논리적 동작들이 습관이 될 때까지 "미세 조정(fine-tuning)"되어야 합니다.

거시적 관점

이 연구의 핵심 결론은, 규칙을 단순히 암기하는 것이 아니라 규칙을 가지고 '생각하는 법'을 가르침으로써, 인간처럼 유연하면서도 컴퓨터 프로그램처럼 신뢰할 수 있는 AI를 구축할 수 있다는 것입니다. 연구자는 AI가 외부 정보에 논리를 "고정(anchor)"하는 법을 배울 수 있다면, 기존의 것을 잊지 않고도 즉각적으로 새로운 것을 배울 수 있다고 제안합니다.

하지만 논문은 이것이 단지 "초기 시도"이자 "예비적 증거"임을 주의 깊게 밝히고 있습니다. 이는 엄격하고 안전한 옛날 방식의 전문가 시스템과 유연하고 창의적인 현대 AI 사이의 간극을 메우기 위한 유망한 단계입니다. 적절한 훈련을 거친다면 AI가 훨씬 더 나은 규칙 준수자가 될 수 있음을 보여주지만, 아직 고도의 위험이 따르는 상황에서 인간 전문가를 대체할 수준에는 도달하지 못했습니다. 잊지 않고 신뢰할 수 있는 AI를 향한 여정은 여전히 진행 중이며, 이 새로운 "추론기"는 앞으로 나아갈 길에 대한 새로운 지도를 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →