← 최신 논문
🤖 AI

Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

이 논문은 WnuanBench에서 91.51%의 정답 수락률을 달고 일반적인 지시 이행 능력과 관련된 트레이드오프를 정량화하는 동시에, 대규모 언어 모델을 기업 전용 지식에 효과적으로 적응시키는 3단계 사후 학습 파이프라인인 Wnuan을 소개한다.

원저자: Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu, Ying Liu, Haiping Wang, Hua Zhou

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu, Ying Liu, Haiping Wang, Hua Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 구체적이고 복잡한 비즈니스를 운영하는 법을 가르치려는, 아주 똑똑하고 박학다식한 십 대에게 가르치고 있다고 상상해 보세요. 이 십 대는 이미 공공 도서관의 거의 모든 책을 읽었으며 역사부터 코딩까지 무엇이든 이야기할 수 있습니다. 하지만 그들은 회사의 내부 규칙집, 안전 매뉴얼, 또는 비밀 프로젝트 파일들을 본 적이 없습니다. 만약 당신이 단순히 그들이 외부 세계에서 알고 있는 지식을 바탕으로 답을 추측하게 한다면, 그들은 자신감 있게 말할 수는 있겠지만 세부 사항은 틀릴 것이고, 더 심하게는 실제처럼 들리지만 사실은 아닌 내용을 지어낼 수도 있습니다(전문가들은 이를 "환각(hallucination)"이라고 부릅니다).

이것이 바로 **기업용 질의응답(Enterprise Question Answering)**의 과제입니다. 기업들은 자신들의 사적인 문서라는 거대한 산을 가지고 있지만, 그들의 AI 모델은 그 내용을 알지 못합니다. 목표는 AI가 유능하고 예의 바르며 논리적인 대화 상대로서의 능력을 잃지 않으면서도, 이 사적인 비밀들을 학습하도록 가르치는 것입니다. 이는 섬세한 균형 잡기입니다. 만약 회사의 내용에 대해 너무 많이 가르치면 일반적인 어시스턴트로서의 기능을 상실할 수 있고, 충분히 가르치지 않으면 직무를 수행할 수 없습니다. 당신이 읽게 될 논문은 이 퍼즐을 풀기 위한 영리한 3단계 레시피를 탐구하며, 범용 AI를 회사의 전문가로 탈바꿈시키는 방법을 제시합니다.


Wnuan 레시피: AI에게 기업 전문가가 되는 법을 가르치기

범용 AI를 회사의 사적인 문서를 속속들이 아는 전문가로 바꾸기 위해 설계된 새로운 훈련 파이프라인인 Wnuan을 만나보세요. AI를 단순히 시험 공부를 하는 학생이 아니라, 회사의 핸드북, 안전 프로토콜, 프로젝트 이력을 배우면서도 동시에 인간으로서 예의를 갖추는 법을 기억해야 하는 신입 사원이라고 생각해보세요.

이 논문의 저자들은 AI를 위한 3단계 훈련 캠프를 구축했습니다. 이것을 Wnuan이라고 부릅니다. 여정이 어떻게 진행되는지 단계별로 살펴보겠습니다.

1단계: 핸드북을 퀴즈 쇼로 바꾸기

먼저, 팀은 건조하고 지루한 수천 개의 회사 문서(안전 규칙이나 기술 사양 PDF 등)를 AI가 실제로 학습할 수 있는 형태로 바꾸어야 했습니다. 500페이지짜리 매뉴얼을 그냥 AI에게 먹여주고 그것을 암기하기를 바랄 수는 없습니다. 대신, 그들은 **문서-질의응답(Document-to-QA)**이라고 불리는 과정을 사용했습니다.

밀도 높은 규칙서를 가져와서 스마트한 편집자가 모든 규칙을 하나의 "질문과 답변" 형태의 플래시카드로 만드는 것을 상상해 보세요. 만약 규칙에 "모든 직원은 구역 B에서 안전모를 착용해야 한다"라고 되어 있다면, 시스템은 "구역 B에서 무엇을 착용해야 합니까?"라고 묻고 정답을 제공하는 카드를 만듭니다. 그들은 이 작업을 22만 개 이상의 사례에 대해 수행했습니다! 심지어 특정 AI의 말투와 똑같이 들리도록 AI가 답변을 다시 쓰게 만들기도 했습니다. 이를 통해 회사의 비밀에 특화된 거대하고 맞춤 제작된 퀴즈 덱(quiz deck)이 만들어졌습니다.

2단계: "리플레이(Replay)" 휴식 시간

이제 까다로운 부분이 나옵니다. 만약 회사 핸드북만 공부한다면, 사람들과 대화하거나 일반적인 문제를 해결하는 법을 잊어버릴 수 있습니다. 이를 "파괴적 망각(catastrophic forgetting)"이라고 합니다. 이를 방지하기 위해 팀은 **일반 데이터 리플레이(General-Data Replay)**라는 기술을 사용했습니다.

이것은 학생이 회사 핸드북을 공부하다가 잠시 멈추고 스포츠, 과학, 또는 논리 퍼즐 같은 일반적인 주제에 대해 대화하며 휴식을 취하는 학습 세션과 같습니다. 논문에서는 일반적인 대화 데이터 약 **48%**를 섞어주는 것이 "최적의 지점(sweet spot)"이라는 것을 발견했습니다. 이는 AI가 회사의 규칙을 배우는 동안에도 똑똑하고 예의 바른 상태를 유지하게 해주었습니다. 이 휴식 과정이 없었다면, AI는 훌륭한 회사 전문가는 되었을지언정 끔찍한 대화 상대가 되었을 것입니다.

3단계: "잔차 오류(Residual Error)" 드릴 훈련

첫 두 단계를 거친 후, AI는 꽤 괜찮아졌지만 여전히 실수를 저질렀습니다. 쉬운 질문은 맞혔지만 어려운 질문에서는 비틀거렸습니다. 여기서 세 번째 단계인 **잔차 오류 강화 학습(Residual-Error Reinforcement Learning, RL)**이 투입됩니다.

전체 퀴즈 덱을 다시 공부하는 대신, 팀은 AI가 틀린 질문들(즉, "잔차 오류")에 집중했습니다. 그들은 이 실수들을 마치 코치가 선수의 약점에 집중하는 것처럼 다루었습니다. 그들은 AI가 이러한 특정 오류를 수정하는 법을 배우도록 특별한 보상 시스템을 사용했습니다. 이는 마치 "너는 쉬운 수학 문제는 잘 풀었지만, 이 까다로운 대수학 문제 세 개는 마스터할 때까지 반복 훈련하자"라고 말하는 것과 같습니다.

결과: 작은 비용으로 얻은 큰 승리

이 3단계 훈련의 결과는 인상적이었습니다. 훈련 전, AI(Wnuan-Base)는 Wnuan-Bench라고 불리는 테스트 세트의 질문 중 약 **52.76%**에 대해서만 수용 가능한 답변을 내놓을 수 있었습니다.

  • 2단계 이후 (SFT와 Replay 적용): 점수가 **80.06%**로 뛰어올랐습니다. 이제 AI는 탄탄한 직원이 되었습니다.
  • 3단계 이후 (잔차 오류 RL 적용): 점수가 **91.51%**까지 더 높아졌습니다. AI는 회사의 비밀을 완전히 마스터했습니다.

팀은 또한 AI가 일반적인 어시스턴트로서의 능력을 잃었는지 확인했습니다. 그들은 AI가 매우 구체적이고 까다로운 지시를 따르는 능력이 약간 저하되었지만(일반 벤치마크에서 약 5포인트 하락), 일반적인 지능은 잃지 않았다는 것을 발견했습니다. 트레이드오프(trade-off)는 가치가 있었습니다. AI는 훨씬 더 나은 회사 전문가가 되었습니다.

이 논문이 입증한 것(그리고 입증하지 않은 것)

저자들은 자신들의 아이디어를 매우 신중하게 테스트했습니다. 그들은 단순히 실수에 집중하는 것이 더 낫다고 추측한 것이 아니라, 그것을 증명했습니다.

  • 실수에 집중하는 것이 효과적이다: 그들은 "잔차 오류" 방식(틀린 답변에만 집중)을 두 가지 다른 방식, 즉 모든 것을 공부하는 방식(full pool) 및 무작위로 섞인 질문을 공부하는 방식과 비교했습니다. "잔차 오류" 방식이 승리했으며, 무작위 방식보다 2.97포인트, 전체 풀(full pool) 방식보다 3.11포인트 앞섰습니다. 이는 일단 AI가 기초를 익히고 나면, 자신의 구체적인 약점을 집중적으로 훈련하는 것이 가장 효율적인 학습 방법임을 시사합니다.
  • 검색(Retrieval)은 마법 같은 해결책이 아니다: 팀은 테스트 중에 AI가 데이터베이스에서 답을 찾아볼 수 있도록 하는 흔한 기법인 **RAG(Retrieval-Augmented Generation)**도 테스트했습니다. 놀랍게하게도, 완전히 훈련된 AI의 경우 답을 찾아보는 것이 어떤 경우에는 오히려 성능을 떨어뜨렸습니다. AI가 이미 내용을 너무 잘 학습했기 때문에, 답을 찾아보려고 하면 오히려 혼란을 겪는 것이었습니다. 이는 이 특정 유형의 훈련에서는 지식을 실시간으로 찾아보는 것보다 내재화(baked in)하는 것이 더 낫다는 것을 시사합니다.
  • 모든 곳에 통하는 만능 해결책은 아니다: 논문은 이 방법이 이 특정 회사의 내부 문서에는 매우 잘 작동한다고 인정합니다. 이 방법이 세상의 모든 AI 문제를 해결한다고 주장하지 않습니다. 또한, 이 AI는 여전히 인간이 확인하는 것을 돕는 조력자로 설계되었으며, 스스로 최종적인 안전이나 채용 결정을 내리는 로봇이 아닙니다.

핵심 요약

Wnuan 논문은 AI 전문가를 만드는 명확한 경로를 보여줍니다. 문서를 퀴즈로 바꾸고, 균형을 유지하기 위해 일반적인 대화를 섞으며, 마지막으로 실수하는 부분에 집중적으로 훈련함으로써, 범용 로봇을 숙련된 회사 내부자로 바꿀 수 있습니다.

저자들은 이 "단계적" 접근 방식이 핵심이라고 제안합니다: 먼저 기초를 가르치고, 그다음 약점을 정교하게 다듬는 것입니다. AI가 복잡한 지시를 따르는 능력이 아주 조금 감소하긴 했지만, 정확도의 엄청난 향상( **52.76%**에서 **91.51%**로)은 이 전략이 승리하는 전략임을 보여줍니다. 이는 때때로 최선의 학습법은 모든 것을 다시 공부하는 것이 아니라, 자신이 틀린 것에 온전히 집중하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →