Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning
이 논문은 대규모 언어 모델이 명시적인 인용과 함께 구조화되고 증거가 뒷받침된 출력을 생성하도록 유도함으로써 검색 증강 생성의 투명성과 정확성을 향 향상시키고 고급 상용 모델에 필적하는 성능을 달성하는 강화 학습 프레임워크인 TRACE를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 어려운 역사 시험을 치르고 있는 학생이라고 상상해 보세요. 당신은 교과서 더미(이른바 "검색된 문서")를 시험실에 가지고 들어갈 수 있습니다. 하지만 선생님(AI)에게는 나쁜 습도가 하나 있습니다. 선생님은 아주 자신만만하게 들리지만 사실은 지어낸 답변을 쓰거나, 주장을 뒷받침하기 위해 책의 엉뚱한 페이지를 사용하는 경우가 종종 있다는 점입니다.
이것이 바로 현재의 RAG(검색 증강 생성) 시스템이 가진 문제입니다. 그들은 사실에 접근할 수는 있지만, 자신이 어떻게 그 결론에 도달했는지 과정을 보여주지 못할 때가 많습니다. 그들은 정답을 맞힐 수는 있어도, 당신은 그들이 어떤 부분을 사용했는지, 아니면 단순히 학습된 내용을 바탕으로 추측한 것인지 알 방법이 없습니다.
이 논문은 TRACE(증거 추적을 통한 투명한 RAG)라고 불리는 새로운 시스템을 소개합니다. TRACE를 학생이 좋은 성적을 받기 위해 반드시 특정하고 투명한 과정을 따르도록 강요하는 엄격한 선생님이라고 생각해 보세요.
TRACE가 어떻게 작동하는지 다음과 같이 쉬운 개념들로 나누어 설명합니다.
1. "풀이 과정을 적으시오" 규칙 (구조화된 프로토콜)
일반적인 시험에서 학생은 자신의 생각, 찾은 사실, 그리고 최종 답변을 모두 섞어서 하나의 문단으로 작성할 수 있습니다. 이는 무질서하며 확인하기 어렵습니다.
TRACE는 AI가 답변을 작성하기 전에 세 개의 뚜렷하고 라벨이 붙은 상자(마치 양식처럼)에 나누어 쓰도록 강제합니다.
- 상자 1 (증거): "내가 사용하고 있는 구체적인 페이지 번호들입니다." (AI는 답변을 쓰기 시작하기 전에 올바른 문서들을 먼저 선택해야 합니다.)
- 상자 2 (추론): "그 페이지들을 어떻게 연결하여 답을 찾아냈는지에 대한 과정입니다."
- 상자 3 (답변): "최종 결과입니다."
이 방식은 AI가 실수를 숨기는 것을 막아줍니다. 만약 AI가 잘못된 페이지를 골랐다면, 당신은 즉시 그 사실을 확인할 수 있습니다.
2. "금메달" 시스템 (적응형 보상)
AI가 이러한 규칙을 따르도록 가르치기 위해, 연구진은 강화 학습(Reinforcement Learning) 기법을 사용했습니다. AI가 옳은 행동을 할 때마다 점수를 받는 비디오 게임을 상상해 보세요.
보통 AI는 최종 답변이 맞았을 때만 점수를 받습니다. 하지만 TRACE는 이 채점 방식을 바꿉니다.
- 형식 점수: 세 개의 상자를 올바르게 사용했는가?
- 정확도 점수: 최종 답변이 맞는가?
- 관련성 점수: 답변을 뒷받침하기 위해 정확히 맞는 페이지들을 골랐는가?
- "금메달" 보너스: 이것이 핵심 비법입니다. AI는 형식, 답변, 그리고 증거 선택까지 모든 것을 완벽하게 해냈을 때만 거대한 "금메달" 보너스를 받습니다.
이 "금메달"은 강력한 자석 역할을 합니다. 이는 AI가 지름길을 택하지 못하도록 강제합니다. AI는 단순히 답을 찍고 운 좋게 맞기를 바랄 수 없습니다. 모든 단계에서 완벽해야만 큰 보상을 얻을 수 있기 때문입니다.
3. "안정적인 손길" (안정화된 훈련)
AI에게 이토록 엄격한 규칙을 따르도록 훈련하는 것은 줄타기 곡예사가 저글링을 하며 균형을 잡도록 가르치는 것과 같습니다. 만약 지침이 너무 엄격하면 AI는 혼란에 빠져 "줄"에서 떨어지게 됩니다(훈련이 불안정해집니다).
연구진은 표준적인 수학적 도구(소위 "KL 추정치")가 이 줄타기에는 너무 흔들림이 심하다는 것을 발견했습니다. 이 도구는 AI를 심하게 휘청거리게 만들고 배운 내용을 잊게 만들었습니다.
연구진은 이 흔들리는 수학 대신 더 안정적인 "편향되지 않은(unbiased)" 버전을 도입했습니다. 이것은 줄타기 곡교사에게 더 나은 균형 막대기를 쥐여주는 것과 같습니다. 이를 통해 훈련을 매끄럽게 유지하고, AI가 훈련 과정에서 무너지지 않고 엄격한 규칙을 실제로 학습할 수 있도록 보장합니다.
결과: 어떤 일이 일어났는가?
연구진은 TRACE를 까다로운 "멀티홉(multi-hop)" 질문(서로 다른 정보 조각들 사이의 점들을 연결해야 하는 질문)에 대해 테스트했습니다.
- 더 나은 답변: AI는 이전 방식들에 비해 유의미하게 더 많은 질문을 맞혔습니다 (10~30% 향상).
- 투명성: AI는 사실을 지어내는 것을 멈췄습니다. 일관되게 정확한 문서를 지목했습니다.
- 경쟁력: TRACE로 훈련된 작은 규모의 오픈 소스 AI가 거대하고 값비싼 상용 모델(OpenAI의 o1이나 DeepSeek-R1 등)과 거의 대등한 성능을 보여주었습니다.
핵심 요약
TRACE는 AI에게 투명성을 강요한다면—즉, 답변을 내놓기 전에 증거를 먼저 제시하게 하고, 그렇게 완벽하게 수행했을 때 보상을 크게 준다면—단순히 더 정직한 AI를 얻는 것에 그치지 않고, 실제로 더 똑똑한 AI를 얻을 수 있다는 것을 증명합니다. 이는 AI를 추측하는 "블랙박스"에서, 자신의 논리를 검증하는 투명한 사고가로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.