← 최신 논문
💬 NLP

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

이 논문은 고위험 분야에서 언어 모델의 환각 현상을 줄이고 증거 기반의 신뢰할 수 있는 답변을 생성하기 위해 검색된 증거와 정답에 대한 일관성을 강화 학습 (GRPO) 을 통해 학습하는 'EvidenceRL' 프레임워크를 제안하고, 심장 진단 및 법적 추론 분야에서 그 유효성을 입증합니다.

원저자: J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

게시일 2026-03-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

증거 RL (EvidenceRL): AI 가 "거짓말"을 하지 않게 만드는 새로운 방법

이 논문은 최근 큰 인기를 끌고 있는 **거대 언어 모델 (LLM, AI)**의 치명적인 약점인 **'할루시네이션 (Hallucination, 환각)'**을 해결하기 위한 새로운 방법을 소개합니다.

AI 는 글을 매우 유창하게 쓰지만, 사실과 다른 내용을 마치 진실인 것처럼 꾸며내는 경우가 많습니다. 특히 의료나 법률처럼 실수가 치명적인 분야에서는 이 문제가 매우 심각합니다. 이 논문은 **"AI 가 자신의 말에 대한 증거를 반드시 제시하게 만드는 훈련법"**을 제안합니다.

이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드리겠습니다.


1. 문제: "무식한 천재" AI

지금까지의 AI 는 마치 지식만 많고 기억력만 좋은 천재 학생과 같습니다. 시험을 볼 때, 책 (데이터) 을 보지 않고 머릿속에 있는 기억만 믿고 답을 냅니다.

  • 상황: "심장병 환자를 진단해 줘."
  • AI 의 반응: "아, 이 환자는 심근경색이야! 왜냐하면 내가 예전에 심근경색에 대해 많이 읽었으니까."
  • 문제점: 하지만 환자의 실제 검사 결과 (증거) 를 보면 심근경색이 아닐 수도 있습니다. AI 는 자신은 맞다고 믿지만, 실제 증거와는 무관한 답을 내놓는 것입니다. 이를 **'할루시네이션'**이라고 합니다.

기존의 해결책 (RAG) 은 AI 옆에 '참고서'를 펼쳐놓고 "이 책을 봐"라고 하는 정도였습니다. 하지만 AI 는 책을 옆에 두면서도 여전히 머릿속 기억을 믿고 답을 내는 경우가 많았습니다.

2. 해결책: 증거 RL (EvidenceRL)

이 논문이 제안하는 EvidenceRL은 AI 를 단순히 '지식 많은 학생'이 아니라 **'증거를 근거로만 답하는 엄격한 검사관'**으로 훈련시키는 방법입니다.

🏫 비유: "시험 감독관"과 "감점 시스템"

기존의 AI 훈련은 "정답을 맞히면 점수 줌"이었습니다. 하지만 EvidenceRL 은 **"정답을 맞혔더라도, 그 답을 내기 위해 제시된 '증거'를 제대로 인용하지 않으면 감점한다"**는 새로운 규칙을 도입했습니다.

  1. 집중해서 확인하기 (Focus-Then-Verify):

    • AI 가 쓴 긴 답변 전체를 한 번에 보는 게 아니라, 문장 하나하나를 뜯어봅니다.
    • "이 문장은 환자 기록의 A 부분에서 나온 거야?"라고 묻습니다.
    • 만약 AI 가 "A 부분에서 봤는데..."라고 말했지만, 실제로 A 부분에는 그런 내용이 없다면 감점합니다.
  2. 두 가지 점수 시스템:

    • 정답 점수: 진단이나 법률 답변이 맞았나요?
    • 증거 점수: 그 답을 내기 위해 제시된 '증거 (환자 기록, 법률 조문)'를 제대로 인용했나요?
    • 핵심: 증거 점수가 낮으면, 정답이 맞더라도 전체 점수가 깎입니다. AI 는 "증거 없이 맞히는 것 (운 좋은 추측)"보다 "증거를 바탕으로 틀리는 것"을 더 싫어하도록 학습됩니다.

3. 실제 효과: 의료와 법률에서의 변화

이 방법을 심장 진단법률 시험 두 가지 분야에서 테스트했습니다.

  • 심장 진단 (의료):

    • 이전: AI 는 37% 만이 실제 증거를 바탕으로 진단을 내렸습니다. 나머지는 기억이나 운에 의존했습니다.
    • EvidenceRL 적용 후: **61.6%**로 크게 증가했습니다. 즉, AI 가 "이 환자는 심부전입니다. 왜냐하면 환자의 혈압과 심전도 기록 (증거) 이 이를 뒷받침하기 때문입니다"라고 증거를 붙여서 말하게 된 것입니다.
    • 할루시네이션 감소: 엉뚱한 소리를 하는 경우가 5 배나 줄었습니다.
  • 법률 시험 (Bar Exam):

    • AI 가 법조문을 인용하지 않고 추측으로 답하는 경우가 많았는데, 이 훈련을 통해 증거에 기반한 답변 비율이 18% 에서 41% 로 두 배 이상 늘었습니다.

4. 왜 이것이 중요한가요?

이 기술의 핵심은 **"AI 의 사고방식 자체를 바꾼다"**는 점입니다.

  • 기존 방법: "답이 나오면 그걸로 끝" (결과 위주)
  • EvidenceRL: "어떻게 그 답을 냈는지 과정과 증거를 확인" (과정과 근거 위주)

마치 법정에서 변호사가 "이게 맞습니다"라고 외치는 게 아니라, **"법전 3 조 2 항과 이 사건의 증거 A 를 근거로 이렇습니다"**라고 변론해야만 승리를 인정받는 것과 같습니다.

5. 결론: 신뢰할 수 있는 AI 로 가는 길

이 논문은 AI 가 단순히 "유창하게 말하는 것"을 넘어, **"신뢰할 수 있는 근거를 바탕으로 말하는 것"**을 배울 수 있음을 증명했습니다.

  • 의료: 의사가 AI 의 진단을 믿고 수술을 결정할 때, AI 가 근거를 명확히 제시하면 실수를 막을 수 있습니다.
  • 법률: 변호사가 AI 의 조언을 참고할 때, 근거가 명확하면 잘못된 법률 해석을 방지할 수 있습니다.

한 줄 요약:

"EvidenceRL 은 AI 에게 **'네가 한 말의 근거를 대라'**고 가르쳐서, AI 가 무식한 천재에서 책임감 있는 전문가로 변모하게 만든 혁신적인 훈련법입니다."

이 기술은 앞으로 의료, 법률, 금융 등 실수가 치명적인 분야에서 AI 를 안전하게 활용하는 데 큰 역할을 할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →