← 최신 논문
🤖 machine learning

KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning

이 논문은 모델의 지식 경계를 실시간으로 추정하여 보상에 반영하는 '지식 경계 인식 보상(Knowledge-Boundary-Aware Reward)'과 '2단계 RL 학습 전략'을 통해, 답변의 정확도를 유지하면서도 지식 범위를 벗어난 질문에 대해 적절히 답변을 거부(abstention)함으로써 LLM의 환각 현상을 완화하는 KARL 프레임워크를 제안합니다.

원저자: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

게시일 2026-04-28
📖 2 분 읽기☕ 가벼운 읽기

원저자: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 배경: "모르면 모른다고 말해!" (하지만 너무 겁쟁이가 되진 마!)

우리가 시험을 본다고 상상해 보세요.

  1. 기존 AI (거짓말쟁이 학생): 모르는 문제가 나와도 점수를 깎이기 싫어서 아무 말이나 지어냅니다. "이건 아마 이럴 거예요!"라고 당당하게 틀린 답을 말하죠. 이게 바로 **'환각'**입니다.
  2. 기존의 해결책 (겁쟁이 학생): "모르면 모른다고 해!"라고 엄격하게 가르쳤더니, 이 학생은 조금이라도 헷갈리면 아예 백지를 내버립니다. 점수는 엄청 깎이고, 아는 문제까지 다 안 풀어버리는 '과도한 회피' 상태가 됩니다.

이 논문의 목표는 무엇일까요?
바로 **"아는 건 확실하게 맞히고, 모르는 것만 딱 골라서 '모른다'고 말하는 똑똑한 학생"**을 만드는 것입니다.


🛠️ KARL의 해결 전략: "지식 경계선을 찾는 2단계 훈련법"

연구진은 KARL이라는 새로운 훈련 시스템을 만들었습니다. 이 시스템은 학생(AI)에게 두 단계에 걸쳐 아주 특별한 방식으로 공부를 시킵니다.

1단계: "일단 아는 걸 최대한 많이 찾아내!" (지식 탐험 단계)

처음부터 "모르면 모른다고 해"라고 하면 학생은 겁을 먹고 백지만 냅니다. 그래서 1단계에서는 **'지식 탐험'**을 시킵니다.

  • 비유: 학생에게 "틀려도 좋으니 일단 네 머릿속에 있는 걸 다 꺼내봐! 아는 게 나오면 상을 줄게"라고 격려하는 단계입니다.
  • 이 과정을 통해 AI는 자신이 어디까지 알고 있는지, 어떤 지식이 머릿속에 있는지 최대한 넓게 탐색하며 **'기초 실력(정확도)'**을 쌓습니다.

2단계: "이제 모르는 건 솔직하게 말해!" (정교한 교정 단계)

기초 실력이 쌓였다면, 이제 진짜 실력을 가릴 시간입니다.

  • 비유: "자, 이제 아는 건 계속 맞히되, 아까 탐험해 보니 도저히 답이 안 나오던 문제들은 이제 '모르겠습니다'라고 정중하게 말해봐"라고 가르치는 단계입니다.
  • 이때 핵심은 **'지식 경계선(Knowledge Boundary)'**을 실시간으로 체크하는 것입니다. AI가 똑같은 질문에 여러 번 답하게 해보고, "어? 한 번도 맞힌 적이 없네? 그럼 이건 진짜 모르는 거구나!"라고 스스로 판단하게 만드는 똑똑한 보상 시스템을 사용합니다.

🌟 결과: "정답률은 높이고, 거짓말은 줄이고!"

실험 결과, KARL 방식은 기존 방식들보다 훨씬 뛰어난 성적을 거두었습니다.

  • 거짓말(환각)은 확 줄였습니다: 모르는 걸 아는 척하는 빈도가 크게 낮아졌습니다.
  • 정답률은 유지하거나 오히려 높였습니다: 겁쟁이처럼 모든 문제를 포기하는 게 아니라, 아는 문제는 끝까지 찾아내서 맞힙니다.
  • 응용력도 좋습니다: 공부한 내용과 조금 다른 새로운 분야의 질문을 받아도, 당황하지 않고 "아는 건 답하고, 모르는 건 모른다"는 태도를 유지합니다.

💡 요약하자면?

KARL은 AI에게 **"무조건 정답을 맞히라는 압박"**과 "무조건 입을 다물라는 압박" 사이에서 균형을 잡는 법을 가르친 것입니다. 마치 자신감 있는 전문가처럼, 아는 것은 명확하게 설명하고 모르는 것은 겸손하게 인정하게 만드는 훈련법이라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →