Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning
이 논문은 RLHF 나 표준 DPO 가 유창성보다 사실성을 우선시하도록 설계된 이진 사실성 레이블만 활용하여 환각을 보정하고 사실성 마진을 도입한 'F-DPO'를 제안함으로써 다양한 오픈 가중치 LLM 의 환각률을 획기적으로 낮추고 사실성을 향상시킨다고 요약할 수 있습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎭 문제: "멋진 거짓말"이 더 인기 있을까?
지금까지 AI 를 가르칠 때, 사람들은 AI 가 유창하고 자신감 있게 말하는 것을 좋아했습니다. 마치 연극을 잘하는 배우처럼 말이죠.
하지만 여기서 문제가 생깁니다.
질문: "호주의 수도는 어디야?"
AI 답변 A (사실): "캔버라입니다." (조금 딱딱하고 짧음)
AI 답변 B (거짓말): "호주의 수도는 시드니입니다! 시드니는 가장 크고 유명한 도시죠!" (유창하고 자신감 넘침)
사람들이나 기존 AI 평가 시스템은 B를 더 좋아합니다. 왜냐하면 B 가 더 말솜씨가 좋기 때문이죠. 하지만 B 는 완전히 틀린 거짓말입니다. AI 는 이렇게 "멋진 거짓말"을 반복하며 학습하다 보니, 점점 더 사실과 다른 말을 잘하게 되는 악순환에 빠집니다.
💡 해결책: F-DPO (사실 확인이 된 선택 학습)
이 논문에서는 F-DPO라는 새로운 방법을 소개합니다. 기존 학습 방식 (DPO) 을 조금만 수정해서, AI 가 말솜씨보다 '사실'을 더 중요하게 생각하도록 가르치는 것입니다.
이 방법은 두 가지 간단한 비유로 이해할 수 있습니다.
1️⃣ "거짓말은 반칙!" (레이블 뒤집기)
기존에는 AI 가 "시드니가 수도야"라고 말하고, 사람이 "오, 잘했네!"라고 칭찬하면 AI 는 그 말을 계속 반복합니다.
하지만 F-DPO 는 **사실 확인관 (Fact-checker)**을 둡니다.
- 만약 AI 가 거짓말을 하고, 사실을 말한 다른 AI 가 있다면?
- F-DPO 는 **"아니야! 거짓말한 건 '패배자', 사실만 말한 게 '승자'야!"**라고 순서를 바꿔버립니다.
- 마치 축구 경기에서 실수한 선수가 골을 넣었더라도, 심판이 "반칙이야!"라고 선언하고 점수를 빼앗는 것과 같습니다. AI 는 "아, 내가 거짓말하면 점수가 깎이는구나"라고 배우게 됩니다.
2️⃣ "진실은 더 큰 점수!" (사실성 마진)
단순히 순서만 바꾸는 게 아니라, 사실과 거짓말의 차이가 클수록 더 큰 점수 차이를 줍니다.
- 사실 vs 거짓말: "와! 이거 진짜 vs 가짜야!"라고 크게 소리쳐서 AI 가 확실하게 구분하게 합니다.
- 사실 vs 사실: 둘 다 사실이라면, 기존 방식처럼 말솜씨나 스타일을 따져도 됩니다.
- 거짓말 vs 거짓말: 둘 다 거짓말이라면, 어떤 게 더 그럴듯한지 비교합니다.
이처럼 AI 가 **"사실적인 답변을 선택했을 때 더 큰 보상을 받는다"**는 것을 학습하게 만드는 것입니다.
🚀 결과: 얼마나 효과가 좋을까요?
이 방법을 적용한 결과, AI 의 거짓말이 놀랍게도 줄었습니다.
- Qwen3-8B라는 AI 모델의 경우, 거짓말을 하는 비율이 5 배나 줄었습니다 (42% → 8% 로 감소).
- 사실성 점수는 50% 나 올랐습니다.
- 특히, 훈련 데이터에 없던 새로운 질문 (예: 진실성 테스트) 을 해도 잘 대처했습니다.
🌟 왜 이 방법이 특별한가요?
기존의 다른 방법들은 사실성을 높이기 위해:
- 별도의 검증 AI 를 따로 두거나 (복잡함),
- 문장 하나하나를 세세하게 검사하거나 (비쌈),
- 여러 단계로 나누어 학습시켰습니다 (시간 걸림).
하지만 F-DPO는 매우 간단합니다.
- 단순한 이진법 (0 또는 1): "사실이다 (0)" 아니면 "거짓말이다 (1)"라고만 표시하면 됩니다.
- 한 번에 끝남: 복잡한 과정 없이 한 번에 학습할 수 있습니다.
- 비용 절감: 추가적인 검증 모델이 필요 없습니다.
📝 결론
이 논문은 "AI 가 유창하게 말하기만 하면 된다는 생각"을 버리고, "사실과 진실에 더 집중하도록" 가르치는 간단한 방법을 제시했습니다.
마치 학생이 시험을 볼 때, "정답을 외우는 것"보다 "진짜 사실을 아는 것"이 더 중요하다는 것을 깨닫게 해주는 선생님과 같습니다. AI 가 이제부터는 화려한 거짓말보다는, 조금은 투박할지라도 정직한 답변을 하도록 훈련받게 된 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.