Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models
본 논문은 어텐션 맵, 토큰 확률, 그리고 재귀적으로 계산된 불확실성 점수를 기반으로 회귀 모델을 학습시켜 Large Language Model 의 불확실성을 정량화하는 새로운 방법을 제안함으로써, 여러 데이터셋과 모델에 걸쳐 환각을 효과적으로 탐지하고 선택적 생성을 개선합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 말을 빠르게 하는 로봇이 당신에게 이야기를 들려주고 있습니다. 이 로봇은 문장을 만들어내는 데 뛰어나지만, 때로는 실제로 틀린 내용에 대해 자신감을 갖기도 합니다 (이를 '할루시네이션'이라고 부릅니다).
문제는 로봇이 자신이 거짓말하고 있다는 것을 모른다는 점입니다. 로봇은 그냥 말을 이어갈 뿐이며, 만약 이야기 초반에 실수를 범하면 그 실수를 바탕으로 나머지 이야기를 이어가면서 오히려 더 자신감 있게 됩니다. 이는 첫 번째 사람이 잘못된 사실을 속삭이고 나머지 사람들이 그 사실을 점점 더 자신 있게 반복하는 '전화 게임'과 같습니다.
문제: 로봇의 맹점
로봇이 거짓말을 하고 있는지 확인하는 기존 방법들은 로봇이 말하는 각 단어에 대한 '신뢰도 점수'를 주로 살펴봅니다. 하지만 이는 까다롭습니다. 로봇이 "하늘은 초록색이다"라고 말한다면, 그것은 자신의 논리를 따를 뿐이므로 다음 단어인 "잔디"에 대해 여전히 매우 자신감을 느낄 수 있습니다. 로봇은 전체 문장이 거짓 위에 세워졌다는 사실을 깨닫지 못합니다.
이 논문의 저자들은 이를 '조건적 의존성 (conditional dependency)' 문제라고 부릅니다. 로봇의 다음 단어에 대한 신뢰도는 완전히 이전 단어에 달려 있는데, 심지어 그 이전 단어가 실수였음에도 불구하고 그렇습니다.
해결책: TAD (학습 가능한 어텐션 기반 의존성)
연구진들은 TAD라는 새로운 도구를 개발했습니다. TAD 를 로봇 옆에 앉아 한 단어씩 쓰면서 지켜보는 초지능 편집자로 생각하세요.
다음은 몇 가지 간단한 비유를 통해 편집자가 작동하는 방식입니다:
- 시선 (Attention): 로봇이 말할 때, 다음에 무엇을 말할지 결정하기 위해 이전 단어들을 '본다'고 할 수 있습니다. 연구진들은 로봇이 진실을 말할 때 그 '시선' (어텐션) 이 안정적이고 집중되어 있음을 발견했습니다. 하지만 로봇이 할루시네이션을 시작하면 시선이 흔들리거나 혼란스러워집니다. TAD 는 이 시선을 면밀히 관찰합니다.
- 연쇄 반응 (Recurrence): 편집자는 현재 단어만 보지 않습니다. 이전 단어들의 불확실성을 기억합니다. 로봇이 1 번 단어를 실수했다면, 편집자는 로봇이 그다음 단어들 (2 번, 3 번, 4 번) 에 대해 자신감 있게 말하더라도 이를 의심스러운 것으로 표시합니다. 이는 수학 문제의 첫 번째 단계를 틀렸다면, 학생이 답을 얼마나 깔끔하게 썼는지와 상관없이 최종 답이 틀릴 가능성이 높다는 것을 아는 선생님처럼 행동하는 것과 같습니다.
- 2 단계 훈련: 이 편집자를 가르치기 위해 연구진들은 2 단계 과정을 사용했습니다.
- 1 단계: 편집자에게 로봇의 원시 신뢰도만을 사용하여 실수를 찾아내는 법을 가르쳤습니다.
- 2 단계: 편집자가 1 단계에서 얻은 자신의 '직감'을 활용하여 더 잘 학습하도록 했습니다. 이는 스포츠를 연습하는 것과 같습니다. 먼저 기본 동작을 배운 다음, 자신의 이전 동작에 반응해야 하는 실제 경기에서 연습하는 것입니다.
테스트 방법
연구진들은 이 편집자를 뉴스 기사 요약부터 까다로운 상식 퀴즈 답변에 이르기까지 10 가지 다른 유형의 작업에 적용하여 테스트했으며, 세 가지 다른 버전의 로봇 (LLaMA, Gemma, Qwen) 을 사용했습니다.
- 결과: TAD 는 그들이 시도한 다른 어떤 방법보다 로봇의 거짓말을 잡아내는 데 훨씬 뛰어났습니다. 특히 긴 이야기가 엉망이 될 때를 포착하는 데 매우 효과적이었습니다.
- 효율성: 정답을 다섯 번이나 '생각'하게 하는 다른 방법들 (이는 느리고 비용이 많이 듭니다) 과 달리, TAD 는 매우 빠릅니다. 로봇의 사고 과정에 약 5% 의 추가 시간만 더할 뿐입니다. 이는 로봇에게 전체 이야기를 다시 쓰게 하는 대신 빠르게 한 번 더 확인하는 것과 같습니다.
결론
이 논문은 컴퓨터 모델이 로봇이 자신의 이전 단어들을 어떻게 바라보는지에 주의를 기울이도록 가르치고, 문장 초반에 저지른 실수를 기억함으로써 AI 를 위한 훨씬 더 나은 '거짓말 탐지기'를 구축할 수 있다고 주장합니다. 이는 속도를 너무 늦추지 않으면서도 특히 긴 답변의 경우 AI 를 더 안전하고 신뢰할 수 있게 만듭니다.
이 논문이 주장하지 않는 것
- 이 도구가 모든 상황의 모든 AI 유형에서 작동한다고 주장하지 않습니다 (특정 모델과 작업에 대해 테스트되었습니다).
- 이것이 의료 도구나 법적 판사라고 주장하지 않습니다.
- AI 가 다시는 실수를 하지 않을 것이라고 주장하지 않습니다. 다만 이 도구가 실수를 발견하는 데 더 뛰어나서 이를 걸러낼 수 있다고 주장할 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.