LLMs Should Express Uncertainty Explicitly
이 논문은 대규모 언어 모델의 불확실성을 추론 후 추정하는 것이 아니라, 최종 답변의 신뢰도를 판단하는 전역적 verbalized confidence 와 추론 중 개입이 필요한 시점을 알리는 국소적 신호라는 두 가지 상호 보완적인 인터페이스로 명시적으로 표현하도록 훈련할 때, 보정 능력과 오류 감지 효율성이 극대화됨을 보여줍니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"거대 언어 모델 (LLM) 이 자신의 무지를 어떻게 표현해야 하는가?"**라는 아주 중요한 질문을 던집니다.
기존의 AI 는 답을 내놓을 때, 자신이 틀렸을지라도 "100% 확신합니다!"라고 너무 자신 있게 말하곤 했습니다. 마치 시험을 치르다가 모르는 문제를 풀 때, 정답을 모른다는 걸 알면서도 임의로 찍어서 "이게 정답이야!"라고 외치는 학생과 같습니다.
이 연구는 AI 가 "모르겠다"는 신호를 어떻게 보내야 더 똑똑하고 안전한지 두 가지 방식으로 실험했습니다. 마치 운전자가 차를 운전할 때, "이 길은 막혀서 우회해야겠다"라고 미리 말해주는 것과 "목적지에 도착해서야 '아, 내가 길을 잘못 들었네'라고 후회하는 것"의 차이와 비슷합니다.
🚗 핵심 비유: "자신감 있는 운전사" vs "신중한 내비게이션"
이 논문은 AI 의 불확실성 (Uncertainty) 을 두 가지 다른 방식으로 표현하는 것을 비교했습니다.
1. 전역 인터페이스: "답을 다 하고 나서 하는 '신뢰도 점수'"
- 상황: AI 가 모든 추론을 끝내고 최종 답을 내놓은 뒤, **"이 답에 대한 내 자신감은 80% 입니다"**라고 숫자로 말합니다.
- 비유: 시험을 다 본 후, 교사가 채점하기 전에 "이 답은 80% 맞을 것 같아"라고 말하며 제출하는 것과 같습니다.
- 효과:
- AI 가 "잘못된 답을 자신 있게 말하는 (과신)" 경우를 크게 줄여줍니다.
- 마치 "이건 90% 확신하지만, 저건 30% 만 확신해"라고 구분해 주는 것이죠.
- 장점: 우리가 AI 의 답을 믿을지, 아니면 검색을 더 해볼지 최종 결정을 내리는 데 아주 유용합니다.
2. 지역 인터페이스: "추론 중 '혼란' 신호 보내기"
- 상황: AI 가 답을 찾는 과정 (추론) 중에, 정보가 부족하거나 헷갈리는 순간에 즉시 **
<uncertain>(불확실함)**이라는 특수한 말을 내뱉습니다. - 비유: 길을 찾다가 "여기서부터 지도가 안 나오네? <불확실함> 신호를 보내고 다시 검색해 봐야겠다"라고 중간에 멈춰서 말하는 것입니다.
- 효과:
- AI 가 실수하기 전에 미리 경고를 줍니다.
- "아, 여기서 정보가 부족하구나"라고 알려주면, 시스템이 바로 추가 정보를 찾아오게 (검색) 할 수 있습니다.
- 장점: 실수가 확정되기 전에 **중재 (개입)**할 기회를 줍니다.
🔍 연구 결과: 왜 두 가지 방식이 모두 필요할까?
연구팀은 이 두 가지 방식을 훈련시켜 비교했습니다. 결과는 매우 흥미로웠습니다.
자신감 점수 (전역) 는 '최종 심사관' 역할:
- AI 가 "이건 틀렸을 수도 있어"라고 솔직하게 말하게 만들었습니다.
- 덕분에 AI 가 엉뚱한 소리를 하면서도 "내가 100% 확신해!"라고 거짓말하는 경우가 사라졌습니다.
- 핵심: "이 답을 믿어도 될까?"를 판단할 때 가장 좋습니다.
불확실함 마커 (지역) 는 '경보 시스템' 역할:
- AI 가 길을 잘못 들었을 때, 바로 "여기서 멈춰! 정보가 부족해!"라고 외치게 했습니다.
- 이전에는 AI 가 조용히 (Silently) 틀린 답을 내놓았지만, 이제는 "잠깐, 여기서 검색이 필요해!"라고 소리칩니다.
- 핵심: "지금 검색이나 추가 조치가 필요한가?"를 판단할 때 가장 좋습니다.
🧠 기술적인 비밀: AI 의 뇌는 어떻게 변했을까?
연구팀은 AI 의 내부 작동 원리 (뇌의 신경망) 를 분석했습니다.
- 자신감 점수 방식: AI 의 '생각' 자체는 크게 바꾸지 않고, 마지막에 나오는 점수판만 더 정확하게 조정했습니다. 마치 똑똑한 학생이 시험을 잘 보다가, 마지막에 "내가 이 문제에서 실수할 수도 있겠다"라고 솔직하게 고백하는 것과 같습니다.
- 불확실함 마커 방식: AI 가 "모르겠다"라고 말하기 위해 생각하는 과정 자체를 다시 짜야 했습니다. 마치 길을 잃었을 때, 그냥 "모르겠다"라고 말하기 위해 지도를 다시 펴고, 방향을 다시 잡는 복잡한 과정을 거치는 것과 같습니다.
💡 결론: AI 는 상황에 따라 다르게 말해야 한다
이 논문의 결론은 매우 명확합니다.
"AI 는 상황에 맞는 방식으로 불확실성을 표현해야 한다."
- 최종 답을 믿을지 말지 결정할 때는: "자신감 점수"를 말하게 하세요. (예: "이 답은 90% 확신합니다.")
- 추론 과정에서 도움이 필요할 때는: "불확실함 마커"를 보내게 하세요. (예: "여기서 정보가 부족해서
<uncertain>신호를 보냅니다. 검색이 필요합니다.")
이처럼 AI 가 자신의 무지를 명확하게 표현할 때, 우리는 AI 를 더 안전하게 사용할 수 있고, 필요한 때에 바로 도움을 요청할 수 있게 됩니다. AI 가 "모르겠다"라고 솔직하게 말할 줄 아는 것이, 오히려 더 똑똑한 AI 로 가는 지름길입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.