The Knowing-Saying Gap: When Probes See Errors that Confidence Misses
이 논문은 선형 프로브(linear probes)가 언어 모델 내의 오염된 컨텍스트를 정확하게 탐지할 수는 있지만, 최종 답변의 정답 여부를 신뢰성 있게 예측하거나 효과적인 실시간 개입을 유도하는 데에는 실패하며, 따라서 일률적인 모니터링 솔루션보다는 모델 인지적이고 오류 유형 인지적인 라우팅 전략이 필요함을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 마술사의 카드 마술을 보고 있다고 상상해 보세요. 마술사는 너무 매끄럽고, 자신만만하며, 속도가 빨라서 당신은 전혀 의심할 틈이 없습니다. 하지만 만약 마술사의 뇌 깊은 곳에서 작은 경보기가 "잠깐! 방금 엉뚱한 카드를 바꿨어!"라고 비명을 지르고 있다면 어떨까요? 인공지능, 구체적으로는 코드를 짜고, 여행 계획을 세우고, 수학 문제를 푸는 똑똑한 챗봇인 거대 언어 모델(LLM)의 세계에서는 바로 이런 일이 일어납니다. 이 모델들은 마치 마술사와 같습니다. 심각한 실수를 저지르고 있을 때조차 아주 자신만만하게 말을 할 수 있기 때문입니다.
과학자들은 오랫동안 모델이 혼란에 빠지거나 틀렸을 때, 모델이 "음... 잘 모르겠어요"라며 말을 더듬거나 불확실함을 표현하기를 희망해 왔습니다. 이 개념을 "언어화된 자신감(verbalized confidence)"이라고 부릅니다. 이는 마치 마술사에게 "그 카드가 맞다고 확신하시나요?"라고 물어보며 그들이 자신의 실수를 인정하기를 바라는 것과 같습니다. 하지만 이를 확인하는 또 다른 방법이 있습니다. 모델의 내부 "뇌파"(컴퓨터 내부의 수학적 신호)를 살펴봄으로써, 모델이 겉으로 말하지 않더라도 스스로가 망가졌다는 것을 알고 있는지 확인하는 것입니다. 이 논문은 매우 무섭고도 매혹적인 격차, 즉 모델이 디지털 뇌 내부에서 '아는 것'과 겉으로 '말하는 것' 사이의 차이를 조사합니다.
침묵의 경보와 자신만만한 거짓말
연구진은 이를 테스트하기 위해 디지털 놀이터를 구축했습니다. 그들은 모델이 단계별로 퍼즐을 풀어야 하는(예: "사과 5개가 있는데 3개를 더 사고, 그중 절반을 잃었다면...") 1,400개의 수학 문제를 만들었습니다. 트릭은 바로 이 연쇄 과정의 첫 번째 단계에 몰래 실수를 심어두는 것이었습니다. 그들은 두 가지를 확인하고자 했습니다:
- 경보: 특수한 탐지기(리니어 프로브, linear probe라고 불림)가 모델의 내부 뇌 활동을 살펴봄으로써 첫 번째 단계가 잘못되었다는 것을 찾아낼 수 있는가?
- 예측: 그 동일한 탐지기가 최종 답변이 틀릴 것이라는 점을 예측할 수 있는가?
그들은 Llama-3.1-8B나 Qwen3-4B와 같이 오늘날 사용 가능한 가장 똑똑한 모델들을 포함하여 다섯 가지 모델을 테스트했습니다.
거대한 발견: 알고 있지만 말하지 않는 것
결과는 충격적이었습니다. "경보"는 완벽하게 작동했습니다. 모델이 실수를 저질렀을 때, 탐지기는 모델의 내부 뇌파를 통해 오류를 거의 100%의 정확도로(구체적으로 한 모델에서 AUROC 점수 0.997로) 포착할 수 있었습니다. 마치 모델의 뇌가 "에러! 에러!"라고 비명을 지르는 것과 같았습니다.
하지만 반전이 있었습니다. 모델은 자신의 경보 소리를 듣지 않았습니다.
내부 경보가 울리고 있음에도 불구하고, 모델의 최종 답변은 마치 정답을 맞혔을 때와 다름없는 자신감을 보였습니다. 오류를 완벽하게 볼 수 있었던 그 탐지기는 정작 최종 답변이 틀릴 것인지를 예측하는 데 있어서는 완전히 무용지물이었습니다. 이는 마치 토스트를 태웠을 때 "불이야!"라고 외치는 화재 경보기는 있지만, 소방대(모델의 최종 답변)는 여전히 출동하여 "모든 것이 괜찮습니다, 불은 없습니다"라고 말하는 것과 같습니다.
이 논문은 사람들이 사실일 것이라고 기대할 법한 몇 가지 사항을 명시적으로 배제합니다:
- 자신감은 단서가 되지 못한다: 모델에게 얼마나 자신 있는지 물었을 때, 모델은 미묘한 차이 없이 단순히 "예" 또는 "아니오"라는 이분법적인 답변만을 내놓았습니다. 99% 확신하는 모델이나 50% 확신하는 모델이나 틀릴 확률은 비슷했습니다.
- 더 깊이 생각하는 것은 도움이 되지 않는다: 연구진은 모델이 추론 과정을 단계별로 글로 쓰도록 강제하는 "사고 모드(Chain-of-Thought)"를 시도했습니다. 이렇게 하면 모델이 자신의 실수를 잡아낼 수 있을 것이라 생각할 수 있습니다. 하지만 결과는 오히려 모델이 정답을 맞히는 능력을 떨어뜨렸습니다(정확도가 27.9%에서 1.2%로 하락). 그러면서도 내부 경보가 여전히 울리고 있다는 사실은 변하지 않았습니다. 모델은 자신이 틀렸다는 것을 알았지만, 그것에 대해 말하는 것이 문제를 해결해주지는 못했습니다.
어떻게 고칠 수 있을까? "브랜치 앤 픽(Branch-and-Pick)" 전략
모델이 스스로 틀렸음을 인정하지 않기 때문에, 연구진은 모델을 위한 "안전망" 역할을 하기로 했습니다. 그들은 내부 경보를 감지하고 모델이 답변을 마치기 전에 실수를 수정하려고 시도하는 시스템을 구축했습니다. 그들은 세 가지 개입 방법을 테스트했습니다:
- 리프롬프트(Reprompt): 단순히 모델에게 "이봐, 네 작업을 다시 확인해봐!"라고 말하는 방식입니다. (이것은 효과가 없었습니다).
- 리플레이스-프라이어(Replace-Prior): 잘못된 단계를 지우고 모델이 처음부터 다시 시도하도록 강제하는 방식입니다. 결과는 엇갈렸습니다. 일부 틀린 답은 살려냈지만, 실수로 맞는 답까지 망가뜨리기도 했습니다.
- 브랜치 앤 픽(Branch-and-Pick): 이것이 승자였습니다. 경보가 울리면 시스템은 단순히 추측하는 대신, 모델에게 다음 단계를 네 가지 다른 방식(다양한 무작위성 수준 사용)으로 시도하도록 요청했습니다. 그런 다음, 내부 경보를 사용하여 가장 "깨끗한"(오염될 가능성이 가장 낮은) 경로를 선택했습니다.
이 "브랜치 앤 픽" 방식은 맞는 답을 망가뜨리지 않으면서 틀린 답을 일관되게 구해낸 유일한 방법이었습니다. 특정 모델(Llama-3.1-8B)에서, 이 방식은 4개의 틀린 답을 구출했고 0개의 맞는 답을 망가뜨렸습니다. 그러나 논문은 이것이 모든 상황에 적용되는 마법의 해결책은 아니라고 언급합니다. 성공 여부는 어떤 종류의 실수가 발생했느냐에 크게 좌우되었습니다. 예를 들어, "잘못된 단위" 오류를 고치는 데는 효과적이었지만, "잘못된 백분율" 오류를 고치는 데는 오히려 상황을 악화시켰습니다.
시사점
논문은 우리가 모델의 말이 옳다는 것을 알려주기 위해 그 말을 믿어서는 안 된다고 결론짓습니다. 모델은 재앙을 인지하면서도 자신만만하게 틀린 답을 내놓을 수 있습니다. "알고 있는 것과 말하는 것 사이의 격차(Knowing-Saying Gap)"는 실재하며 위험합니다.
해결책은 모델에게 더 정직해지라고 요구하는 것이 아니라, "모델을 인지하는(model-aware)" 안전 시스템을 구축하는 것입니다. 우리는 내부 경보(프로브)에 귀를 기울이고, "브랜치 앤 픽"과 같은 스마트한 전략을 사용하여 오류를 잡아내야 합니다. 하지만 주의해야 할 점도 있습니다. 모든 종류의 실수나 모든 모델에 적용되는 단 하나의 해결책은 존재하지 않습니다. 안전한 AI의 미래는 챗봇의 자신감을 믿는 것이 아니라, 챗봇이 스스로에게 거짓말을 하고 있을 때 그것을 알아채는 가드레일을 구축하는 데 달려 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.