← 최신 논문
💬 NLP

Diagnosing Correctness Probes under Self-Judgement Confounding

이 논문은 언어 모델의 은닉 상태 판독(hidden-state readouts)이 실제 정답성보다는 모델의 자기 판단(self-judgement)을 포착하는 경우가 많다는 것을 보여주는데, 이는 자기 판단과 연관된 방향이 실제 정답성과 연관된 방향보다 도메인 간 전이성이 더 우수하다는 사실에 의해 입증된다.

원저자: Yi-Long Lu

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yi-Long Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇이 진실을 말하고 있는지 알아내려 한다고 상상해 보십시오. 당신은 질문을 던지고, 로봇은 답변을 내놓습니다. 그러면 당신은 결정해야 합니다. 그 답변이 실제로 옳은 것인가, 아니면 로봇이 단지 자신이 옳다고 확신하고 있는 것뿐인가? 이것이 바로 '기계적 해석 가능성(mechanistic interpretability)'이라는 새로운 과학 분야의 핵심이며, 여기서 연구자들은 거대 언으로 모델(LLM)의 '두뇌' 내부를 들여다보고 그들이 실제로 무엇을 생각하고 있는지 파악하려 노력합니다. 이 모델들은 시를 쓰고, 수학 문제를 풀고, 역사에 대해 대화할 수 있는 거대한 디지털 신탁과 같지만, 때때로 사실을 지어내기도 합니다(이를 '환각(hallucination)' 현상이라고 합니다). 과학자들은 모델이 답변을 마치는 바로 그 순간의 내부 전기 신호(이를 '은닉 상태(hidden states)'라고 부릅니다)를 살펴보면, 그 답변이 맞는지 틀린지를 종종 예측할 수 있다는 사실을 발견했습니다. 이는 마치 로봇의 마음속에 거짓말 탐지기가 내장되어 있는 것과 같습니다. 하지만 까다로운 점이 있습니다. 보통 로봇이 틀린 답을 내놓을 때, 로봇은 스스로도 그것이 틀렸다고 생각합니다. 그리고 로봇이 맞는 답을 내놓을 때, 로봇은 대개 그것이 맞다고 생각합니다. 로봇의 내부 '진실 신호'와 '자기 확신 신호'가 대개 일치하기 때문에, 로봇이 실제로 진실을 감지하고 있는 것인지, 아니면 단지 자신의 의견을 감지하고 있는 것인지 구별하는 것은 어려웠습니다.

"자기 판단 혼재 하에서의 정답성 프로브 진단(Diagnosing Correctness Probes under Self-Judgement Confounding)"이라는 제목의 이 논문은 바로 그 혼란을 다룹니다. 루 이롱(Yi-Long Lu)이 이끄는 연구팀은 로봇의 '진실'과 '자기 확신'이 서로 어긋나는 특별한 테스트를 구축하기로 했습니다. 그들은 모델이 수학적으로는 정답을 내놓으면서도 "아니요, 틀렸습니다"라고 말하는 시나리오와, 오답을 내놓으면서도 "네, 맞습니다"라고 말하는 시나리오를 만들었습니다. 이 두 신호가 서로 싸우도록 강제함으로써, 그들은 마침내 내부의 '거짓말 탐지기'가 실제로 무엇을 포착하고 있는지 알아낼 수 있었습니다.

연구팀은 70억 개에서 140억 개의 파라미터(로봇의 뇌에 있는 연결의 수라고 생각하면 됩니다) 규모에 이르는 네 가지 서로 다른 거대 언어 모델을 대상으로 테스트를 진행했습니다. 그들은 혼합된 스무디에서 원래의 과일과 우유를 분리하여 어떤 맛인지 확인하는 것과 같은 영리한 방법인 '요인 대조(factorial contrasts)'법을 사용했습니다. 그 결과, 내부 신호에는 진실과 확신에 대한 정보가 모두 포함되어 있었지만, 가장 안정적으로 전이 가능한 구성 요소는 객관적인 정답성이 아니라 로봇의 자기 판단 극성을 보존하는 것임이 밝혀졌습니다.

여기에는 놀라운 반전이 있습니다. 연구진이 틀린 답을 내놓으면서도 스스로는 맞다고 생체하는 로봇의 내부 신호를 살펴보았을 때, '거짓말 탐지기'는 정답을 맞혔을 때와 마찬가지로 높은 점수를 주었습니다. 반대로, 로봇이 정답을 내놓으면서도 스스로는 틀렸다고 생각할 때, 탐지기는 낮은 점수를 주었습니다. 실제로 수학 문제, 영화 퀴즈, 일반 상식 퀴즈를 포함하여 그들이 수행한 모든 모델과 테스트 전반에 걸쳐, 한 유형의 질문에서 다른 유형의 질문으로 가장 잘 전달된 내부 신호는 실제 진실이 아니라 로봇의 확신을 추적하는 것이었습니다.

이 논문은 우리가 모델에서 보는 '진실' 신호가 사실의 객관적인 척도일 수 있지만, 증거에 따르면 전이 가능성만으로는 객관적 정답성 의미론을 확립할 수 없다고 명시적으로 언급합니다. 심지어 연구진이 로봇의 자기 판단을 완전히 무시하고 '정답/오답' 레이블만을 사용하여 탐지기를 구축하려 했을 때조차, 그 탐지기는 여전히 로봇의 확신을 따라갔습니다. 이는 우리가 모델에서 보는 '진실'이 실제 사실에 관한 것이라기보다 모델이 자신의 출력물에 대해 어떻게 느끼느냐에 관한 것일 수 있음을 시사합니다. 저자들은 어떤 신호가 한 작업에서 다른 작업으로 전이될 수 있다고 해서 그것이 진실을 나타내는 것은 아니며, 그것은 단지 모델 자신의 의견을 나타내는 것일 수 있다고 결론지었습니다. 따라서 우리는 로봇의 뇌를 들여다보고 그들이 얼마나 확신하는지는 알 수 있지만, 그 확신이 진실을 말하고 있는지까지는 아직 확신할 수 없습니다. 이 연구는 우리가 이 모델들로부터 읽을 수 있는 가장 신뢰할 만한 것은 객관적인 현실 검증이 아니라 그들 자신의 자기 평가라는 점을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →