← 최신 논문
💬 NLP

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

본 논문은 활성화 오라클에 대한 불확실성 정량화를 평가하기 위해 여섯 가지 신뢰도 추정 방법을 분석한 결과, 부트스트랩 모드 빈도가 가장 우수한 보정을 제공하며 로그 확률은 비용 효율적인 분류 신호로 작용함을 규명하였다.

원저자: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 비밀을 가진 초지능 로봇 (이를 '타겟'이라고 부르겠습니다) 이 있다고 가정해 봅시다. 아마도 '나무'와 같은 특정 단어가 뇌 속에 숨겨져 있도록 프로그래밍되었을지도 모릅니다. 당신은 그 단어를 직접 볼 수 없습니다. 오직 로봇이 생각할 때의 전기 신호 (즉, '활성화') 만 볼 수 있을 뿐입니다.

이제 두 번째 로봇인 '오라클'을 상상해 보세요. 이 로봇의 유일한 임무는 그 전기 신호를 살펴보고 평범한 영어로 번역하는 것입니다. 오라클은 "비밀 단어는 나무입니다!"라고 말합니다.

문제:
오라클은 단어를 추측하는 데 뛰어나지만, 치명적인 성격 결함이 하나 있습니다. 자신이 틀렸을 때를 절대 알지 못한다는 점입니다. 오라클이 정답을 맞췄든 완전히 환각을 보고 있든, "비밀 단어는 나무입니다"라고 말할 때의 자신감은 정확히 동일합니다. 만약 당신이 이 오라클을 "이 AI 를 출시해도 안전한가?"와 같은 중요한 결정을 내리는 데 사용한다면, 당신은 알아야 합니다: 오라클은 실제로 얼마나 확신하고 있는가?

실험:
이 논문의 저자들은 오라클에게 "나는 꽤 확신한다"거나 "나는 그냥 추측할 뿐이다"라고 말하도록 가르치려 했습니다. 그들은 오라클의 확신을 측정하기 위해 여섯 가지 다른 방법을 테스트했는데, 이는 일기 예보의 신뢰성을 확인하는 여섯 가지 다른 방법을 시도해 보는 것과 비슷합니다.

다음은 그들이 사용한 간단한 비유를 통해 설명한 테스트 방법입니다:

여섯 가지 확신 측정 방법

  1. 직감 (로그 확률):

    • 작동 원리: 오라클은 방금 말한 단어를 보고 "내가 이 특정 단어를 선택할 확률은 얼마나 될까?"라고 묻습니다.
    • 결과: 꽤 괜찮은 추측이지만, 종종 오라클은 과도하게 확신합니다. 실제로는 60% 만 맞는데도 90% 확신한다고 생각합니다.
  2. 다수결 (부트스트랩 모드 빈도):

    • 작동 원리: 오라클에게 한 번만 묻는 대신, 매번 약간의 무작위성 (주사위 굴리기와 같음) 을 허용하면서 20 번 연속으로 물어봅니다. 만약 20 번 중 18 번은 '나무'라고 하고 2 번은 '자동차'라고 한다면, 이는 매우 확신한다는 뜻입니다. 반면 '나무', '자동차', '구름', '바위', '나무'가 무작위로 나온다면 혼란스러워한다는 뜻입니다.
    • 결과: 이것이 승리했습니다. 오라클이 맞았는지 틀렸는지 알려주는 데 가장 정확했습니다. 이는 사람 무리에게 물어보는 것과 같습니다; 모두 동의한다면 그 답을 신뢰할 수 있습니다.
  3. 정직한 인터뷰 (직접 자기 보고):

    • 작동 원리: 단순히 오라클에게 묻습니다: "0 에서 100 사이의 척도로, 당신은 얼마나 확신합니까?"
    • 결과: 이것이 가장 나쁜 방법이었습니다. 오라클은 자기 성찰에 서툴렀습니다. 더 큰 모델에서는 정답일 때보다 틀렸을 때 오히려 확신했습니다. 이는 완전히 틀린 수학 문제를 100% 확신하며 맞았다고 믿는 학생과 같습니다.
  4. MCMC 체인 (파워 샘플링):

    • 작동 원리: 이는 오라클이 한 가지 답에 갇히는지 확인하기 위해 다양한 가능한 답 사이를 '점프'해 보게 하는 복잡한 수학 트릭입니다.
    • 결과: 잘 작동하지 않았습니다. 오라클의 뇌가 한 가지 답에 너무 집중되어 있어 다른 가능성으로 실제로 '점프'하지 않기 때문에, 이 방법은 오라클이 확신하는지 아니면 고집을 부리는지 구분할 수 없었습니다.
  5. 줄다리기 (조종 민감도):

    • 작동 원리: 오라클의 뇌를 서로 다른 방향으로 살짝 밀어 답이 변하는지 확인합니다. 답이 변하지 않으면 확신하는 것입니다.
    • 결과: 너무 거칠었습니다. '뜨겁다'와 '차가다' 설정만 있는 온도계로 온도를 재려는 것과 같습니다.
  6. 멀티 체인 투표:

    • 작동 원리: '다수결'과 유사하지만, 20 개의 답을 생성하기 위해 더 복잡하고 비용이 많이 드는 수학 방법을 사용합니다.
    • 결과: 그럭저럭 작동했지만, 훨씬 느렸고 간단한 '다수결'보다 더 나은 결과를 주지 못했습니다.

주요 교훈

  • 최고의 도구: '다수결'(모델에게 20 번 물어보고 얼마나 자주 스스로 동의하는지 확인하는 것) 은 오라클이 진실을 말하고 있는지 알 수 있는 가장 좋은 방법입니다.
  • 함정: 오라클이 단순히 "나는 확신한다"고 말할 때는 절대 신뢰하지 마십시오. 논문은 오라클이 자신의 확신을 평가하도록 요청받았을 때, 답에 대해 거짓말을 하거나 (혹은 확신에 대한 환각을 일으켜) 거의 같은 정도로 거짓말을 한다는 것을 발견했습니다.
  • 비용: '다수결'은 모델을 20 번 실행해야 하므로 더 많은 컴퓨터 성능이 필요합니다. '직감' 방법은 빠르지만 정확도는 낮습니다. 저자들은 빠른 방법을 빠른 필터로만 사용하고, 최종 결정에는 '다수결'에 의존할 것을 제안합니다.

이것이 중요한 이유

AI 모델을 점검하는 안전 시스템을 구축한다면, 오라클이 말하는 내용만 들어서는 안 됩니다. 그 내용이 얼마나 신뢰할 만한지를 알아야 합니다. 이 논문은 그 신뢰를 구축하는 방법을 보여주는 매뉴얼을 제공하며, 오라클에게 '두 번 생각하게'(다수결을 통해) 하는 것이 그것이 지어낸 것을 잡아내는 가장 신뢰할 수 있는 방법임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →