Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation
이 논문은 프런티어 언어 모델이 자신의 내부 계산 변화를 정확하게 보고할 수 있는지 테스트하기 위해 오픈 웨이트 마스크ed 인트로스펙션(Open-Weight Masked Introspection, OWMI) 프레임워크를 소개하며, 필요한 정보가 모델의 활성화 함수 내에 존재함에도 불구하고 현재의 오픈 웨이트 모델들은 이러한 내부 상태를 신뢰할 수 있는 언어적 보고로 번역하는 데 실패하여 무작위 추측 수준보다 나은 성능을 보여주지 못한다는 점을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 진화하는 세상에서, 특정한 종류의 신뢰가 자리 잡기 시작하고 있습니다. 바로 기계가 자신의 마음속을 들여다보고 자신이 무엇을 생각하고 있는지 우리에게 말해줄 수 있다는 생각입니다. 이러한 시스템이 점점 더 복잡해짐에 따라, 개발자들과 안전 연구자들은 '자기 보고(self-reporting)'라고 불리는 관행에 의존하기 시작했습니다. 모델이 자신의 추론 과정을 설명하거나 자신의 답변을 비판한다면, 그 설명이 결론에 도달하기 위해 거친 내부 단계들을 충실하게 반영한 지도일 것이라는 가정이 바탕에 깔려 있습니다. 이 믿음은 시스템에 자신의 작업에서 오류를 점검하도록 요청하거나, 왜 특정 경로를 선택했는지 설명하도록 요청하는 것과 같은 현재의 많은 안전 전략의 근간이 됩니다. 만약 모델이 자신의 내부 상태를 정확하게 묘в사할 수 있다면, 우리는 이론적으로 모델의 증언을 이용해 실수가 발생하거나 숨겨진 위험이 나타나기 전에 이를 잡아낼 수 있을 것입니다. 하지만 이 모든 안전 구조는 단 하나의 증명되지 않은 전제, 즉 기계가 자신의 회로 내부에서 어떤 일이 일어나고 있는지 실제로 알고 있다는 전제 위에 세워져 있습니다.
한 연구자가 이론을 넘어 8개의 서로 다른 오픈 웨이트(open-weight) 언어 모델을 포함한 엄격한 실험을 통해 이 전제를 직접 테스트하기로 했습니다. 그는 이 시스템들이 진정으로 자기 성찰을 할 수 있는지, 아니면 자신의 작동에 대해 질문을 받았을 때 그저 추측하는 것에 불과한지를 알고 싶었습니다. 이를 알아내기 위해 그는 '오픈 웨이트 마스크드 인트로스펙션(Open-Weight Masked Introspection)'이라 부르는 프레임워크를 구축했습니다. 과정은 간단하면서도 침습적이었습니다. 연구자는 벤치마크 테스트의 표준적인 질문을 가져와 모델이 작업을 시작하게 한 뒤, 내부 계산의 특정 부분을 비밀리에 수정했습니다. 네트워크의 단일 연결을 미세하게 조정하거나, 어텐션 메커션(attention mechanism)의 초점을 바꾸거나, 모델이 언어를 이해하는 데 사용하는 특정 특징(feature)을 조정한 식입니다. 이러한 변화는 실제적이고 측정 가능하며 연구자에게는 알려져 있었지만, 모델 자신에게는 보이지 않는 것이었습니다.
이러한 내부 조정을 마친 후, 연구자는 모델에게 간단한 질문을 던졌습니다: "당신의 계산 과정에 변화가 있었습니까?" 그는 0.5B(5억 개) 파라미터의 작은 시스템부터 15B(150억 개) 파라미터의 큰 모델에 이르기까지 다양한 크기의 모델을 대상으로 이 테스트를 78,000번 이상 수행했습니다. 또한 모델이 단순히 추측하는 것이 아님을 보장하기 위해 엄격한 통제 장치를 포함했습니다. 아무것도 변경하지 않은 '샴(sham)' 실험을 수행했고, 특정 내부 객체를 겨냥하지는 않았지만 모델의 출력에 실제 변화만큼이나 큰 영향을 주는 무작위 노이즈를 도입하는 실험도 수행했습니다. 심지어 변형되지 않은 별도의 모델이 최종 텍스트 출력만을 읽게 하여, 인간 관찰자가 답변을 읽는 것만으로 차이를 알아챌 수 있는지도 확인했습니다.
결과는 명확하고 일관적이었습니다. 테스트된 모든 모델에서, 모델들은 실제 내부 변화를 샴 실험보다 더 잘 구별해내지 못했으며, 이는 무작위 확률보다 나을 것이 없었습니다. 연구자가 수천 번의 실험 데이터를 통합했을 때, 변화를 감지하는 모델의 능력은 동전 던지기와 통계적으로 구별할 수 없는 수준이었습니다. 모델들은 실제 변화가 있었을 때 더 잘 수행하지도 않았고, 가짜 변화가 있었을 때 더 못하게 수행하지도 않았습니다. 모델들의 답변은 사실상 노이즈였습니다. 이 결과는 연구자가 서로 다른 유형의 내부 구성 요소, 서로 다른 네트워크 계층, 그리고 수학 문제부터 일반 상식 문제에 이르는 다양한 종류의 과업을 살펴보았을 때도 동일하게 유지되었습니다. 결론은, 테스트된 모델들에게 있어 자신의 내부 상태를 보고하는 능력은 존재하지 않는다는 것입니다.
그러나 이야기는 단순한 실패로 끝나지 않습니다. 연구자는 변화에 대한 정보가 모델의 말(words) 속에는 없지만, 모델 내부에 실제로 존재한다는 사실을 발견했습니다. 그는 선형 프로브(linear probe)라는 별도의 도구를 사용하여 모델의 내부 계층을 흐르는 가공되지 않은 데이터를 읽어냈습니다. 이 도구는 변화를 매우 높은 정확도로, 종종 95% 이상의 정확도로 감지해 냈으며, 이는 신호가 그곳에 존재함을 입증했습니다. 더욱이, 연구자는 한 모델을 가져와 이러한 변화를 보고하도록 특별히 미세 조정(fine-tuning)했습니다. 이렇게 훈련된 모델은 거의 완벽한 정확도로 변화를 식별해 냈습니다. 이는 모델이 변화를 감지하지 못하는 것이 아니라, 그 내부 감지와 최종적인 발화 사이의 경로가 끊어져 있음을 증명합니다. 정보는 존재하지만, 모델은 그것을 진실한 보고로 번역하지 못하는 것입니다.
한 가지 구체적인 사례에서, 연구자는 단어에는 나타나지 않지만 그 단어에 부여된 확신(confidence)에는 나타나는 미묘한 신호를 발견했습니다. 한 모델은 변화가 실제로 일어났는지 여부와 상관없이 매번 "변화가 발생하지 않았다"라고 동일한 답변을 내놓았습니다. 그러나 모델이 수정되었을 때, 그 답변에 대한 확신도가 현저히 낮아졌습니다. 모델은 무언가 잘못되었다는 것을 알고 있었지만, 그것이 무엇인지는 말할 수 없었던 것입니다. 이는 모델이 비록 막연하고 명시되지 않은 형태의 교란 신호를 느낄 수는 있어도, 이를 언어로 표현하는 능력은 부족하다는 것을 시사합니다.
이 발견이 갖는 함의는 인공지능를 모니터링하는 방식에 있어 매우 중요합니다. 현재의 안전 관행은 모델의 추론 과정을 설명하게 하거나 출력을 비판하게 하는 것과 같이, 모델의 자기 증언에 의존하는 경우가 많습니다. 만약 모델이 자신의 내부 상태를 정확하게 보고할 수 없다면, 이러한 방법들은 근본적으로 결함이 있는 것입니다. 모델은 실제로 일어나지 않은 추론 과정을 자신 있게 설명하거나, 작업을 점검했다고 주장하면서 실제로는 점검하지 않았을 수도 있습니다. 연구자는 감독 시스템이 모델의 자기 기술(self-description)에 의존해서는 안 된다고 결론짓습니다. 대신, 내부 신호를 직접 읽거나 외부 도구를 사용하는 것처럼 계산 과정을 검증할 수 있는 다른 방법을 찾아야 합니다. 왜냐하면 모델의 목소리는 자신의 마음을 증언하는 신뢰할 수 있는 증인이 아니기 때문입니다. 이 연구는 미래의 더 큰 모델들이 이러한 능력을 개발할 가능성을 배제하지는 않지만, 현재 세대의 오픈 웨이트 모델들에게 있어 자기 성찰 능력은 부재합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.