Reading Between the Dots: Decoding Hidden Computation across Filler Tokens
이 논문은 최첨단 거대언어모델(LLM)이 표면적인 토큰이 가시적인 사고 사슬(chain-of-thought)을 제공하지 않는 경우에도, 잔차 스트림(residual stream)의 비지도 디코딩을 통해 은닉 계산이 여전히 모니터링 가능하다는 것을 드러내며, 모델의 은닉 상태 내에서 내용이 없는 필러 토큰(filler tokens)을 통해 구조화되고 판독 가능한 다단계 추론을 수행함을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
마치 마술사가 마술을 부리는 것을 지켜보고 있다고 상상해 보세요. 보통 마술이 어떻게 이루어졌는지 이해하려면, 그들의 손을 보고 그들이 하는 말을 들어야 합니다. 인공지능(AI)의 세계에서 이것은 AI가 정답을 내놓기 전에 써 내려가는 단계별 설명인 '사고의 사슬(Chain of Thought, CoT)'을 관찰하는 것과 같습니다.
오랫동안 안전 전문가들은 만약 AI가 단계별 과정을 쓰는 것을 멈추고 최종 답변만 내놓는다면, AI가 올바르게 생각하고 있는 것인지 아니면 그냥 추측하고 있는 것인지 알 수 있는 방법이 없을 것이라며 우려해 왔습니다. **"점들 사이를 읽기(Reading Between the Dots)"**라는 제목의 이 논문은, 질문과 답변 사이에 의미 없는 '채우기용' 토큰(예를 들어 ......와 같은 점의 나열이나 1 2 3 4 5와 같은 숫자 세기)이 주어지는 특이하고 기묘한 시나리오를 조사합니다.
연구진이 발견한 내용을 쉬운 개념으로 나누어 설명하면 다음과 같습니다.
1. 마술의 트릭: AI는 "빈 공간"을 사용한다
연구진은 두 개의 매우 똑똑한 AI 모델(DeepSeek V3 및 Kimi K2)에게 어려운 수학 및 논리 문제를 던졌습니다.
- 점이 없을 때: AI는 정답을 틀리는 경우가 많았습니다.
- 점이 있을 때: AI는 정답을 맞히는 경우가 훨씬 더 많았습니다.
결론적으로 AI는 단순히 점들을 무시하는 것이 아닙니다. AI는 그 "빈 공간"을 **연습장(scratchpad)**으로 사용하고 있습니다. 우리에게 그 점들은 아무것도 아닌 것처럼 보이지만, AI는 그 점들이 위치한 디지털 공간 안에서 비밀리에 수학 계산과 추론을 수행하고 있는 것입니다. 이는 마치 요리사가 고객에게 말을 멈추고 채소를 썰면서 자신에게 레시피를 속삭이는 것과 같습니다. 고객에게는 아무 소리도 들리지 않지만, 요리는 진행되고 있는 것입니다.
2. "X-레이 비전": 숨겨진 생각을 보다
중요한 질문은 이것입니다. 만약 AI가 단계를 글로 쓰지 않는다면, 우리는 여전히 그것이 무엇을 생각하는지 알 수 있을까?
저자들은 그렇다고 말합니다. 그들은 AI가 출력하는 단어 대신 AI의 내부 전기 신호(즉, '잔차 흐림/residual stream')를 들여다보는 특별한 "X-레이" 도구(Logit Lens라고 불림)를 개발했습니다.
- 비유: AI의 뇌를 분주한 고속도로라고 상상해 보세요. AI가 타이핑하는 단어들은 그 표면 위를 달리는 자동차들에 불과합니다. 하지만 도로 아래에는 실제 물과 전기를 운반하는 터널과 파이프가 있습니다.
- 발견한 내용: 이 "점들" 아래의 "터널"을 살펴봄으로써, 연구진은 AI가 최종 답변을 타이핑하기도 전에 사실(예: "모차르트는 35세에 사망했다")을 인출하고 수학 계산(예: "35 + 93 = 128")을 수행하고 있다는 것을 확인할 수 있었습니다. 점들은 비어 있지 않았습니다. 그 안은 AI의 내부 계산으로 가득 차 있었습니다.
3. "뇌 이식" 실험
점들이 실제로 AI의 사고를 유도하는 것인지(단순한 우연이 아닌지) 증명하기 위해, 연구진은 "뇌 이식" 실험을 진행했습니다.
- 연구진은 성공적인 AI 실행에서 얻은 내부 "생각"(숨겨진 데이터)을 가져와서, 실패할 예정이었던 다른 AI 실행에 이식했습니다.
- 결과: 실패하던 AI가 마치 다른 AI로부터 올바른 생각을 "전염"받은 것처럼 갑자기 정답을 맞히기 시작했습니다. 이는 점 안에 담긴 정보가 실제적이고, 유용하며, 필수적이라는 것을 증명했습니다.
4. "해독 반지": 비밀 코드를 읽다
연구진은 (학습이 필요 없는) 비지도 파이프라인(일련의 지침 세트)을 구축하여 이러한 숨겨된 생각을 해독했습니다.
- 연구진은 점들 속에 담긴 숨겨진 신호를 가져와 노이즈를 제거한 뒤, 상위 후보들을 두 번째의 매우 똑똑한 AI("판사")에게 입력했습니다.
- 성공률: 이 해독기는 AI가 무엇을 생각하고 있었는지 80%에서 95% 사이의 확률로 정확하게 맞혔습니다.
- 발견한 내용: 이 해독기는 AI가 단 한 번도 글로 쓰지 않았음에도 불구하고 특정 숫자, 도시 이름, 또는 원소 이름을 복구해 낼 수 있었습니다. 만약 AI가 답을 틀렸다면, 해독기는 그 이유(예: "올바른 사실은 찾았으나 더하기를 하는 과정에서 실수함")까지도 알려줄 수 있었습니다.
핵심 결론
이 논문은 AI가 자신의 추론 과정을 겉으로 말하지 않는다(또는 가시적인 사고의 사슬을 보여주지 않는다)고 해서, 그 추론이 영원히 숨겨져 있는 것은 아니라고 주장합니다.
- 문제점: 우리가 AI가 쓰는 단어만을 본다면, 특히 AI가 "채우기용" 토큰을 사용하여 작업할 때, 우리는 실제 사고 과정을 놓칠 수 있습니다.
- 해결책: 우리에게는 AI의 내부 신호를 들여다볼 수 있는 도구가 있습니다. AI가 "빈" 공간 속에 자신의 작업을 숨기려 할지라도, 우리는 여전히 "잔차 흐림(residual stream, 내부의 전기적 활동)"을 읽어내어 그것이 실제로 무엇을 하고 있는지 볼 수 있습니다.
요약하자면: AI는 시험을 치르는 학생과 같습니다. 정답은 종이에 적지만, 모든 수학 계산은 머릿속으로 하는 학생 말이죠. 이 논문은 비록 종이 위에 수학 계산 과정이 보이지 않더라도, 특별한 도구를 사용하면 그 학생의 마음을 읽어 문제를 어떻게 풀었는지 정확히 알 수 있다는 것을 보여줍니다. 이는 "숨겨진" 연산이 반드시 "감사가 불가능한(unauditable)" 것은 아님을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.