← 최신 논문
💬 NLP

States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States

이 논문은 거대 언어 모델이 명시적인 사고 사슬(chain-of-thought) 추론 없이도 은닉 상태 내에 불완전한 암묵적 이산 상태 표현(Imperfect Implicit Discrete State Representations)을 형성하고 활용함으로써 어떻게 확장된 계산을 수행하는지 조사하며, 또한 이러한 표현의 형성을 규명하고 계산 오류에 대한 기여도를 식별한다.

원저자: Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

게시일 2026-08-05
📖 5 분 읽기🧠 심층 분석

원저자: Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마술사가 모자에서 토끼를 꺼내는 장면을 보고 있다고 상상해 보세요. 당신은 그 토끼가 허공에서 갑자기 나타난 것이 아님을 알고 있지만, 마술의 트릭은 볼 수 없습니다. 오랫동안 인공지능(AI)을 연구하는 과학자들도 이와 비슷한 상황에 처해 있었습니다. 그들은 거대 언어 모델(LLM)이라 불리는 이 거대한 컴퓨터 두뇌가 시를 쓰고, 수학 문제를 풀고, 인간처럼 대화하는 놀라운 일을 할 수 있다는 것을 알고 있습니다. 하지만 이들의 "마음"(사실은 거대한 숫자와 층들의 집합체인) 내부에서 어떻게 그런 일이 일러나는지는 일종의 블랙박스처럼 가려져 있었습니다.

이 논문을 이해하기 위해서는 두 가지 간단한 사실을 알아야 합니다. 첫째, LLM은 문장에서 한 번에 한 단어씩 다음 단어를 예측하며 작동합니다. 둘째, 이 과정에서 AI는 **숨겨진 상태(hidden state)**라고 불리는 일시적인 "메모장" 정보를 생성합니다. 이 숨겨진 상태를 AI가 생각하는 동안 작성하는 '정신적 메모'라고 생각해보세요. 보통 우리는 AI가 질문 전체를 읽고 나서 답을 추측한다고 가정합니다. 하지만 만약 AI가 긴 숫자 목록을 읽는 동안, 마치 당신이 계산기를 쓰지 않고 머릿속으로 식료품 값을 더하듯, 몰래 '달리는 합계(running total)'를 기록하고 있다면 어떨까요? 이 논문은 AI가 실제로 그런 정신적 산수를 하고 있는 것인지, 아니면 그저 때려 맞히는 것인지를 묻습니다.


정신적 산수의 마술

당신이 파티에 있다고 상상해 보세요. 누군가 당신에게 17, 38, 32, 87... 과 같은 긴 숫자 목록을 건네며, 아무것도 적거나 소리 내어 단계를 말하지 않고 즉시 모두 더해보라고 요청합니다. 대부분의 사람은 어려워하겠지만, 세계에서 가장 똑똑한 AI 모델들은 이 일을 매우 잘하기 시작했습니다. 그들은 최대 15개의 숫자로 이루어진 문자열을 보고, 과정을 보여주지 않고도 즉시 정확한 합계를 내뱉을 수 있습니다.

"States Hidden in Hidden States"라는 제목의 이 논문은 이 AI 모델들이 정확히 어떻게 이 마술을 부리는지 조사합니다. 칭화 대학교의 연구진은 이 모델들이 단순히 추측하는 것이 아니라, 비밀리에 **암시적 이산 상태 표현(Implicit Discrete State Representations, IDSRs)**을 구축하고 있다는 가설을 세웠습니다.

이 어려운 용어를 쉽게 풀어보겠습니다. AI가 물 양동이를 줄지어 전달하는 작업자 팀이라고 상상해 보세요.

  • 암시적(Implicit): 그들은 숫자를 입 밖으로 외치지 않습니다(텍스트 생성).
  • 이산 상태(Discrete State): 그들은 손에 특정하고 정확한 숫자(예를 들어 17과 20을 더한 후의 "37")를 쥐고 있습니다.
  • 표현(Representation): 이 숫자는 AI의 내부 층(layer) 안에 하나의 패턴으로서 존재합니다.

연구진은 AI가 목록을 읽는 동안 단순히 마지막까지 기다렸다가 한꺼번에 계산하는 것이 아니라, 실제로 중간 숫자들을 붙잡고 있는지 증명하고 싶었습니다.

탐정 작업: 뇌 내부를 들여다보기

이 "정신적 메모장"이 정말 존재하는지 확인하기 위해, 연구진은 AI의 내부 층을 대상으로 "스무 고개" 게임을 진행했습니다. 그들은 **프로브(probe)**라고 불리는 도구를 사용했습니다. 프로브를 AI의 내부 노트를 특정 순간에 훔쳐보고 "지금 무슨 숫자를 생각하고 있니?"라고 물어볼 수 있는 작고 매우 빠른 탐정이라고 생각하세요.

연구진은 Llama2-7B와 같은 작은 모델부터 GPT-4나 Qwen-72B와 같은 거대 모델에 이르기까지 다양한 모델을 대상으로 이 테스트를 수행했습니다. 그리고 모델들에게 2개에서 14개 사이의 숫자가 포함된 덧셈 문제를 풀게 했습니다.

연구 결과:

  1. 덩치가 커질수록 능력이 커진다: 이 정신적 산수 능력은 모델이 커짐에 따라 "발현(emerge)"됩니다. 작은 모델은 두세 개의 숫자를 더할 수 있지만, 목록이 8개에 도달하면 무너집니다. 그러나 가장 큰 모델들은 11개, 심지어 15개의 목록도 놀라운 정확도로 처리할 수 있습니다.
  2. 숨겨진 메모는 실재한다: 연구진이 "탐정 프로브"를 사용하여 AI의 숨겨진 층을 조사했을 때, 모델들이 실제로 '달리는 합계'를 보유하고 있다는 것을 발견했습니다. 예를 들어, AI가 "17 + 24"를 읽은 후, 내부 상태에는 아직 "41"이라는 단어를 말하지 않았음에도 불구하고 "41"에 대한 표현이 담겨 있었습니다.
  3. 완벽하지는 않다: 나쁜 소식은 이 정신적 메모가 완벽하지 않다는 것입니다. 숫자 목록이 길어질수록 "메모"는 다소 흐릿해집니다. 연구진은 AI가 처음 몇 단계까지는 숫자를 완벽하게 유지하지만, 15번째 숫자에 도달할 때쯤이면 내부 표현이 세부 사항을 잃기 시작한다는 것을 발견했습니다. 이러한 "손실이 있는(lossy)" 압축이 똑똑한 모델들조차 가끔 최종 답을 틀리는 이유입니다.

AI가 숫자를 만드는 법

이 논문은 AI가 어떻게 이 숫자들을 만드는지도 밝혀냈는데, 이는 놀랍게도 인간이 하는 방식과 유사합니다.

  • 한 번에 한 자리씩: AI는 전체 숫자를 한꺼번에 계산하지 않습니다. 일의 자리부터 시작하여 십의 자리, 백의 자리 순으로 숫자를 만들어 나갑니다. 이는 종이에 세로셈을 하는 것과 같지만, 완전히 AI의 뇌 안에서 일어나는 일입니다.
  • "얕은" 층 vs "깊은" 층: AI에는 여러 개의 처리 층이 있습니다. 연구진은 처음 10개의 층이 "계산기" 역할을 하는 뇌 부분이라고 발견했습니다. 즉, 이들은 단순히 원시적인 수학을 수행합니다. 하지만 정보가 더 깊은 층(약 10번째 층 이후)으로 이동함에 따라, AI는 문장의 맥락을 섞기 시작합니다. 이는 마치 계산기가 주변의 대화에 의해 주의가 분산되는 것과 같습니다. 이러한 혼합이 최종 답의 "흐릿함"이나 오류를 유발합니다.
  • 마법이 아닌 선형적 과정: AI는 마법처럼 한 번에 모든 것을 처리하지 않습니다. 숫자를 선형적으로 처리합니다. 만약 숫자 A, B, C, D가 있다면, (A+B)를 계산하고, 그 결과에 C를 더한 뒤, 다시 D를 더합니다. (A+B)와 (C+D)를 따로 계산한 뒤 결합하는 방식이 아닙니다.

"다리(Bridge)" 실험

AI가 단순히 추측하는 것이 아니라 실제로 이 숨겨진 메모를 사용하고 있다는 것을 증명하기 위해, 연구진은 아주 영리한 트릭을 사용했습니다. 그들은 AI의 어텐션 메커니즘(attention mechanism)에 "다리"를 놓았습니다. AI가 긴 문장을 읽고 있을 때, 문장의 앞부분을 보지 못하도록 차단하여 오직 바로 직전에 읽은 것만 보도록 강제한 것입니다.

만약 AI가 문장 전체를 바탕으로 단순히 추측하는 것이라면, 이 차단은 AI를 완전히 망가뜨릴 것입니다. 하지만 AI는 만약 "다리"(가장 최근의 더하기 기호)를 볼 수 있다면 여전히 수학 문제를 풀 수 있었습니다. 이는 AI가 한 단계에서 다음 단계로 '달리는 합계'를 전달하고 있음을 입증했으며, 이는 마치 인간이 하는 방식과 같습니다.

요 conclusão (결론)

이 논문은 거대 AI 모델이 과정을 보여주지 않고 수학 문제를 풀 때, 실제로 그 작업을 수행하고 있다는 점을 시사합니다. 그들은 읽는 동안 합계를 유지하는 보이지 않는 내부의 "포스트잇"을 만들고 있습니다.

하지만 함정이 있습니다. 이 포스트잇은 완벽하지 않습니다. 숫자 목록이 길어질수록 메모는 조금씩 번지고, AI는 실수를 하기 시작합니다. 연구진은 만약 우리가 이 내부 메모를 더 명확하고 "손실이 적게" 만드는 방법을 찾아낸다면, AI를 단순한 수학을 넘어 훨씬 더 복잡한 추론 작업에서도 뛰어나게 만들 수 있을 것이라고 믿습니다.

현재로서는, AI가 마법을 부리는 것이 아니라, 비록 그 기록이 긴 목록의 끝에서 다소 흐릿해질지라도, 머릿속으로 셈을 아주 잘하고 있는 것임을 알 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →