Categorical Perception in Large Language Model Hidden States: Structural Warping at Digit-Count Boundaries
본 논문은 대규모 언어 모델의 은닉 상태가 아라비아 숫자의 자릿수 변화 경계 (10, 100 등) 에서 인지 심리학의 범주적 지각과 유사한 기하학적 왜곡을 보이며, 이는 의미적 지식 여부와 무관하게 토큰화 구조적 불연속성에 의해 발생함을 규명했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🌍 핵심 비유: "숫자 마을의 국경선"
생각해 보세요. 숫자들이 사는 마을이 있다고 칩시다.
- 1~9까지는 '한 자리 숫자 마을'입니다.
- 10~99까지는 '두 자리 숫자 마을'입니다.
- 100~999는 '세 자리 숫자 마을'이죠.
이 논문은 인공지능이 이 마을들을 어떻게 인식하는지 조사했습니다. 특히 **9 에서 10 으로 넘어가는 순간 (한 자리에서 두 자리로 바뀌는 경계)**과 99 에서 100 으로 넘어가는 순간에 무슨 일이 일어나는지 집중했습니다.
🔍 발견한 놀라운 사실 3 가지
1. 인공지능도 '경계선'을 느끼고 있다 (기하학적 왜곡)
우리가 소리를 들을 때, 'ba'와 'pa' 사이에는 명확한 경계가 있어 소리가 갑자기 다르게 들리는 것처럼 (이를 '범주 지각'이라고 합니다), 인공지능도 숫자 경계선에서 마치 지형이 갑자기 꺾이는 것처럼 인식합니다.
- 비유: 9 와 10 은 숫자 값으로는 아주 가깝지만, 인공지능의 뇌 (은닉 상태) 에서는 마치 9 와 10 사이에 깊은 강이나 높은 산맥이 생긴 것처럼 인식됩니다.
- 결과: 6 가지 다른 인공지능 모델을 실험했는데, 모든 모델이 이 경계선에서 숫자들 사이의 거리를 평소보다 훨씬 더 넓게 인식했습니다. 마치 경계선에서 지구가 살짝 '뒤틀린' 것처럼요.
2. "모르는 척"하는 인공지능 vs "알고 있는" 인공지능 (가장 중요한 발견!)
이게 이 연구의 하이라이트입니다. 모든 인공지능이 똑같이 행동한 것은 아닙니다.
- A 형 (Gemma, Qwen): 경계선을 인식할 뿐만 아니라, "저는 10 이 두 자리 숫자라는 걸 알아요!"라고 입으로 말 (답변) 할 수도 있습니다.
- 비유: 마을의 국경선을 알고 있는 현명한 안내원입니다.
- B 형 (Llama, Mistral, Phi): 경계선에서 지형이 꺾이는 것은 똑같이 느끼는데, 질문하면 "모르겠어요"라고 대답하거나, 아예 구분하지 못합니다.
- 비유: 국경선에서 땅이 갑자기 울퉁불퉁해지는 것은 몸으로 느끼지만, 그 이유를 설명할 수 없는 무의식적인 감각을 가진 사람입니다.
결론: 인공지능은 의식적으로 분류할 수 없어도, 뇌의 내부 구조에서는 이미 '카테고리'를 나누고 있었다는 것입니다. 이는 인공지능의 '지식'과 '구조'가 다를 수 있음을 보여줍니다.
3. 왜 이런 일이 일어날까? (단순한 학습이 아니다)
연구진은 이것이 인공지능이 "숫자"를 배우면서 생긴 것일까, 아니면 단순히 입력 방식 (토큰화) 때문일까 궁금해했습니다.
- 실험 1 (온도): "뜨겁다/차갑다"라는 언어적 구분은 있지만, 숫자처럼 글자 수가 바뀌지 않는 경우 (예: 21 도와 23 도) 에는 이런 경계 효과가 전혀 나타나지 않았습니다.
- 실험 2 (가상 단어): 실제 숫자 대신 "글롭, 블릭켓" 같은 가짜 단어를 순서대로 배정해도 경계 효과가 아주 미미하게만 나타났습니다.
- 결론: 인공지능이 숫자의 '의미'를 배워서 그런 게 아니라, 숫자를 입력받을 때 글자 수가 갑자기 늘어나는 '구조적 충격' (예: 9 는 글자 1 개, 10 은 글자 2 개) 때문에 뇌의 지형이 왜곡된 것입니다. 마치 문이 갑자기 두 배로 넓어지는 것을 보고 놀란 것처럼요.
💡 이 연구가 우리에게 주는 교훈
- 인공지능의 '눈'과 '입'은 다를 수 있다: 인공지능이 어떤 것을 '알고 있다'고 판단할 때, 단순히 질문에 답하는지 (입) 만 보면 안 됩니다. 그 내부의 데이터 구조 (눈) 가 어떻게 변형되어 있는지 봐야 진짜 이해를 할 수 있습니다.
- 형식이 내용을 만든다: 인공지능이 복잡한 개념을 배우지 않아도, 단순히 입력되는 데이터의 형태 (글자 수, 토큰 수) 가 바뀌는 것만으로도 마치 인간처럼 '카테고리'를 나누는 지각이 생길 수 있습니다.
- 가장 잘 보이는 곳이 중요한 곳이 아니다: 인공지능의 뇌에서 숫자 경계가 가장 뚜렷하게 보이는 층 (레이어) 은, 실제로 그 정보를 처리하는 핵심 층이 아니었습니다. 마치 가장 선명한 사진을 찍은 카메라가 실제 사건을 목격하지는 않았을 수 있는 것처럼요.
📝 한 줄 요약
"인공지능은 숫자가 10 이 될 때, 글자 수가 늘어나는 '구조적 충격' 때문에 마치 인간처럼 숫자 세계의 경계를 느끼지만, 정작 그 사실을 말로 표현하지는 못할 수도 있다."
이 연구는 인공지능이 어떻게 세상을 '이해'하는지, 그리고 우리가 인공지능을 평가할 때 무엇을 봐야 하는지에 대한 새로운 시각을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.