Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models
본 논문은 3 가지 아키텍처의 3 개 대형 언어 모델에서 심리물리학 도구를 적용한 결과, 학습 데이터 통계가 로그 압축적 기하학을 생성하지만 이러한 기하학적 구조가 반드시 인간과 유사한 행동적 능력이나 인과적 처리를 보장하지는 않음을 규명했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 "AI(특히 대형 언어 모델) 가 숫자나 시간, 거리 같은 '크기'를 어떻게 머릿속에 저장하고 있는지" 에 대한 흥미로운 비밀을 밝혀낸 연구입니다.
마치 AI 의 뇌를 해부하여 '숫자 감각'이 어디에, 어떻게 숨어있는지 찾아낸 탐정 이야기라고 생각하시면 됩니다.
이 연구의 핵심 내용을 쉬운 비유와 함께 설명해 드릴게요.
1. 연구의 배경: AI 는 숫자를 어떻게 기억할까?
최근 연구자들 사이에서 "AI 는 숫자를 선형적으로(1, 2, 3... 이렇게 균일하게) 기억할까, 아니면 로그arithm 적으로(1, 10, 100... 이렇게 압축해서) 기억할까?"라는 논쟁이 있었습니다. 어떤 사람은 "균일하게 저장한다"고 하고, 어떤 사람은 "압축해서 저장한다"고 했습니다.
이 연구팀은 "심리물리학 (Psychophysics)" 이라는 인간의 감각을 연구하는 고전적인 도구를 가져와서 이 논쟁을 해결했습니다. 심리물리학은 "사람이 100 원과 200 원의 차이를 느끼는 것과, 1000 원과 1100 원의 차이를 느끼는 것이 어떻게 다른지"를 연구하는 학문입니다.
2. 주요 발견 1: AI 의 뇌는 '로그arithm'으로 숫자를 압축한다
연구팀은 Llama, Mistral, Qwen 등 세 가지 다른 AI 모델을 분석했습니다. 결과는 놀라웠습니다.
- 비유: AI 가 숫자를 기억하는 방식은 지진계와 비슷합니다.
- 작은 진동 (1, 2, 3) 은 아주 세밀하게 감지하지만, 큰 진동 (1000, 10000) 은 거대한 간격으로 압축해서 저장합니다.
- 마치 지도를 생각해보세요. 서울의 골목길은 아주 자세히 그려져 있지만, 전 세계 지도에서는 한국 전체가 한 점처럼 작게 그려집니다.
- AI 도 숫자가 커질수록 그 간격을 좁혀서 저장합니다. 이는 AI 가 학습한 텍스트 데이터의 통계적 특징(작은 숫자가 훨씬 자주 등장함) 을 그대로 반영한 결과로, AI 가 스스로 효율적으로 정보를 압축하는 방식을 터득했다는 뜻입니다.
3. 주요 발견 2: "머리에는 있는데, 입으로는 못 말해" (가장 중요한 발견!)
이 연구의 가장 충격적인 사실은 AI 가 숫자를 '아는데', 그걸 '사용'하지 못한다는 점입니다.
- 비유: 완벽한 지도를 가지고 있지만 길 찾기를 못하는 나침반을 상상해보세요.
- AI 의 뇌 깊은 곳 (중간 층) 에는 숫자 크기에 대한 완벽한 '로그arithm 지도'가 그려져 있었습니다.
- 하지만 AI 에게 "100 분과 2 시간이 어느 게 더 길까?"라고 물으면, AI 는 완전히 무작위로 답을 했습니다. (50% 확률)
- 왜 그럴까요? AI 는 숫자 자체의 '크기'를 이해하지 못해서가 아니라, '단위 변환'에 실패했기 때문입니다. "100 분"과 "2 시간"은 같은 크기지만, AI 는 이를 서로 다른 단어로 인식해서 비교를 못 했습니다.
- 반면, 숫자만 비교하는 문제 ("47 과 83 중 무엇이 큰가?") 에서는 AI 가 인간과 비슷한 수준으로 잘 맞췄습니다.
4. 주요 발견 3: "뇌의 어느 부분이 진짜 일을 할까?"
AI 는 숫자를 처리할 때 뇌의 여러 층 (Layer) 을 사용합니다. 연구팀은 AI 의 뇌를 살짝 건드려서 (Causal Intervention) 어떤 층이 진짜로 일을 하는지 확인했습니다.
- 비유: 공장을 생각해보세요.
- 초기 층 (공장의 1 층): 숫자 크기를 실제로 비교하고 계산하는 작업대 역할을 합니다. 여기서 AI 가 "어떤 게 더 큰가?"를 결정합니다.
- 후기 층 (공장의 5 층): 숫자 정보가 아주 아름답게 정리되어 있지만, 장식처럼 보입니다. 이 층은 숫자를 '기억'하거나 '예측'하는 데는 좋지만, 실제 '비교' 작업을 하지는 않습니다.
- 즉, 가장 잘 정리된 정보가 있는 곳 (후기 층) 이 아니라, 초기 층에서 실제 계산이 이루어집니다.
5. 결론: AI 는 '학습'과 '지시'가 다르다
이 연구는 AI 가 숫자를 어떻게 다루는지 두 가지 핵심을 밝혀냈습니다.
- 학습 (Pre-training): AI 는 책과 인터넷 글을 읽는 과정에서 자연스럽게 "작은 숫자는 자주, 큰 숫자는 드물게 나온다"는 통계를 배우고, 이를 효율적으로 저장하기 위해 로그arithm 방식으로 숫자를 압축합니다. 이는 AI 가 스스로 터득한 능력입니다.
- 지시 (Instruction Tuning): 하지만 그 압축된 숫자 정보를 실제로 비교해서 답을 내는 능력은, 사람이 AI 에게 "이걸 비교해봐"라고 **지시 (Instruction)**를 줄 때 비로소 활성화됩니다.
- 어떤 AI(Llama, Qwen) 는 지시를 잘 받아서 숫자 비교를 잘하지만, 어떤 AI(Mistral) 는 지시를 받아도 숫자 비교 기능을 켜지 못했습니다.
요약
이 논문은 **"AI 는 숫자를 인간의 감각과 유사하게 (로그arithm 적으로) 저장하지만, 그걸 실제로 비교해서 답을 내는 능력은 학습 데이터가 아니라 사람이 준 '지시'에 달려있다"**는 것을 증명했습니다.
AI 는 숫자의 '지도'는 가지고 있지만, 그 지도를 보고 길을 찾는 '나침반'은 사람 (지시) 이 만들어줘야 작동한다는 뜻입니다. 이는 AI 가 단순히 데이터를 외우는 게 아니라, 어떻게 정보를 활용하느냐가 중요하다는 중요한 통찰을 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.