← 최신 논문
💬 NLP

Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models

본 논문은 3 가지 아키텍처의 3 개 대형 언어 모델에서 심리물리학 도구를 적용한 결과, 학습 데이터 통계가 로그 압축적 기하학을 생성하지만 이러한 기하학적 구조가 반드시 인간과 유사한 행동적 능력이나 인과적 처리를 보장하지는 않음을 규명했습니다.

원저자: Jon-Paul Cacioli

게시일 2026-03-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jon-Paul Cacioli

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 "AI(특히 대형 언어 모델) 가 숫자나 시간, 거리 같은 '크기'를 어떻게 머릿속에 저장하고 있는지" 에 대한 흥미로운 비밀을 밝혀낸 연구입니다.

마치 AI 의 뇌를 해부하여 '숫자 감각'이 어디에, 어떻게 숨어있는지 찾아낸 탐정 이야기라고 생각하시면 됩니다.

이 연구의 핵심 내용을 쉬운 비유와 함께 설명해 드릴게요.


1. 연구의 배경: AI 는 숫자를 어떻게 기억할까?

최근 연구자들 사이에서 "AI 는 숫자를 선형적으로(1, 2, 3... 이렇게 균일하게) 기억할까, 아니면 로그arithm 적으로(1, 10, 100... 이렇게 압축해서) 기억할까?"라는 논쟁이 있었습니다. 어떤 사람은 "균일하게 저장한다"고 하고, 어떤 사람은 "압축해서 저장한다"고 했습니다.

이 연구팀은 "심리물리학 (Psychophysics)" 이라는 인간의 감각을 연구하는 고전적인 도구를 가져와서 이 논쟁을 해결했습니다. 심리물리학은 "사람이 100 원과 200 원의 차이를 느끼는 것과, 1000 원과 1100 원의 차이를 느끼는 것이 어떻게 다른지"를 연구하는 학문입니다.

2. 주요 발견 1: AI 의 뇌는 '로그arithm'으로 숫자를 압축한다

연구팀은 Llama, Mistral, Qwen 등 세 가지 다른 AI 모델을 분석했습니다. 결과는 놀라웠습니다.

  • 비유: AI 가 숫자를 기억하는 방식은 지진계와 비슷합니다.
    • 작은 진동 (1, 2, 3) 은 아주 세밀하게 감지하지만, 큰 진동 (1000, 10000) 은 거대한 간격으로 압축해서 저장합니다.
    • 마치 지도를 생각해보세요. 서울의 골목길은 아주 자세히 그려져 있지만, 전 세계 지도에서는 한국 전체가 한 점처럼 작게 그려집니다.
    • AI 도 숫자가 커질수록 그 간격을 좁혀서 저장합니다. 이는 AI 가 학습한 텍스트 데이터의 통계적 특징(작은 숫자가 훨씬 자주 등장함) 을 그대로 반영한 결과로, AI 가 스스로 효율적으로 정보를 압축하는 방식을 터득했다는 뜻입니다.

3. 주요 발견 2: "머리에는 있는데, 입으로는 못 말해" (가장 중요한 발견!)

이 연구의 가장 충격적인 사실은 AI 가 숫자를 '아는데', 그걸 '사용'하지 못한다는 점입니다.

  • 비유: 완벽한 지도를 가지고 있지만 길 찾기를 못하는 나침반을 상상해보세요.
    • AI 의 뇌 깊은 곳 (중간 층) 에는 숫자 크기에 대한 완벽한 '로그arithm 지도'가 그려져 있었습니다.
    • 하지만 AI 에게 "100 분과 2 시간이 어느 게 더 길까?"라고 물으면, AI 는 완전히 무작위로 답을 했습니다. (50% 확률)
    • 왜 그럴까요? AI 는 숫자 자체의 '크기'를 이해하지 못해서가 아니라, '단위 변환'에 실패했기 때문입니다. "100 분"과 "2 시간"은 같은 크기지만, AI 는 이를 서로 다른 단어로 인식해서 비교를 못 했습니다.
    • 반면, 숫자만 비교하는 문제 ("47 과 83 중 무엇이 큰가?") 에서는 AI 가 인간과 비슷한 수준으로 잘 맞췄습니다.

4. 주요 발견 3: "뇌의 어느 부분이 진짜 일을 할까?"

AI 는 숫자를 처리할 때 뇌의 여러 층 (Layer) 을 사용합니다. 연구팀은 AI 의 뇌를 살짝 건드려서 (Causal Intervention) 어떤 층이 진짜로 일을 하는지 확인했습니다.

  • 비유: 공장을 생각해보세요.
    • 초기 층 (공장의 1 층): 숫자 크기를 실제로 비교하고 계산하는 작업대 역할을 합니다. 여기서 AI 가 "어떤 게 더 큰가?"를 결정합니다.
    • 후기 층 (공장의 5 층): 숫자 정보가 아주 아름답게 정리되어 있지만, 장식처럼 보입니다. 이 층은 숫자를 '기억'하거나 '예측'하는 데는 좋지만, 실제 '비교' 작업을 하지는 않습니다.
    • 즉, 가장 잘 정리된 정보가 있는 곳 (후기 층) 이 아니라, 초기 층에서 실제 계산이 이루어집니다.

5. 결론: AI 는 '학습'과 '지시'가 다르다

이 연구는 AI 가 숫자를 어떻게 다루는지 두 가지 핵심을 밝혀냈습니다.

  1. 학습 (Pre-training): AI 는 책과 인터넷 글을 읽는 과정에서 자연스럽게 "작은 숫자는 자주, 큰 숫자는 드물게 나온다"는 통계를 배우고, 이를 효율적으로 저장하기 위해 로그arithm 방식으로 숫자를 압축합니다. 이는 AI 가 스스로 터득한 능력입니다.
  2. 지시 (Instruction Tuning): 하지만 그 압축된 숫자 정보를 실제로 비교해서 답을 내는 능력은, 사람이 AI 에게 "이걸 비교해봐"라고 **지시 (Instruction)**를 줄 때 비로소 활성화됩니다.
    • 어떤 AI(Llama, Qwen) 는 지시를 잘 받아서 숫자 비교를 잘하지만, 어떤 AI(Mistral) 는 지시를 받아도 숫자 비교 기능을 켜지 못했습니다.

요약

이 논문은 **"AI 는 숫자를 인간의 감각과 유사하게 (로그arithm 적으로) 저장하지만, 그걸 실제로 비교해서 답을 내는 능력은 학습 데이터가 아니라 사람이 준 '지시'에 달려있다"**는 것을 증명했습니다.

AI 는 숫자의 '지도'는 가지고 있지만, 그 지도를 보고 길을 찾는 '나침반'은 사람 (지시) 이 만들어줘야 작동한다는 뜻입니다. 이는 AI 가 단순히 데이터를 외우는 게 아니라, 어떻게 정보를 활용하느냐가 중요하다는 중요한 통찰을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →