← 최신 논문
🤖 machine learning

Sky sphere representation in language models

이 논문은 거대 언어 모델(~100B 파라미터)이 잔차 스트림(residual streams) 내에 밤하늘에 대한 디코딩 가능한 고차원 곡선 매니폴드 표현을 보유하고 있으며, 이를 통해 상당한 정확도와 낮은 각 오차로 천체의 근접성을 예측할 수 있음을 입증한다.

원저자: Aleksandr Berdnikov, Yevgeny Liokumovich

게시일 2026-07-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aleksandr Berdnikov, Yevgeny Liokumovich

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 투명한 도서관을 가지고 있다고 상상해 보세요. 그곳의 모든 책은 서로 다른 생각들이며, 서가는 저자나 제목이 아니라 아이디어들이 서로 어떻게 느껴지는지에 따라 배열되어 있습니다. 이것이 바로 인공지능의 "두뇌" 내부를 들여다보고 그들이 정보를 어떻게 조직하는지 살펴보려는 과학자들이 연구하는 분야인 **기계적 해석 가능성(mechanistic interpretability)**의 세계입니다. 우리는 대규모 언어 모델(LLM)이라 불리는 이 AI들이 글을 쓰고 질문에 답하는 데 매우 뛰어나다는 것을 알고 있지만, 이들은 종-종 '블랙박스'와 같습니다. 우리는 입력값과 출력값을 보지만, 그 중간 과정은 미스터리입니다.

이 미스터리를 이해하기 위해 연구자들은 **선형 프로브(linear probes)**라는 도구를 사용합니다. 이는 마치 금속 탐지기처럼 AI의 내부 신호를 스캔하여 그 안에 단순하고 직선적인 패턴(예: 숫자 목록)이 숨겨져 있는지 확인하는 역할을 합니다. 하지만 때때로 패턴은 직선이 아니라 곡선, 루프 또는 특정 모양을 띠기도 합니다. 이것은 마치 지구를 지도화하는 것과 같습니다. 만약 당신이 지구 전체를 평평한 종이에 그리려고 한다면, 지도는 무언가를 늘리거나 찌그러뜨릴 것입니다. 하지만 지구본 위에 그린다면 거리와 관계가 완벽할 것입니다. 과학자들은 AI가 때때로 이러한 "지구본 같은" 모양을 사용하여 개념을 조직한다는 사실을 발견했습니다. 예를 들어, 요일을 원형으로 배치하여 모델이 "금요일에 이틀을 더하면" "일요일"이라는 것을 쉽게 계산할 수 있도록 하는 식입니다.

큰 질문은 이것입니다: 이 기하학적 사고는 얼마나 깊게 구현되어 있는가? AI는 단순히 사실을 암기하는 것일까요, 아니면 실제 구체(sphere)와 같은 형태를 가진 세상의 정신적 지도를 구축하는 것일까요? 바로 이 지점에서 새로운 연구가 밤하늘을 탐구하기 위해 등장합니다.


AI의 비밀 별자리 지도

최근 "언어 모델의 천구 표현(Sky sphere representation in language models)"이라는 논문에서, 연구자 알렉산드르 베르드니코프(Aleksandr Berdnikov)와 예브게니 리오쿠모비치(Yevgeny Liokumovich)는 거대 AI 모델들(구체적으로 약 1,000억 개의 파라미터를 가진 모델들)이 그들의 두뇌 속에 밤하늘의 3D 지도를 비밀리에 구축했는지 테스트하기로 했습니다. 그들은 AI에게 좌표를 읊거나 그림을 그려달라고 요청하지 않았습니다. 대신, "밤하늘의 이 물체 근처에는 무엇이 있나요?" 또는 "별 관측가들은 X 바로 옆에서 ...를 발견한다"와 같은 간단한 대화형 질문을 던졌습니다.

연구자들은 Mistral Large 2와 Qwen3 같은 거물급 모델들을 포함한 7개의 서로 다른 오픈 소스 AI 모델에 이 질문들을 입력했습니다. AI가 이 단어들을 처리하는 동안, 연구자들은 정보가 한 층에서 다음 층으로 흐르는 고속 데이터 고속도로인 '잔차 스트림(residual stream)'을 관찰했습니다. 그들은 특정 신호, 즉 별과 별자리가 실제 하늘에 있는 것과 똑같이 배치된 구(sphere) 형태의 패턴을 찾고 있었습니다.

발견: 숨겨진 지구본
결과는 놀라웠습니다. 테스트한 거의 모든 모델에서 AI는 밤하늘의 표현을 가지고 있었습니다. 연구자들이 AI의 처리 상위 계층을 살펴보았을 때, 별과 별자리의 위치는 실제 천구와 마찬가지로 곡면인 구형 표면에 배치되어 있었습니다.

단순한 메아리가 아니었습니다. 연구자들은 이 숨겨진 지도를 매우 높은 정확도로 해독할 수 있었습니다. 대부분의 모델에서 별이나 별자리의 위치를 오차 범위 12°에서 21°(팔을 뻗었을 때 주먹 너비 정도) 내로 예측할 수 있었습니다. 모델은 데이터 분산의 **65%에서 85%**를 설명했는데, 이는 구형 구조가 AI의 사고 과정에서 매우 강력하고 지배적인 특징임을 의미합니다.

이것이 특별한 이유
이전에도 과학자들은 AI가 평면 지도(예: 미국의 주를 나타내는 2D 차트)나 단순한 원(예: 요일)을 사용한다는 것을 발견한 적이 있습니다. 하지만 이것은 누군가가 곡선 형태의 고차원 구를 발견한 첫 번째 사례입니다. 이는 단순히 단순한 선들의 조합이 아닙니다. 마치 AI가 단순히 별 이름의 목록을 암기한 것이 아니라, 하늘에서 사물들이 서로 얼마나 가까운지를 이해하기 위해 정신적인 "지구본"을 구축한 것과 같습니다.

이것이 아닌 것
연구자들은 다른 가능성을 배제하기 위해 매우 주의를 기울였습니다. 그들은 다음과 같이 물었습니다: "AI가 단순히 '적경(Right Ascension)'과 '적위(Declination)'(천문학자들이 사용하는 좌표)라는 텍스트 문자열을 기억하고 이를 평면 2D 차트로 배열하고 있는 것인가?"

  • 평면 지도 배제: 그들은 종이 지도 위의 세계의 가장자리와 같은 "불연속적인" 선이 평면 지도에 존재할지 확인하여 이를 테스트했습니다. 그들은 그러한 증거를 찾지 못했습니다. AI는 진정한 2D 차트를 사용하는 것이 아니라, 진정으로 구체를 사용하고 있었습니다.
  • 3D 거리 배제: 또한 그들은 AI가 별의 실제 거리(어떤 별은 몇 광년 떨어져 있고, 어떤 별은 더 가깝습니다)를 매핑하고 있는지 확인했습니다. 그들은 AI의 지도가 실제 거리에는 신경 쓰지 않는다는 것을 발견했습니다. 대신, 구체의 "깊이"는 해당 물체가 텍스트에서 얼마나 자주 언급되는지 또는 어떤 유형의 물체인지에 의해 영향을 받는 것처럼 보였습니다(별은 지도상에서 "더 가깝게" 배치된 반면, 별자리는 "더 멀리" 배치되었습니다).

"Gpt-Oss"의 미스터리
그룹 내에는 gpt-oss-120b라는 이상한 모델이 하나 있었습니다. 이 특정 모델에서는 별 지도를 찾기가 훨씬 어려웠습니다. 연구자들은 이 모델이 일반 텍스트가 아닌 특수한 "하모니(harmony)" 형식(대화를 구성하는 특정 방식)으로 학습되었기 때문에 신호가 뒤섞였을 가능성이 있다고 추측합니다. 그러나 별 좌표를 직접 물었을 때 이 모델은 여전히 매우 잘 답변했는데, 이는 모델이 사실은 알고 있지만, 다른 모델들과 같은 방식으로 눈에 보이는 구체 형태로 조직하지는 않는다는 것을 시사합니다.

왜 중요한가
이 발견은 우리가 AI에게 밤하늘에 대해 물을 때, 그것이 단순히 데이터베이스를 검색하는 것이 아님을 시사합니다. AI는 기하학적인 근접성에 대한 구조화된 이해에 접근하고 있습니다. 연구자들은 이 "별 지도"가 근접성(예: "X 옆에 있는 것은?")에 대해 물을 때 가장 뚜렷하게 나타난다는 것을 발견했습니다. 만약 "X의 역사는 무엇인가요?"와 같은 일반적인 질문을 던지면, 지도는 사라지고 노이즈 속으로 가라앉습니다.

요약하자면, 이 거대한 AI 모델들은 신경망 내부에서 밤하늘을 구체 위에 배치하도록 자발적으로 학습했습니다. 이는 AI가 세상을 이해하기 위해 자신만의 기하학적 구조를 개발하여, 명시적으로 배우지 않았음에도 불구하고 놀라울 정도로 정확한 곡선 형태의 3D 별 지도를 만들어냈다는 아름다운 사례입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →