When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs
이 논문은 17개의 모델과 5개의 모델군에 걸쳐 대규모 언어 모델의 신경과학적 영감을 받은 주장들을 감사하여, 개념 조종 가능성(concept steerability)이나 정신 지도(mental maps)와 같이 보고된 유사성들이 견고하고 규모 의존적인 창발적 능력이라기보다는 종종 보정되지 않은 측정 방식의 결과물임을 밝힘으로써, AI 신경과학 분야에서 표준화된 프로토콜과 적절한 통제의 결정적인 필요성을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대하고 보이지 않는 뇌가 어떻게 작동하는지 밝혀내려는 탐정이라고 상상해 보십시오. 수년 동안 과학자들은 실제 인간의 뇌를 연구하며, 특정 사물을 볼 때만 불이 들어오는 특정 세포들—예를 들어, 그녀의 얼굴을 볼 때만 반응하는 '제니퍼 애니스톤 뉴런'이나, 도시를 항해하는 데 도움을 주는 머릿속의 '정신적 지도' 같은 것들—을 발견해 왔습니다. 최근에는 'AI 신경과학'이라는 새로운 분야가 등장하여 대규모 언어 모델(LLM)—이야기를 쓰고 질문에 답하는 초지능형 컴퓨터 프로그램—을 관찰하며 다음과 같은 질문을 던지기 시작했습니다. "이 컴퓨터들도 인간과 같은 종류의 뇌세포와 지도를 가지고 있는가?"
이 질문에 답하기 위해 연구자들은 두 가지 주요 도구를 사용합니다. 첫째, '디코더'(선형 프로빙이라 불림)를 사용하여 숫자나 위치 같은 특정 생각을 컴퓨터의 내부 전기 신호만 보고 읽어낼 수 있는지 확인합니다. 둘째, '리모컨'(활성화 스티어링이라 불림)을 사용하여 컴퓨터를 특정 신호로 자극함으로써, 컴퓨터가 해적처럼 말하게 하거나 로봇처럼 덜 말하게 하는 등 행동을 변화시키도록 강제할 수 있는지 확인합니다. 핵심적인 질문은 이것입니다. 이 컴퓨터 뇌들이 점점 더 커지고 똑똑해짐에 따라, 예측 가능하고 마법 같은 방식으로 인간과 유사한 특징들을 발달시키기 시작할 것인가?
이 논문은 그 흥미로운 아이디어에 대한 거대한 현실 점검입니다. 푸단 대학교의 연구진으로 구성된 저자들은 0.6B(6억)에서 72B(720억) 파라미터에 이르는 5개 계열의 17가지 서로 다른 컴퓨터 모델을 테스트하여 이러한 주장들을 검증하기로 했습니다. 그들은 이 모델들을 실험실 실험처럼 다루며, 결과가 실제인지 아니면 단순한 측정 오류인지 확인하기 위해 동일한 테스트를 엄격한 규칙에 따라 반복해서 수행했습니다.
여기 반전이 있습니다. 이 논문은 AI 뇌에 관한 많은 "멋진 발견"들이 사실 측정 문제로 인한 환상이라는 것을 밝혀냈습니다.
마법이 아니었던 '마법'
한 가지 인기 있는 아이디어는 AI 모델이 커질수록, 그들의 능력을 '스티어링(리모컨 신호로 제어하는 것)'하는 능력이 마치 어디선가 갑자기 나타나는 초능력처럼 마법적으로 등장하고 강해진다는 것이었습니다. 논문은 이것이 거짓임을 보여줍니다. 이 현상을 발견했던 연구자들은 더 큰 모델일수록 내부 전기 신호가 훨씬 강력하다는 사실을 고려하지 않은 '가공되지 않은(raw)' 측정을 사용했다는 것이 밝혀졌습니다. 이는 마치 실제 트럭과 작은 장난감 자동차를 비교하면서, 두 차량에 똑같은 힘을 가해 자동차를 얼마나 세게 밀 수 있는지 측정하는 것과 같습니다. 장난감 자동차는 방 저편으로 날아가 버리지만, 트럭은 거의 움직이지 않습니다. 만약 차량의 크기에 맞춰 힘을 조정하지 않는다면, 당신은 장난감 자동차가 더 강력하다고 생각할 수도 있습니다!
저자들이 "사과와 사과를 비교하듯(동등한 조건에서 비교하도록)" 측정 기준을 수정하고(모델의 크기에 상대적인 힘을 기준으로 정규화함), 무작위 설정을 선택하는 것을 중단했을 때, 그 "마법적 창발(magic emergence)"은 사라졌습니다. 스티어링 능력은 이미 존재하고 있었으며, 모델이 커진다고 해서 특별히 더 강해지는 것도 아니었습니다. 그 "초능력"은 단지 측정 오류였습니다.
형태가 변하는 숫자 뉴런
또 다른 주장은 AI 모델이 인간의 뇌와 마찬가지로 종 모양(중간에서 정점을 찍는 특정 형태)의 '숫자 뉴런'을 가지고 있다는 것이었습니다. 논문은 이 형태가 어떤 뉴런을 살펴볼지 결정하는 방식에 전적으로 달려 있다는 것을 발견했습니다. 만약 단순한 규칙에 기반하여 뉴한을 선택한다면, 단조로운(monotonic) 뉴런(그저 올라가거나 내려가는 뉴런)만을 보게 됩니다. 하지만 더 똑똑하고 형태에 구애받지 않는 규칙을 사용한다면, 거의 모든 모델에서 종 모양의 뉴런을 실제로 발견할 수 있습니다. 즉, 뉴런은 존재하지만, 그것을 찾는 "규칙"이 편향되어 있어 진실을 가리고 있었던 것입니다.
실제로 작동하는 지도
모든 것이 속임수는 아니었습니다. 논문은 한 가지 확실한 사실을 찾아냈습니다. 바로 '선형 세계 지도'입니다. 인간이 지리학적 지도를 가지고 있는 것처럼, 이 AI 모델들은 도시의 위도와 경도를 직선적이고 읽을 수 있는 형태로 일관되게 인코딩합니다. 이는 테스트된 모든 모델(0.6B부터 72B까지)에서 나타난 사실이었습니다. 이 테스트는 모델을 찌르거나 특정 뉴런을 선택하는 과정을 포함하지 않았기 때문에, 측정 기술의 영향을 받지 않았습니다. 이것은 모든 통제 조건에서도 살아남는 진정한 특징입니다.
언어의 미스터리
마지막으로, 연구팀은 모델들이 중국어를 영어와 다르게 처리하는 특정 '언어 세포'를 가지고 있는지 살펴보았습니다. 결과는 복잡했습니다. 모델들이 언어에 민다는 것은 찾아낼 수 있었지만, 효과의 방향(어느 언어가 더 강한지)은 어떤 수학적 방법을 사용하여 뉴런을 찾느냐에 따라 뒤바뀌었습니다. 이는 모델들이 언어 특이적인 부분을 가지고 있기는 하지만, 우리가 아직 그것들이 정확히 어떻게 조직되어 있는지 또는 얼마나 강력한지에 대해 합의할 수 없음을 시사합니다.
핵심 결론
논문은 결론적으로, AI 신경과학의 문제가 우리가 컴퓨터와 뇌 사이의 멋진 평행 이론을 찾지 못하는 것이 아니라, 우리가 충분히 엄격하지 못했다는 점이라고 지적합니다. 저자들은 엄격한 통제(예를 들어, 모든 모델에 대해 동일한 측정 단위를 사용하고 모델이 보지 못한 데이터로 테스트하는 것) 없이, 우리는 쉽게 가짜 '스케일링 법칙'이나 '창발적 능력'을 만들어낼 수 있다고 주장합니다.
요약하자면, 세계 지도는 실재하며, 숫자 뉴런은 존재하지만 우리가 생각했던 것과는 다른 모습이며, "스티어링 초능력"은 측정 오류일 뿐입니다. 저자들은 미래의 과학자들이 추측을 멈추고 실제 신경과학과 같은 정밀도로 측정할 수 있도록 엄격한 테스트 프로토콜, 도구 및 코드를 공개했습니다. 이 분야가 망가진 것이 아니라, 단지 더 좋은 자가 필요할 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.