What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model
이 논문은 반복적인 자기 섭식 언어 모델 실험에서 프로브 구축에 내재된 인위적 현상(예: 운동학적 손상 확산)과 진정한 모델의 속성(예: 리아푸노프 지수)을 구별하기 위한 엄격한 테스트를 도입하며, 이전의 상전이 주장이 모델보다는 방법론에 잘못 귀속되었음을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
탐정의 딜레마: 도구가 단서가 될 때
당신이 특정 유형의 자동차 엔진이 어떻게 작동하는지 알아내려고 노력하고 있다고 상상해 보십시오. 엔진을 분해할 수는 없기에, 대신 거대하고 자동화된 테스트 트랙을 만듭니다. 자동차의 배기가스를 다시 흡기구로 계속해서 집어넣으며, 엔진이 자신의 배기가스에 어떻게 반응하는지 관찰합니다. 이것은 현대의 "대규모 언어 모델(LLM)"을 다루는 과학자들이 하는 방식과 매우 비슷합니다. 이러한 AI 시스템은 문장에서 다음 단어를 예측하는 초지능 엔진과 같습니다. 연구자들은 종-종 AI가 스스로의 실수를 바로잡거나, 더 깊게 생각하거나, 어려운 문제를 해결할 수 있는지 확인하기 위해 AI의 출력값을 다시 자기 자신에게 입력합니다. 이를 "자기 피드백(self-feeding)" 또는 "반복적 프로빙(iterated probing)"이라고 부릅니다.
하지만 여기에 까다로운 문제가 있습니다. 테스트 트랙을 만들면, 그 트랙 자체에도 규칙이 존재합니다. 예를 들어 트랙이 너무 울퉁불퉁하거나, 바람이 특정 방향으로 불어 차를 흔들리게 할 수도 있습니다. 만약 차가 흔들리는 것을 보았다면, 그것은 엔진이 고장 났기 때문일까요, 아니면 트랙이 울퉁불퉁하기 때문일까요? AI의 세계에서 과학자들은 AI의 '두뇌'에 대해 알려주는 수치라고 가정하며 "AI의 생각이 얼마나 빨리 변하는지" 또는 "답변이 얼마나 안정적인지"와 같은 것들을 측정해 왔습니다. 이 논문은 아주 단순하면서도 무서운 질문을 던집니다. 만약 그 숫자들은 AI에 대한 것이 아니라, 우리가 만든 테스트 트랙에 대한 것을 말해주고 있는 것이라면 어떡할 것인가?
거대한 혼동: AI의 문제인가, 실험의 문제인가?
이 논문에서 연구자 니콜라스 베라 주니가(Nicolás Vera Zúñiga)는 이를 알아내기 위해 매우 구체적이고 약간은 기묘한 실험을 설정합니다. 4096개의 구슬로 이루어진 거대한 원형 목걸이를 상상해 보십시오. 각 구슬은 AI의 어휘 사전에서 가져온 단어(또는 토큰)입니다. AI는 특정 지점 주변의 작은 구슬 창을 보고, 그 구슬이 무엇이 되어야 하는지 추측한 다음, 현재의 구슬을 새로운 추측값으로 교체합니다. AI는 목걸이의 모든 구슬에 대해 이 과정을 반복하며 자신의 이야기를 계속해서 다시 써 내려갑니다. 이는 폐쇄된 루프를 형성하며, AI는 이전의 추측을 바탕으로 끊임없이 자신의 이야기를 재구성합니다.
이를 테스트하기 위해 연구자는 두 개의 동일한 목걸이를 만듭니다. 두 번째 목걸이에서는 시작 단계에서 단 하나의 구슬만 바꿉니다. 그런 다음, 스왑(swap)을 결정하는 데 동일한 난수를 사용하여 두 목걸이를 정확히 똑같은 시뮬레이션에 통과시킵니다. 만약 AI의 "두뇌"가 민감하다면, 이 단 하나의 바뀐 구절이 파급 효과를 일으켜 두 목걸이를 시간이 지남에 따라 점점 더 다르게 만들 것입니다. 이를 "손상 확산(damage spreading)"이라고 합니다. 연구자는 이 손상이 퍼지는 속도()와 그 손상이 얼마나 살아남는지를 측정합니다.
거대한 반전: 존재하지 않았던 "상전이"
연구자는 충격적인 사실을 발견했습니다. 매우 낮은 "온도"(즉, AI가 매우 확신을 가지고 가장 가능성 높은 단어만을 선택하도록 강제되는 상태)에서 실험을 진행했을 때, 시스템이 갑자기 붕괴되었습니다. 목걸이는 변화를 멈추고 하나의 반복되는 단어(예: "줄바꿈"에 갇힌 고장 난 레코드판처럼)로 얼어붙었습니다. 이것은 물이 순식간에 얼음으로 변하는 것과 유사한 극적인 "상전이(phase transition)"처럼 보였습니다.
연구자는 이 전이를 소수점 세 자리까지 극도로 정밀하게 측정했습니다. 마치 AI의 행동에 대한 새로운 발견인 것처럼 보였습니다. 하지만, 이 논문은 이 전이가 AI가 아닌 실험의 결과임을 증명합니다.
그들이 알게 된 방법은 다음과 같습니다:
- 대조 테스트: 그들은 구조가 다른 다른 유형의 AI 모델("마스크드 언어 모델")로 똑같은 실험을 수행했습니다. 이 두 번째 모델은 동일한 낮은 온도에서도 결코 얼어붙지 않았습니다.
- 메커니즘: 그들은 이 결빙 현상이 첫 번째 AI 모델이 단어를 선택하는 방식에 있는 특정한 수학적 "함정" 때문에 발생한다는 것을 깨달았습니다. 이는 마치 공이 깊은 구멍 속으로 굴러떨어지는 것과 같습니다. 일단 빠지면 나올 수 없습니다. 이 구멍은 AI가 특별해서가 아니라, 실험의 규칙(AI가 구슬을 업데이트하는 특정한 방식) 때문에 존재하는 것입니다.
- 결론: 이 "상전이"는 "제조된" 사건이었습니다. 그것은 자동차가 아니라 테스트 트랙의 속성이었습니다. 연구자는 자신이 AI 물리학의 새로운 법칙을 발견했다고 생각하며 4개월을 보냈으나, 결국 자신이 들고 있는 측정 도구의 특이점을 발견했을 뿐이라는 사실을 깨달았다고 인정합니다.
그렇다면 실험은 무엇을 측정하는가?
만약 "상전이"가 가짜라면, 이 실험은 정말 아무것도 알려주지 못하는 걸까요? 아닙니다. 다만 무엇을 보느냐에 대해 매우 주의해야 합니다. 이 논문은 노이즈와 신호를 구분하기 위해 "판별 테스트(Discriminator Test)"를 도입합니다.
- "구조적" 측정값 (노이즈): 손상이 퍼지는 속도()와 같은 일부 수치는 테스트의 기하학적 구조에 의해 결정됩니다. 창(window)의 크기나 구슬의 순서를 바꾸면 이 수치들은 변합니다. AI 모델을 바꾸더라도 이 수치들은 거의 일정하게 유지됩니다. 이러한 측정값은 AI가 아니라 실험에 대해 말해줍니다.
- "모델" 측정값 (신호): "어트랙터 공유(attractor share)"(AI가 특정 단어 하나에 얼마나 안착하는지)와 같은 다른 수치들은 AI 모델을 바꿀 때 실제로 변합니다. 모델을 더 오래 학습시키면 이 수치가 움직입니다. 다른 AI 아키텍처로 교체하면 이 수치가 움직입니다. 이것이 바로 AI의 두뇌에 대해 실제로 알려주는 부분입니다.
"함정"과 철회된 주장들
이 논문은 통계에 속아 넘어가기가 얼마나 쉬운지에 대한 경고이기도 합니다. 연구자는 수학을 제대로 확인하지 않아 잘못된 "발견"을 발표할 뻔했던 네 가지 사례를 나열합니다.
- 한 번은 유효하기에는 너무 작은 설정에서 "임계점"을 측정했습니다.
- 실수로 서로 다른 부분에 동일한 난수를 사용하여 결과가 실제보다 더 확실해 보이게 만들었습니다.
- 실제로는 평탄한 선(분산이 0인 데이터)인 데이터에서 패턴을 찾으려 했고, 이로 인해 상관관계가 실제가 아닌 데이터 정렬 방식의 우연에 의한 것임에도 불구하고 실제처럼 보이게 만들었습니다.
매번, 그들은 동료 검토(peer review)가 아니라, "이미 답을 알고 있는" 테스트(결과가 이미 알려진 시뮬레이션 등)를 실행하여 자신들의 도구가 틀린 답을 내놓는 것을 확인함으로써 실수를 잡아냈습니다.
핵심 요약
이 논문은 우리에게 새로운 초능력을 주는 것이 아닙니다. 대신, 우리에게 새로운 안경을 제공합니다. 우리가 AI에게 자신의 출력값을 다시 입력할 때, 우리는 AI의 실제 지능과 실험의 인위적인 규칙을 혼합하고 있다는 점을 가르쳐줍니다.
주요 교훈은 단순히 숫자를 보고 그것이 AI에 대해 말해준다고 가정해서는 안 된다는 것입니다. 우리는 "통제와 변수"의 게임을 해야 합니다. 만약 AI를 바꿨는데도 숫자가 그대로라면, 그 숫자는 실험에 관한 것입니다. 만약 실험을 바꿨는데도 숫자가 그대로라면, 그 숫자는 AI에 관한 것입니다. 이 논문은 이 분야의 가장 흥격한 "발견" 중 일부가 우리가 바라보고 있는 얼굴이 아니라, 우리가 들고 있는 거울에 비친 모습일 수 있음을 증명합니다. 이는 과학자들에게 겸손할 것, 도구를 확인할 것, 그리고 때때로 우리가 발견하는 가장 흥미로운 것이 자신의 측정 테이프에 있는 결함일 수 있음을 깨달으라는 촉구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.