Testing History Dependence Between In-Context and In-Weights Learning
본 연구는 훈련 순서(서로 다른 방향에서 균형 잡힌 혼합물에 접근하는 것)가 인컨텍스트 학습 메커니즘과 가중치 내 학습 메커니즘의 강도 사이에 일시적이고 측정 가능한 차이를 생성하지만, 소규모 트랜스포머에서 지속적인 이력 현상이나 근본적으로 다른 인과적 회로 구성을 초래하지는 않는다는 점을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 농담을 가르치는 법을 가르치고 있다고 상상해 보세요. 당신은 두 가지 방식으로 로봇을 가르칠 수 있습니다. 첫째, 로봇이 말하기 직전에 몇 가지 예시를 보여주는 것입니다. 마치 테이블 위에 놓인 참고서와 같습니다. 로봇은 이 참고서를 읽고 지금 당장 보이는 것에 기반하여 농담의 핵심(punchline)을 파악합니다. 이것을 **인컨텍스트 러닝(In-Context Learning)**이라고 합니다. 이는 로봇가 임기응변으로 생각하는 것과 같습니다. 둘째, 로봇이 참고서 없이도 농담을 완벽하게 기억할 수 있도록 몇 시간 동안 연습시키는 것입니다. 이제 농담들은 로봇의 뇌에 단단히 박혔습니다. 이것이 **인웨이트 러닝(In-Weights Learning)**입니다.
오랫동안 과학자들은 의문을 품었습니다. 만약 로봇에게 정확히 동일한 양의 참고서와 연습량을 제공한다면, 로봇은 항상 똑같은 방식으로 문제를 해결할까요? 아니면 어떻게 그 지점에 도달했느냐가 중요할까요? 로봇이 먼저 암기한 뒤에 참고서를 읽는 법을 배웠을까요, 아니면 참고서를 먼저 읽은 뒤에 암기하는 법을 배웠을까요? 이 질문은 **이력 의존성(history dependence)**에 관한 것입니다. 물리학의 세계에서 이것은 자석이 끌어당겨진 방향을 기억하여, 힘을 멈춘 후에도 그 흔적을 남기는 히스테리시스(hysteresis) 현상과 유사합니다. 만약 AI 모델이 이런 특성을 가지고 있다면, 모델의 현재 상태는 단순히 지금 무엇을 보고 있느냐가 아니라, 그것이 걸어온 경로에 의해서도 결정됩니다. 이는 만약 AI 모델이 이와 같다면, 우리가 현재의 데이터만 보고는 모델의 행동을 예측할 수 없으며, 모델의 전체 훈련 이력을 알아야 한다는 것을 의미합니다.
이 논문은 작고 통제된 로봇(작은 AI 모델)을 가져와서, 이 로봇이 이러한 종류의 "경로 기억"을 가지고 있는지 확인하기 위해 특정 테스트를 수행합니다. 연구진은 로봇이 비밀 코드를 맞히는 게임을 설정했습니다. 때때로 코드는 현재 문장에 주어진 단서(참고서)에 의존하고, 때때로는 로봇이 오래전에 배운 규칙(단단히 박힌 기억)에 의존합니다. 연구진은 동일한 지점에 도달하도록 설계된 두 개의 똑같은 복제 로봇을 훈련시켰지만, 서로 다른 경로를 통해 그 지점에 도달하게 했습니다. 한 복제 로봇은 단단히 박힌 규칙에 집중하며 시작하여 서서히 참고서를 활용하는 쪽으로 옮겨갔습니다. 다른 복제 로봇은 참고서를 먼저 활용하며 시작하여 서서히 단단히 박힌 규칙을 활용하는 쪽으로 옮겨갔습니다.
연구진은 두 로봇이 정확히 같은 지점에 도착했을 때, 똑같이 행동하지 않는다는 것을 발견했습니다. "단단히 박힌 규칙" 쪽에서 온 로봇은 "참고서" 쪽에서 온 로봇보다 참고서를 사용할 확률이 약간 더 높았습니다. 마치 규칙에서 시작한 로봇이, 비록 지금은 다른 단서들을 보고 있음에도 불구하고 여전히 그 사고방식에 약간 "갇혀" 있는 것 같았습니다. 이 차이는 실제적이고 측정 가능했습니다. 두 로봇의 행동 차이는 특정 척도에서 약 0.098점이었습니다. 그리고 이 현상은 다섯 가지의 서로 다른 훈련 실험 모두에서 나타났습니다.
하지만 이 경로의 기억은 매우 일시적이었습니다. 연구진은 로봇을 해당 지점에서 조금 더 계속 훈련시켰습니다. 단 25단계의 훈련만으로도 차이가 뒤집히기 시작하더니 사라졌습니다. 100단계가 되었을 때, 두 로봇은 거의 동일하게 행동했습니다. 그들이 걸어온 경로의 "유령"은 사라진 것입니다.
왜 이런 일이 일어났는지 이해하기 위해, 과학자들은 로봇의 뇌 내부를 들여다보았습니다. 그들은 두 로봇 모두 문제를 해결하기 위해 정확히 같은 내부 부품을 사용하고 있다는 것을 발견했습니다. 그들은 다른 "회로"나 새로운 사고방식으로 전환한 것이 아니었습니다. 대신, "단단히 박힌 규칙" 쪽에서 온 로봇은 단지 참고서를 읽는 뇌의 부위의 볼륨을 약간 더 높였을 뿐이었습니다. 이는 영구적인 배선 변화가 아니라, 일시적인 볼륨 조절이었습니다.
따라서 이 논문은 AI 모델이 특정 지점에 도달하는 과정을 잠시 기억할 수는 있지만, 이것이 모델을 영원히 다른 상태에 갇히게 만드는 영구적인 "히스테리시스" 루프는 아니라고 제안합니다. 그것은 일시적인 지연, 즉 모델이 학습을 계속함에 따라 진정되는 빠른 오버슈트(overshoot)와 같습니다. 이 연구는 AI의 행동을 진정으로 이해하려면 즉각적인 이력을 보아야 하지만, 어떻게 훈련되었는지 때문에 모델이 이상한 상태에 영원히 갇혀 있을 것이라고 걱정할 필요는 없다는 것을 보여줍니다. 모델은 결국 따라잡고, 경로를 잊은 채 목적지에만 집중하게 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.