Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
본 연구는 단일 훈련 예시가 빠르게 학습되어 모델의 즉각적인 예측에 측정 가능한 영향을 미치기는 하지만, 그 구체적인 기여도는 사전 학습 과정 전반에 걸쳐 완전히 감쇄되어, 서로 다른 무작위 시드로 인해 발생하는 자연스러운 변동성을 제외하고는 최종 모델의 손실, 가중치 또는 기하학적 구조에 탐지 가능한 장기적 영향을 남기지 않는다는 점을 경험적으로 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이라는 광활한 풍경 속에서, 연구자들은 방대한 텍스트 라이브러리를 학습시켜 언어 모델이라 불리는 거대한 컴퓨터 프로그램을 구축합니다. 이 프로그램들은 수십억 개의 문장을 읽으며 학습하며, 시퀀스 내의 다음 단어를 예측하기 위해 내부 설정을 조금씩 조정합니다. 수년 동안 과학자들은 단 하나의 문장이나 특정 사실이 모델의 최종 지능에 정확히 어느 정도 기여하는지 알고 싶어 했습니다. 이는 원인과 결과의 문제입니다. 만약 학습 라이브러리에서 아주 작은 데이터 한 조각을 제거한다면, 완성된 모델은 변할까요? 이에 답하는 것은 매우 어렵습니다. 왜냐하면 이를 알아내는 표준적인 방법은 모든 다른 세부 사항을 동일하게 유지하면서, 해당 문장이 있는 버전과 없는 버전으로 모델을 처음부터 두 번 학습시켜야 하기 때문입니다. 이러한 모델을 학습시키는 데는 엄청난 시간과 비용이 들기 때문에, 연구자들은 직접 측정하기보다는 수학적 지름길을 이용해 답을 추측하는 데 의존하곤 합니다.
한 연구팀은 추측을 멈추고 측정을 시작하기로 했습니다. 그들은 언어 모델의 학습 과정 중에 특정 텍스트 하나가 삽입되었을 때 어떤 일이 일어나는지 보기 위해 정밀한 실험을 설계했습니다. 그들은 모두 동일한 무작위 시작점에서 출발하는 32개의 별도 모델을 구축했습니다. 그들은 각 모델을 방대한 인터넷 텍스트 컬렉션으로 학습시켰지만, 과정 초기에 특정 시점에서 개입했습니다. 24개의 모델에 대해서는, 학습 데이터에 있는 실제 인물에 관한 잘 쓰인 한 단락을 새로운 194단어 분량의 구절로 교체했습니다. 이 작업은 세 가지 방식으로 수행되었습니다. 한 그룹은 실제 학습 데이터에 등장하는 실존 인물에 관한 잘 쓰인 단락을 받았고, 다른 그룹은 데이터에 등장하지 않는 가공의 인물에 관한 잘 쓰인 단락을 받았으며, 세 번째 그룹은 무작위 키보드 문자열을 받았습니다. 나머지 8개의 모델은 교체 없이 그대로 두어, 완벽한 쌍둥이 모델과 비교할 수 있도록 대조군 역할을 하게 했습니다.
연구진은 모델의 내부 구조에서 나타나는 특정한 종류의 변화를 찾고 있었습니다. 그들은 단 하나의 문장이 모델의 '기억'에 영구적인 흔적을 남기는지 확인하고 싶었습니다. 그들은 주입된 이후 수천 단계 동안 학습이 계속되는 동안 모델을 추적했습니다. 결과는 학습과 망각의 매혹적인 패턴을 보여주었습니다. 모델이 새로운 구절을 본 지 불과 50단계 만에, 모델은 그 구절을 보지 못한 모델들보다 해당 구절의 단어들을 유의미하게 더 잘 예측할 수 있었습니다. 이는 모델이 단 한 번의 노출만으로도 실제로 그 정보를 학습했음을 입증했습니다. 그러나 학습이 계속됨에 따라, 이 이점은 점차 사라졌습니다. 모델이 학습을 마칠 때쯤에는 특정 구절을 예측하는 능력이 사라졌으며, 텍스트를 본 모델들과 그렇지 않은 모델들 사이의 차이를 구분할 수 없게 되었습니다.
연구진이 모델의 최종 상태를 살펴보았을 때, 단 하나의 문장이 모델의 근본적인 행동이나 일반적인 언어 이해 능력에는 변화를 주지 않았음을 발견했습니다. 그들은 텍스트를 본 모델들과 그 쌍둥이 모델들 사이의 내부 설정값 간의 거리를 측정했는데, 모델의 내부 설정이 약간 이동하기는 했으나 새로운 영역으로 넘어가지는 않았습니다. 그들은 여전히 동일한 '분지(basin)' 안에 머물러 있었으며, 이는 기능적으로 동일하다는 것을 의미합니다. 또한 연구진은 해당 구절이 실존 인물에 관한 것인지 가공의 인물에 관한 것인지가 차이를 만드는지 테스트했습니다. 그들은 실재적 사실과 허구적 이야기 사이에 측정 가능한 차이가 없음을 발견했습니다. 모델은 두 가지 이야기를 똑같이 취급했습니다. 심지어 더 큰 초기 교란을 일으켰던 무작위 문자열조차 결국 다른 모델들과 기능적으로 동일한 상태로 수렴했습니다.
이 연구는 모델의 내부 수치가 변하는 방식과 실제 행동이 변하는 방식 사이의 결정적인 차이를 강조합니다. 연구진은 단 하나의 문장이 모델의 내부 좌표를 눈에 띄게 변화시켜(두 개의 완전히 다른 모델이 서로에게서 이동할 수 있는 거리의 약 44%만큼 이동함), 모델의 내부 설정에는 상당한 변화를 일으켰지만, 모델의 기능적 성능에는 거의 변화를 주지 않았다는 것을 발견했습니다. 새로운 미학습 텍스트에 대한 다음 단어 예측 능력은 변하지 않았습니다. 이는 모델의 내부 설정이 유연하다는 것을 시사합니다. 즉, 최종 출력값을 바꾸지 않고도 내부 설정은 크게 변할 수 있습니다. 또한 이 실험은 측정의 타이밍이 매우 중요하다는 것을 드러냈습니다. 모델이 사실을 학습한 직후에 확인하면 강한 효과가 나타납니다. 하지만 학습이 완료될 때까지 기다리면 그 효과는 쇠퇴합니다. 연구진은 단일 사례의 경우, 모델이 그것을 학습하고, 사용하고, 그 후에는 그것을 놓아버림으로써 최종 생성물을 그 고립된 데이터에 의해 거의 변하지 않은 상태로 남겨둔다고 결 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.