← 최신 논문
💬 NLP

How Do Large Language Models Learn Concepts During Continual Pre-Training?

이 논문은 대규모 언어 모델의 내부 개념 회로를 분석함으로써 지속적 사전 학습 과정에서 모델이 개념을 어떻게 습득, 유지 및 망각하는지를 조사하며, 이를 통해 망각을 완화하기 위한 새로운 회로 인식 훈련 전략의 동기가 되는 뚜렷한 시간적 학습 패턴, 간섭 효과 및 전이 역학을 밝혀낸다.

원저자: Barry Menglong Yao (UC Davis), Sha Li (Virginia Tech), Yunzhi Yao (UCLA), Minqian Liu (Virginia Tech), Zaishuo Xia (UC Davis), Qifan Wang (Meta AI), Lifu Huang (UC Davis)

게시일 2026-08-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Barry Menglong Yao (UC Davis), Sha Li (Virginia Tech), Yunzhi Yao (UCLA), Minqian Liu (Virginia Tech), Zaishuo Xia (UC Davis), Qifan Wang (Meta AI), Lifu Huang (UC Davis)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간은 사물을 정신적 범주로 묶음으로써 세상을 이해합니다. 우리는 털이 많고 네 발 달린 동물을 보고 즉각적으로 그것을 '개'라는 개념으로 인식하며, 이 개념에는 짖는다, 꼬리가 있다, 달릴 수 있다와 같은 공유된 특성들이 담겨 있습니다. 구체적인 관찰을 일반적인 아이디어로 추상화하는 이 능력은 인간 추론의 근간입니다. 이야기를 쓰거나 질문에 답할 수 있는 강력한 컴퓨터 프로그램인 대규모 언어 모델도 이와 유사한 작업을 수행하려고 시도합니다. 이 모델들은 방대한 텍스트의 바다를 통해 학습하며, 그 과정에서 동일한 종류의 추상적 개념을 추출하여 내부 시스템 안에 저장하도록 기대됩니다. 하지만 우리는 이 모델들이 학습할 수 있다는 점은 알고 있지만, 어떻게 그 지식을 시간이 지나도 유지하는지, 혹은 왜 새로운 정보가 제시될 때 때때로 그 지식을 잃어버리는 것처럼 보이는지를 정확히 이해하는 데 어려움을 겪어 왔습니다.

수년 동안 연구자들은 이 디지털 정신의 내부를 들여다보고 그것이 어떻게 작동하는지 확인하기 위해 노력해 왔습니다. 어떤 이들은 모델에게 질문을 던져 사실을 기억하는지 테스트했고, 다른 이들은 컴퓨터가 정보를 처리하는 데 사용하는 특정 경로를 매핑하려고 시도했습니다. 그러나 이러한 방법들은 종로종종 고립된 사실이나 정적인 순간만을 바라봅니다. 이 방식들은 모델이 새로운 아이디어를 배우고, 이를 강화하고, 다시 다른 것을 배우도록 강요받았을 때 어떻게 망각하는지의 역동적인 과정을 놓칩니다. 이러한 이해의 공백은 매우 중요합니다. 왜냐로 새로운 데이터로 모델을 업데이트할 때, 우리가 모델이 진정으로 안정적인 세계관을 구축하고 있는 것인지, 아니면 다음 업데이트와 함께 사라질 패턴만을 암기하고 있는 것인지 알아야 하기 때문입니다.

한 연구팀은 인공지능이 특정 개념을 실시간으로 어떻게 배우고 잊는지 관찰함으로써 이 미스터리를 해결하고자 했습니다. 그들은 가상의 개념들을 사용한 통제된 환경을 조성했습니다. 예를 들어, 달릴 수 있는 능력을 가진 '올레(Olre)'라는 생물이나, 네 다리가 달린 '푸(Foo)'에 대해 아이에게 가르치는 상황을 상상해 보십시오. 이 생물들은 현실 세계에 존재하지 않기 때문에, 컴퓨터는 이에 대한 사전 지식이 전혀 없습니다. 이를 통해 과학자들은 어떠한 선입견 없이도 처음부터 학습 과정을 관로 관찰할 수 있었습니다. 그들은 모델에게 이 허구의 사실들을 학습시킨 다음, 모델의 '올레'와 '푸'에 대한 기억에 어떤 일이 일어나는지 확인하기 위해 방대하고 관련 없는 새로운 텍스트를 도입했습니다.

그들이 발견한 것은 모델의 내부 구조가 어떻게 변화하는지에 대한 명확하고 측정 가능한 패턴이었습니다. 연구진은 컴퓨터가 단순히 한 곳에 사실을 저장하는 것이 아니라, 그 아이디어를 표현하기 위해 복잡한 연결망, 즉 회로를 구축한다는 것을 발견했습니다. 이 웹(web)의 형태와 밀도를 분석함으로써, 그들은 모델이 개념을 얼마나 잘 학습했는지, 그리고 잊어버릴 가능성이 얼마나 높은지를 예측할 수 있었습니다. 또한 놀라운 상충 관계를 발견했는데, 모델이 가장 빠르고 강력하게 배운 개념일수록 새로운 정보가 들어왔을 때 가장 쉽게 잊어버리는 경향이 있다는 것이었습니다. 초기 학습의 강도가 오히려 시스템이 스스로를 재편해야 할 때 그 기억을 더 취약하게 만드는 것처럼 보였습니다.

또한 이 연구는 서로 다른 아이디어들이 어떻게 서로 간섭하는지도 밝혀냈습니다. 모델이 의미가 매우 유사한 두 가지 개념을 동시에 배우려고 할 때, 관련 없는 개념을 배울 때보다 훨씬 더 큰 어려움을 겪었습니다. 유사한 아이디어들을 위한 내부 웹이 서로 겹치면서, 컴퓨터가 둘을 쉽게 구별하지 못하는 일종의 교통 체증 현상이 발생한 것입니다. 반대로, 연구진은 한 종류의 지식을 배우는 것이 모델이 다른 것을 배우는 데 도움이 될 수 있다는 점도 발견했습니다. 예를 들어, 사물의 속성과 기능에 대해 가르치는 것은 모델이 나중에 유사한 단어와 반대되는 단어 사이의 관계를 배우는 것을 훨씬 쉽게 만들었습니다. 이는 정보가 제시되는 순서가 매우 중요하다는 것을 시사합니다. 어떤 수업은 다른 수업을 위한 토대가 됩니다.

아마도 가장 중요한 점은, 연구진이 이러한 내부 패턴이 단순한 추상적 관찰에 그치지 않고 모델 자체를 개선하는 데 사용될 수 있음을 보여주었다는 것입니다. 학습 회로의 형태를 살펴봄으로써, 그들은 어떤 개념이 잊힐 위험이 가장 큰지 식별할 수 있었습니다. 그런 다음 이 통찰력을 바탕으로 간단한 훈련 전략을 만들었습니다. 모델이 새로운 것을 배울 때마다, 특정하게 취약한 개념들을 주기적으로 검토하고 복습하도록 한 것입니다. 내부 구조에 기반한 이러한 표적 복습은 컴퓨터가 지식을 유지하는 데 큰 도움이 되었습니다. 이 연구는 모델이 학습하는 내부 구조에 주목함으로써, 우리가 모델을 더 효과적으로 가르칠 수 있으며, 마치 시험 전에 복습할 노트를 알고 있는 학생처럼 모델이 더 안정적이고 신뢰할 수 있는 세계 이해를 구축하도록 도울 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →