← 최신 논문
💬 NLP

Transformers perform adaptive partial pooling

이 논문은 트랜스포머가 드물고 유사한 문맥으로부터 정보를 활용함으로써 계층적 회귀와 유사한 적응형 부분 풀링(adaptive partial pooling)을 나타낸다는 것을 입증하며, 이러한 동작은 훈련 과정 중 문맥 빈도의 영향력이 극대화되었다가 추가 훈련과 함께 감소하기 전의 특정 "스위트 스팟(sweet spot)"에서 정점에 달한다.

원저자: Vsevolod Kapatsinski

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vsevolod Kapatsinski

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구의 대화에서 다음에 무슨 말을 할지 추측하려고 한다고 상상해 보세요. 만약 그 친구가 똑같은 문구를 천 번이나 말하는 것을 들었다면, 당신은 다음에 무엇이 올지 정확히 알 수 있습니다. 하지만 만약 그 친구가 완전히 새로운 것을 말한다면 어떨까요? 당신은 단순히 무작위로 추측할 수 없습니다. 대신 비슷한 상황에서 그가 이전에 무엇을 말했는지를 살펴봐야 합니다. 이것이 인간 아이든 컴퓨터 프로그램이든, 언어 학습의 핵심적인 수수께끼입니다.

이를 해결하기 위해 과학자들은 "적응형 부분 풀링(adaptive partial pooling)"이라는 영리한 기술을 사용합니다. 이것을 똑똑한 탐정이라고 생각해 보세요. 탐정이 희귀한 범죄 현장을 목격했을 때, 탐정은 눈앞에 있는 단 하나의 단서(그것은 너무 적어서 오해를 불러일으킬 수 있습니다)만 빤히 쳐다보고 있지 않습니다. 대신, 보통 그런 곳에서 어떤 일이 일어나는지 파악하기 위해 다른 유사한 범죄 현장들을 살펴봅니다. 탐정은 특정 단서와 일반적인 패턴을 혼합하지만, 특정 단서가 자주 발생하면 그 단서를 더 비중 있게 다루고, 특정 단서가 일회성이라면 일반적인 패턴을 더 비중 있게 다룹니다. 이는 희귀하고 이상한 사고 때문에 혼란에 빠지지 않으면서도 최선의 추측을 할 수 있도록 도와줍니다.

이제, "트랜스포머(Transformer)"라고 불리는 초지능형 컴퓨터 뇌(현대적인 챗봇을 구동하는 종류)를 상상해 보세요. 오랫동안 사람들은 이 컴퓨터 뇌가 실제로 이 똑똑한 탐정 기술을 사용하는지, 아니면 자신이 읽은 모든 것을 단순히 암기하는 것인지 궁금해했습니다. 만약 단순히 암기하는 것이라면, 새로운 것을 보았을 때 실패할 수도 있습니다. 하지만 만로 "적응형 부분 풀이"를 사용한다면, 그것은 인간처럼 배우고 적응할 수 있습니다. 이 논문은 컴퓨터 뇌가 실제로 이 탐정 업무를 수행하는지, 그리고 더 많이 공부함에 따라 그것을 더 잘하게 되는지 혹은 못하게 되는지를 묻습니다.

컴퓨터 뇌의 탐정 업무

이 연구에서 저자인 브세볼로드 카팟스키(Vsevolod Kapatsinski)는 GPT-2라는 컴퓨터 모델을 테스트하기 위해 작은 인공 언어 게임을 설정했습니다. 그는 문장이 항상 "A" 또는 "B"로 끝나도록 하는 언어를 발명했는데, 선택은 바로 앞의 단어들에 달려 있었습니다. 어떤 단어 조합은 매우 흔했고, 어떤 조합은 아주 드물었습니다. 이는 현실 세계에서 어떤 문구는 매일 사용되지만 어떤 문구는 아주 가끔씩만 사용되는 것과 같습니다.

컴퓨터는 이 게임을 통해 훈련되었고, 연구자는 그것이 어떻게 학습하는지 관찰했습니다. 여기서 큰 발견이 있었습니다: 네, 컴퓨터는 실제로 적응형 부분 풀링을 사용합니다. 컴퓨터가 희귀한 문장을 보았을 때, 단 하나의 희귀한 사례에만 근거하여 추측하지 않았습니다. 대신, 컴퓨터는 더 나은 추측을 하기 위해 유사한 문장들을 살펴보며 자신의 지식을 "풀링(pooling)"했습니다. 컴퓨터는 앞서 설명한 똑똑한 탐정처럼 행동했습니다.

하지만 반전이 있습니다. 컴퓨터의 탐정 기술은 훈련을 계속함에 따라 변합니다.

  • 초기 단계: 컴퓨터가 학습을 막 시작할 때는 일반적인 패턴에 크게 의존합니다. 이는 아직 구체적인 규칙을 배우지 못한 신입생이 흔히 일어나는 일에 근거하여 추측하는 것과 같습니다. 그것은 많은 정보를 많이 결합합니다.
  • 중기 단계: 컴퓨터가 조금 더 훈련을 받으면 "스위트 스폿(sweet spot, 최적의 지점)"에 도달합니다. 이 순간은 구체적인 희귀 단서와 일반적인 패턴 사이에서 가장 잘 균형을 잡는 시기입니다. 이 단계에서 컴퓨터는 계층적 회귀의 수학적 모델처럼 완벽한 인간형 탐정의 행동을 모방합니다.
  • 후기 단계: 만약 컴퓨터가 이 스위트 스폿을 지나 너무 오래 훈련을 계속하면, 다시 변화하기 시작합니다. 컴퓨터는 구체적이고 희귀한 단서들을 너무 많이 신뢰하기 시작합니다. 일반적인 패턴을 보는 것을 멈추고, 모든 개별적인 희귀 사례에 대해 완벽하게 답을 알고 있다고 생각하기 시작합니다. 저자는 충분한 훈련을 거치면 컴퓨터가 희귀한 상황에서 너무 자신만만해져서, 인간처럼 들리게 만드는 유용한 "부분 풀링" 능력을 잃을 수 있다고 제안합니다.

연구는 또한 컴퓨터가 다른 면에서도 인간처럼 행동한다는 것을 발견했습니다. 만약 문장 그룹이 매우 다양하다면(어떤 것은 A라고 하고, 어떤 것은 B라고 함), 컴퓨터는 그것들을 함께 풀링하는 것을 멈추고 개별적으로 취급합니다. 하지만 문장 그룹이 매우 유사하다면, 컴퓨터는 기꺼이 그것들을 혼합합니다. 또한, 유사한 문장의 종류가 많을 때(높은 유형 빈도), 컴퓨터는 인간이 다양한 방식으로 규칙을 사용해 본 경험이 많을 때 규칙을 일반화하려는 경향이 있는 것처럼, 더 기꺼이 그것들을 함께 풀링한다는 점도 알아냈습니다.

이것이 중요한 이유

이 논문은 단순히 "컴퓨터가 학습한다"라고 말하는 것이 아닙니다. 그것은 컴퓨터가 "어떻게" 학습하는지를 보여줍니다. 이는 거대한 컴퓨터 뇌들이 단순히 모든 단어를 암기하는 거대한 기억 저장소가 아님을 증명합니다. 그것들은 시간이 지남에 따라 점점 더 상세해지는 내부 표현을 구축합니다. 그것들은 넓은 범주(예: "모든 동물")를 보는 것에서 시작하여, 인간 아이들이 하는 것처럼 점차 더 작은 그룹(예: "물고기 vs 새")을 구분하는 법을 배웁니다.

가장 흥兴奋적인 발견은 "스위트 스폿"입니다. 저자는 컴퓨터가 인간 학습자와 가장 유사해지는 특정 훈련 지점이 존재한다고 제안합니다. 즉, 희귀한 단어들을 과하게 생각하지 않고 적절한 양의 일반화를 사용하여 처리하는 지점입니다. 만약 우리가 컴퓨터를 너무 많이 훈련시킨다면, 그것은 인간과 같은 유연성을 잃고 희귀한 사례에 대한 예측에서 너무 경직될 수 있습니다.

그러므로 다음에 챗봇과 대화할 때, 그것이 단순히 대본을 낭독하고 있는 것이 아님을 기억하세요. 그것은 구체적인 순간에 알고 있는 것과 세상에 대해 알고 있는 것 사이에서 정교한 균형 잡기를 수행하고 있으며, 학습의 완벽한 중간 단계에 있을 때 이를 가장 잘 해냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →