← 최신 논문
💬 NLP

What Matters in Linearizing Language Models? A Comparative Study of Architecture, Scale, and Task Adaptation

본 논문은 7가지 선형화된 언어 모델 아키텍처에 대한 비교 연구를 제시하며, 아키텍처의 귀납적 편향, 특히 오차 수정 업데이트 규칙과 게이트형 델타 공식이 성능과 장기 문맥 능력의 주요 결정 요인임을 밝히는데, 이는 훈련 초기에 확립된 이러한 이점들이 파라미터 규모나 토큰 예산에 관계없이 지속되기 때문이다.

원저자: Patrick Haller, Jonas Golde, Alan Akbik

게시일 2026-02-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Patrick Haller, Jonas Golde, Alan Akbik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 정교하고 거대한 주방을 사용하는, 천재적이고 세계적인 수준의 셰프(트랜스포머)가 있다고 상상해 보세요. 이 셰프는 다음에 무엇을 넣을지 결정하기 위해 식료품 창고에 있는 모든 재료를 한꺼번에 살펴보는 특별한 기술을 사용합니다. 완벽하긴 하지만, 속도가 느리고 거대한 주방이 필요합니다.

이제, 당신은 더 빠르고 효율적인 작은 주방을 사용하면서도 그만큼 요리를 잘할 수 있는 새로운 견습생(선형 모델)을 고용하고 싶다고 상상해 보세요. 이를 위해 당신은 견습생에게 처음부터 요리를 가르치는 것이 아닙니다. 대신, 마스터 셰프의 지식을 견습생의 뇌로 **증류(distillation)**하려고 노력합니다. 당신은 이렇게 말합니다. "전체 식료품 창고를 다 보려고 하지 말고, 지금까지 본 것 중 가장 중요한 것들을 담은 실행 목록(running list)을 계속 유지해라."

이 논문은 이 빠른 작은 주방으로 마스터 셰프의 기술을 복제하려고 할 때, 어떤 유형의 견습생이 가장 잘 작동하는지를 알아보기 위한 거대한 실험입니다.

핵심 질문

이 "실행 목록"(토큰 믹서)을 만드는 데는 많은 방법이 있습니다. 어떤 견습생은 단순히 긴 두루마리에 새로운 메모를 계속 추가하기만 합니다(가산 방식, Additive). 또 다른 견습생은 무엇을 남기고 무엇을 버릴지 결정하는 문(gate)을 사용합니다(게이트 방식, Gated). 다른 이들은 새로운 정보가 기존 정보와 일치하면 기존 것을 덮어쓰는 "삭제 및 교체" 규칙을 사용합니다(델타 규칙, Delta-rule).

연구자들은 알고 싶었습니다: 견습생이 사용하는 이 "메모 방식"이 중요할까요? 아니면 그냥 견습생을 더 크고 똑똑하게 만들면 어떤 나쁜 습관이든 고칠 수 있을까요?

실험

연구자들은 일곱 가지 서로 다른 유형의 견습생(xLSTM, Gated DeltaNet, GLA 등과 같은 아키텍처)을 데려와서, 동일한 마스터 셰프, 동일한 레시피(데이터), 그리고 동일한 연습 시간 동안 학습시켰습니다. 이들은 세 가지 크기로 테스트했습니다:

  1. 소형 (1억 4천만 파라미터)
  2. 중형 (3억 6천만 파라미터)
  3. 대형 (17억 파라미터)

또한 두 가지 다른 도전 과제로도 테스트했습니다:

  • "건초더미 속 바늘 찾기" 테스트: 아주 긴 이야기 속에 숨겨진 특정 사실을 찾아낼 수 있는가?
  • "지시 사항 따르기" 테스트: 복잡한 명령을 이해하고 따를 수 있는가?

연구 결과

1. 크기보다 "메모 방식"이 더 중요하다

가장 놀라운 발견은 견습생의 유형이 크기보다 더 중요하다는 점입니다.

  • 승자: **"게이트 델타 규칙(Gated Delta-rules)"**을 사용하는 견습생들(정교한 지우개를 사용하여 오래되고 불필요한 메모를 정확히 삭제하고 새것으로 교체할 수 있는 이들을 생각하세요)이 가장 뛰어났습니다. 이들은 규모가 커져도 선두를 유지했습니다.
  • 패자: 아무것도 삭제하지 않고 메모를 계속 쌓아두기만 하는 견습생들(선형 어텐션)은 정체되었습니다. 이들이 아무리 커져도 똑똑한 이들을 따라잡을 수 없었습니다. 이들은 마치 10시간짜리 영화를 기억하기 위해 지울 수 없는 종이에 모든 단어를 적어 내려가는 사람과 같았습니다—종이는 결국 쓰레기로 가득 차서 중요한 부분을 찾을 수 없게 됩니다.

비유: 이는 언어를 배우는 것과 같습니다. 한 학생은 들리는 모든 단어를 공책에 적습니다(가산 방식). 다른 학생은 필요할 때만 오래된 단어를 지우고 새 단어를 쓸 수 있는 공책을 가지고 있습니다(게이트 델타). 두 번째 학생은 공부를 몇 년을 하든 상관없이 더 빠르게 배우고 더 잘 기억합니다.

2. 더 많은 데이터로 나쁜 습관을 고칠 수는 없다

연구자들은 궁금했습니다. "만약 우리가 '나쁜' 견습생들에게 더 많은 데이터(더 많은 연습 토큰)를 준다면, 결국 따라잡을 수 있을까?"

  • 답변: 아니오.
    심지어 엄청난 양의 데이터(100억 토큰)로 학습시킨 후에도 성능 격차는 그대로 유지되었습니다. "나쁜" 메모 스타일은 한계점에 부딪혔습니다. "좋은" 스타일은 계속해서 약간씩 개선되었지만, 기본적으로 앞서 나가 있었습니다.
    교훈: 망가진 기억 시스템은 단순히 더 많은 정보를 입력한다고 해서 고칠 수 없습니다. 기억의 구조가 병목 현상입니다.

3. "긴 기억" 문제

이야기가 매우 길어질 때(수천 단어), 대부분의 견습생은 "건초더미 속 바늘 찾기" 테스트에서 실패했습니다. 그들은 이야기의 시작 부분을 잊어버렸습니다.

  • 예외: 오직 Gated DeltaNet(스마트한 지우개를 가진 모델)만이 여전히 건초더미 속에서 바늘을 찾을 수 있었습니다.
  • 실패: "가산(Additive)" 모델들(그저 메모를 계속 추가하는 모델들)은 특정 지점을 넘어서면 모든 것을 완전히 잊어버렸습니다. 그들의 기억은 노이즈로 "포화(saturated)"되었습니다.

4. 지시 사항 교육은 핵심적인 결함을 해결하지 못한다

마지막으로, 연구자들은 이 견습생들에게 지시 사항(예: "시를 써라" 또는 "수학 문제를 풀어라")을 따르는 법을 가르쳐 보았습니다.

  • 결과: 똑똑한 견습생들은 지시 사항을 따르는 능력이 더욱 향상되었습니다. 약한 견습생들도 약간 좋아졌지만, 여전히 약했습니다.
  • 반전: 복제 과정(증류) 중에 지시 사항을 가르치는 것이 약한 모델들을 따라잡는 데 도움이 되지 않았습니다. 사실, 이는 때때로 그들의 장기 기억을 더 악화시키기도 했습니다.
    핵도록: 학생의 뇌가 그렇게 설계되어 있지 않다면, 그 학생에게 장기 기억의 천재가 되라고 가르칠 수는 없습니다. 아키텍처(뇌 구조)가 주요 제약 조건입니다.

결론

빠르고 효율적이면서도 복잡한 작업을 수행하고 긴 이야기를 기억할 수 있는 AI를 만들고 싶다면, 단순히 나쁜 설계를 키우기만 해서는 안 됩니다.

논문은 모델이 메모를 업데이트하는 방식(특히, 오래된 정보를 선택적으로 삭제하고 덮어쓸 수 있는 규칙을 사용하는 방식)이 가장 중요한 요소라고 결론짓습니다. 잘못된 "메모 방식"을 선택한다면, 아무리 많은 훈련 데이터나 모델 크기도 그것을 올바른 방식으로 만들 수 없습니다.

요약하자면: 얼마나 큰 뇌를 가졌느냐가 아니라, 얼마나 똑똑하게 노트를 정리하느냐의 문제입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →