← 최신 논문
🤖 machine learning

LT2: Linear-Time Looped Transformers

본 논문은 이차적 어텐션을 효율적인 선형 또는 희소 변형으로 대체하는 선형 시간 루프형 트랜스포머 계열인 LT2 를 소개하며, 루핑이 이러한 메커니즘과 시너지를 이루어 언어 모델링 작업에서 뛰어난 성능과 확장성을 달성함을 입증한다.

원저자: Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 매우 똑똑하지만 느린 사서 (AI 모델) 를 가지고 있으며, 이 사서가 질문에 답하기 위해 매우 긴 책을 읽어야 한다고 가정해 봅시다.

구식 방법: "루프된" 사서
전통적으로 더 똑똑해지기 위해 우리는 사서에게 책을 여러 번 읽게 했습니다. 이를 **루프된 트랜스포머 (Looped Transformer)**라고 합니다. 더 많은 사서를 고용하는 것 (이는 많은 비용/파라미터가 듭니다) 대신, 우리는 동일한 사서에게 책을 다시 읽게 하고, 다시 읽게 하여 각 통과마다 이해도를 정제하도록 했습니다.

  • 문제점: 사서는 자신이 읽은 내용을 기억하기 위해 매우 느린 방법을 사용했습니다. 페이지를 넘길 때마다 특정 단어를 찾기 위해 책의 전체를 처음부터 다시 읽어야 했습니다. 책이 길다면 이는 영원히 걸렸습니다. 이 논문은 이를 "이차 복잡도 (quadratic complexity)"라고 부릅니다. 이는 한 걸음 뛸 때마다 건초 더미 속의 바늘을 찾기 위해 모든 건초 조각을 반복해서 확인하려는 것과 같습니다.

새로운 해결책: LT2 (선형 시간 루프된 트랜스포머)
이 논문의 저자들은 LT2를 소개했습니다. 그들은 사서가 책을 여러 번 읽는다는 아이디어 (루핑) 는 유지하되, 사서에게 완전히 새롭고 초고속인 기억 비법을 제공했습니다.

그들은 "모든 것을 확인하는" 느린 방법을 두 가지 더 빠른 기억 방식으로 대체했습니다:

  1. 선형 어텐션 (Linear Attention): 책 전체를 다시 읽는 대신, 사서는 진행 중인 요약 노트를 유지합니다. 새로운 페이지를 읽을 때 노트만 업데이트하면 됩니다. 이는 책이 얼마나 길든 상관없이 빠릅니다.
  2. 희소 어텐션 (Sparse Attention): 사서는 자신이 읽은 최근 몇 페이지만 보고, 그 특정 순간에는 책의 나머지는 무시합니다.

마법 같은 시너지: 루핑이 이러한 빠른 방법들을 더욱 향상시키는 이유
여기서 이 논문이 발견한 교묘한 부분이 있습니다. 일반적으로 이러한 빠른 방법들은 약점이 있습니다.

  • 선형 어텐션은 빠르지만 때로는 세부 사항을 잊어버립니다.
  • 희소 어텐션은 빠르지만 책의 먼 곳의 내용을 볼 수 없습니다.

하지만 이를 루핑하면 (사서에게 책을 여러 번 읽게 하면) 약점들이 사라집니다:

  • 선형 어텐션의 경우: 사서가 루프를 돌 때마다 요약 노트를 정제할 기회가 생깁니다. 초고를 읽고, 문법을 수정하기 위해 다시 읽고, 줄거리를 수정하기 위해 다시 읽는 것과 같습니다. "루프"는 단순한 노트를 깊고 상세한 이해로 바꿉니다.
  • 희소 어텐션의 경우: 사서가 최근 10 페이지만 본다면 시작 부분을 볼 수 없습니다. 하지만 4 번 루핑하면 효과적으로 40 페이지를 보게 됩니다! "루프"는 그들의 시야를 확장시켜 속도를 늦추지 않고도 책 전체를 볼 수 있게 합니다.

양쪽의 장점을 모두 갖춘 것: 하이브리드 접근법
이 논문은 또한 이러한 방법들을 혼합해 보기도 했습니다. 사서 팀을 상상해 보세요:

  • 일부는 빠른 "요약 노트" 방법을 사용합니다.
  • 일부는 "최근 몇 페이지만 보기" 방법을 사용합니다.
  • 몇몇 특수 사서들은 가장 중요한 부분에만 구식인 느린 "모든 것 확인" 방법을 사용합니다.

그들은 하이브리드 팀이 가장 잘 작동한다는 사실을 발견했습니다. 소수의 "느리고 신중한" 사서들을 "빠른" 사서들과 섞어 두면, 빠른 방법들의 속도와 느린 방법들의 정확성을 모두 얻을 수 있었습니다.

결과: 더 빠르고, 더 똑똑하며, 더 저렴함
이 논문은 다양한 작업에서 이를 테스트했습니다:

  • 속도: 그들의 새로운 모델은 특히 긴 텍스트의 경우 기존 루프된 모델보다 텍스트를 읽고 처리하는 속도가 훨씬 빨랐습니다. 책이 거대해져도 충돌하거나 메모리가 고갈되지 않았습니다.
  • 품질: 질문 답변, 수학 문제 해결, 사실 기억 등에서 기존 느린 모델과 똑같이 (심지어 더 잘) 수행했습니다.
  • 효율성: 그들은 거대하고 비싼 40 억 파라미터 모델의 성능을 달성하면서도 단지 14 억 파라미터 모델만 사용했으며, 이를 훨씬 더 빠르게 수행했습니다.

"오로 (Ouro)" 실험
마지막으로, 그들은 처음부터 새로운 사서를 구축할 필요조차 없음을 보여주었습니다. 기존에 존재하는 느리지만 똑똑한 사서 (사전 훈련된 모델) 를 가져와 새로운 빠른 기억 비법을 "가르칠" 수 있습니다. 이렇게 변환된 모델은 업계 표준인 다른 소형 모델들보다 더 좋은 성능을 발휘했으며, 이는 기존 시스템을 지능을 잃지 않고도 번개처럼 빠르게 업그레이드할 수 있음을 증명했습니다.

요약하자면
이 논문은 다음과 같이 말합니다: "우리는 더 똑똑해지기 위해 내용을 여러 번 읽는 AI 모델을 만들되, 매번 모든 것을 확인하는 느림에 발목이 잡히지 않는 방법을 찾았습니다. 더 빠른 기억 비법들을 사용하고 이를 루핑하여 결합함으로써, 우리는 놀라울 정도로 똑똑하면서도 놀라울 정도로 빠른 모델을 얻었습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →