← 최신 논문
💻 computer science

One Vector Is All You Need for O(1) Self-Attention: The Ocean State

이 논문은 표준 셀프 어텐션을 단일 지속 벡터로 대체하여 O(1)의 계산 및 메모리 복잡도를 달성하는 동시에, 1,000만 단계의 컨텍스트에서도 망각의 징후 없이 우수한 학습 안정성을 입증하는 방법론인 "Ocean State"를 소개한다.

원저자: SHUYUAN YU

게시일 2026-09-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: SHUYUAN YU

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능은 종종 트랜스포머(Transformer)라고 불리는 특정한 유형의 컴퓨터 프로그램에 의존하며, 이는 텍스트 작성, 언어 번로, 질문 답변과 같은 작업의 표준이 되었습니다. 이러한 프로그램은 단어의 시퀀스를 살펴보고 다음에 올 단어가 무엇인지 결정하는 방식으로 작동합니다. 이를 정확하게 수행하기 위해 프로그램은 이미 본 단어들을 기억해야 합니다. 현재의 설계에서는 프로그램이 긴 문장이나 책 한 권을 읽을 때, 지금까지 처리한 모든 단어의 점점 늘어나는 목록을 유지합니다. 이 목록은 지금까지 처리한 모든 단어를 담고 있는 메모리 뱅크 역할을 하며, 새로운 단어가 추가될 때마다 확장됩니다. 이 방식은 짧은 텍스트에는 잘 작동하지만, 매우 긴 텍스트에는 무거운 부담이 됩니다. 컴퓨터는 관련 정보를 찾기 위해 끊임없이 계속 커지는 이 목록을 스캔해야 하며, 이는 막대한 양의 연산 능력과 메모리를 요구합니다. 텍스트가 길어질수록 이를 읽는 데 필요한 시간과 에너지는 텍스트 자체보다 훨씬 빠르게 증가하여, 결국 매우 긴 문서를 효율적으로 처리하는 것을 불가능하게 만듭니다.

유수원(Yu Shuyuan)이라는 연구자는 이 메모리 문제를 해결하기 위한 다른 방법을 제안했습니다. 모든 단어의 늘어나는 목록을 유지하는 대신, 새로운 방법은 저자가 "오션 스테이트(ocean state)"라고 부르는 단 하나의 단일 요약 벡터만을 유지할 것을 제안합니다. 이 상태를 하나의 밀도 높은 컨테이너라고 상상해 보십시오. 이 컨테이너는 프로그램이 지금까지 읽은 모든 것의 정수를 담고 있는 하나의 조밀한 용기입니다. 프로그램이 새로운 단어를 읽을 때, 이 단일 컨테이너를 업데이트하여 새로운 정보를 포함시키고 기존의 요약을 새로운 요약으로 교체합니다. 그런 다음 프로그램은 이 단일 컨테이너를 사용하여 다음 단어를 예측하는 데 도움을 받습니다. 이 접근 방식은 문제의 근본적인 수학적 구조를 바꿉니다. 즉, 노력이 텍스트의 길이에 따라 늘어나는 것이 아니라, 텍스트가 아무리 길어져도 노력이 일정하게 유지됩니다. 프로그램은 백만 단어를 읽을 때도 단어당 동일한 양의 작업을 수행하며, 텍스트의 길이와 상관없이 고정된 아주 작은 양의 메모리만을 사용합니다.

이 연구의 핵심 아이디어는 매우 단순한 질문에서 출발합니다: 만약 우리가 문장의 최종 요약을 다음 단어를 예측하는 데 사용한 후 바로 버리지 않는다면 어떻게 될까? 표준적인 프로그램에서는 이 요약을 계산한 뒤 바로 폐기합니다. 하지만 새로운 방법은 이 요약을 버리지 않고 유지하며, 이를 한 단계에서 다음 단계로 흐르는 지속적인 메모리로 취급합니다. 프로그램은 현재의 단어와 이 단일 요약 벡터를 읽고, 이 둘을 결합하여 새로운 요약을 생성합니다. 이 과정은 텍스트의 모든 단어에 대해 반복됩니다. 결정적으로, 프로그램은 이 단일 벡터를 읽고 업데이트하는 방법을 완전히 스스로 학습합니다. 누구도 이 정보를 한 곳에 압축하라고 가르쳐주지 않았지만, 설계 자체가 가능하도록 되어 있었기에 프로그램은 훈련 과정에서 이를 스스로 학습했습니다. 연구진은 이 단일 벡터가 놀라울 정도로 유능하다는 것을 발견했습니다. 이 벡터는 천만 단계의 시퀀스에서 나온 정보를 전혀 잃어버리지 않고 보유할 수 있습니다. 테스트 결과, 프로그램은 천만 단계의 시퀀스 시작 부분에 있는 특정 단어를 처음 몇 단계에서 가져온 것만큼이나 정확하게 회상할 수 있었으며, 망각의 징후를 보이지 않았습니다.

연구진은 대규모 텍스트 데이터를 사용하여 이 아이디어를 표준 방식과 비교 테스트했습니다. 두 버전 모두 문장에서 다음 단어를 예측하도록 훈련시켰습니다. 결과는 단 하나의 벡터만을 사용하는 새로운 방식이 늘어나는 목록을 유지하는 표준 방식보다 일관되게 더 우수한 성능을 보였다는 것을 보여주었습니다. 이러한 우위는 우연이 아니었습니다. 이는 모델의 크기나 텍스트의 길이에 따른 다양한 설정에서도 나타났습니다. 실제로 새로운 방식은 매우 안정적이어서, 표준 방식이 텍스트의 아주 일부분만 처리하더라도 메모리가 부족하거나 불가능한 시간이 걸렸을 상황에서도 천만 단계의 시퀀스를 오류 증가 없이 처리할 수 있었습니다. 또한 연구진은 프로그램이 긴 지연 시간 후에 특정 단어를 반복해야 하는 특정 과제를 테스트했는데, 새로운 방식은 0.0006의 손실률로 단어를 재현해낸 반면, 표준 방식은 완전히 실패했습니다.

이러한 압축된 메모리에 대해 가질 수 있는 우려 중 하나는, 시간이 지남에 따라 내용이 읽기 어렵거나 "뿌옇게(foggy)" 변하여 좋은 예측을 하는 데 필요한 세부 정보를 잃어버릴 수 있다는 점입니다. 그러나 실험 결과는 그 반대였습니다. 단일 벡터는 여로 날카롭고 명확하게 유지되었으며, 수백만 단계 이후에도 특정 정보를 성공적으로 회상할 수 있었습니다. 연구진은 또한 이 방식을 실제 컴퓨터에서 더 빠르게 만드는 방법도 탐구했습니다. 새로운 방식은 단어를 엄격한 순서에 따라 차례대로 처리하기 때문에, 여러 단어를 동시에 처리할 수 있는 표준 방식에 비해 단일 기기에서의 훈련 속도가 느릴 수 있습니다. 이를 해결하기 위해 연구진은 프로그램의 서로 다른 레이어들에 걸쳐 작업을 분할하는 방법을 개발하여, 여러 단계를 동시에 처리할 수 있도록 했습니다. 이러한 엔지니어링적 변화는 높은 성능을 유지하면서도 모델 훈련에 소요되는 시간을 크게 단축시켰습니다.

이 연구는 고정된 양의 메모리와 연산 능력을 사용하여 방대한 양의 정보를 기억하는 시스템을 구축하는 것이 가능하다는 것을 입증합니다. 연구진은 프로그램이 특별한 지침 없이도 정보를 효율적으로 조직하는 법을 스스로 학습한다는 것을 보여주었습니다. 비록 현재의 실험은 특정 데이터셋과 상대적으로 작은 규모의 모델을 대상으로 수행되었고, 실제 규모에서의 동작은 아직 검증되지 않았지만, 결과는 이 근본 원리가 견고하다는 것을 시사합니다. 이 방법은 프로그램이 자신의 내부 상태를 다루는 방식을 재배치함으로써, 버려지던 요약을 지속적인 메모리로 전환하는 방식으로 작동합니다. 이러한 변화는 AI 시스템이 처리할 수 있는 텍스트 길이를 제한해 온 구조적 비용을 제거합니다. 이번 연구 결과는 이러한 접근 방식을 통해 컨텍스트 길이의 한계가 더 이상 장벽이 되지 않을 수 있음을 나타내며, 일관된 속도와 정확도로 어떤 크기의 문서라도 읽고 이해할 수 있는 시스템을 가능하게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →