Full-bandwidth transformer
이 논문은 이전 최상위 레이어의 은닉 상태를 잠재 피드백을 통해 모델로 다시 전달함으로써 자기회귀 디코딩을 강화하는 새로운 아키텍처인 풀-밴드위스 트랜스포머(full-bandwidth transformer)를 소개하며, 이는 표준적인 효율성을 유지하면서도 기존 트랜스포머보다 훨씬 적은 학습 데이터를 필요로 하면서 다양한 작업에서 성능을 향상시킨다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 까다로운 퍼즐을 풀려고 노력 중이라고 상상해 보세요. 하지만 당신에게는 아주 엄격한 규칙이 하나 있습니다. 미래의 자신에게 한 번에 단 하나의 단어만 속삭여야 한다는 규칙입니다. 만약 계획의 복잡한 단계를 알아냈다면, 당신은 그것을 하나의 단어로 적어야 하고, 미래의 자신이 그것을 읽을 때까지 기다렸다가 다시 처음부터 시작해야 합니다. 이것이 오늘의 대부분의 현대적인 AI 챗봇이 작동하는 방식입니다. 그들은 읽고 쓰는 데는 매우 뛰어나지만, 생각할 때는 자신의 생각을 밖으로 소리 내어 말하듯, 한 번에 한 단어씩 "말해야"만 합니다. 이것은 무거운 배낭 가득 정보를 담아 운반하고 있는데, 매 단계마다 미래의 자신에게 배낭 속의 엽서 한 장만을 건네줄 수 있는 것과 같습니다.
과학자들은 이 AI 모델들을 "트랜스포머(transformers)"라고 부릅니다. 이들은 우리가 매일 사용하는 스마트한 챗봇들의 엔진입니다. 이 모델들은 두 가지 방향으로 작동합니다. 페이지 전체의 단어들을 가로로 읽고, 그 위에 쌓인 여러 층의 "뉴런"을 통해 세로로 정보를 처리합니다. 문제는 모델이 이미 쓴 모든 단어들을 볼 수는 있지만, 자신의 깊고 복잡한 내부적인 생각을 다시 처리하기 위해 뇌의 바닥 부분으로 쉽게 보낼 수는 없다는 점입니다. 일단 생각이 단어로 변환되면, 그 생각의 풍부하고 숨겨진 세부 사항들은 대부분 사라지며, 이로 인해 AI는 길고 장황한 설명을 쓰거나 모든 것을 처음부터 다시 계산해야 합니다. 연구자들은 다음과 같은 질문을 던집니다. AI가 자신의 "비밀 노트"를 유지하면서, 단어로 써 내려가는 대신 자신의 뇌의 시작점으로 다시 보낼 수 있을까? 만약 가능하다면, AI는 더 빠르고, 더 똑똑하며, 더 적은 단어를 사용할 수 있을 것입니다.
이 논문은 "풀-밴드위스 트랜스포머(full-bandwidth transformer)"라는 새로운 종류의 AI를 소개합니다. 마이크로소프트와 유수 대학의 연구진은 이 좁은 "속삭임" 채널을 넓히는 방법을 찾아냈습니다. 미래의 자신에게 엽서 한 장을 건네는 대신, AI가 자신의 "숨겨진 상태(hidden state)"—즉, 지금까지 생각한 모든 것의 거대하고 복잡한 요약본—를 뇌의 바닥으로 다시 보낼 수 있게 한 것입니다. 그들은 "잠재적 피드백(latent feedback)"이라는 영리한 기술을 사용하여 이를 수행합니다. 만약 당신이 미래의 자신에게 엽서를 건네는 대신, 당신의 노트가 담긴 배낭 전체를 시작 지점으로 즉시 순간 이동시킬 수 있다면, 그러면서도 당신이 말한 기록으로서의 엽서는 여전히 가지고 있을 수 있다면 어떨지 상상해 보세요. AI는 방금 생성한 단어와 자신의 깊은 내부 요약본을 융합하여, 다음 단계를 위한 초강력 입력을 만들어냅니다.
팀은 학습 단계 동안 이 "순간 이동" 능력을 서서히 도입하는 특별한 스케줄을 사용하여 이 새로운 모델들을 훈련시켰습니다. 그들은 엄청난 양의 텍스트(최대 4,000억 토큰)를 사용하여 10억 개의 파라미터를 가진 모델들을 테스트했습니다. 결과는 이 방법이 놀라울 정도로 잘 작동한다는 것을 보여줍니다. AI는 단순히 수학과 코딩 능력이 좋아진 것이 아니라, 더 짧고 효율적인 방식으로 생각하기 시작했습니다. 많은 테스트에서 풀-밴드위스 트랜스포머는 두 배의 데이터로 훈련된 표준 모델만큼 성능이 좋았으며, 때로는 다섯 배의 데이터로 훈련된 모델과도 대등한 성능을 보였습니다. 아마도 가장 흥-미로운 점은, 수학 문제를 풀 때 이 새로운 모델들이 정답을 맞히면서도 훨씬 더 짧은 답변을 생성했다는 것입니다. 이는 그들이 단어를 낭비하며 설명하는 대신, 자신의 "머릿속"에서 어려운 생각을 수행하고 있음을 시사합니다. 연구진은 이 접근 방식이 AI의 속도에 거의 추가 비용을 발생시키지 않는다는 것을 발견했으며, 이는 끝없는 새로운 데이터 없이도 더 똑똑하고 효율적인 AI를 구축할 수 있는 유망한 방법임을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.