HRM-Text: Efficient Pretraining Beyond Scaling
본 논문은 계층적 순환 아키텍처, 전문화된 학습 기법, 그리고 지시문 전용 사전 학습을 결합하여 기초 언어 모델 연구에 필요한 컴퓨팅 및 데이터 요구 사항을 획기적으로 줄이면서도 훨씬 더 큰 규모의 모델과 경쟁력 있는 성능을 달성하는 10 억 매개변수 모델인 HRM-Text 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 현재 상태를 거대하고 고속인 공장에 비유해 보십시오. "지능형" 기계를 만들기 위해 이러한 공장들은 수조 장의 원시 텍스트 페이지(인터넷 전체와 같은) 를 블렌더에 쏟아붓고, 이를 처리하는 데 수십억 달러 상당의 전기를 사용합니다. 그 결과로 지능형 모델이 나오지만, 이 과정은 너무 비싸고 에너지를 많이 소비하여 소수의 거대 기업만이 공장을 가동할 비용을 감당할 수 있습니다.
공유하신 논문인 HRM-Text는 이러한 기계를 구축하는 완전히 다른 방식을 제안합니다. 거대하고 무차별적인 공장 대신, 인간 두뇌처럼 학습하는 작고 매우 효율적인 작업장을 구축한 것입니다.
간단한 비유를 사용하여 그들이 이를 어떻게 달성했는지 설명하겠습니다.
1. 두뇌 비유: "느린 사고자"와 "빠른 실행자"
오늘날 대부분의 AI 모델은 읽기, 사고, 작성을 모두 하나의 거대하고 혼란스러운 급박함 속에서 동시에 하려는 한 사람과 같습니다.
저자들은 인간 두뇌가 어떻게 작동하는지 살펴보았습니다. 그들은 우리 두뇌에 전두 - 두정 루프가 있다는 사실을 발견했는데, 이는 느리고 전략적인 사고(큰 그림을 계획하는 것) 와 빠르고 실행적인 사고(실제 작업을 수행하는 것) 를 분리하는 시스템입니다.
- 구식 방식: 표준 AI 는 멈추지 않고 마라톤을 뛰려는 스프린터와 같습니다. 지치고 혼란스러워집니다.
- HRM-Text 방식: 그들은 두 개의 계층으로 구성된 모델을 구축했습니다.
- "H" 모듈 (사령관): 이는 느리고 전략적인 계층입니다. 잠시 시간을 내어 큰 그림을 이해하고 방향을 설정합니다.
- "L" 모듈 (전문가): 이는 빠르고 실행적인 계층입니다. 사령관의 계획에 따라 세부 사항을 신속하게 처리하고 답변을 정제합니다.
- 결과: "계획"과 "수행"을 분리함으로써 모델은 세부 사항에 빠지지 않습니다. 더 빠르고 효율적으로 학습합니다.
2. 훈련 방법: 질문을 읽는 것을 멈추고 답변하기 시작하세요
현재의 AI 모델은 책을 읽으며 책의 모든 단어, 심지어 질문 자체까지 포함하여 다음 단어를 예측하도록 훈련됩니다. 이는 문제를 해결하는 방법을 배우는 대신 교사의 질문을 단어 그대로 외우며 시험을 준비하는 학생과 같습니다.
HRM-Text 는 규칙을 바꿉니다.
- "작업 완료" 목표: 전체 문장을 예측하려는 대신, 모델은 답변을 틀렸을 때만 패널티를 받습니다. 훈련 중에는 질문 부분을 무시합니다.
- "PrefixLM" 트릭: 학생이 질문을 읽는다고 상상해 보십시오. 표준 AI 의 경우 학생은 이미 작성한 단어만 볼 수 있습니다. 반면 HRM-Text 의 경우 학생은 답변을 작성하기 전에 전체 질문을 먼저 읽을 수 있습니다(앞뒤로 살펴보며). 이는 질문 텍스트 자체를 외울 필요 없이 맥락을 훨씬 더 잘 이해하도록 돕습니다.
3. "마법" 안정화 장치
루프 (재귀) 로 "사고"하는 모델을 훈련시키는 것은 notoriously 어렵습니다. 바닥이 흔들리는 동안 접시 더미를 균형을 맞추려는 것과 같습니다. 이 논문은 그 더미가 무너지지 않도록 유지하는 두 가지 "안정화 장치"를 소개합니다.
- MagicNorm: 이를 충격 흡수 장치로 생각하십시오. 모델이 여러 단계를 거쳐 "사고"할 때, 컴퓨터 내부의 숫자가 너무 커지거나 너무 작아져 학습이 중단되는 것을 방지합니다.
- Warmup Deep Credit Assignment: 아이가 걷는 것을 가르치는 상황을 상상해 보십시오. 첫날에 마라톤을 뛰게 하지 않습니다. 짧은 걸음으로 시작하여 힘이 세지면 더 긴 걸음을 허용합니다. HRM-Text 는 처음에는 실수를 배우기 위해 몇 단계만 거슬러 올라가다가, 더 똑똑해짐에 따라 점차 더 멀리 거슬러 올라갑니다. 이는 모델이 너무 일찍 자신의 과거에 혼란을 겪는 것을 방지합니다.
결과: "다윗과 골리앗"의 승리
이 논문은 이러한 트릭을 통해 10 억 개의 파라미터를 가진 모델(상대적으로 작은 AI) 을 구축했다고 주장하며, 이는 구글이나 메타 같은 거대 기업들이 사용하는 수조 개에 비해 미미한 400 억 개의 토큰으로만 훈련되었습니다.
- 비용: 그들은 약 1,500 달러를 지출하고 16 개의 그래픽 카드를 2 일 미만으로 사용했습니다.
- 비교: 작고 저렴함에도 불구하고 이 모델은 훈련에 수십만 달러가 들고 수개월이 걸린 거대 모델만큼 잘 수행했으며 때로는 더 나은 성과를 냈습니다.
- 효율성: 동일한 결과를 얻기 위해 표준 모델은 100 배에서 900 배 더 많은 데이터와 96 배에서 432 배 더 많은 컴퓨팅 파워가 필요했습니다.
큰 그림
저자들은 이것이 최종적인 완벽한 AI 라고 말하지 않습니다. 그들은 **"가능성을 증명했다"**고 말합니다.
지능형 AI 를 구축하기 위해 수십억 달러의 예산이 필요하지 않음을 보여주었습니다. 두뇌처럼 사고하도록 아키텍처를 설계하고 (느린 계획 + 빠른 수행), 문제 해결에만 집중하도록 훈련하면 (질문 텍스트 무시), AI 연구를 민주화할 수 있습니다. 이는 소규모 연구실, 대학, 심지어 개인들도 이제 처음부터 자체 기반 모델을 훈련할 수 있게 되어, 현재 가장 부유한 기업들만이 독점하고 있는 상황을 깨뜨릴 수 있음을 의미합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.