Inferring the Size of Large Language Models From Popular Text Memorization
본 논문은 인기 있는 텍스트에 대한 암기 정확도를 분석하여 대규모 언어 모델의 매개변수 수에 대한 보수적인 하한을 추론하는 블랙박스 방법을 제시함으로써, 폐쇄형 가중치 시스템을 포함한 모델 크기의 순위 매기기를 가능하게 하고 숨겨진 업계 확장 전략을 드러냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 이상한 나라의 앨리스나 성경과 같은 유명한 이야기들을 여러 사람들이 암송하고 있는 방에 들어갔다고 가정해 봅시다. 당신은 그들을 볼 수 없고, 그들의 뇌 크기를 물어볼 수도 없으며, 그들의 메모를 엿볼 수도 없습니다. 당신은 그들이 문장 중간에 멈추었을 때 다음에 무엇을 말하는지 듣는 것만 가능합니다.
이는 현대 AI 모델 (대규모 언어 모델) 을 연구하는 연구자들이 직면한 문제와 정확히 일치합니다. 빅테크 기업들은 이러한 강력한 AI 를 구축하지만 그 '청사진'은 비밀로 유지합니다. 그들은 AI 가 가진 '뉴런' (파라미터) 의 수를 알려주지 않는데, 이는 모델의 지능 수준이나 비용을 측정하는 표준적인 방법입니다.
이 논문은 이러한 비밀스러운 AI 뇌의 크기를 문장을 얼마나 잘 완성하는지 들어봄으로써 추측하는 교묘한 '블랙박스' 탐정 방법을 소개합니다.
핵심 아이디어: '기억력 테스트'
연구자들은 거의 모든 대규모 AI 가 동일한 거대한 인터넷 텍스트 뭉치로 훈련된다는 사실을 깨달았습니다. 이는 그들이 모두 동일한 인기 있는 책, 종교 텍스트, 그리고 유명한 문서들을 읽었다는 것을 의미합니다.
이를 기억력 대회라고 생각해 보세요. 만약 당신이 암기한 책의 문장을 완성하도록 사람에게 요청한다면, 뇌가 더 큰 사람 (더 많은 파라미터를 가진 사람) 이 일반적으로 뇌가 더 작은 사람보다 더 자주 정확하게 완성할 것입니다.
연구자들은 이를 다음과 같이 테스트했습니다:
- 햄릿, 성경, 미국 헌법과 같은 37 개의 유명한 퍼블릭 도메인 텍스트를 선정했습니다.
- 이를 수천 개의 작은 조각으로 잘랐습니다.
- 서로 다른 AI 모델들에게 해당 조각들에서 다음 단어를 예측하도록 요청했습니다.
그들은 명확한 패턴을 발견했습니다: AI 가 클수록 이러한 유명한 이야기들에서 다음 단어를 추측하는 능력이 더 뛰어났습니다. 다른 요인들 (AI 가 어떻게 가르쳐졌는지 등) 도 중요하지만, 뇌의 크기가 성공의 가장 큰 원동력이었습니다.
두 가지 탐정 도구
이러한 '기억력 점수'를 크기 추정치로 변환하기 위해 팀은 두 가지 다른 도구를 개발했습니다:
1. '스케일링 법칙' (지도)
뇌 크기를 알고 있는 알려진 사람들 (오픈소스 AI) 의 그룹이 있다고 상상해 보세요. 그들의 기억력 점수와 알려진 크기를 그래프에 표시하고 점들을 연결하는 부드러운 곡선을 그립니다. 그것은 사다리처럼 보입니다: 점수가 올라갈수록 크기는 기하급수적으로 증가합니다.
- 작동 원리: 비밀 AI 가 테스트를 받으면, 그것이 사다리의 어디에 위치하는지 확인합니다. 만약 그것이 1,000 억 파라미터 모델과 유사한 점수를 기록한다면, 대략 그 크기라고 추정합니다.
- 주의점: 비밀 AI 는 다르게 구축되었을 수 있기 때문에 (예: 한 번에 뇌의 일부만 활성화되는 '전문가 혼합' 모델), 연구자들은 매우 보수적으로 결정했습니다. 그들은 정확한 크기를 추측하지 않고 최소 바닥값을 추측합니다. 그들은 말합니다. "이 AI 는 적어도 이만큼 큽니다."
2. '정면 대결' 테스트 (경주)
때로는 정확한 숫자가 필요하지 않고, 누가 더 큰지만 알면 됩니다.
- 작동 원리: 연구자들은 두 개의 비밀 AI 를 동일한 기억력 테스트에서 서로 겨루게 합니다. 통계적인 '경주'를 통해 한 AI 가 다른 AI 보다 일관되게 문장을 더 잘 완성하는지 확인합니다.
- 결과: 만약 AI A 가 경주에서 AI B 를 이기면, 정확한 숫자를 알지 못하더라도 "AI A 는 확실히 AI B 보다 더 크다"라고 자신 있게 말할 수 있습니다.
그들이 발견한 것
팀은 19 개의 오픈소스 모델 (정답을 알고 있는 경우) 에 대해 이 방법을 테스트하여 95% 의 정확도로 맞혔습니다. 그 후, 그들은 OpenAI, Google, Anthropic, Alibaba 와 같은 회사의 '비밀' 모델들을 주목했습니다.
다음은 이 '탐정 작업'이 업계의 숨겨진 전략들에 대해 밝혀낸 내용입니다:
- '큰 뇌' 전략 (Google & Anthropic): 이러한 기업들은 거대한 파라미터 수를 가진 모델을 구축하는 것으로 보입니다. 예를 들어, 최상위 모델들은 수백 억 개의 파라미터를 가진 징후를 보였으며, 이는 새로운 세대가 나올수록 점점 더 커지고 있음을 시사합니다.
- '효율성' 전략 (OpenAI & Alibaba): 놀랍게도 연구자들은 OpenAI 의 새로운 모델들 (GPT-4o 및 GPT-5 변형 등) 이 이전 버전들에 비해 원시 파라미터 수 측면에서 크게 커지지 않은 것으로 보인다고 발견했습니다. 그들은 '크기 한계'에 도달한 것으로 보입니다. 뇌를 더 크게 만드는 대신, 더 나은 훈련이나 더 지능적인 알고리즘을 통해 기존 뇌를 더 똑똑하게 만드는 것으로 보입니다.
- 위계 확인: 이 방법은 제품들의 내부 순위도 정확하게 식별했습니다. 예를 들어, Anthropic 의 'Opus' 모델이 'Sonnet' 모델보다 크고, 'Sonnet' 모델이 'Haiku' 모델보다 크다는 것을 사전에 알려주지 않고도 정확히 추측해냈습니다.
한계점 (세부 사항)
이 논문은 이 방법이 할 수 없는 것에 대해 매우 솔직합니다:
- 하한선입니다: 이 방법은 안전하도록 설계되었습니다. AI 가 적어도 X 크기라고 말해주지만, 실제 크기는 훨씬 더 클 수 있습니다. 마치 실제로는 50 파운드일 수 있는 상자에 대해 "이 상자는 적어도 10 파운드입니다"라고 말하는 것과 같습니다.
- 'MoE' 문제: 일부 현대 AI 는 '전문가 혼합 (Mixture of Experts)' 아키텍처를 사용합니다. 전체 직원이 아니라 질문을 답변하기 위해 몇몇 특정 사서만 호출되는 도서관을 상상해 보세요. 연구자들은 총 사서 수와 활성화된 사서 수를 구분할 수 없기 때문에, 이러한 모델들의 정확한 총계는 알 수 없고 보수적인 최소값만 알 수 있습니다.
- 사기 금지: 이 방법은 AI 가 속이려고 하지 않는다고 가정합니다. 만약 한 회사가 자신의 크기를 숨기기 위해 유명한 책들을 잊어버리도록 AI 를 고의로 프로그래밍했다면, 이 방법은 실패할 것입니다.
결론
이 논문은 회사의 비밀 청사진이 없어도 그들의 AI 가 얼마나 큰지 좋은 아이디어를 얻을 수 있음을 증명합니다. 단순히 AI 가 유명한 이야기들을 얼마나 잘 기억하는지 테스트함으로써, 신뢰할 수 있는 '최소 크기'를 추론하고 회사가 모델을 더 크게 만들어 성장시키는지, 아니면 더 똑똑하게 만들어 성장시키는지 여부를 밝혀낼 수 있습니다. 이는 모든 것을 볼 수는 없더라도 '블랙박스'인 AI 를 우리가 엿볼 수 있는 것으로 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.