← 최신 논문
🤖 AI

To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining

이 논문은 고정된 데이터 예산 하에서 사전 학습 데이터 규모와 검색 저장소 규모 간의 상충 관계를 체계적으로 분석하여, 모델 규모와 작업 유형에 따라 검색과 사전 학습 간의 최적 자원 배분을 결정하는 3 차원 스케일링 프레임워크를 제안합니다.

원저자: Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng

게시일 2026-04-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 지식을 어떻게 배워야 가장 효율적인가?"**라는 질문에 대한 흥미로운 답을 제시합니다.

핵심 아이디어는 **"AI 가 모든 것을 머릿속 (모델 가중치) 에 외워야 할까, 아니면 필요할 때 책 (검색 데이터) 을 찾아봐야 할까?"**를 정량적으로 분석한 것입니다.

이 복잡한 연구를 일상적인 비유로 쉽게 설명해 드릴게요.


🧠 1. 두 가지 학습 방법: "암기" vs "검색"

우리가 지식을 습득할 때 두 가지 방식이 있습니다.

  1. 암기 (Pretraining, 파라미터 지식): 시험을 보기 전에 모든 교과서를 통째로 외우는 방식입니다. 시험장에 책이 없어도 답을 바로 뱉어낼 수 있지만, 외우는 데 엄청난 시간과 에너지가 듭니다. 그리고 외운 게 틀리면 수정하기 어렵습니다.
  2. 검색 (RAG, 비파라미터 지식): 시험장에 교과서 (검색 데이터) 를 가지고 들어가는 방식입니다. 모르는 게 나오면 책을 펼쳐서 찾아보죠. 외울 필요는 없지만, 책을 찾는 시간이 걸리고, 책에 정답이 없으면 당황합니다.

이 논문은 이 두 가지 방식을 섞어서 쓸 때, "얼마나 많은 책을 외우고, 얼마나 많은 책을 검색용으로 남겨둬야 가장 똑똑해질까?"를 연구했습니다.


⚖️ 2. 핵심 발견: "작은 아이는 검색이, 큰 아이는 암기가 유리하다"

연구진은 다양한 크기의 AI 모델 (작은 것부터 큰 것까지) 을 훈련시키며 실험을 했습니다. 결과는 놀라웠습니다.

  • 작은 AI (초등학생 수준):

    • 작은 AI 는 머릿속 용량이 부족해서 모든 것을 외우기엔 한계가 있습니다.
    • 이때는 **검색 (책)**을 많이 활용하는 것이 훨씬 효과적입니다. "모르는 건 책에서 찾아보자"는 전략이 큰 점수 향상을 줍니다.
    • 비유: 작은 가방을 가진 학생은 책 100 권을 다 넣을 수 없으니, 도서관 (검색) 을 자주 이용하는 게 훨씬 똑똑해집니다.
  • 큰 AI (대학원생 수준):

    • 큰 AI 는 이미 머릿속에 많은 지식을 담고 있습니다.
    • 이들에게 검색을 더 추가하면 점수가 오르는 정도는 매우 작아집니다 (한계효용 체감). 이미 알고 있는 게 많아서, 책에서 찾아보는 게 큰 도움이 안 됩니다.
    • 비유: 이미 도서관 전체를 머릿속에 저장한 천재에게는, 다시 책을 찾아보는 시간이 아깝고, 오히려 그 시간에 새로운 개념을 더 깊이 공부하는 (암기) 게 나을 수 있습니다.

📉 3. 중요한 전환점: "4 배의 법칙"

연구진은 흥미로운 전환점을 발견했습니다.

  • 데이터 양이 모델 크기에 비해 약 4 배 정도일 때 (예: 10 억 개의 파라미터에 40 억 개의 단어) 는, 검색이 암기보다 훨씬 효율적입니다.
  • 하지만 이 비율을 넘어서서 더 많은 데이터를 주면, 이제는 **암기 (모델 훈련)**가 더 효율적인 길이 됩니다.
  • 비유: 공부를 시작할 때는 참고서 (검색) 를 보는 게 도움이 되지만, 어느 정도 실력이 붙으면 참고서보다 내 머릿속에 개념을 정리하는 (암기) 게 더 빠른 점수 상승을 가져옵니다.

🎯 4. 어떤 과목은 검색이 더 잘 통할까?

모든 문제가 검색으로 해결되는 건 아닙니다.

  • 사실 기반 질문 (예: "대한민국의 수도는?", "아인슈타인의 생년월일은?"): 검색이 매우 강력합니다. 정확한 사실을 책에서 찾아오면 되니까요.
  • 추론 문제 (예: 수학 문제, 논리 퀴즈): 검색이 크게 도움이 안 됩니다. 책에서 답을 찾아오는 게 아니라, 문제 자체를 분석하고 계산해야 하니까요. 오히려 검색 결과가 산만해서 혼란을 줄 수도 있습니다.

💡 5. 결론: "무조건 외우지 말고, 상황에 맞게 섞어라"

이 논문의 가장 큰 메시지는 **"데이터 예산 (학습 자료) 을 어떻게 나눌지 정하는 것이 중요하다"**는 것입니다.

  • 과거의 생각: "데이터가 많으면 무조건 AI 에게 다 먹여서 (외워서) 똑똑하게 만들자."
  • 이 논문의 제안: "데이터를 얼마나 많이 외울지얼마나 많이 검색용으로 남겨둘지를 상황에 맞게 조절하자."

실생활 비유:
회사를 운영한다고 상상해 보세요.

  • 작은 스타트업 (작은 AI): 직원 수가 적으니 모든 지식을 직원 머릿속에 넣기엔 무리입니다. 대신 외부 전문가나 검색 엔진을 잘 활용하는 시스템을 만드는 게 이득입니다.
  • 대기업 (큰 AI): 직원 수가 많고 교육 예산도 충분하니, 핵심 지식은 직원들이 다 외워두게 하고, 검색 시스템은 보조 수단으로만 두는 게 효율적일 수 있습니다.

한 줄 요약:

"AI 를 만들 때, 무조건 많은 데이터를 먹여 외우는 것보다, 모델의 크기와 문제의 종류에 맞춰 '머릿속 암기'와 '책 검색'의 비율을 잘 조절하는 것이 훨씬 똑똑하고 효율적인 AI 를 만드는 비결입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →