← 최신 논문
🤖 AI

daVinci-LLM:Towards the Science of Pretraining

이 논문은 산업적 규모와 연구 자유를 동시에 확보한 'daVinci-LLM' 프로젝트를 통해, 데이터 처리의 깊이와 적응형 커리큘럼이 사전 학습의 성능 한계를 결정한다는 것을 200 여 건 이상의 통제 실험을 통해 규명하고 완전한 오픈 패러다임을 통해 사전 학습의 과학적 방법론을 정립했습니다.

원저자: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍳 핵심 메시지: "좋은 재료와 조리법이 없으면, 아무리 큰 냄비 (컴퓨터) 를 써도 맛있는 요리는 안 됩니다."

지금까지 인공지능 (AI) 연구계는 두 가지 큰 문제가 있었습니다.

  1. 대기업들: 엄청난 돈과 컴퓨터 (냄비) 는 있지만, 비결 (레시피) 을 공개하지 않아서 "어떻게 만들었는지" 알 수 없었습니다.
  2. 학자들: 비결을 공개하고 싶지만, 큰 냄비 (컴퓨터) 가 없어서 실험을 제대로 할 수 없었습니다.

이 논문은 SII-GAIR라는 팀이 이 두 가지를 모두 해결했습니다. "우리는 대기업만큼 큰 냄비도 있고, 학자처럼 모든 비결을 공개할 자유도 있다"고 말하며, 30 억 개의 파라미터 (뇌세포) 를 가진 작은 AI 를 만들어 70 억 파라미터의 큰 AI 와 맞먹는 실력을 냈습니다.


🥣 1. 식재료 준비 (데이터): "다 같은 재료는 아니다"

AI 를 훈련시킬 때 쓰는 데이터 (책, 코드, 과학 논문 등) 는 그냥 무작위로 모으면 안 됩니다. 이 연구팀은 **'다윈의 진화 (Data Darwinism)'**라는 개념을 썼습니다.

  • L0~L2 (가공 안 된 원재료): 인터넷에서 긁어온 더러운 텍스트들입니다. 잡음이 많고 엉망입니다.
  • L3 (선별): "이건 쓰레기야, 이건 좋은 거야"라고 AI 가 먼저 골라냅니다. (약간 더 좋아짐)
  • L4 (다듬기): 좋은 글이라도 문장이 어색하거나 불필요한 부분이 있으면 AI 가 다듬어서 깔끔하게 만듭니다.
  • L5 (새로운 요리): 단순히 다듬는 게 아니라, AI 가 직접 "질문과 답"을 만들어내거나, 어려운 과학 논문을 초등학생도 이해할 수 있게 해설을 달아주는 것입니다.

💡 비유: 그냥 고기를 구워 먹는 것 (L2) 보다, 소스를 바르고 (L4), 요리사가 맛을 보고 양념을 더한 (L5) 고기가 훨씬 맛있다는 뜻입니다. 이 연구는 단순히 양 (데이터 양) 을 늘리는 것보다, 질 (데이터 가공 깊이) 을 높이는 게 더 중요함을 증명했습니다.


🍽️ 2. 조리 과정 (학습): "단계별로 메뉴를 바꿔라"

이 모델은 한 번에 모든 걸 다 익히는 게 아니라, **두 단계 (Stage)**로 나누어 훈련시켰습니다.

  • 1 단계 (기초 다지기): 인터넷의 다양한 글 (뉴스, 블로그 등) 을 많이 읽게 해서 일반적인 상식과 언어 감각을 익힙니다.
    • 발견: 일반 상식은 금방 다 익히지만, 수학이나 코딩 같은 복잡한 추론 능력은 시간이 훨씬 더 걸립니다.
  • 2 단계 (특화 훈련): 기초가 잡히자, 일반 글의 비율을 줄이고 질문과 답 (QA) 이 있는 데이터를 집중적으로 먹입니다.
    • 비유: 처음에는 "다양한 음식"을 맛보게 하다가, 나중에 "요리사 학교"에 보내서 추리력 (수학/코딩) 을 집중적으로 훈련시킨 셈입니다.

💡 핵심: "무조건 많이 먹이는 것"보다, 배우는 단계에 따라 먹이는 메뉴를 바꿔주는 것이 훨씬 효과적이었습니다.


📊 3. 결과: "작은 모델이 거인을 이겼다"

이렇게 정성들여 만든 30 억 파라미터 (작은 AI) 모델은, 70 억 파라미터 (큰 AI) 모델과 거의 같은 실력을 냈습니다. 특히 수학 문제 해결코드 작성 능력은 훨씬 뛰어났습니다.

  • 기존 방식: "컴퓨터가 더 크고, 데이터가 더 많아야 AI 가 똑똑해진다."
  • 이 연구의 방식: "데이터를 어떻게 다듬고, 어떤 순서로 먹이느냐가 더 중요하다."

🌟 4. 왜 이 논문이 특별한가? (투명성)

대부분의 AI 회사는 "우리가 이 모델을 만들었어요. 성능은 이렇습니다"라고만 말합니다. 하지만 이 연구팀은 모든 것을 공개했습니다.

  • 어떤 데이터를 썼는지 (식재료 목록)
  • 어떻게 다듬었는지 (조리법)
  • 어떤 실험이 실패했는지 (맛없는 요리 실패 기록)

💡 비유: 다른 식당은 "맛있는 음식만 내어줍니다"라고 하지만, 이 연구팀은 **"이 요리를 만들기 위해 실패한 레시피 200 개와 성공한 레시피, 그리고 모든 재료의 출처를 공개합니다"**라고 말합니다. 덕분에 다른 연구자들도 이 비법을 배워서 더 좋은 AI 를 만들 수 있게 되었습니다.

📝 한 줄 요약

"AI 를 똑똑하게 만드는 비결은 거대한 컴퓨터가 아니라, 데이터를 어떻게 정성껏 다듬고 단계별로 훈련시키느냐에 있습니다. 우리는 그 비결을 모두 공개했습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →