← 최신 논문
💻 computer science

Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning

다윈 가족 프레임워크는 추가적인 경사 기반 학습 없이 대규모 언어 모델의 추론 능력을 획기적으로 향상시키기 위해 경사 없는 가중치 공간 재결합, 적응적 신뢰 기반 융합, 그리고 교차 아키텍처 번식을 활용하는 학습이 없는 진화적 병합 접근법을 제시합니다.

원저자: Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim

게시일 2026-05-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 명의 전문가 셰프가 있다고 상상해 보세요. 한 명은 이탈리아 요리의 대가 (그를 '아버지'라고 부르겠습니다) 이고, 다른 한 명은 프랑스 제과 분야의 대가 (그녀를 '어머니'라고 부르겠습니다) 입니다. 두 셰프 모두 같은 유명한 요리 학교 (이것을 '사전 학습된 기반'이라고 합니다) 에서 기본적인 칼질 기술과 주방 레이아웃을 배웠습니다.

이제 완벽한 파스타와 완벽한 크루아상을 모두 요리할 수 있는 궁극적인 '슈퍼 셰프'를 만들고 싶지만, 새로운 요리 학교에 보내 배울 시간은 없습니다. 또한 그들을 훈련시키기 위해 새로운 팀을 고용하고 싶지도 않습니다. 그저 지금 당장 그들의 기존 기술을 섞어보고 싶을 뿐입니다.

이것은 바로 다윈 패밀리 (Darwin Family) 논문이 수행하는 작업과 정확히 일치합니다. 다만 셰프 대신 대규모 언어 모델 (LLM)(AI 두뇌) 을 섞어 새로운 훈련 없이 추론(어려운 논리 퍼즐 해결) 능력을 향상시키는 것입니다.

다음은 그들이 사용한 간단한 비유를 통해 설명한 방법입니다:

1. 문제: 단순히 '섞는 것'이 보통 실패하는 이유

보통 두 개의 AI 모델을 섞으려 하면, 스테이크와 바나나를 블렌더에 넣어 스무디를 만드는 것과 같습니다. 매우 지저분해집니다. 두 모델이 서로 다른 방식으로 다른 것들을 배웠기 때문에 AI 는 혼란을 겪습니다.

  • 구식 방법은 재료를 단순히 평균 내는 것 (스테이크 50%, 바나나 50%) 과 같습니다. 이는 모델들이 서로 간섭하기 때문에 종종 나쁜 맛 (낮은 성능) 을 초래합니다.
  • 다윈의 해결책은 셰프 A 의 어떤 칼을 가져오고 셰프 B 의 어떤 휘핑 도구를 가져와서 완벽하게 결합하는지 정확히 아는 똑똑한 수석 조리기 (sous-chef) 와 같습니다.

2. 다윈의 세 가지 비밀 재료

이 논문은 이러한 혼합을 성공적으로 만들기 위한 세 가지 주요 도구를 소개합니다:

A. "14 차원 게놈 (The 14-Dimensional Genome)" (레시피 책)

AI 모델을 여러 개의 방 (레이어) 이 있는 거대한 건물로 생각하세요. 다윈 팀은 14 개의 서로 다른 노브가 있는 '레시피 책'(이를 게놈이라고 부름) 을 만들었습니다.

  • 건물 전체를 한 번에 섞는 대신, 노브를 돌려 다음과 같이 결정할 수 있습니다: "생각하는 방의 80% 는 셰프 A 에서 가져오되, 창의성 방의 20% 는 셰프 B 에서 가져오라."
  • 그들은 진화 탐색 (evolutionary search) 이라는 컴퓨터 프로그램을 사용하여 수천 가지의 이러한 레시피를 자동으로 시도하고, 맛이 가장 좋은 것들은 유지하며 나쁜 것들은 버립니다.

B. "MRI-Trust Fusion" (똑똑한 가이드)

이것은 이 논문의 가장 큰 혁신입니다. 똑똑한 수석 조리기에게 AI 의 두뇌 내부에서 실제로 추론을 위해 무거운 일을 수행하는 부분을 보여주는 특수 스캐너 (MRI) 가 있다고 상상해 보세요.

  • 문제: 때때로 스캐너는 약간 흐릿하거나 노이즈가 있을 수 있습니다. 때때로 레시피를 추측하는 컴퓨터도 잘못 추측할 수 있습니다.
  • 해결책: 시스템에는 '신뢰 다이얼'(τ\tau라고 함) 이 있습니다. "우리는 MRI 스캐너를 얼마나 신뢰해야 하며, 컴퓨터의 무작위 추측을 얼마나 신뢰해야 할까?"라고 묻습니다.
  • 시스템은 이 균형을 학습합니다. 스캐너가 "이 방은 논리에 중요합니다"라고 말하면 시스템은 귀를 기울입니다. 스캐너가 혼란스러우면 시스템은 컴퓨터의 시행착오에 더 의존합니다. 이 균형이 최종 결과를 매우 강력하게 만듭니다.

C. "아키텍처 매핑러 (The Architecture Mapper)" (번역기)

때로는 트랜스포머(표준 AI 구조) 로 구축된 모델과 맘바(더 새롭고 다른 구조) 로 구축된 모델을 섞고 싶을 수 있습니다. 그들은 서로 다른 '언어'를 사용합니다.

  • 아키텍처 매핑러는 번역기와 같은 역할을 합니다. 두 모델을 살펴보고 "좋아, 비록 다르게 보이지만 모델 A 의 이 특정 부분은 모델 B 의 이 부분과 동일하다"라고 말합니다.
  • 이를 통해 일반적으로 재학습 없이는 불가능했던 완전히 다른 유형의 AI 가족들 간의 부분들을 혼합할 수 있게 됩니다.

3. 결과: '슈퍼 셰프'의 등장

팀은 Darwin-27B-Opus라는 플래그십 모델로 이를 테스트했습니다.

  • 테스트: 그들은 이 모델을 GPQA Diamond에 통과시켰는데, 이는 대학원 수준의 과학 및 논리 질문 (PhD 입학 시험과 유사) 을 테스트하는 매우 어려운 시험입니다.
  • 점수: **86.9%**를 기록했습니다.
  • 순위: 이는 평가된 1,252 개 모델 중 #6 위에 올랐습니다.
  • 마법: 이는 자신의 '아버지' 모델 (원래 기반 모델) 을 능가했을 뿐만 아니라, 수개월간 훈련된 훨씬 더 큰 모델들조차 능가했습니다.
  • 비용: 그들은 새로운 훈련 없이 이를 달성했습니다. 새로운 데이터를 공급하거나 비싼 수학 (기울기) 을 사용하여 가중치를 조정하지 않았습니다. 그들은 단순히 이미 가지고 있던 기존 가중치를 재배열했을 뿐입니다.

4. 그들이 발견한 것 ("아하!" 순간들)

  • "초점" 유지: 승리한 레시피들을 살펴보면 한 가지 패턴을 발견했습니다. 시스템은 거의 항상 원래 기반 모델의 '어텐션 (Attention)' 부분 (AI 가 올바른 단어에 집중하는 데 도움이 되는 부분) 을 유지했지만, 실제 계산을 수행하는 '피드포워드 (Feed-Forward)' 부분은 전문화된 모델로 교체했습니다. 이는 셰프의 안정적인 손은 유지하면서 새로운 레시피 책으로 교체하는 것과 같습니다.
  • 어디서나 작동함: 그들은 40 억 개의 파라미터 (작은 규모) 에서 350 억 개의 파라미터 (큰 규모) 에 이르는 모델들에서 이를 테스트했습니다. 동일한 '혼합 규칙'이 모두에게 작동하여, AI 추론을 개선하는 보편적인 방법을 발견했음을 시사합니다.

요약

다윈 패밀리 논문은 더 똑똑한 AI 를 훈련시키기 위해 수백만 달러와 수개월의 시간이 항상 필요한 것은 아님을 증명합니다. 대신 기존 AI 모델을 가져와서 그들이 무엇을 알고 있는지 보기 위해 똑똑한 '스캐너'를 사용하고, 컴퓨터를 이용해 식물처럼 그들을 '교배'하여 부모보다 추론 능력이 뛰어난 새로운 더 똑똑한 모델을 만들 수 있습니다. 이는 새로운 훈련 코드를 한 줄도 작성하지 않고도 가능합니다.

핵심 교훈: 그들은 새로운 지식을 발명하지 않았습니다. 그들은 이미 모델 안에 숨겨져 있던 지식을 더 잘 작동하도록 재구성했을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →