← 최신 논문
🤖 AI

A-Evolve-Training: Autonomous Post-Training of a 30B Model

이 논문은 자율 시스템이 인간의 개입 없이 30B 규모의 프런티어 모델에 대해 엔드 투 엔드 사후 학습을 성공적으로 수행하여 경쟁력 있는 리더보드 성능을 달가하고, 스스로의 오도된 평가 지표를 독립적으로 탐지 및 수정할 수 있는 능력을 입증한 최초의 공개 기록 사례를 보고한다.

원저자: Zhan Shi, Bing He, Yisi Sang, Hanqing Lu

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhan Shi, Bing He, Yisi Sang, Hanqing Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

연구진들이 매우 똑똑한 로봇(300억 개의 파라미터를 가진 AI 모델)에게 복잡한 논리 퍼즐을 푸는 법을 가르치려 한다고 상상해 보십시오. 보통 이 과정은 인간의 손길이 많이 가는 느린 작업입니다. 팀이 새로운 전략을 추측하고, 몇 주가 걸리는 테스트를 실행하고, 결과를 확인한 뒤, 무엇을 유지할지 결정하는 식이죠.

이 논문은 A-Evolve-Training이라 불리는 시스템이 인간의 개입 없이 몇 주 동안 이 전체 과정을 자율적으로 수행해 낸 과정을 설명합니다.

다음은 그들이 무엇을 했는지, 어떻게 했는지, 그리고 무엇을 발견했는지를 쉬운 비유를 통해 설명한 이야기입니다.

1. 거대한 도전: "비싼 실험" 문제

작은 AI(예: 구형 GPT-2)를 훈련시키는 것을 쿠키 한 조각을 굽는 것에 비유해 봅시다. 몇 분밖에 걸리지 않고 비용도 거의 들지 않으며, 만약 쿠키가 타버린다면 그냥 버리고 다시 구우면 그 그만입니다. 오후 한나절 동안 1,000개의 레시피를 시도해 볼 수도 있죠.

하지만 거대한 "프런티어" AI(300억 개의 파라미터)를 훈련시키는 것은 도시 전체를 위한 거대한 다일간의 연회 음식을 만드는 것과 같습니다. 몇 주가 걸리고, 엄청난 양의 전기와 하드웨어 비용이 들며, 만약 레시피를 망쳤을 때 쉽게 "다시 시도"할 수 없습니다. 매우 신중해야 합니다.

이전의 AI 연구 에이전트들은 작은 모델(쿠키)을 굽는 데는 뛰어났습니다. 이 팀은 질문을 던졌습니다. AI 에이전트가 인간 셰프의 감시 없이도 저 거대한 연회 음식을 구워낼 수 있을까?

2. 해결책: "불변의 주방"과 "리셋 버튼"

이 작업을 성공시키기 위해 팀은 주요 문제를 해결해야 했습니다. 바로 일관성입니다. 만약 AI가 매번 새로운 레시피를 시도할 때마다 오븐, 재료, 계량컵을 마음대로 바꾼다면, 케이크가 실패한 이유가 레시피 때문인지 아니면 오븐이 고장 났기 때문인지 알 수 없게 됩니다.

그들은 "대칭적 자유(Symmetric Freedom)" 원칙을 사용하여 세 가지 핵심 규칙으로 시스템을 설계했습니다.

  • 불변의 주방 (기질/Substrate): 오븐, 조리대, 기본 도구들이 인간에 의해 잠겨 있는 주방을 상상해 보십시오. 어떤 AI도 이것들을 건드릴 수 없습니다. 이는 모든 실험이 정확히 동일하고 완벽한 기준점에서 시작되도록 보장합니다.
  • 리셋 버튼 (기억이 없는 일꾼들): "데이터 에이전트"가 반쯤 구워진 케이크를 "베이킹 에이전트"에게 전달하고, 그것을 다시 "시식 에이전트"에게 전달하는 방식 대신, 시스템은 **8개의 동일한 복제본(Clone)**을 사용합니다.
    • 매 라운드마다 8개의 복제본을 생성합니다.
    • 각 복제본은 잠겨 있는 주방의 새로운 사본을 받습니다.
    • 각 복제본은 서로 다른 수정 사항을 시도합니다 (예: "초콜릿 추가", "더 오래 굽기", "밀가루 바꾸기").
    • 그들은 굽고, 맛보고, 보고합니다.
    • 결정적으로: 라운드가 끝나면 모든 것이 폐기됩니다. 다음 라운드는 8개의 새로운 복제본과 새로운 주방에서 시작됩니다. 이는 "나쁜 습관"이나 숨겨진 오류가 시간이 흐름에 따라 누적되는 것을 방지합니다.
  • 헤드 셰프 (메타 에이전트): 중앙 AI는 8개 복제본의 보고서를 읽습니다. 이 AI는 주방을 바꾸지 않습니다. 오직 다음 라운드를 위한 **지침서(Instruction Manual)**만을 바꿉니다. AI는 결정합니다: "좋아, 초콜릿 아이디어는 효과가 있었지만, 밀가루 아이디어는 실패했어. 다음번에는 초콜릿 변형을 더 많이 시도해 보자."

3. 결과: 인간을 이기다 (거의)

시스템은 몇 주 동안 4번의 라운드를 수행했습니다.

  • 점수: 최종 AI 모델은 어려운 추론 과제에서 0.86을 기록했습니다.
  • 경쟁: 최고의 인간 팀은 0.87을 기록했습니다.
  • 순위: 이 AI는 약 4,000개의 참가 팀 중 8위를 차지했습니다.

이는 매우 중요한 성과입니다. 왜냐하면 AI가 복잡한 다주간의 연구 캠페인을 스스로 수행하여 인간 최고의 팀들과 거의 차이가 없는 결과를 낼 수 있음을 증명했기 때문입니다.

4. 진짜 발견: "쉬운 지표의 함정"

이 논문의 가장 흥ante로운 부분은 단순히 점수가 아니라, AI가 자신의 지침을 역이용(Outsmart)한 순간입니다.

  • 함정: 처음에 AI는 "내부 발전 점수(연습 테스트)"를 극대화하라는 명령을 받았습니다. AI는 한 가지 특정 유형의 논리 퍼즐(방정식)에 과도하게 집중함으로써 내부 점수를 기록적인 수준까지 높일 수 있는 트릭을 찾아냈습니다.
  • 깨달음: AI는 자신의 내부 점수는 완벽하지만, 실제 리더보드에서의 성능은 움직이지 않고 있다는 사실을 알아차렸습니다. AI는 깨달았습니다: "잠깐, 나는 연습 테스트에서는 잘하고 있지만, 실제 게임에서는 똑똑해지지 않고 있어. 연습 테스트가 나를 속이고 있어."
  • 전환: 내부 점수를 맹목적으로 쫓는 대신, AI는 자신의 전략을 바꿨습니다. AI는 쉬운 지표를 무시하기로 결정했고, 대신 내부 점수는 낮아질 수 있지만 실제 리더보드에는 도움이 될 만한 것들을 시도하기로 했습니다.
  • 왜 중요한가: 이는 자율 시스템이 자신의 측정 도구가 고장 났음을 감지하고 스스로의 탐색 전략을 수정한 첫 번째 사례입니다. AI는 단순히 최적화를 한 것이 아니라, 게임의 규칙에 결함이 있음을 발견하고 게임을 플레이하는 방식을 바꾼 것입니다.

요약

이 논문은 AI가 거대한 모델에 대해 인간의 도움 없이 처음으로 완전한 엔드 투 엔드(end-to-end) 연구 캠페인을 성공적으로 수행했다고 주장합니다.

  • 단순히 명령을 따르지 않았습니다: 자신의 "성적표"가 오해를 불러일으킬 수 있다는 것을 알아차리고 접근 방식을 바꿨습니다.
  • 단순히 쿠키를 굽지 않았습니다: 거대한 연회 음식을 구워냄으로써, 실수가 비용이 큰 규모에서도 자율적 연구가 작동할 수 있음을 증명했습니다.
  • 핵심 요점: 우리는 AI가 정해진 틀 안에서 최적화하는 단계를 넘어, 틀이 잘못되었다는 것을 깨달았을 때 틀 자체를 재설계할 수 있는 단계로 나아가고 있습니다.

저자들은 이것이 완성된 제품이 아니라 "첫 걸음"이라고 신중하게 밝히고 있지만, 이는 오늘날 자율적 AI 연구가 무엇을 할 수 있는지에 대한 기준을 명확히 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →