← 최신 논문
🤖 machine learning

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

본 논문은 데이터 동질성을 극복하고 견고한 일반화를 달성하기 위해 구조화된 진화 연산자와 동적 난이도 필터를 활용하여 데이터 합성을 기술 구성 및 복잡성 속성에 대한 지향적 탐색으로 간주함으로써 대형 언어 모델의 추론 능력을 향상시키는 진화적 작업 발견 (EvoTD) 프레임워크를 제안합니다.

원저자: Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하지만 경험이 부족한 로봇에게 복잡한 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 이를 위해 크게 두 가지 방법이 있습니다:

  1. 오래된 방식 (인간이 선별한 방법): 기존 퍼즐 수천 개를 찾아 적어두고 로봇이 그것들로부터 배우기를 바랍니다. 문제는 양질의 퍼즐이 충분하지 않으며, 기존에 있는 퍼즐들은 너무 쉽거나 서로 너무 비슷할 수 있다는 점입니다.
  2. "더 어렵게 만들기" 방식 (현재의 AI 방법): 초지능 AI 에게 "이걸 더 어렵게 만들어 줘"라고 말하며 새로운 퍼즐을 발명하게 합니다. 하지만 AI 는 종종 5 를 6 으로 바꾸는 것처럼 사소한 무의미한 변화만 하거나, 같은 퍼즐을 반복해서 만듭니다. 로봇은 지루해지고 실제로 똑똑해지지 않습니다.

**EVOTD (진화적 작업 발견, Evolutionary Task Discovery)**는 조지아 공과대학교 연구진이 이 문제를 해결하기 위해 제안한 새로운 방법입니다. 단순히 AI 에게 "더 어렵게 만들어 줘"라고 요청하는 대신, 훈련용 퍼즐 생성을 새로운 식물 종을 번식시키는 과정처럼 다룹니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

1. 두 가지 재료: "레시피"와 "분량"

연구진은 모든 퍼즐이 두 가지 뚜렷한 부분으로 구성되어 있음을 깨달았습니다:

  • 기술 (The Skill, 레시피): "슬라이딩 윈도우"나 "이진 탐색"을 사용하는 방법과 같은 핵심 논리입니다. 이는 요구되는 사고의 유형입니다.
  • 복잡도 (The Complexity, 분량): 특정 사례가 얼마나 크거나 어려운지입니다. 숫자 목록이 5 개인지 5,000 개인가요? 트리가 3 단계 깊이인지 100 단계 깊이인가요?

대부분의 이전 방법들은 이 두 가지를 동시에 무작위로 변경하려 했습니다. EVOTD 는 이를 분리합니다. 마치 요리사가 먼저 무슨 요리를 할지 (기술) 결정하고, 그다음 몇 명에게 제공할지 (복잡도) 결정하는 것처럼요.

2. 진화식 주방

이 시스템은 새로운 퍼즐을 만들기 위해 두 가지 특수한 "요리사" (연산자) 를 사용합니다:

  • 변이체 (Mutator, 분량 요리사): 이 요리사는 유효한 퍼즐을 가져와 핵심 논리를 바꾸지 않고 크기제약 조건을 변경합니다.
    • 비유: 원래 퍼즐이 "10 명 줄에서 가장 키 큰 사람 찾기"였다면, 변이체는 이를 "10,000 명 줄에서 가장 키 큰 사람 찾기"로 바꿉니다. 논리 (최댓값 찾기) 는 그대로지만 난이도 (규모) 는 증가합니다. 이는 로봇이 작은 예시뿐만 아니라 어떤 크기에서도 작동하는 견고한 규칙을 배우도록 강요합니다.
  • 교배체 (Crossbreeder, 레시피 요리사): 이 요리사는 서로 다른 두 퍼즐을 가져와 핵심 기술을 결합하여 완전히 새로운 것을 만듭니다.
    • 비유: 퍼즐 A 가 "정렬"을 사용하고 퍼즐 B 가 "그래프 탐색"을 사용한다면, 교배체는 그래프를 탐색하기 전에 항목을 정렬해야 하는 새로운 퍼즐을 만듭니다. 초콜릿과 땅콩 버터를 섞어 둘 다 없던 새로운 맛을 만들어내는 것과 같습니다. 이를 통해 로봇이 서로 다른 논리 도구를 결합하는 법을 배우게 됩니다.

3. "골디락스" 필터 (근접 발달 영역)

무작위 퍼즐을 로봇에게 던져서는 안 됩니다. 퍼즐이 너무 쉬우면 아무것도 배우지 못하고, 불가능하면 로봇은 포기합니다.

EVOTD 는 골디락스 필터를 사용합니다. 퍼즐이 훈련에 사용되기 전에 시스템이 다음을 확인합니다:

  • 너무 쉬운가? (버린다).
  • 불가능한가? (버린다).
  • 딱 좋은가? (보관한다).

중요한 점은 "딱 좋은" 기준이 로봇이 똑똑해짐에 따라 변한다는 것입니다. 어제까지 불가능했던 퍼즐이 오늘에는 "딱 좋은" 수준이 될 수 있습니다. 이는 로봇이 향상됨에 따라 자동으로 더 어려워지는 동적 커리큘럼을 만들어 항상 "학습 영역"에 머무르게 합니다.

4. 결과

연구진은 수학 및 코딩 문제를 해결하는 모델들을 대상으로 이를 테스트했습니다. 그 결과 다음과 같은 점을 발견했습니다:

  • 향상된 일반화: 모델들은 단순히 답을 외우는 것이 아니라 근본적인 논리를 매우 잘 학습하여 본 적 없는 문제도 해결할 수 있었습니다.
  • "동질성 붕괴" 부재: 다른 방법들은 결국 아이디어가 고갈되어 같은 퍼즐을 반복하는 반면, EVOTD 는 신선하고 다양한 과제를 계속 찾아냈습니다.
  • 보편적 향상: 모델의 크기나 원래 훈련 방식과 관계없이 다양한 유형의 AI 모델에서 잘 작동했습니다.

결론

EVOTD 는 단순히 워크시트를 나눠주는 교사와 같습니다. 대신, 다양한 논리 기술을 혼합하고 학생의 현재 능력에 맞춰 난이도를 완벽하게 조절하여 새로운 문제를 체계적으로 발명하는 방식을 취합니다. 이는 학생이 항상 성장하기 위해 충분히 도전받도록 보장하며, 정적이고 미리 작성된 문제들만 연습하는 것보다 훨씬 강력한 추론 능력을 기르게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →