← 최신 논문
🤖 machine learning

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1는 이중 수준 목적 함수로 훈련된 경량 생성기를 통해 재사용 가능한 자연어 기술을 최적화하는 강화 학습 프레임워크로, 기본 고정 모델을 업데이트하지 않고도 복잡한 작업에서 에이전트형 LLM 의 비용 효율적이고 모델에 구애받지 않는 개선을 가능하게 합니다.

원저자: Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 요리에는 능숙하지만 레시피를 바꾸거나 새로운 기술을 배우는 것을 거부하는 천재적이지만 고집 센 요리사 (작업용 LLM) 가 있다고 가정해 봅시다. 그들은 자신의 방식에 "고정"되어 있습니다. 당신은 그들에게 완벽하고 복잡한 요리를 해달라고 원하지만, 올바른 지시가 없기 때문에 실수를 계속 반복합니다.

보통 이를 해결하기 위해 요리사를 처음부터 다시 훈련시키거나 (비싸고 어렵습니다), 실수할 때마다 새로운 프롬프트로 그들을 향해 소리치는 방법 (비효율적입니다) 을 시도할 수 있습니다.

Skill-R1은 이를 해결하는 새로운 방법입니다. 요리사를 바꾸는 대신, 메인 요리사가 따르는 레시피 카드 (스킬) 를 작성하고 수정하는 **가벼운 부조리 (스킬 생성기)**를 고용합니다.

이 시스템이 작동하는 방식을 간단한 단계로 나누어 설명합니다:

1. 설정: 요리사와 부조리

  • 요리사 (고정된 작업 모델): 이는 거대한 AI 모델입니다. 실제 작업 (요리 또는 문제 해결) 을 수행합니다. 이 모델의 뇌는 절대 변하지 않으며, 오직 지시사항만 따릅니다.
  • 부조리 (스킬 생성기): 이는 작고 훈련 가능한 AI 입니다. 지시사항을 작성합니다. 요리사가 실패하면 부조리는 무엇이 잘못되었는지 분석하고 다음 시도를 위해 더 나은 레시피를 작성합니다.

2. 과정: "시도, 실패, 수정, 반복" 루프

부조리가 요리사에게 특정 케이크를 굽는 법을 가르치려 한다고 상상해 보세요.

  1. 1 세대 생성: 부조리가 레시피를 작성합니다. 요리사가 이를 따라 케이크를 굽습니다. 결과는 다소 엉망입니다.
  2. 점수판: "심사관 (검증기)"이 케이크를 맛보고 점수를 매깁니다.
  3. 진화: 부조리는 점수와 엉망인 케이크를 살펴봅니다. 단순히 "다시 해봐"라고 말하는 대신, 다음 라운드를 위해 새롭고 개선된 레시피를 작성합니다.
  4. 2 세대 생성: 요리사는 새로운 레시피를 사용합니다. 케이크가 더 나아집니다.
  5. 반복: 이 과정이 반복됩니다 (여러 "세대"에 걸쳐). 부조리는 무엇이 작동했고 무엇이 실패했는지에 대한 역사를 바탕으로 레시피를 작성하는 데 더 똑똑해집니다.

3. 비법: 두 가지 유형의 "칭찬"

이 논문은 부조리가 더 나은 레시피를 작성하는 법을 가르치는 교묘한 방법을 소개합니다. 코치가 조언을 주는 것처럼 두 가지 유형의 피드백을 사용합니다:

  • 세대 내 피드백 (동료 검토):
    부조리가 요리사에게 동일한 레시피를 사용하여 한 번에 5 개의 케이크를 굽도록 요청한다고 상상해 보세요. 어떤 것은 훌륭하게 나오고 어떤 것은 타버립니다. 부조리는 이렇게 배웁니다: "알겠다, 이 특정 레시피가 저것보다 더 잘 작동한다." 이는 현재 아이디어의 가장 좋은 버전을 선택하는 데 도움이 됩니다.
  • 세대 간 피드백 (진행 상황 보고서):
    이는 큰 그림을 살펴봅니다. 5 세대의 레시피가 1 세대의 레시피보다 더 좋은 케이크를 만들어냈습니까? 새로운 레시피가 이전 것보다 개선되었다면 부조리는 큰 보상을 받습니다. 이는 시스템이 실제로 진화하고 시간이 지남에 따라 나아지고 있으며, 단순히 제자리걸음을 하고 있지 않음을 보장합니다.

4. 이것이 중요한 이유

  • 저렴합니다: 거대하고 비싼 요리사를 다시 훈련시킬 필요가 없습니다. 작고 저렴한 부조리만 훈련하면 됩니다.
  • 잠긴 문에서도 작동합니다: 요리사를 변경하지 않기 때문에, 요리사가 접근할 수 없는 독점 AI(예: 폐쇄 소스 모델) 라 하더라도 이 방법이 작동합니다. 단지 그에게 주는 지시사항만 변경하면 됩니다.
  • 어려운 문제를 해결합니다: 논문은 단순한 작업에서는 이것이 괜찮다고 밝혔습니다. 하지만 복잡한 다단계 작업(웹사이트 탐색이나 여러 단계가 포함된 수학 문제 해결 등) 의 경우, 이 방법은 게임 체인저입니다. 표준 방법들은 종종 포기하거나 막히지만, Skill-R1 은 문제가 해결될 때까지 지시사항을 계속 정제합니다.

결과

연구자들은 이 방법을 두 가지 어려운 도전 과제에서 테스트했습니다:

  1. GAIA: PDF, 스프레드시트, 웹 페이지를 읽는 실제 세계 작업.
  2. WebWalker: AI 가 특정 정보를 찾기 위해 인터넷을 탐색해야 하는 게임.

결과:

  • 특별한 지시 없이 요리사는 매우 적은 수의 작업을 올바르게 수행했습니다 (GAIA 에서 약 6%).
  • 표준 기법을 사용하면 더 나아졌습니다 (약 30%).
  • Skill-R1을 사용하면 요리사의 성능이 크게 향상되었습니다 (GAIA 에서 약 42%, WebWalker 에서 26%).

논문은 가장 큰 도약이 초기 (1 세대부터 3 세대까지) 에 발생했다고 지적합니다. 이때 부조리가 주요 오류를 수정했습니다. 이후 세대 (4 세대와 5 세대) 는 새로운 초능력을 추가하지는 않았지만, 요리사의 성능을 훨씬 더 일관되고 신뢰할 수 있게 만들어, 요리사가 쉬운 단계에서 실수로 실패하지 않도록 보장했습니다.

요약하자면: Skill-R1 은 작고 훈련 가능한 보조자가 무엇이 작동했고 무엇이 작동하지 않았는지에 따라 지시사항을 지속적으로 다시 작성함으로써 "고정된" AI 를 올바른 길로 유지하는 시스템입니다. 이는 AI 자체를 재구축할 필요 없이 더 똑똑하고 신뢰할 수 있는 에이전트를 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →