SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution
SkillRise는 대규모 언어 모델 에이전트가 기술을 점진적인 시퀀스로 구성하고 단일 정책을 사용하여 과업 해결과 진화하는 기술 문서 큐레이션을 동시에 수행함으로써, 서로 다른 과업 전반에 걸쳐 전이 가능한 기술을 진화시키고 재사용할 수 있게 하는 통합 강화 학습 프레임워크로서, 기존의 다단계 또는 독립적 과업 접근 방식보다 우수한 성능과 효율성을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 비디오 게임을 하는 법을 가르치고 있다고 상상해 보세요. 옛날에는 로봇이 1단계를 통과하지 못하면, 모든 것을 잊어버리고 2단계를 처음부터 다시 시작하며 운 좋게 성공하기만을 바랐습니다. 이는 마치 자전거를 타다 넘어졌을 때, 왜 넘어졌는지 기억하지 못한 채 바로 일어나서 다른 자전거를 타려고 시도하는 것과 같았습니다. 이것이 바로 'AI 에이전트'라고 불리는 많은 컴퓨터 프로그램이 작동하던 방식이었습니다. 그들은 모든 새로운 도전을 완전히 새롭고 고립된 사건으로 취급하여, 이전 단계에서 배웠던 모든 교훈을 낭비했습니다.
하지만 만약 로봇이 게임을 할 때마다 점점 더 똑똑해지는 '컨닝 페이퍼'나 '일기'를 가질 수 있다면 어떨까요? 이것이 바로 AI가 시행착착오를 거치며, 성공했을 때 보상을 받고 실수를 통해 배우는 '강화 학습(Reinforcement Learning)'이라는 분야의 핵심입니다. 최근 과학자들은 AI 에이전트가 단순히 하나의 퍼즐을 푸는 것을 넘어, 여러 가지 다양한 퍼즐을 풀 수 있게 도와주는 일반적인 '기술'을 배우도록 가르치려 노력하고 있습니다. 여기서 큰 질문은, 첫 번째 퍼즐의 구체적인 세부 사항 때문에 혼란을 겪지 않으면서도, 나중에 실제로 도움이 될 수 있는 방식으로 자신의 교훈을 기록하도록 AI를 어떻게 가르칠 것인가 하는 점입니다.
여기에 AI 에이전트를 위한 초스마트 튜터 역할을 하는 새로운 방법인 SkillRise가 등장했습니다. Skill-Rise는 에이전트가 과거를 잊게 만드는 대신, 쉬운 것에서 어려운 것으로 이동하는 '레벨 업' 시퀀스로 과제를 구성합니다. 에이전트는 게임을 진행하면서 두 가지 일을 동시에 수행합니다. 현재 단계를 해결하려고 노력하는 동시에, 자신의 기술 일기를 업데이트하는 '큐레이터' 역할을 수행하는 것입니다. 이것은 마치 비디오 게임 캐릭터가 보스를 물리친 후, 단순히 다음 단계로 넘어가는 것이 아니라 즉시 자신의 저널에 새로운 항목을 적는 것과 같습니다: "이봐, 그 보스는 네가 왼쪽에 있을 때만 공격했다는 걸 기억해. 다음번에는 오른쪽에 있어."
SkillRise의 마법은 AI에게 보상을 주는 방식에 있습니다. 현재 과제를 해결했을 때 점수를 줄 뿐만 아니라, 그 '일기 항목'이 미래의 과제를 해결하는 데 얼마나 잘 도움이 되었는지에 따라서도 점수를 줍니다. 이는 AI가 구체적인 세부 사항(예: "보스의 이름은 Bob이었다")보다는 일반적인 규칙(예: "오른쪽에 머물러라")을 기록하도록 장려합니다. 연구진은 이 방법을 세 가지 서로 다른 '세계'에서 테스트했습니다: 에이전트가 청소와 정리를 해야 하는 집(ALFWorld), 특정 물건을 구매해야 하는 온라인 상점(WebShop), 그리고 실험을 수행해야 하는 과학 실험실(ScienceWorld)입니다.
결과는 인상적이었습니다. SkillRise는 단순히 훈련된 특정 과제에서만 잘하게 된 것이 아니라, '학습하는 법' 자체를 배웠습니다. 연구진이 관련 있는 과제들의 더 긴 시퀀스를 연습하도록 주었을 때, 에이전트는 더욱 발전했는데, 이는 에이전트가 단순히 답을 암기하는 것이 아니라 자신의 기술을 진정으로 재사용하고 있음을 시사합니다. 실제로 SkillRise는 다른 최고 수준의 방법들을 상당한 차이로 앞질렀으며, 성공률을 최대 8.5%포인트까지 향상시켰습니다. 더욱 놀라운 점은, 서로 다른 과제들에 대해 훈련되었음에도 불구하고, 특정 과제만을 위해 설계된 방법들보다 동일한 과제를 반복해서 수행하는 데 있어서도 더 뛰어난 성능을 보였다는 것입니다. 또한, 복잡한 다단계 파이프라인을 통해 메모리를 관리해야 했던 기존 방식들보다 훨씬 더 빠르고 적은 컴퓨팅 자원으로 이 모든 것을 해냈습니다.
요약하자면, SkillRise는 AI를 똑똑하게 만들고 싶다면 단순히 연습하게 하는 것에 그치지 말고, 자신의 지혜를 담은 지속적으로 진화하는 노트를 작성하도록 가르쳐야 한다는 것을 시사합니다. '행하는 것'과 '배운 것을 기록하는 것'을 분리하고, 그 기록이 미래의 도전에 얼마나 유용한지에 따라 에이전트에게 보상을 줌으로써, 우리는 단순히 문제를 해결하는 것을 넘어 시간이 흐름에 따라 스스로의 전략을 진화시켜 더 나은 문제 해결사가 되는 에이전트를 구축할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.