← 최신 논문
🤖 AI

Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember

이 논문은 정보가 풍부한 실패 사례들을 진화하는 기술 메모리로 증류하여 솔버(solver)를 가이드하고, 이 솔버가 다시 챌린저(challenger)의 문제 생성을 형성함으로써, 여러 QA 벤치마크 전반에서 성능을 향상시키기 위해 태스크 분포와 절차적 지식을 공동 진화시키는 양방향 루프를 구축하는 자기 진화형 검색 에이전트인 SESA를 소개한다.

원저자: Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai, Haoyu Wu, Minghui Wu, Chenxu Zhao, Ante Wang, Guannan He, Changwei Wang

게시일 2026-08-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai, Haoyu Wu, Minghui Wu, Chenxu Zhao, Ante Wang, Guannan He, Changwei Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 복잡한 비디오 게임을 하는 법을 가르치려 한다고 상상해 보세요. 하지만 당신에게는 규칙 책도 없고 연습할 레벨 목록도 없습니다. 대신 로봇은 진행하면서 스스로 레벨을 만들어내야 합니다. 이것은 인공지능(AI)이 학생인 동시에 교사 역할을 하는 **자기 대국(Self-Play)**이라는 과학 분야입니다. AI의 "교사" 부분은 퍼즐을 만들고, "학생" 부분은 그것을 풀려고 노력합니다. 만약 학생이 정답을 맞히면 점수를 얻고, 틀리면 실수로부터 조금 배우며 다시 시도합니다.

보통 이러한 AI 학생들은 실수를 할 때 그 순간에는 그것으로부터 배우지만, 다음 퍼즐로 넘어가면 그 구체적인 교훈은 잊어버립니다. 이것은 마치 자전거 타기를 배우기 위해 넘어졌다가, 일어나자마자 넘어졌는지 바로 잊어버리는 것과 같습니다. **기술 메모리(Skill Memory)**라고 불리는 또 다른 접근 방식은 자신이 배운 모든 기술을 적어두는 물리적인 공책을 간직하는 것과 같습니다. 하지만 종종 그 공책은 로봇이 직접 선택하지 않은, 고정된 오래된 게임들로부터 얻은 교훈들로 채워져 있습니다. 연구자들이 던져온 큰 질문은 이것입니다: 만약 로봇이 자신만의 어려운 레벨을 발명하고, 자신의 구체적인 실패로부터 배우며, 자신이 똑똑해짐에 따라 변화하는 공책에 그 교훈들을 적을 수 있다면 어떨까?

이것이 바로 "Self-Play Meets Skill Evolution"이라는 논문이 탐구하는 내용입니다. 저자들은 SESA(Self-Evolving Skill-Augmented Agent)라는 새로운 시스템을 소개합니다. SESA를 서로 협력하는 두 가지 뚜렷한 인격을 가진 로봇이라고 생각해 보세요: "챌린저(Challenger)"와 "솔버(Solver)"입니다. 챌린저는 까다로운 질문을 만들어내는 말썽꾸러기입니다. 솔버는 검색 엔진을 사용하여 답을 찾아내려는 탐정입니다.

여기 마법 같은 기술이 있습니다: 솔버가 질문에 답하는 데 실패했을 때, SESA는 그 실패를 그냥 버리는 대신, 그것을 하나의 "기술 카드(Skill Card)"로 만듭니다. 마치 "헤이, 다음에 프라하에서 태어난 왕자에 관한 질문을 받으면, 그가 특정 성씨를 가지고 있는지 확인하는 것을 기억해. 안 그러면 혼란스러울 수 있어!"라고 적힌 포스트잇과 같습니다. 솔버는 새로운 질문을 시도하기 전에 이 포스트잇들을 읽습니다.

하지만 SESA를 특별하게 만드는 영리한 부분은 바로 이것입니다: 챌린저(말썽꾸러기)는 이 포스트잇들을 볼 수 없습니다. 챌린저는 오직 솔버가 정답을 맞혔는지 틀렸는지만 볼 수 있습니다. 이것은 공정한 게임을 만듭니다. 만약 솔버가 포스트잇 덕분에 더 똑똑해진다면, 챌린저는 "오, 내 질문들이 너무 쉬웠구나!"라고 깨닫고 더 어려운 질문들을 만들기 시작합니다. 이는 솔버가 더 발전된 기술을 배우도록 강제하며, 이는 더 어려운 질문들로 이어져, AI가 스스로 점점 더 똑똑해지는 순환 구조를 만듭니다.

연구자들은 이 시스템이 매우 잘 작동한다는 것을 발견했습니다. 그들은 단순한 사실부터 여러 조각을 연결해야 하는 복잡한 퍼즐에 이르기까지 일곱 가지 다른 유형의 까다로운 질문들에 대해 테스트를 진행했습니다. 그들은 SESA가 실수를 그냥 잊어버리는 표준 방식에 비해 AI의 정확도를 약 1.2에서 3.2 포인트 정도 향상시켰다는 것을 발견했습니다. 더욱 흥сно로운 점은, AI가 교훈을 너무 잘 "학습"해서 나중에 포스트잇을 보지 않고도 문제를 올바르게 풀 수 있었다는 것입니다. 하지만 포스트-잇을 사용할 수 있는 상태로 두는 것은, 굳이 필요 없지만 자꾸 쳐다보게 되는 참고서처럼 약간의 추가적인 도움을 주었습니다.

이 논문은 이 "진화하는 메모리"가 단순히 최종 테스트를 위한 화려한 기술이 아니라, 실제로 AI가 학습하는 방식을 변화시킨다는 것을 보여줍니다. 실패를 재사용 가능한 기술로 바꾸고 이를 학습 과정에 다시 피드백함으로써, SESA는 자기 개선 순환을 만들어냅니다. 저자들은 이 접근 방식이 고정된 데이터셋으로부터 교훈을 단순히 암기하는 것보다 더 낫다고 제안하는데, 왜냐하면 AI의 현재 기술 수준에 맞춰 끊임없이 적응하며, AI를 할 수 있는 능력의 한계까지 계속 밀어붙이기 때문입니다. 요컨대, SESA는 자신의 실수를 기억하고 그것을 더 나은 미래를 만드는 데 사용하는 AI가, 단지 다음 질문으로 그냥 넘어가 버리는 AI보다 훨씬 더 똑똑한 학생임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →