← 최신 논문
🤖 AI

VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience

본 논문은 태스크별 실행 궤적과 공개된 스킬 버전 이력으로부터 증류된 구조화된 경험을 적응적으로 융합함으로써 에이전트 스킬의 자기 진화를 강화하는 새로운 프레임워크인 VCE-Skill을 제안하며, 이는 상당한 성능 향상과 더 강력한 교차 모델 전이 능력을 결과로 가져온다.

원저자: Jianming Chen, Xuanbin Ye, Yawen Wang, Junjie Wang, Qing Wang, Fanjiang XU

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jianming Chen, Xuanbin Ye, Yawen Wang, Junjie Wang, Qing Wang, Fanjiang XU

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 연구자들은 컴퓨터 프로그램이 인간 비서처럼 행동하도록 가르치고 있습니다. 흔히 '에이전트'라고 불리는 이 프로그램들은 단순히 질문에 답하는 것에 그치지 않고, 도구를 사용하고, 지시사항을 따르며, 파일을 관리함으로써 과업을 수행합니다. 이러한 에이전트를 신뢰할 수 있게 만들기 위해, 개발자들은 그들에게 '기술(skill)'을 부여합니다. 기술을 일종의 휴대 가능한 도구 상자로 생각해보십시오. 이 상자에는 에이전트가 특정 유형의 문제에 직면할 때마다 꺼내어 사용할 수 있는 일련의 지침, 스크립트, 그리고 자원들이 담겨 있습니다. 하지만 인간이 실수를 통해 배우는 것처럼, 이 도구들도 처음 만들어졌을 때 완벽한 경우는 드뭅니다. 세상이 변하고 새로운 도전 과제가 생겨남에 따라, 이 도구 상자 안의 지침들도 업데이트되고, 패치되고, 개선되어야 합니다. 과학자들의 핵심적인 질문은 어떻게 이 개선 과정을 자동화하여 에이전트가 시간이 흐름에 따라 스스로 더 나아질 수 있도록 가르칠 것인가 하는 점입니다.

한동안 이러한 자기 개선을 위한 표준적인 접근 방식은 에이전트가 과업을 시도하게 하고, 어디서 실패했는지 관찰한 뒤, 그 특정 실패를 바탕으로 지침을 다시 작성하게 하는 것이었습니다. 이 방법은 전적으로 현재의 시도에서 수집된 증거에 의존합니다. 이 방식은 효과적이긴 하지만, 하나의 사각지대를 가지고 있습니다. 바로 현재 발생하는 실수만을 본다는 점입니다. 이는 다른 개발자들이 유사한 도구들을 수년간 유지보수하며 배운 더 넓은 교훈들을 놓치게 만듭니다. 중국과학원과 베이징 정보통신대학교의 연구진은 이러한 좁은 초점이 방대한 지식의 도서관을 활용하지 못하게 만들고 있다는 사실을 깨달았습니다. 그들은 공개 소프트웨어 도구들에 가해진 변경 사항의 역사가 에이전트의 즉각적인 경험이 가르쳐줄 수 없는 무언가를 가르쳐줄 수 있는지 확인하고자 했습니다.

연구진은 먼저 두 가지 서로 다른 정보원을 비교하는 것으로 시작했습니다. 첫 번째 정보원은 과업에 대한 에이전트 자신의 최근 시도였으며, 이는 무엇이 잘못되었는지에 대해 상세하지만 좁은 시야를 제공했습니다. 두 번째 정보원은 인간 개발자들이 오랜 시간에 걸쳐 유사한 도구들에 가한 변경 사항의 공개 기록이었습니다. 이 두 가지 소스를 나란히 분석했을 때, 연구진은 명확하고 유용한 차이점을 발견했습니다. 에이전트 자신의 시도는 주로 도구를 호출하거나 지침을 읽는 방식에서의 즉각적이고 구체적인 오류를 수정하는 데 집중되었습니다. 반면, 공개 기록은 데이터가 어떻게 조직되는지, 스크립트가 어떻게 구조화되는지, 그리고 도구가 예상치 못한 상황을 어떻게 처리하는지에 대한 변경을 포함하여 훨씬 더 다양한 종류의 개선 사항을 담고 있었습니다. 공개 기록은 더 넓은 관점을 제공했고, 에이전트 자신의 기록은 근거 있고 과업 특정한 현실을 제공했습니다. 두 소스는 서로 반복되는 것이 아니라, 오히려 서로의 빈틈을 채워주었습니다.

이 통찰력을 실제로 적용하기 위해, 연구진은 VCE-Skill이라는 새로운 시스템을 개발했습니다. 이 시스템은 에이전트의 현재 경험과 과거의 집단 지성 사이를 잇는 가교 역할을 합니다. 과정은 크게 두 단계로 진행됩니다. 첫째, 시스템은 공개 저장소로부터 온 가공되지 않은 무질서한 변경 이력을 가져와 이를 정제합니다. 시스템은 특정 프로젝트에만 적용되는 구체적인 세부 사항들을 제거하고, 이를 일반적이고 재사용 가능한 교훈으로 추출합니다. 예를 들어, 많은 개발자가 파일을 열기 전에 파일이 존재하는지 확인하는 절차를 추가했다면, 시스템은 이를 단일한 수정 사항이 아닌 일반적인 규칙으로 학습합니다. 이렇게 추출된 교훈들은 구조화된 경험 라이브러리에 저장됩니다.

두 번째 단계에서, 에이전트는 과업을 시도하고 발생한 일을 바탕으로 개선을 위한 자체 아이디어를 생성합니다. 그런 다음 시스템은 자신의 경험 라이브러리를 살펴보고 현재의 문제와 가장 관련이 깊은 교훈들을 선택합니다. 시스템은 단순히 과거의 교훈을 복사하거나 에이전트 자신의 아이디어를 무시하지 않습니다. 대신, 두 가지를 신중하게 혼합합니다. 만약 에이전트가 공공 기록에서 이미 여러 번 해결된 흔한 문제로 어려움을 겪고 있다면, 시스템은 외부의 지혜에 크게 의존합니다. 만약 에이전트가 이전에 본 적 없는 독특하고 기이한 오류에 직면했다면, 시스템은 에이전트 자신의 관찰을 더 신뢰합니다. 이 균형은 고정되어 있지 않습니다. 시스템은 실제 변경 사항이 에이전트의 성능을 실제로 향상시키는지 여부에 따라 외부 라이브러리와 에이전트 자신의 경험 중 어느 쪽을 더 신뢰할지를 끊임없이 조정합니다.

이 접근 방식의 결과는 복잡한 질문에 답하는 것부터 스프레드시트 관리, 가상 환경에서의 로봇 제어에 이르기까지 다섯 가지 유형의 과업에 걸쳐 테스트되었습니다. 연구진은 에이전트 역할을 수행하기 위해 네 가지 서로 다른 대규모 언어 모델을 사용했습니다. 모든 경우에서, 이 외부 경험을 에이전트의 자기 개선 루프에 추가하는 것이 에이전트의 성능 향상으로 이어졌습니다. 에이전트들은 평균적으로 더 높은 점수를 기록했으며, 다양한 테스트 전반에서 약 3점에서 5점 사이의 향상을 보였습니다. 더 중요한 것은, 이 방법을 통해 개선된 기술들이 더 견고하다는 점이 입증되었다는 것입니다. 연구진이 이 새로운 방식으로 진화시킨 기술을 훈련에 사용된 것과 다른 컴퓨터 모델에서 테스트했을 때, 해당 기술은 오직 자신의 즉각적인 실수로부터만 배웠던 기술들보다 현저히 더 나은 성능을 보였습니다. 이는 공개 기록으로부터의 더 넓은 교훈을 통합함으로써, 에이전트가 단순히 특정 오류를 수정하는 법을 암기하는 것이 아니라 새로운 상황에 적용될 수 있는 더 일반적인 원칙들을 학습했음을 시사합니다.

이 연구는 기존의 실수로부터 배우는 방식이 쓸모없다고 주장하는 것이 아닙니다. 에이전트 자신의 경험은 당면한 과업의 구체적인 세부 사항을 이해하는 데 여전히 필수적입니다. 새로운 방법은 단지 에이전트가 스스로 찾을 수 없는 맥락의 층위를 추가할 뿐입니다. 공개 소프트웨어 변경 이력을 귀중한 사전 지식의 원천으로 취급함으로써, 연구진은 에이전트가 더 효과적으로 진화할 수 있음을 보여주었습니다. 그들은 더 똑똑하고 신뢰할 수 있는 에이전트로 가는 길이 단지 순간에 일어나는 일을 관찰하는 것뿐만 아니라, 유사한 도구들이 어떻게 개선되어 왔는지에 대한 긴 이야기를 이해하는 것임을 입증했습니다. 이 접근 방식은 인공지능을 더욱 적응 가능하게 만들어, 에이전트가 사용하는 도구들이 단지 오늘을 위한 기능적인 도구를 넘어 미래에도 견고하게 작동할 수 있도록 하는 실질적인 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →