← 최신 논문
🤖 AI

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

이 논문은 생성, 기억, 관리, 평가, 정제라는 통합된 수명 주기를 통해 기술을 관리하고, 재사용성, 신뢰성, 그리고 작업 간 이전을 향상시키기 위해 기술을 장기적이고 경험 인식을 갖춘 자산으로 간주함으로써 작업 해결 능력을 강화하는 자기 진화형 에이전트 프레임워크인 MUSE-Autoskill을 소개합니다.

원저자: Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 천재적이지만 매우 건망증이 심한 비서 (AI 에이전트) 를 두고 있습니다. 복잡한 문제를 해결해 달라고 요청하면, 예를 들어 새는 파이프를 수리하거나 방대한 스프레드시트를 정리하라고 하면, 그들은 매번 처음부터 다시 해결 방법을 찾아내려 합니다. 매뉴얼을 읽고, 몇 가지를 시도해 보다가 실패하고, 다시 매뉴얼을 읽고 다른 것을 시도하는 식입니다. 이는 느리고 비용이 많이 들며, 그들은 종종 같은 실수를 반복합니다.

이 논문은 이러한 비서가 배우고 성장할 수 있도록 돕는 새로운 방법인 MUSE-Autoskill을 소개합니다. 단순히 "똑똑한 두뇌"로만 머무는 대신, MUSE 는 비서를 개인 작업장을 갖춘 숙련된 장인으로 변모시킵니다.

다음은 이를 단순한 개념으로 분해한 작동 원리입니다:

1. 문제: "일회성" 접근법

현재 대부분의 AI 비서는 모든 작업을 완전히 새로운 모험으로 취급합니다. 특정 유형의 컴퓨터 오류를 해결하는 방법을 찾아내더라도, 그 지식을 실제로 "저장"하지는 않습니다. 다음에 요청하면 다시 배워야 합니다. 완벽한 라자냐를 요리하고, 그것을 먹은 뒤 레시피를 완전히 잊어버려 다음 고객을 위해 재료를 다시 추측해야 하는 요리사와 같습니다.

2. 해결책: "기술 작업장"

MUSE 는 비서가 **기술 (Skills)**을 구축, 저장 및 정제할 수 있는 **작업장 (Workshop)**을 제공함으로써 게임을 바꿉니다.

**기술 (Skill)**을 마법 주문이 아닌 완성된 사전 포장된 도구 세트로 생각하세요.

  • 레시피 (SKILL.md): 도구가 무엇을 하는지에 대한 명확한 지시 사항.
  • 도구들 (Scripts): 작업을 수행하는 데 필요한 실제 코드나 단계.
  • 품질 검사 (Tests): 도구가 선반에 올려지기 전에 작동하는지 확인하는 내장 검사관.
  • 노트 (.memory.md): 비서가 "이 도구는 훌륭하게 작동하지만, 파일이 너무 크면 충돌합니다. 저는 그걸 고생하며 배웠습니다"라고 적어두는 개인 로그.

3. 5 단계 생명주기 (장인의 일과)

이 논문은 숙련된 목수가 도구를 관리하는 방식과 유사하게 MUSE 가 이러한 기술을 관리하는 지속적인 루프를 설명합니다:

  1. 생성 (도구 제작): 비서가 기존 도구로 해결할 수 없는 문제에 직면하면, 단순히 추측하지 않습니다. 잠시 멈추고 "새로운 도구가 필요합니다"라고 말합니다. 그들은 즉시 새로운 기술 패키지를 구축합니다.
  2. 기억 (개인 로그): 기술이 사용될 때마다 비서는 해당 기술의 특정 노트에 메모를 남깁니다. 성공했나요? 실패했나요? 느렸나요? 이것이 **기술 수준의 기억 (Skill-Level Memory)**입니다. 이는 정비공이 "너무 빠르게 돌리면 이 렌치가 볼트를 손상시킵니다"라고 렌치 손잡이에 적어두는 것과 같습니다.
  3. 관리 (선반 정리): 비서는 작업장을 깔끔하게 유지합니다. 두 도구가 같은 일을 한다면 이를 병합합니다. 도구가 고장 나고 절대 작동하지 않으면 버립니다. 그들은 "최고"의 도구를 즉시 꺼낼 수 있도록 준비해 둡니다.
  4. 평가 (안전 검사관): 새로운 도구가 선반에 올라가기 전에 엄격한 테스트를 통과해야 합니다. 비서는 안전하고 격리된 샌드박스에서 도구를 실행합니다. 테스트에 실패하면 도구는 수정을 위해 작업장으로 다시 보내집니다. 완벽해질 때까지 선반에 올라갈 수 없습니다.
  5. 정제 (도구 다듬기): 도구가 테스트나 실제 작업에서 실패하면, 비서는 단순히 포기하지 않습니다. 오류를 살펴보고 코드를 수정한 뒤 다시 시도합니다. 도구는 시간이 지남에 따라 더 나아집니다.

4. "장기적" 트릭

AI 에게 가장 큰 문제 중 하나는 제한된 "주의 집중력 (컨텍스트 창)"입니다. 작업이 50 단계가 걸린다면, AI 는 50 단계에 도달할 때쯤이면 1 단계에서 무엇을 했는지 잊어버립니다.

MUSE 는 **적응형 압축 (Adaptive Compression)**으로 이를 해결합니다. 긴 이야기를 쓴다고 상상해 보세요. 쓴 모든 단어를 유지하는 대신, 중간 장들을 짧은 단락으로 요약하면서 시작과 끝은 상세하게 유지합니다. MUSE 는 이를 자동으로 수행합니다. 가장 중요한 대화 부분을 유지하고 중간을 요약하여, 매우 긴 작업에서도 AI 가 자신의 위치를 잃지 않도록 합니다.

5. 결과: 실험실에서 무슨 일이 있었나요?

연구자들은 SkillsBench(데이터 분석, 코드 수정, 운영 계획 등 51 가지 실제 작업 세트) 에서 이를 테스트했습니다.

  • "인간" 기준선: 인간이 만든 도구를 AI 에게 제공했을 때도 MUSE 비서가 가장 잘 수행했습니다. 다른 AI 들보다 지시 사항을 읽고 도구를 사용하는 데 더 뛰어났습니다.
  • "스스로 배운" 기적: 가장 흥미로운 부분은 무엇일까요? MUSE 비서가 스스로 가르칠 수 있었다는 점입니다.
    • 도구가 없이 작업을 시도했습니다.
    • 성공했을 때, 그 성공에서 기술을 구축했습니다.
    • 그런 다음 그 자체로 만든 기술을 사용하여 작업을 다시 수행했습니다.
    • 결과: 기술을 구축할 수 있었던 작업에서 정확도는 약 53% 에서 거의 **88%**로 급증했습니다. 실제로는 원래 도구를 작성한 인간들보다 더 나아졌습니다.
  • 공유는 배려입니다: 가장 좋은 점은 이러한 기술이 한 AI 안에 잠겨 있지 않다는 것입니다. 연구자들은 MUSE 가 구축한 기술을 다른 AI(헤르메스) 에게 주었습니다. 헤르메스는 즉시 해당 작업에서 훨씬 더 나아졌으며, 이는 기술이 어떤 똑똑한 근로자도 집어 들고 사용할 수 있는 보편적인 도구임을 증명했습니다.

요약 비유

**주니어 인턴 (일반 AI)**과 **숙련된 장인 (MUSE-Autoskill)**을 상상해 보세요.

  • 인턴은 매번 매뉴얼을 1 페이지부터 읽으며 고장 난 모든 기계를 수리하려고 시도합니다. 그들은 느리고 실수를 저지르며 어제 배운 것을 잊어버립니다.
  • 숙련된 장인작업장을 가지고 있습니다.
    • 새로운 문제를 마주치면, 이를 위해 맞춤형 도구를 제작합니다.
    • 도구가 작동하는지 확인하기 위해 테스트합니다.
    • 도구를 최상으로 사용하는 방법에 대해 메모를 작성합니다.
    • 다음에 올바른 도구를 즉시 찾을 수 있도록 선반을 정리합니다.
    • 도구가 고장 나면, 그것을 수리하고 더 튼튼하게 만듭니다.

이 논문은 AI 에게 이러한 "작업장"과 자체 도구를 구축할 수 있는 능력을 부여함으로써, 이전보다 훨씬 더 빠르고 정확하며 훨씬 더 어려운 문제를 해결할 수 있게 됨을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →