← 최신 논문
🤖 AI

OpenSkill: Open-World Self-Evolution for LLM Agents

이 논문은 LLM 에이전트가 대상 작업에 대한 감독 없이 외부 자원으로부터 전이 가능한 기술과 검증 신호를 합성함으로써 오픈 월드 배포 환경에서 자율적으로 자기 진화의 부트스트래핑을 가능하게 하는 프레임워크인 OpenSkill을 소개한다.

원저자: Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

게시일 2026-06-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 퍼즐을 풀기 위해 아주 똑똑하지만 경험이 부족한 견습생을 고용했다고 상상해 보십시오. 보통 이들에게 가르침을 주려면, 교과서를 주거나, '해야 할 일과 하지 말아야 할 일'의 목록을 주거나, 옆에서 "잘했어!" 또는 "다시 해봐"라고 말해줄 선생님이 필요할 것입니다.

OpenSkill은 이러한 것들이 전혀 없는 상황에서 AI '견습생'(LLM 에이전트)을 훈련시키는 새로운 방법입니다. 당신은 오직 퍼즐 프롬프트와 인터넷만을 제공합니다. AI는 스스로 학습하고, 무엇을 배워야 할지 파악하며, 정답지를 훔쳐보지 않고도 자신의 작업을 검증할 자신만의 '선생님'을 직접 구축해야 합니다.

이 논문은 이 과정을 쉬운 비유를 사용하여 다음과 같이 설명합니다.

문제점: "침묵의 방"

현재 대부분의 AI 훈련 방식은 AI에게 도움이 되는 루프가 있다고 가정합니다. 즉, 무언가를 시도하고, 점수를 받고, 다시 시도하는 과정입니다. 하지만 현실 세계(오픈 월드)에서는 종종 작업 지시와 함께 일련의 복잡한 자원들(웹사이트, 매뉴얼, 코드 저장소 등)만 받게 됩니다. 여기에는 정답지가 없으며, 작업을 채점해 줄 사람도 없습니다.

만약 AI가 자신의 추측으로부터 배우려고 한다면, 자신이 틀렸을 때조차 스스로 옳다고 확신해 버릴 수 있습니다. 이는 마치 사전 없이 혼자서만 대화하며 새로운 언어를 배우려는 것과 같습니다.

해결책: OpenSkill

연구진은 AI를 위한 자급자족형 생존 가이드 역할을 하는 OpenSkill이라는 프레임워크를 구축했습니다. 이 과정은 세 가지 주요 단계로 작동합니다.

1. "사서" 단계 (지식 습득)

AI가 이미 기억하고 있는 것(이미 오래되었거나 틀릴 수 있는 정보)에 의존하는 대신, OpenSkill은 AI를 "오픈 월드"(인터넷, 문서, 코드 저장소)로 보냅니다.

  • 비유: AI가 탐정이 되었다고 상상해 보십시오. 범인을 추측하는 대신, 도서관에 가서 사건과 관련된 모든 경찰 보고서, 기술 매뉴얼, 뉴스 기사를 읽습니다. 계획을 세우는 데 필요한 가공되지 않은 사실들을 수집하는 것입니다.

2. "가상 도장" 단계 (정보 유출 없는 진화)

AI는 연습이 필요하지만, 실제 정답지를 사용할 수는 없습니다. 그래서 OpenSkill은 **가상 검증기(Virtual Verifier)**를 구축합니다.

  • 비유: 이것은 "도장"이나 연습용 체육관과 같습니다. AI는 퍼즐을 풀기 위한 규칙(기술) 세트를 작성합니다. 그런 다음, 별도의 독립적인 AI가 엄격한 심판 역할을 합니다.
  • 심판의 작동 방식: 심판은 정답지를 알지 못합니다. 대신, 앞서 도서관에서 찾아낸 확실한 사실들에 근재하여 AI의 작업을 검서합니다.
    • 예시: 만약 과제가 데이터셋을 분석하는 것이라면, 심판은 다음과 같이 확인합니다: "AI가 행(row)의 개수를 정확히 셌는가? 숫자의 합계가 알려진 총합과 일치하는가?"
    • 이는 수학 선생님이 학생의 답이 짝수인지 혹은 현실적인 범위 안에 있는지를 확인하는 것과 같습니다. 구체적인 숫자가 무엇인지 몰라도 말입니다.
  • 만약 AI가 실패하면, 심판은 "단계를 하나 놓쳤습니다" 또는 "이 특정 규칙을 다시 찾아봐야 합니다"라고 말합니다. 그러면 AI는 자신의 규칙을 수정하고 다시 시도합니다. 이 루프는 AI가 모든 "가상" 테스트를 통과할 때까지 반복됩니다.

3. "최종 시험" 단계 (제로샷 평가)

가상 도장에서 기술을 연마한 후, AI는 실제 세계로 보내져 실제 과제를 수행합니다.

  • 비유: AI는 최종 시험을 치릅니다. 실제 정답지는 시험이 끝난 후에야 공개됩니다. 연구진은 자신만의 "심판"과 함께 연습한 AI가 놀라운 성과를 냈으며, 미리 작성된 기술이나 인간의 피드백에 의존하는 다른 방식들을 종종 능가한다는 것을 발견했습니다.

이것이 왜 중요한가 (결과)

연구진은 두 가지 AI 모델을 사용하여 세 가지 다른 유형의 도전 과제(소프트웨어 코딩, 사회적 추론, 과학 실험)에 대해 이 시스템을 테스트했습니다.

  • 속임 없이 작동합니다: AI는 훈련 중에 실제 정답을 본 적이 없습니다. AI는 공공의 사실들로부터 스스로의 "진실"을 구축했습니다.
  • 이식성이 뛰어납니다: AI가 배운 '기술'(작성된 규칙들)은 마치 물리적인 책과 같습니다. 한 AI가 작성한 책을 완전히 다른 약한 AI에게 주어도 여전히 작동합니다. AI는 단순히 정답을 암기한 것이 아니라, 하나의 방법을 학습한 것입니다.
  • 경쟁 상대를 압도합니다: 거의 모든 테스트에서 OpenSkill은 이 특정 "가상 심판" 설정 없이 학습을 시도한 다른 방법들보다 더 높은 점수를 기록했습니다.

핵심 요약

OpenSkill은 AI 에이전트가 스스로 자립할 수 있도록 가르치는 시스템입니다. 이는 AI가 특정 작업에 대해 아무것도 모르는 상태에서 시작하여, 단순히 다음의 과정을 통해 전문가가 될 수 있음을 보여줍니다:

  1. 매뉴얼을 읽는다 (오픈 월드).
  2. 사실에 기반한 자신만의 연습 테스트를 만든다 (가상 검증기).
  3. 그 테스트를 통과할 때까지 연습한다.
  4. 그리고 실제 문제를 해결한다.

이는 AI에게 더 나아지는 법을 가르치기 위해 반드시 인간 교사나 숨겨진 정답지가 필요한 것이 아니라, 단지 자신의 작업을 스스로 검증할 수 있는 올바른 도구만 있으면 된다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →