SkillAlchemy: Open-World Agent Skill Creation
SkillAlchemy는 대조적 증거를 통해 암시적 요구사항을 식별하고 소스에 근거한 절차를 컴파일함으로써 오픈 월드 에이전트 기술의 생성을 자동화하는 새로운 프레임워크로, 인간이 큐레이션한 기술에 필적하는 성능을 달ien하며 SkillsBench에서 기존 베이스라인을 크게 능가합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, 컴퓨터 모델이 '아는 것'과 실제로 '할 수 있는 것' 사이에는 커지는 차이가 존재합니다. 거대 언어 모델은 방대한 텍스트 라이브러리를 통해 학습되어 세상에 대한 폭넓고 일반적인 이해를 갖추고 있습니다. 그러나 복잡한 데이터 세트를 분석하거나 특화된 소프트웨어 환경을 탐색하는 것과 같이 구체적이고 다단계적인 작업을 수행하라는 요청을 받으면, 이들은 해당 특정 작업을 수행하는 데 필요한 정밀한 단계별 지침이 부족하기 때문에 종종 실수를 범하곤 합니다. 이 간극을 메우기 위해 연구자들은 '기술(skills)'이라는 개념을 개발했습니다. 기술을 새로운 지식의 조각이 아니라, 에이전트가 특정 워크플로우를 처리하기 위해 불러올 수 있는 재사용 가능한 도구 또는 미리 작성된 매뉴얼이라고 생각하십시오. 이러한 기술은 AI가 일반적인 학습을 넘어 전문적인 절차를 실행할 수 있게 해주며, 이는 마치 목수가 섬세한 절단을 위해 드라이버로 못을 박으려 노력하는 대신 특정 끌을 집어 드는 것과 같습니다. 이러한 도구가 유용하려면, 단순히 만들어진 단일 사례뿐만 아니라 광범위한 상황에 적용될 수 있을 만큼 신뢰할 수 있고 정확하며 적용 가능해야 합니다.
하지만 문제는 작업이 생소할 때 이러한 기술을 어떻게 만드느냐 하는 것이었습니다. 전통적으로 기술을 만드는 데는 인간 전문가가 처음부터 매뉴얼을 작성하거나, AI가 과거의 성공적인 시도 기록으로부터 학습하는 과정이 필요했습니다. 하지만 전문가가 없고 과거의 시도 기록도 존재하지 않는 새로운 작업이 주어지면 어떻게 될까요? 그러한 경우, 필요한 정보는 종종 문서, 코드 저장소, 포럼 토론의 형태로 인터넷 전역에 흩어져 있습니다. 문제는 이 정보들이 무질서하다는 점입니다. 이 정보들은 종종 특정 인물, 특정 순간, 또는 특정 컴퓨터 설정을 위해 작성되었습니다. 여기에는 현재 다루고 있는 일반적인 작업에는 적용되지 않는 숨겨진 가정과 국지적인 세부 사항들이 포함되어 있습니다. 만약 AI가 단순히 이 지침들을 복사한다면, 상황이 조금만 변해도 실패하게 되는 너무 경직된 도구를 만들게 됩니다.
한 연구팀은 이 문제를 해결하기 위한 새로운 접근 방식인 '스킬알케미(SkillAlchemy)'를 제안했습니다. 그들은 인터넷을 준비된 정답의 도서관으로 취급하는 대신, 사용 가능한 도구가 되기 전에 반드시 면밀히 검토되고 테스트되어야 하는 '가공되지 않은 증거'의 원천으로 취급합니다. 그들의 방법은 "여행 계획하기"나 "모델 보정하기"와 같이 단순하고 때로는 모호한 기술 요청에서 시작됩니다. 시스템은 즉시 해결책을 찾는 대신, 먼저 그 요청에서 무엇이 빠져 있는지를 묻습니다. 예산 제한을 확인해야 하는지, 혹은 특정 파일 형식이 사용 중인 소프트웨어와 호환되는지 확인해야 하는지와 같이 인간의 프롬프트에 명시되지 않은 숨겨진 요구사항들을 식별합니다. 이러한 누락된 요소들을 구체적인 질문으로 바꿈으로써, 시스템은 방대한 온라인 정보 속에서 정확히 무엇을 찾아야 할지 알게 됩니다.
시스템은 무엇을 찾아야 할지 알게 되면 다양한 출처로부터 정보를 수집하지만, 발견한 모든 것을 받아들이지는 않습니다. 연구자들은 최종 기술에 포함될 만큼 신뢰할 수 있는 정보가 무엇인지 결정하기 위해 엄격한 과정을 설계했습니다. 시스템은 여러 상황에 걸쳐 절차를 뒷받침하는 증거를 찾습니다. 만약 어떤 방법이 오직 한 가지 유형의 컴퓨터나 특정 데이터 세트에서만 작동한다면, 시스템은 이를 국지적인 사례로 인식하여 주요 지침과는 분리하여 보관합니다. 시스템은 증거가 여러 맥락에서 안정적으로 작동함을 보여줄 때에만 해당 절차를 일반적인 규칙으로 승격시킵니다. 이 과정은 보편적인 원칙과 일시적인 세부 사항을 분리하는 필터 역할을 합니다. 그런 다음 시스템은 승인된 지침들을 명확한 단계, 안전 점검, 그리고 각 결정의 근거가 되는 증거에 대한 참조를 포함한 구조화된 패키지로 컴파일합니다.
연구진은 소프트웨어 엔지니어링, 사무 업무, 금융 분석, 과학 계산에 이르는 87가지의 서로 다른 작업에 대해 이 방법을 테스트했습니다. 그들은 인간이 작성한 기술이나 인터넷에서 직접 지침을 생성하는 자동화 도구를 사용하는 방식 등 여러 다른 방법들과 이 시스템을 비교했습니다. 결과에 따르면, 이 새로운 방법은 자동화된 베이스라인 모델들을 크게 앞질렀습니다. 에이전트가 이 시스템이 만든 기술을 사용했을 때, 기술이 전혀 없을 때보다 작업 성공률이 거의 20%포인트 더 높았습니다. 더욱 중요한 것은, 이 시스템이 골드 스탠다드로 여겨지는 인간이 큐레이션한 기술과 대등한 성능을 보였다는 점입니다. 종합적으로 자동화 시스템은 인간이 큐레이션한 기술보다 1.5%포인트 높은 성공률을 달고, 통계적 분석에 따르면 두 결과는 매우 유사한 수준입니다. 또한, 이 시스템은 테스트된 4가지 에이전트-모델 구성 중 3가지에서 가장 높은 전반적인 성능을 달성했습니다.
이 연구는 또한 이전의 시도들이 왜 자주 실패했는지도 밝혀냈습니다. 시스템이 범위(scope)를 확인하지 않고 단순히 웹에서 정보를 가져왔을 때, 그들은 너무 구체적이거나 상충하는 증거에 기반한 지침을 포함하는 경우가 많았습니다. 예를 들어, 어떤 기술은 특정 버전의 소프트웨어에서만 작동하는 규칙을 포함하여, 해당 버전이 없을 때 에이전트가 실패하게 만들었습니다. 새로운 방법은 절차가 다양한 시나리오에서 증거에 의해 뒷받침되는지를 명시적으로 확인함으로써 이러한 함정을 성공적으로 피했습니다. 또한, 혼란스럽거나 오해의 소지가 있는 정보에 직면했을 때도 견고함을 입증했습니다. 연구진이 검색 과정에 상충하거나 무관한 문서를 도입했을 때, 이 시스템은 이를 올바르게 무시한 반면, 다른 방법들은 잘못된 조언을 최종 기술에 포함시키곤 했습니다.
이 연구는 우리가 지능형 에이전트를 구축하는 방식에 있어 근본적인 변화를 시사합니다. AI가 새로운 일을 마법처럼 스스로 해내기를 기대하거나, 인간이 모든 매뉴얼을 작성하는 것에 의존하는 대신, 우리는 AI에게 신중한 연구자처럼 행동하도록 가르칠 수 있습니다. AI는 올바른 질문을 던지고, 증거를 수집하며, 일반적인 규칙과 국지적인 예외를 구분하는 법을 배웁니다. 기술 생성을 직접적인 복사가 아닌 검증된 증거에 기반하게 함으로써, 시스템은 유연하면서도 신뢰할 수 있는 도구를 생산합니다. 연구진은 이 접근 방식이 에이전트로 하여금 이전에는 인간의 개입 없이는 불가능했던 수준의 능숙함으로 낯선 작업을 처리할 수 있게 한다는 것을 발견했습니다. 시스템이 완벽하지는 않으며 여전히 매우 전문적인 미디어 작업에는 어려움을 겪기도 하지만, 결과는 시작 정보가 불완전하고 출처가 무질서할 때라도 신뢰할 수 있는 기술 생성이 가능하다는 것을 보여줍니다. 핵심은 즉각적으로 완벽한 답을 찾는 것이 아니라, 무엇이 진실이고 무엇이 단지 국지적인 세부 사항인지를 검증하는 규율 있는 과정에 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.