Toward Scalable Terminal Task Synthesis via Skill Graphs
본 논문은 시나리오 매개 기술 그래프를 활용하여 다양하고 제어 가능한 말단 작업 인스턴스를 생성함으로써 데이터 부족 문제를 해결하고 자율 말단 에이전트의 훈련을 강화하는 자동화 프레임워크인 SkillSynth를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 복잡한 작업을 수행하도록 컴퓨터 명령줄(명령을 입력하는 텍스트 기반 화면) 을 사용하는 방법을 가르치고 싶다고 상상해 보세요. 예를 들어 파일을 정리하거나 소프트웨어 버그를 수정하는 작업입니다. 문제는 로봇을 가르치려면 이러한 작업을 수행하는 수천 개의 예시를 보여줘야 한다는 점입니다. 하지만 수천 개의 양질이고 다양한 예시를 직접 찾아내거나 작성하는 것은 매우 느리고 비용이 많이 듭니다.
이 논문의 저자인 텐센트의 Hunyuan 팀은 이를 해결하기 위해 SkillSynth라는 시스템을 구축했습니다. SkillSynth 를 로봇 훈련을 위한 **초효율적인"레시피 생성기"**라고 생각하세요.
다음은 이를 간단한 단계로 분해한 작동 방식입니다:
1. 문제: 너무 많은 유사한 레시피
이전 방법들은 훈련 예시를 생성하기 위해 다음 두 가지 방식을 시도했습니다:
- 추측: 똑똑한 AI 에게 새로운 작업을 발명하도록 요청하는 것 (이는 종종 가짜처럼 들리거나 현실과 맞지 않음).
- 도용: 인터넷에서 실제 코드를 가져와 고의로 고장 나게 만들어"수정"작업을 만드는 것 (이는 로봇에게 다른 일을 하는 법이 아니라 오직 소프트웨어를 수정하는 법만 가르침).
두 방법 모두 로봇이 동일한 유형의 문제를 반복적으로 접하게 하는 결과를 낳았습니다. 이는 스파게티 레시피만 제공하며 요리사에게 요리를 가르치는 것과 같습니다. 스파게티는 잘 만들 수 있게 되겠지만, 샐러드를 만들거나 케이크를 구우는 법은 배우지 못하게 됩니다.
2. 해결책:"스킬 그래프"(지도)
단순히 추측하는 대신, SkillSynth 는 거대한 지도(스킬 그래프라고 함) 를 구축합니다.
- 장소 (시나리오): 컴퓨터가 가질 수 있는 다양한 상태를 상상해 보세요. 예를 들어"폴더가 비어있다"거나"비디오 파일이 준비되었다"는 상태입니다. 이러한 것들이 지도상의"장소"입니다.
- 도로 (스킬): 이는 한 장소에서 다른 장소로 이동하기 위해 로봇이 취할 수 있는 행동들입니다. 예를 들어"파일 삭제"또는"비디오 변환"과 같은 것들입니다.
팀은 GitHub 과 ClawHub 라는 데이터베이스와 같은 실제 출처에서 이러한"도로"수천 개를 수집했습니다. 그런 다음 도로들을 연결하여 한 작업을 완료하면 다음 작업이 타당한 장소에 도착하도록 만들었습니다.
3. 과정: 경로 그리기
지도가 구축되면 SkillSynth 는 단순히 하나의 도로를 선택하지 않습니다. 대신 지도 전체에 경로를 그립니다.
- 시작점을 선택합니다.
- 이동할 도로 (스킬) 를 선택합니다.
- 새로운 장소에 도착하면 다른 도로를 선택하고 계속 진행합니다.
비유: 도로 여행을 계획한다고 상상해 보세요. 단순히 집 (Home) 에서 식료품점 (Grocery Store) 으로 가는 것 (하나의 스킬) 만이 아니라, 집 → 주유소 → 경치 좋은 길 → 빵집 → 식료품점으로 이어지는 여행을 계획하는 것입니다. 이 경로는 복잡하고 다단계로 이루어진 작업을 나타냅니다.
이 시스템은 이 과정에서 똑똑합니다. 이전에 사용한 인기 있는 도로를 반복해서 피하려고 노력합니다. 이를 통해 로봇이 새롭고 다양한 경로를 접하도록 하여 훈련을 훨씬 더 풍부하게 만듭니다.
4. 조립 라인: 멀티 에이전트 하네스
지도 위에 경로가 그려지면, 시스템은 그 추상적인 경로를 로봇이 실제로 수행할 수 있는 실제 작업으로 변환해야 합니다. 이를 위해 AI 에이전트 팀 (하네스) 을 사용합니다:
- 플래너: 경로를 보고 명확한 일련의 지시사항을 작성합니다 (예:"이 원본 비디오를 GIF 로 변환하세요").
- 구축자: 로봇이 작업할 수 있도록 실제 환경 (파일, 폴더, 시작 상태) 을 구축합니다.
- 심판: 두 가지 다른 검증이 이루어집니다:
- 오라클 검증: 완벽한 해결책이 실제로 존재하는가? (과연 이 작업을 해결할 수 있는가?)
- 루브릭 검증: 지시사항이 명확한가? 테스트는 공정한가? (실수로 지시사항을 너무 어렵거나 너무 쉽게 만들지는 않았는가?)
작업이 이러한 검증을 통과하지 못하면, 시스템은 공장 품질 관리 라인처럼 자동으로 문제를 수정하고 다시 시도합니다.
5. 결과
팀은 이 시스템을 실행하여 단일 자동화 실행 동안 3,560 개의 검증된 고품질 작업을 생성했습니다.
- 다양성: 작업들은 이전 방법들보다 훨씬 더 많은 다양한 시나리오와 스킬을 포괄했습니다.
- 난이도: 작업들은 실제로 어려웠습니다. 매우 똑똑한 AI(Claude Opus 4.6) 조차도 많은 작업에서 어려움을 겪었으며, 해결하는 데 평균 37 단계가 필요했습니다.
- 성능: 이 새로운 작업들로 자체 로봇 (Qwen3 와 같은 모델을 사용) 을 훈련시켰을 때, 이전의 다양성이 부족한 데이터로 훈련된 로봇들에 비해 터미널 작업을 해결하는 능력이 크게 향상되었습니다.
결론
SkillSynth 는 로봇이 연습할 수 있도록 방대하고 다양한"컴퓨터 잡일"라이브러리를 자동으로 생성하는 방법입니다. 서로 다른 컴퓨터 스킬들이 어떻게 연결되는지 매핑함으로써, endless 한 새로운 현실적인 도전 과제를 만들 수 있습니다. 이는 AI 에이전트가 소프트웨어 수정뿐만 아니라 다양한 실제 컴퓨터 작업을 처리할 수 있도록 더 다재다능하고 유능하게 훈련시키는 데 도움이 됩니다.
참고: 이 논문은 명시적으로 이러한 합성 작업들이 이미 Hy3 Preview(텐센트 제품) 를 훈련하는 데 사용되었으며, 터미널 환경에서 에이전트로서 그 능력을 향상시켰다고 밝히고 있습니다. 저자들은 터미널 자동화의 일반적인 개선 이상으로 의료, 임상 또는 기타 특정 미래 응용 프로그램을 주장하지 않습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.