← 최신 논문
🤖 AI

Recursive Synthesis for Long-Horizon Terminal Tasks

이 논문은 장기적 관점의 터미널 에이전트 태스크를 재귀적으로 생성하고 검증하여 37,484개의 고품질 예시를 저비용으로 생성함으로써, 수확 체감의 징후 없이 도전적인 벤치마크에서 미세 조정된 모델 및 에이전트 모델의 성능을 크게 향상시키는 확장 가능한 프레임워크인 재귀적 합성 터미널 태스크(Recursive Synthetic Terminal Tasks, RST)를 소개한다.

원저자: Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 숙련된 정비사가 되는 법을 가르치고 있다고 상상해 보세요. 당신은 단순히 로봇이 렌치가 어떻게 생겼는지 아는 것을 넘어, 한 번도 고장 난 적 없는 자동차 엔진을 실제로 수리할 수 있기를 바랍니다. 이것이 바로 "AI 에이전트"의 세계입니다. 이들은 단순히 당신과 대화만 하는 것이 아니라, 명령어를 입력하고, 파일을 옮기고, 소프트웨어 버그를 수정하는 등 실제로 무언가를 '수행'하는 똑똑한 컴퓨터 프로그램입니다. 큰 문제는 이 로봇들이 길고 복잡한 작업에는 매우 서투르다는 점입니다. 만약 당신이 집을 지으라고 시킨다면, 그들은 벽돌을 하나 놓다가 혼란에 빠질 수도 있습니다. 그들을 더 잘 가르치기 위해서는 로봇이 집을 짓고, 실패하고, 교정을 받고, 다시 시도하는 과정을 담은 수천 개의 연습 문제가 필요합니다. 하지만 이러한 연습 문제를 만드는 것은 악몽과 같습니다. 사람이 직접 작성하면 막대한 비용이 들고, 컴퓨터에게 작성하게 하면 도구와 맞지 않는 규칙을 만들어내거나 해결이 불가능한 퍼즐을 만들어내기도 합니다. 이는 마치 요리사에게 케이크 레시피를 써달라고 부탁했는데, 레시피에는 주방에 존재하지 않는 재료가 적혀 있거나 오븐이 고장 난 상황과 같습니다.

여기에 **재귀적 합성 터미널 태스크(Recursive Synthetic Terminal Tasks, RST)**라는 새로운 방법이 등장했습니다. 이것을 로봇 훈련용 퍼즐을 만드는 "디지털 진화 기계"라고 생각하세요. 연구진은 인간이 모든 문제를 직접 쓰는 대신, 검증된 데이타가 있는 작동하는 퍼즐 639개(이른가 "시드")를 기초로 삼았습니다. 그런 다음 강력한 AI가 마치 장난기 많지만 천재적인 게임 디자이너처럼 행동하도록 했습니다. 이 AI는 작동하는 퍼즐을 보고, 솔루션에 새로운 단계(예: 엔진에 새로운 기어 추가)를 추가하여 더 어렵게 만든 다음, 즉시 변경된 지침과 "정답지"를 새롭고 더 어려운 버전에 맞춰 업데이트했습니다. 결정적으로, 새로운 퍼즐이 저장되기 전, 이 퍼즐은 실제로 작동하는지 확인하기 위해 디지털 샌드박스(안전하고 격리된 컴퓨터 방)에 던져졌습니다. 만약 솔루션이 실패하면 그 퍼즐은 버려졌습니다. 만약 성공하면, 그 퍼즐은 보존되어 다음 단계의 더 어려운 퍼즐을 위한 시드로 사용되었습니다. 연구진은 이 루프를 15번 반복했습니다. 그 결과, 거의 38,000개의 새로운 검증된 퍼즐을 만들어냈습니다. 가장 멋진 점은 매 라운드마다 퍼즐이 진정으로 더 어려워졌다는 것입니다. 중간 단계의 퍼즐은 해결하는 데 필요한 코드가 67줄에서 374줄로 늘어났습니다. 로봇이 입력해야 하는 명령어의 수도 40개에서 244개로 급증했습니다.

결과는 극적이었습니다. 최상위 AI 솔버를 이 퍼즐들에 테스트했을 때, 성공률은 첫 번째 라운드의 쉬운 퍼즐에서 90%였으나 15번째 라운드에서는 단 2.5%로 떨어졌습니다. 이는 시스템이 단순히 지침을 길게 만든 것이 아니라, 훨씬 더 깊은 사고와 더 많은 단계를 요구하는 과업을 실제로 만들어냈음을 증명했습니다. 하지만 진짜 마법은 이 퍼즐들을 사용하여 다른 AI 모델(Qwen3.5)을 훈련시켰을 때 일어났습니다. 이 퍼즐들로부터 생성된 궤적(단계별 시도 과정)을 바탕으로 훈련한 후, 해당 모델은 실제 세계의 터미널 작업을 수행하는 능력이 크게 향상되었습니다. 표준 테스트에서 성능이 최대 10포인트 상승했으며, 추가적인 강화 학습을 통해 테스트에 따라 20%에서 41%까지 더 개선되었습니다. 가장 흥-미로운 발견은 이 시스템이 멈출 기미를 보이지 않았다는 점입니다. 15라운드 동안 더 어렵게 만드는 과정 이후에도, 시스템은 엉터리로 무너지거나 똑같은 수법을 반복하지 않고 유효하고 다양한 퍼즐을 계속해서 뽑아냈습니다. 이는 우리가 AI 에이전트를 위한 고품질 훈련 데이터를 끝없이 생성할 수 있으며, 비싸고 느린 인간의 교육 과정을 빠르고 자동화된, 확장 가능한 진화로 바꿀 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →