← 최신 논문
💬 NLP

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

본 논문은 기술을 실행 가능한 프로그램으로 표현하는 것이 LLM 에이전트를 새로운 도메인에 적응시키기 위한 가장 비용 효율적인 전략이라고 주장하며, 제안된 "SpeedRunner" 에이전트를 통해 과거의 궤적으로부터 이러한 프로그램들을 점진적으로 학습하고 리팩토링하는 것이 다양한 환경 전반에서 견고함을 유지하면서도 비용을 크게 절감한다는 것을 입증한다.

원저자: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 거대하고 지저분한 놀이터를 탐험하는 법을 가르치고 있다고 상상해 보세요. 처음에는 로봇이 마치 호기심 많은 유아와 같습니다. 앞으로 걸어가려다 벽에 부딪히고, 혼란스러워하고, 다시 시도하고, 어쩌면 아주 조금 배우기도 하죠. 이것이 현대의 AI '에이전트'가 작동하는 방식입니다. 이들은 명령을 이해하고 컴퓨터와 대화할 수 있는 강력한 언어 모델이지만, 새롭고 복잡한 과제에 직면했을 때 매번 모든 단계를 처음부터 다시 '생각'해야 하는 경우가 많습니다. 문을 열려고 시도했다가 실패하고, 다른 방법을 시도했다가 또 실패하며, 성공할 때까지 계속 루프를 돌 수도 있습니다. 이 방식은 작동은 하지만, 느리고 비용이 많이 듭니다. 로봇이 '생각'할 때마다, 마치 인간이 퍼즐을 푸는 데 쓰는 매 분마다 비용을 지불하는 것처럼 돈과 시간이 소모됩니다.

연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 로봇이 똑같은 일을 반복해서 다시 배우지 않고도 더 나아지도록 가르칠 수 있을까? 그 답은 보통 '기술(skills)'에 있습니다. 기술을 일종의 지름길이나 미리 만들어진 레시피라고 생각해 보세요. 케이크를 만들 때마다 매번 처음부터부터 배우는 대신, 이미 작성해 둔 레시피를 따르는 것입니다. 한동안 과학자들은 이 레시피를 평범한 영어로 작성하려고 시로했습니다. 하지만 이 논문의 저자들은 이런 의문을 가졌습니다. '만약 우리가 레시피를 코드로 작성한다면 어떨까?' 코드는 컴퓨터가 혼란을 겪거나 시간을 낭비하지 않고 즉각적으로 따를 수 있는 매우 정밀한 지침서와 같습니다. 핵심 아이디어는 로봇의 지저$\로운 시행착오 경험을 깨끗하고 재사용 가능한 코드로 바꿀 수 있다면, 로봇이 훨씬 더 빠르고, 저렴하며, 똑똑해질 수 있다는 것입니다.

이것이 바로 '스피드러너(SpeedRunner)' 프로젝트 팀이 테스트하고자 했던 내용입니다. 그들은 AI 에이전트가 단순히 무엇을 할지 지시받는 것이 아니라, 작업하는 동안 스스로 코드 기반의 기술을 학습할 수 있는지 확인하고 싶었습니다. 그들은 AI가 게임을 플레이하고, 실수를 하고, 그러면 두 번째의 특별한 '코딩 에이전트'가 로봇의 기록을 살펴보는 시스템을 구축했습니다. 이 코딩 에이전트는 탐정과 프로그래머의 역할을 동시에 수행합니다. 이 에이전트는 로봇의 과거 시도들을 스캔하여, 로봇이 계속 실패하거나 동일한 긴 단계의 순서를 반복했던 패턴을 찾아내고, 이를 해결하기 위해 새로운 코드 조각을 작성합니다. 이는 마치 누군가 신발 끈을 묶으려고 애쓰는 영상을 보면서, 끈이 자꾸 걸린다는 것을 깨닫고, 다시는 걸리지 않도록 완벽한 신발 끈 묶기 지침서를 작성하는 것과 같습니다.

연구진은 이 아이디어를 세 가지 매우 다른 가상 세계에서 테스트했습니다: 화학 물질을 혼합해야 하는 과학 실험실, 물건을 집기 위해 지시를 따라야 하는 그리드 월드, 그리고 자원을 모으고 좀비와 싸워야 하는 생존 게임입니다. 이 모든 곳에서 '스피드러너' 에이전트는 작업하는 도중에 스스로 코드 기술을 작성하는 법을 배웠습니다. 결과는 놀라웠습니다. 다른 방식들이 루프에 갇히거나 학습할수록 비용이 계속 증가하는 반면, 스피드러너는 학습할수록 오히려 더 저렴하고 빨라졌습니다. 그것은 길고 복잡한 행동의 순서를 짧고 재사용 가능한 코드 함수로 변환했습니다. 예를 들어, 로봇이 나무를 찾는 데 많은 비용을 들여 생각하는 대신, "find_tree(나무 찾기)"라는 간단한 코드 명령을 배워서 즉시 클릭하여 사용할 수 있게 된 것입니다.

이 논문은 이러한 접근 방식이 비용 측면에서 게임 체인저가 될 수 있음을 시사합니다. 한 테스트에서 스피드러너 에이전트는 동일한 문제를 해결하기 위해 표준 방식이 사용하는 컴퓨터 처리 능력(비용)의 약 8분의 1만을 사용했습니다. 단순히 돈을 아낀 것뿐만 아니라, 과제 수행 능력도 향상되었습니다. 핵심은 코딩 에이전트가 단순히 일어난 일을 기억하는 것이 아니라, '왜' 실패했는지를 분석했다는 점입니다. 만약 로봇이 자원을 찾지 못해 계속 실패한다면, 코딩 에이전트는 포기하기 전에 "주변을 쓸어버리기(sweep the area)"라는 새로운 기능을 작성했습니다. 이 덕분에 에이전트는 좀비가 갑자기 나타나는 것과 같은 환경의 무작위한 변화에도 당황하지 않고 대처할 수 있는 강건함(robustness)을 갖추게 되었습니다.

하지만 저자들은 이것이 모든 상황에 적용되는 마법의 해결책은 아니라는 점을 주의 깊게 언급합니다. 그들은 로봇이 이미 어떤 작업에 매우 능숙하다면, 코드를 사용하도록 강제하는 것이 마치 오븐이 고장 났을 때 레시피를 너무 엄격하게 따르느라 적응하지 못하는 로봇처럼 다소 경직되게 만들 수 있다는 것을 발견했습니다. 그러나 대부분의 복잡하고 장기적인 과제에 있어서, 지저분한 경험을 깨끗한 코드로 바꾸는 것은 AI 에이전트를 더 똑똑하고 경제적으로 만드는 최선의 방법으로 보입니다. 이 연구는 에이전트가 플레이하면서 스스로 '자동화된 지름길'을 작성하게 함으로써, 새로운 도전에 직면할 때마다 처음부터 다시 훈련할 필요 없이 효율적으로 학습하는 시스템을 구축할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →