← 최신 논문
💻 computer science

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor는 LLM 에이전트가 자신의 사각지대를 식별하고 이를 재사용 가능한 기술로 큐레이션하는 별도의 진단 능력을 학습함으로써 스스로 진화할 수 있게 하는 새로운 프레임워크로, 실행기(executor)의 가중치를 업데이트하거나 인간의 감독에 의존하지 않고도 실행기의 성능을 44.2% 향상시킵니다.

원저자: Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

게시일 2026-07-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 믿을 수 없을 정도로 빠르고 똑똑한 견습생처럼 작동하는 세상을 상상해 보십시오. 오랫동안 과학자들은 이 견습생의 뇌를 끊임없이 재구성하는 방식, 즉 새로운 뉴런 층을 추가하고, 내부 배선을 미세하게 조정하며, 어떻게 행동해야 하는지에 대한 끝없는 사례들을 주입함으로써 이들을 더 잘하도록 가르치기 위해 노력해 왔습니다. 이것이 바로 '에이전트 자기 진화(agent self-evolution)'의 세계이며, 대개 목표는 에이전트가 작업을 수행하는 능력을 더 빠르고 강하게 만드는 데 있습니다. 하지만 여기에는 함정이 있습니다. 만약 견습생에게 단순히 어떻게 행동해야 하는지를 아는 것을 넘어, 자신이 무엇을 모르는지를 깨닫는 능력이 필요하다면 어떨까요? 이는 마치 어떤 학생이 곱셈을 못 해서가 아니라, 일의 올림수를 잊어버렸다는 사실을 스스로 인지하지 못해서 계속 수학 시험에서 낙제하는 것과 같습니다. 이 논문이 던지는 핵심 질문은 이것입니다. "우리는 에이전트가 인간 교사가 지적해주지 않아도, 자신의 지식 속에 숨겨진 빈틈을 스스로 찾아내는 탐정이 되도록 가르칠 수 있을까?"

여기에 기존의 AI 훈련 방식을 완전히 뒤집는 영리한 새로운 시스템, SkillMentor가 등장합니다. 연구진은 에이전트의 뇌를 직접 업그레이드하는 대신, 작고 특화된 '멘토(Mentor)' 에이전트를 만들었습니다. 메인 AI(실행자, Executor)를 앱과 도구들로 가득 찬 거대하고 복잡한 비디오 게임 세계를 항해하는 로봇이라고 생각해 보십시오. 이 실행자는 고정되어 있으며, 그 뇌는 변경되거나 업데이트될 수 없습니다. 보통 로봇이 실패하면 인간이 개입하여 "이봐, 로그인을 잊었잖아"라고 말하며 코드를 수정해 줄 것입니다. 하지만 이 실험에서는 인간의 출입이 금지되었습니다. 라벨링도, 힌트도, 도움도 없습니다.

그렇다면 로봇은 어떻게 더 나아질 수 있을까요? 멘토가 등장할 차례입니다. 이 작은 탐정은 게임을 직접 플레이하려고 하지 않습니다. 대신 실행자가 고군분투하는 모습을 지켜본 뒤, "아하! 무엇이 잘못되었는지 알겠어"라고 말합니다. 멘토의 역할은 로봇이 왜 실패했는지(진단)를 파악한 다음, 로봇이 다음에 동일한 실수를 반복하지 않도록 작고 재사용 가능한 '치트 시트(cheat sheet, 기술)'를 작성하는 것입니다. 이는 마치 멘토가 로봇이 자꾸 카펫에 걸려 넘어지는 것을 보고, "카펫을 조심해!"라는 메모를 써서 로bot의 벽에 붙여두는 것과 같습니다. 로봇은 뇌가 바뀌는 것이 아니라, 자신의 실패로부터 배운 내용을 바탕으로 더 나은 지침을 얻게 되는 것입니다.

연구진은 이 설정을 두 가지 도전적인 디지털 세계에서 테스트했습니다. 하나는 로봇이 다양한 앱(항공권 예약이나 파일 정리 등)을 가로질러 복잡한 작업을 관리해야 하는 AppWorld이고, 다른 하나는 로봇이 특정 컴퓨터 함수를 얼마나 정확하게 호출할 수 있는지를 테스트하는 BFCLv3입니다. 연구진은 이 새로운 SkillMentor를 거대한 모델을 사용해 정답을 추측하거나 고정된 규칙을 사용하는 다른 방법들과 맞붙였습니다. 결과는 놀라웠습니다. 멘토는 다른 방법들에 사용된 거대 모델들보다 훨씬 작고 단순한 모델이었음에도 불구하고, 고정된 실행자의 성능을 평균 44.2% 향상시켰습니다.

여기에는 마법 같은 비결이 있습니다. 멘토는 단순히 추측한 것이 아니라, '진단하는 법'을 배웠습니다. 멘토는 더 열심히 노력하는 것보다, 로봇이 할 줄 모르는 구체적인 '사각지대(blind spots)'를 찾아내는 것이 최선의 개선 방법이라는 것을 깨달았습니다. 멘토는 로봇의 약점을 드러내기 위해 까다로운 테스트 케이스를 생성하고, 그 약점이 얼마나 심각한지 평가하며, 로봇의 도구 상자에 추가할 완벽한 '해결책'을 선별하는 법을 학습했습니다.

가장 흥прав한 발견 중 하나는 이 시스템이 긍정적인 피드백 루프를 생성한다는 점입니다. 멘토가 하나의 사각지대를 해결하면 로봇은 더 똑똑해지고, 그러면 기존의 수법들은 더 이상 통하지 않게 되며 새로운 사각지대가 나타납니다. 그러면 멘토는 다시 이 새로운 빈틈을 포착하여 해결합니다. 이는 로봇이 뇌를 바꾸는 것이 아니라, 자신의 실수로부터 배운 내용을 바탕으로 외부의 '치트 시트'를 끊임없이 업데이트함으로써 스스로 발전하는 자기 개선의 순환입니다.

또한 이 논문은 이러한 '치트 시트'가 휴대 가능하다는 것을 보여줍니다. 만약 멘토를 더 약한 로봇을 대상으로 훈련시킨다면, 그 멘토가 배운 기술은 오히려 더 강한 로봇에게도 도움이 될 수 있는데, 이는 약한 로봇이 배울 수 있는 실수를 더 많이 노출하기 때문입니다. 반대로, 매우 똑똑한 로봇으로부터 배운 기술은 약한 로봇에게는 별로 도움이 되지 않는데, 이는 똑똑한 로봇은 기초적인 것을 가르칠 만큼 충분한 실수를 저지르지 않기 때문입니다. 이는 습득된 지식이 단순히 정답을 암기하는 것이 아니라, '오류를 수정하는 과정'에 관한 것임을 증명합니다.

요약하자면, SkillMentor는 AI를 더 똑똑하게 만들기 위해 반드시 더 크게 만들거나 더 비싸게 만들 필요는 없다는 점을 시사합니다. 우리는 단지 AI에게 자신의 사각지대를 찾아내는 더 나은 탐정이 되는 법을 가르쳐주면 됩니다. '수행하는 행위'와 '무엇이 잘못되었는지 파악하는 행위'를 분리함으로써, 연구진은 인간의 손길 없이도 AI가 스스로 자신의 한계를 발견하고 스스로의 해결책을 구축하며 스스로 진화할 수 있는 방법을 찾아냈습니다. 이는 기계가 단순히 명령을 따르는 것을 넘어, 자신이 어디에서 부족한지 이해하고 이를 어떻게 고칠 수 있는지 배우는 단계로 나아가는 발걸음입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →