← 최신 논문
🤖 AI

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

본 논문은 겉보기에 관련성이 있어 보이는 에이전트 기술이 불필요한 검증 및 구현 단계를 강제함으로써 기능적 실패와 효율성 퇴행을 종종 유발한다는 것을 입증하는 포괄적인 실증 연구와 차별적 분석 프레임워크를 제시하며, 이를 통해 더 안전하고 비용 효율적인 기술 재사용 메커니즘의 필요성을 강조한다.

원저자: Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 코드를 작성하거나, 수학 문제를 풀거나, 주말 계획을 세울 수 있는 초지능 로봇 비서를 만들었다고 상상해 보세요. 이 로봇을 더욱 뛰어나게 만들기 위해, 당신은 로봇에게 '기술 서적(skill book)'을 줍니다. 이는 특정 업무를 위한 참조 시트, 레시피, 단계별 가이드의 모음입니다. 만약 로봇이 웹사이트를 구축해야 한다면 '웹 개발' 기술 서적을 펼칠 것이고, 케이크를 구워야 한다면 '베이킹' 서적을 펼칠 것입니다. 이것이 현대의 AI 에이전트가 작동하는 방식입니다. 그들은 특정한 '기술'을 사용하여 자신의 사고와 행동을 안내합니다. 마치 학생에게 모든 시험마다 교과서를 주는 것과 같습니다. 하지만 여기서 반전이 있습니다. 만약 그 교과서가 사실 틀렸다면 어떻게 될까요? 만약 레시피가 디저트에 소금을 넣으라고 지시하거나, 코딩 가이드가 배가 필요한 상황에 다리를 만들도록 만든다면 어떨까요? 때로는 가이드를 완벽하게 따르는 것이 재앙으로 이어지거나, 적어도 로봇이 엄청난 양의 시간과 에너지를 낭비하게 만듭니다. 이것이 바로 연구자들이 해결하려고 노력 중인 퍼즐입니다: 언제 도움이 되는 가이드가 해로운 함정이 되는가?

"Agent Skills Can Be Harmful(에이전트 기술은 해로울 수 있다)"라는 제목의 새로운 연구는 이 문제를 깊이 파고듭니다. 대학과 마이크로소프트 연구진으로 구성된 연구팀은 이러한 기술 서적이 정확히 어떻게 그리고 AI 에이전트를 실패하게 하거나 비효율적으로 만드는지 알아내고자 했습니다. 그들은 단순히 로봇이 성공했는지 실패했는지만을 본 것이 아니라, 특정 기술을 사용하는 로봇과 동일한 작업을 기술 없이(또는 유사한 다른 기술을 가지고) 수행하는 로봇을 비교했습니다. 이것은 마치 한 명의 주자는 새로운 '마법 신발'을 신고 달리고, 다른 주자는 맨발로 달리는 경주와 같습니다. 만약 신발을 신은 주자가 넘어졌다면, 그것은 신발 때문이었을까요, 아니면 그냥 서툴렀던 것일까요? 팀은 이러한 병렬적인 '차이 분석(differential)' 테스트를 실행함으로써 어떤 기술이 문제를 일으켰는지 정확히 짚어낼 수 있었습니다.

연구팀은 두 가지 주요 AI 기술 테스트 환경을 사용하여 수백 번의 이 헤드 투 헤드 경주를 분석했습니다. 그들은 기술이 문제를 일으킨 307가지 구체적인 사례를 발견했습니다. 이러한 문제들은 두 가지 주요 범주로 나뉩ers: 기능적 실패(Functional Failures) (작업이 아예 완료되지 않음)와 효율성 저하(Efficiency Regressions) (작업은 완료되었으나 로봇이 필요 이상으로 많은 에너지와 시간을 사용함)입니다.

다음은 "나쁜 가이드"의 이야기를 바탕으로 정리한 연구 결과입니다:

1. "똑똑한" 실수 (기능적 실패)
로봇이 자동차 수리 가이드를 사용하여 토스터를 고치려 하는 것처럼, 기술이 직무와 전혀 상관없는 것을 선택해서 실패한다고 생각할 수도 있습니다. 놀랍게도, 연구 결과 이런 경우는 매우 드물었습니다. 125건의 실패 중 단 2건만이 기술이 완전히 무관해서 발생했습니다.

대신, 실패는 주로 기술이 너무 관련이 있을 때 발생했습니다. 가이드는 완벽해 보였지만, 로봇이 일을 잘못된 방식으로 하도록 속였습니다.

  • "잘못된 레시피" (실패의 68.8%): 가장 흔한 문제는 기술이 필수 단계를 잘못 구현하게 하거나 아예 건너뛰게 만든 경우였습니다. 예를 들어, 기술은 "백분율을 계산하라"고 되어 있지만, 로봇의 가이드는 실수로 원수(raw number)를 계산하도록 안내할 수 있습니다. 또는, 가이드가 3개의 설정을 구성하는 법을 보여주지만 실제로 필요한 4번째 설정에 대해서는 언급을 누락할 수 있습니다. 로봇은 가이드를 충실히 따랐지만, 가이드가 불완전하거나 오해의 소지가 있었던 것입니다.
  • "잘못된 주소" (19.2%의 실패): 때때는 로봇이 올바른 것을 만들었지만 엉뚱한 곳에 두기도 했습니다. 만약 작업이 "파일을 '주방' 폴더에 저장하라"고 했는데, 기술 가이드가 "파일을 '거실' 폴더에 저장하라"고 했다면, 로봇은 가이드를 따랐고 결국 테스트에 실패하게 됩니다.
  • "잘못된 세계" (10.4%의 실패): 가끔 기술은 로봇에게 테스트를 망가뜨리는 방식으로 환경을 변경하라고 지시합니다. 예를 들어, 기술은 "이 새로운 버전의 도구를 설치하라"고 할 수 있지만, 테스트는 구버전에서 작동하도록 설계되었습니다. 로봇은 지침을 따랐고, 설정을 망가뜨려 실패했습니다.

2. "과잉 설계된" 실수 (효율성 저하)
182건의 경우, 로봇은 실제로 작업을 마쳤지만 매우 비효효율적이었습니다. 로봇은 기술이 없을 때보다 두 배 이상의 "토큰(AI가 생각하는 데 사용하는 디지털 화폐)"을 사용했고 훨씬 더 많은 시간이 걸렸습니다.

  • "과도한 확인" (62.6%의 실패): 가장 큰 원인은 "과도한 절차"였습니다. 기술 가이드는 단순한 체크리스트를 의무적이고 무거운 의식으로 바꾸어 놓았습니다. 코드가 작동하는지 확인만 하면 되는데, 가이드는 로봇에게 50개의 추가 테스트를 모두 실행하거나 같은 것을 세 번씩 다시 검증하도록 강요할 수 있습니다. 이는 마치 학생이 수학 문제에 답하는 대신, 정답을 쓰기 전에 숫자의 역사에 대해 10페이지 분량의 에세이를 쓰는 것과 같습니다.
  • "무거운 배낭" (25.3%의 실패): 또 다른 주요 원인은 "컨텍스트 팽창(Context Bloat)"이었습니다. 기술 가이드 자체가 너무 길었습니다. 로봇이 생각할 때마다 거대한 가이드 전체를 다시 읽어야 했고, 이는 속도를 늦추고 더 많은 "토큰" 비용을 발생시켰습니다. 이는 마치 메뉴를 읽으려고 하는데 누군가가 옆에서 셰프의 50페이지짜리 전기를 소리 높여 외치는 것과 같습니다.

결론
연구진은 이러한 혼란을 분류하기 위해 SKILLTRIAGE라는 도구를 만들었습니다. 그들의 주요 결론은 일종의 경고입니다: 어떤 기술이 관련 있어 보인다고 해서 반드시 안전한 것은 아닙니다. 사실, 가장 위험한 기술은 도움이 되는 것처럼 보이지만 미묘한 오류, 누락된 단계, 또는 AI가 시간을 낭비하거나 잘못된 것을 만들도록 강요하는 지나치게 엄격한 규칙을 포함하고 있는 기술입니다.

이 연구는 AI 에이전트가 진정으로 신뢰할 수 있게 되려면, 우리는 이 기술 가이드들을 완벽한 지침으로 취급하는 것을 멈춰야 한다고 제안합니다. 대신, 우리는 이를 특정 작업에 맞춰 확인해야 할 '제안'으로 취급하여, 로봇이 케이크에 소금을 넣으라는 레시피를 맹목적으로 따르지 않도록 보장해야 합니다. 이 논문은 이 문제를 영원히 해결했다고 주장하는 것이 아니라, 함정이 어디에 숨겨져 있는지에 대한 명확한 지도를 제공함으로써 개발자들이 미래에 더 안전하고 똑똑한 AI 비서를 구축할 수 있도록 돕는 데 목적이 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →