← 최신 논문
💬 NLP

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

이 논문은 LLM 에이전트가 격리된 환경에서 구조화된 기술을 독립적으로 인식하고 올바르게 적용할 수 있는지 평가하는 벤치마크인 Skill-Use를 소개하며, 신뢰할 수 있는 기술 사용은 모델 자체의 고유한 능력이기보다 특정 에이전트 하네스에 크게 의존한다는 점을 밝혀낸다.

원저자: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

게시일 2026-08-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 코드를 짜고, 데이터를 분석하고, 이메일을 작성할 수 있는 초지능적이고 초창의적인 인턴을 채용한다고 상상해 보세요. 당신은 그들에게 "기술 서적(Skill Books)"이라는 거대한 도서관을 건네줍니다. 각 책은 "고장 난 서버를 고치는 법"이나 "법률 계약서를 작성하는 법"과 같이 특정 업무를 위한 레시피입니다. 하지만 함정이 있습니다. 당신은 책 전체를 한꺼번에 건네주지 않습니다. 대신, 그들에게 책의 제목과 뒷표지에 적힌 아주 짧은 소개글만을 보여줍니다. 만약 인턴이 그 책이 관련이 있다고 판단하면, 직접 책을 요청하여 전체 지침을 찾아내야 하며, 단계를 건너뛰거나 금지된 행동을 하지 않고 그 지침을 정확히 따라야 합니다. 이것이 바로 AI "에이전트"가 "기술"을 사용하려고 시도하는 세상입니다. 한동안 사람들은 적절한 기술 서적만 쥐여준다면 AI가 즉시 완벽한 직원이 될 수 있을 것이라 기대했습니다. 하지만 아무도 AI가 실제로 어떤 책을 집어 들어야 할지 제대로 파악할 수 있을지, 아니면 그저 짐작하며 운에 맡길 것인지 알지 못했습니다.

Tencent Hunyuan의 연구진과 여러 유수 대학의 연구진은 이 아이디어를 실제로 검증해 보기로 했습니다. 그들은 AI 에이전트가 진정으로 "분위기를 파악하고(read the room)" 이러한 기술 서적을 올바르게 사용할 수 있는지 확인하기 위해 설계된 벤치마크인 SKILL-USE라는 거대한 놀이터를 구축했습니다. 그들은 단순히 "AI가 과업을 완수했는가?"라고 묻지 않았습니다. 대신 훨씬 더 어려운 세 가지 질문을 던졌습니다: 트리거(Trigger) (AI가 적절한 책을 집어야 한다는 사실을 인지했는가?), 준수(Compliance) (레시피를 단계별로 잘 따랐는가?), 그리고 경계(Boundary) (책에 명시된 금지된 행동들을 피했는가?). 그들은 소프트웨어 버그 수정부터 비즈니스 보고서 작성에 이르기까지 177가지의 실제 세계 과업을 79개의 실제 기술 문서와 현재 가장 똑똑한 8개의 AI 모델을 사용하여 테스트했습니다.

결과는 다소 냉혹한 현실을 보여주었습니다. 연구진은 최고의 AI 설정조차 "기술 사용(Skill-Use)" 점수에서 약 0.613(0에서 1 사이의 척도)을 기록했을 뿐이라는 것을 발견했습니다. 이는 신뢰할 수 있는 기술 사용이 여전히 도달하기 어려운 영역임을 의미합니다. 가장 큰 문제는 AI가 일단 책을 손에 넣은 후 규칙을 따르지 못하는 것이 아니라, 애초에 책을 집어 들어야 한다는 사실 자체를 인지하지 못하는 경우가 많았다는 점입니다. 이는 마치 레시피를 완벽하게 따를 수 있는 천재 요리사가 재료를 꺼내기 위해 냉장고를 여는 것조차 자꾸 까먹는 것과 같습니다. 더욱이, 연구진은 AI의 성능이 단순히 모델이 얼마나 "똑똑한가"에 달려 있는 것이 아니라, 그 모델을 감싸고 있는 "하네스(harness)" 또는 소프트웨어 래퍼(wrapper)에 크게 의존한다는 것을 발견했습니다. 래퍼를 바꾸는 것은 주방 구조를 바꾸는 것과 같아서, 때로는 같은 요리사가 스타가 되기도 하고 때로는 허둥대기도 했습니다.

요약하자면, 이 논문은 AI 에이전트에게 기술 도서관을 제공한다고 해서 그들이 자동으로 더 나은 직원이 되는 것은 아니라는 점을 시사합니다. "기술을 보유하는 것"과 "기술을 사용하는 것" 사이의 간극은 매우 큽니다. AI는 기술이 언제 적용되는지 인식하는 데 자주 실패하거나, 선택지가 너무 많을 때 엉뚱한 기술에 주의를 빼앗깁니다. AI가 금지된 동작을 피하는 능력은 개선되고 있지만, 복잡한 절차를 충실히 따르는 데는 여전히 어려움을 겪고 있습니다. 저자들은 AI 에이전트가 도구를 사용하는 법을 마법처럼 저절로 배울 것이라고 가정해서는 안 된다고 결론짓습니다. 우리는 그들이 언제 기술을 사용해야 하는지, 그리고 어떻게 계획을 고수해야 하는지를 인식할 수 있도록 돕는 시스템을 구축해야 합니다. 왜냐로 현재로서는 그것이 이 퍼즐의 가장 어려운 부분이기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →