← 최신 논문
🤖 AI

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill은 텍스트 형태의 기술을 사전 학습된 하이퍼네트워크를 통해 플러그 앤 플레이 방식의 LoRA 어댑터로 변환하는 프레임워크로, LLM 에이전트가 작업 절차를 컨텍스트 공간이 아닌 가중치 공간에 재사용 가능한 형태로 저장할 수 있게 함으로써 토큰 오버헤드를 크게 줄이는 동시에 성능을 향상시키고 모듈형 기술 구성을 가능하게 합니다.

원저자: Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델은 복잡한 문제를 추론하는 데 있어 놀라운 능력을 갖추게 되었으며, 종종 계획을 세우고, 검색하며, 소프트웨어와 상호작용하여 작업을 완료하는 디지털 에이전트 역할을 수행합니다. 전문적인 업무를 처리하기 위해, 이러한 에이전트들은 가상 공간의 방을 정리하거나 다단계 질문에 답하는 것과 같이 특정 유형의 문제를 해결하는 방법(본질적으로는 작성된 지침이나 절차)인 '스킬(skills)'에 자주 의존합니다. 전통적으로 이러한 스킬은 모델이 행동을 취하기 전 매번 매뉴얼 페이지를 한 페이지씩 읽는 것처럼, 모델의 입력값에 직접 전달됩니다. 이 방식은 작동은 하지만 심각한 병목 현상을 일으킵니다. 작업이 복잡해지고 스킬 라이브러리가 커질수록 모델이 처리해야 하는 텍스트 양이 많아져 속도가 느려지고 막대한 컴퓨팅 자원을 소모하게 됩니다. 더욱이, 이러한 지침을 일반 텍스트 형태로 입력에 남겨두는 것은 이를 노출시키고 시스템의 다른 부분에 의해 오독되거나 하이재킹(hijacked)될 위험에 처하게 합니다.

상하이 교통 대학교와 OPPO 리서치 인스티튜트의 연구진은 이러한 지침을 텍스트 입력에서 모델의 내부 메모리 구조로 이동시키는 'Lat-entSkill'이라는 다른 접근 방식을 제안했습니다. 스킬 설명을 매번 읽는 대신, 이 시스템은 특수 생성기를 사용하여 스킬의 텍스트를 모델의 뇌에 영구적으로 부착되는 '어댑터(adapters)'라고 불리는 압축된 형태의 내부 조정값 세트로 변환합니다. 이를 통해 에이전트는 지침을 다시 읽을 필요 없이 스킬을 '알고' 있을 수 있습니다. 연구진은 이 방법이 프로세스 속도를 높이고 모델이 처리해야 할 데이터 양을 줄일 뿐만 아니라, 서로 다른 스킬들이 수학적 정밀도로 혼합되고 조합될 수 있는 숨겨진 조직적 공간을 만들어낸다는 것을 발견했습니다.

이 연구의 핵심 아이디어는 스킬을 읽어야 할 문서가 아니라 로드해야 할 '가중치(weights) 세트'로 취급하는 것입니다. 그들의 프레임워크에서 '스킬 컴파일러(skill compiler)'는 작업에 대한 서술된 설명을 가져와 언어 모델을 위한 고유한 내부 수정 사항들을 즉각적으로 생성합니다. 이러한 수정 사항들은 작고 효율적이며 모듈식이라서, 전체 시스템을 재학습시키지 않고도 메인 모델에 부착하거나 분리할 수 있습니다. 스킬이 이 내부 형식으로 변환되면 원래의 텍스트는 입력 스트림에서 제거됩니다. 그 후 모델은 이 숨겨진 조정을 사용하여 작동하며, 이는 텍스트와 마찬가지로 효과적으로 행동을 안내하지만, 매 단계마다 수천 개의 추가 단어를 처리하는 무거운 비용 없이 수행됩니다.

이를 테스트하기 위해 연구진은 두 가지 뚜렷한 과제, 즉 집 안에서 집안일을 완수하기 위해 이동하는 로봇의 텍스트 기반 시뮬레이션과 여러 정보원을 검색해야 하는 일련의 복잡한 질의응답 과제에 이 시스템을 적용했습니다. 집 탐색 과제에서 시스템은 물건을 집고, 닦고, 특정 위치에 놓는 방법을 파악해야 했습니다. 질의응답 과제에서는 여러 정보 조각들을 연결해야 하는 답을 찾아야 했습니다. 스킬 지침을 프롬프트에 붙여넣는 표준 방식과 비교했을 때, 새로운 접근 방식은 훨씬 더 효율적임이 입증되었습니다. 집 탐사 과제에서 시스템은 익숙한 작업에서는 성공률을 20% 이상 높였고, 새로운 미지의 작업에서는 13% 이상 높였으며, 동시에 입력 토큰 사용량은 거의 3분의 2 가까이 줄였습니다. 질의응답 벤치마크에서는 단계당 처리되는 토큰 수를 70% 이상 줄이면서도 더 높은 정확도를 달ek성했습니다.

단순히 시간과 자원을 절약하는 것을 넘어, 연구진은 이러한 내부 스킬 조정값들이 놀라운 수준의 구조를 가지고 있음을 발견했습니다. 이들이 스킬이 존재하는 수학적 공간을 매핑했을 때, 청소 작업이나 검색 작업과 같은 동일한 카테로리에 속하는 스킬들이 자연스럽게 함께 묶여 뚜렷한 클러스터를 형성하는 것을 발견했습니다. 이는 시스템이 단순히 텍스트를 암기하는 것이 아니라, 절차의 기저에 깔린 논리를 학습하고 있음을 시사합니다. 이러한 구조는 높은 수준의 제어를 가능하게 합니다. 연구진은 스케일링 숫자(scaling number)로 표현되는 '다이얼'을 돌리는 것만으로 스킬의 강도를 조절할 수 있다는 것을 발견했습니다. 숫자가 너무 낮으면 스킬이 효과를 내지 못했고, 너무 높으면 모델이 혼란을 겪었습니다. 그러나 적절한 설정값에 도달하면 모델은 최적의 성능을 보였으며, 이 최적의 지점은 다양한 유형의 작업에 걸쳐 일관되게 유지되었습니다.

가장 흥-미로운 발견 중 하나는 이러한 내부 스키들이 결합될 수 있다는 점이었습니다. 마치 요리 재료를 섞어 새로운 요리를 만드는 것처럼, 연구진은 두 가지 서로 다른 스킬의 내부 조정을 가져와 더하여 새로운 복합 스킬을 만들 수 있음을 보여주었습니다. 그러나 이는 스킬들이 섞이기 전에 가장 작고 정렬된 구성 요소들로 분해되었을 때만 안정적으로 작동했습니다. 만약 스킬 블록 전체를 단순히 더하기만 한다면 결과는 종종 덜 효과적이었습니다. 구성 요소들을 주의 깊게 정렬함으로써, 그들은 개별 단계의 수행 능력을 잃지 않으면서도 복잡한 일련의 동작을 수행하는 스킬을 만들어낼 수 있었습니다. 이는 시스템이 유연하면서도 정밀한 방식으로 지식의 모듈형 조각들을 조립하여 복잡한 행동을 구축할 수 있음을 시사합니다.

또한 이 연구는 중요한 보안상의 이점을 강조했습니다. 스킬이 가시적인 텍스트가 아닌 내부 조정값으로 저장되기 때문에, 이를 조작하거나 숨겨진 지식을 추출하기가 훨씬 어렵습니다. 연구진이 지침을 하이재킹하거나 숨겨진 지식을 추출하려는 시도에 대해 시스템을 테스트했을 때, 새로운 방식은 매우 잘 버텨냈습니다. 전통적인 텍스트 기반 방식은 공격을 받았을 때 종종 무너지거나 비밀을 드러냈던 반면, 내부 스킬 버전은 성능을 유지하며 지침을 숨겼습니다. 이는 스킬을 가시적인 프롬프트에서 모델의 내부 가중치로 옮기는 것이 인공 에이전트에게 전문 지식을 부여하는 데 있어 더 견고하고 안전한 방법임을 나타냅니다.

연구진은 이 접근 방식이 더 유능하고 효율적인 AI 에이전트를 구축하기 위한 실질적인 경로를 제공한다고 결론지었습니다. 절차적 지식의 저장소를 입력 스트림에서 모델의 내부 파라미터로 전환함으로써, 그들은 에이전트를 더 빠르고, 더 안전하며, 서로 다른 능력을 더 잘 결합할 수 있게 만드는 방법을 입증했습니다. 이 결과는 AI 에이전트의 미래가 더 많은 텍스트를 입력하는 것이 아니라, 그들이 자신의 스킬을 내부에 간직하고 있다가 단순하고 보이지 않는 스위치로 즉시 배치할 수 있도록 가르치는 데 달려 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →