기술 요약: SkillZip
1. 문제 정의
자기 진화형 에이전트는 성공적인 절차, 실패 수정 사항, 그리고 경고 사항을 자신의 스킬 아티팩트에 추가함으로써 발전한다. 그러나 이 과정은 텍스트의 성장과 절차적 성장 사이의 체계적인 불일치를 초0히한다. 에이전트가 진화함에 따라, 동일한 요구사항이 여러 브랜치, 예시, 경고 문구에 걸쳐 반복적으로 재진술되거나, 공통된 액션 시퀀스가 재사용되는 대신 복사되어 붙여넣어진다.
이는 "스킬 비대화(skill bloat)"를 초래하며, 실제 새로운 절차적 콘텐츠가 안정화된 이후에도 스킬의 길이가 상당히 증가하는 현상(실험에서 평균 5.2배 관찰됨)을 유발한다. 이러한 중복성은 프리필(prefill) 비용을 증가시키고 중요한 지침을 가린다. 기존 솔루션들은 다음과 같은 한계에 직면해 있다:
- 범용 프롬프트 압축(Generic Prompt Compression): 스킬을 평면적인 텍스트로 취급하여 스킬의 구조적 특성(인터페이스, 워크플로우, 계약, 범위 지정된 규칙 등)을 반영하지 못한다. 또한 쿼리의 관련성이 아닌 절차적 필요성에 따라 토큰을 제거하는 데 한계가 있다.
- 평가 가이드 압축(예: SkillReducer): 압축을 검증하기 위해 태스크 롤아웃(rollout), 보상, 행동 검증기에 의존한다. 이는 높은 계산 비용, 지연 시간, 그리고 특정 압축 시점의 평가 세트에 대한 의존성을 초과하여, 테스트되지 않았지만 중요한 가드(guard)나 제약 조건이 손실될 위험을 초래한다.
핵core 과제는 다운스트림 태스크, 롤아웃, 또는 검증기에 의존하지 않으면서도, 희귀한 규칙과 고유한 제약 조건을 엄격히 보존하며 반복되는 구조를 통합하여 진화된 스킬을 압축하는 것이다.
2. 방법론: SkillZip
SkillZip은 스킬의 "최단 충실 구조 설명(shortest faithful structural explanation)"을 찾는 방식으로 작동하는 평가 불필요(evaluation-free) 압축 방식이다. 이는 "한 번 설명하고, 여러 번 참조한다(explain once, reference many)"는 직관에 기반한다. 즉, 반복되는 규칙은 적절한 스코프에 한 번만 기술하고, 반복되는 시퀀스는 공유 절차로 팩터링(factoring)하며, 차이점만을 명시적인 예외 사항으로 남기는 것이다.
A. 계약 표현 (The Contract Representation)
SkillZip은 스킬을 다음과 같은 타입화된 계약 C(S)=⟨I,G,T,C,O,E⟩로 정식화한다:
- 인터페이스 (Interface, I): 이름, 목적, 트리거 및 제외 사항.
- 워크플로우 (Workflow, G): 액션, 순서, 결정, 루프 및 폴백(fallback).
- 도구 프로토콜 (Tool Protocol, T): 도구 이름, 인자, 전제 조건 및 에러 핸들링.
- 범위 지정된 규칙 (Scoped Rules, C): 특정 스코프와 가드를 가진 의무 및 금지 사항.
- 출력 계약 (Output Contract, O): 응답 유형, 필수 필드 및 검증.
- 증거 (Evidence, E): 계약 요소와 연결된 예시 및 근거.
시스템은 스킬 텍스트를 타입화된 단위로 파싱한다. 만약 특정 구간을 확신 있게 해석할 수 없는 경우, 이를 "잠금 잔류물(locked residual)"로 취급하여 안전을 위해 원문 그대로 보존한다.
B. 최적화 목표
압축 목표는 최소 기술 길이(Minimum Description Length, MDL) 문제로 정식화된다. 시스템은 전체 비용을 최소화하는 재사용 가능한 계약 요소 라이브러리(K)와 잔류물(R)을 찾는다:
(K∗,R∗)=arg(K,R)min[L(K)+L(R∣K)]
이때 **강한 커버리지 제약(hard coverage constraint)**을 준수해야 한다: 모든 추출된 규범적 요구사항(인터페이스, 워크플로우 엣지, 도구 요구사항, 규칙, 출력 필드)은 반드시 압축된 표현에 의해 커버되어야 한다. 이는 희귀한 규칙이 샘플링된 태스크에서 빈번하게 나타나지 않더라도 삭제되지 않도록 보장한다.
C. 운영 모드
SkillZip은 두 가지 모드로 작동한다:
- 원샷 압축 (One-Shot Compression): 기존에 진화된 스킬 체크포인트에 사용된다. 이는 결정론적 스캐너, 스키마 제약 기반의 계약 추출, 타입 호환 가능한 재사용 후보 제안, 그리고 가장 짧은 커버링 설명을 선택하기 위한 결정론적 최적화 단계(동적 계획법 및 가중 패킹 사용)를 포함한다.
- Zip-on-Write (지속적 압축): 자기 진화 루프에 통합된다. 새로운 패치(patch)가 도착하면 현재의 컴팩트한 계약과 비교된다. 시스템은 이를 흡수(Absorb)(재진술), 정제(Refine)(가드/예외 추가), 확장(Extend)(새로운 요구사항 추가), 또는 리팩토링(Refactor)(새로운 추상화 생성)할지 결정한다. 이는 전체 이력을 다시 재생하거나 재파싱하는 것을 방지한다. 누적된 패치들이 새로운 교차 스코프 재사용 기회를 생성할 때 주기적인 "리패킹(repacking)"이 수행된다.
3. 주요 기여
- 평가 불필요 정식화 (Evaluation-Free Formulation): 본 논문은 진화된 스킬에 특화된 계약 표현 문제로서 스킬 압축을 정식화하여, 압축 과정에서 다운스트림 태스크, 롤아웃, 또는 검증기가 필요하지 않게 하였다.
- 최단 충실 설명 목표 (Shortest Faithful Explanation Objective): 의미적 공유, 스코프 리프팅(scope lifting), 워크플로우 재사용, 예외 인코딩의 균형을 맞추는 통합된 목표를 제시한다. 결정적으로, 강한 커버리지 제약을 통해 태스크 빈도와 무관하게 희귀한 규칙의 보존을 보장한다.
- 이중 모드 아키텍처 (Dual-Mode Architecture): 배치 압축을 위한 One-Shot SkillZip과 지속적 진화를 위한 Zip-on-Write 설계를 통해, 후자는 컴팩트한 상태를 유지하고 전체 이력의 재파싱을 피한다.
- 실증적 검증 (Empirical Validation): 베이스라인 대비 압축 성능, 일반화 능력 및 비용 효율성 측면에서 상당한 이점을 보여주는 종합적인 실험을 수행하였다.
4. 실험 결과
저자들은 세 가지 에이전트 백본(Qwen3.7-Max, Qwen3.6-Plus, Kimi K2.6)을 사용하여 세 가지 벤치마크(BFCL-v4 Web Search, LiveMathematicianBench, SpreadsheetBench)에서 Skill-Zip을 평가하였다.
- 스킬 성장 (RQ1): 자기 진화는 스킬 길이를 단조 증가시켜 평균적으로 초기 크기의 약 5.2배에 도달하게 하며, 이는 압축의 필요성을 확인시켜 준다.
- 충실도 및 성능 (RQ2): SkillZip은 평균 31.2%(범위 27.1%~36.9%)의 압축률을 달alog했다. 압축 과정에서 어떠한 평가 데이터도 사용하지 않았음에도 불구하고, 압축되지 않은 진화된 스킬과 비교하여 태스크 성능을 유지하거나 약간 향상시켰다(매크로 평균 점수 0.577 vs. 0.570). 또한 압축률과 태스크 성능 모두에서 베이스라인인 SkillReducer를 능가했다.
- 효율성 (RQ3): SkillZip은 SkillReducer 대비 3.5배의 속도 향상을 보여주었다. SkillReducer는 검증을 위해 압축당 40~80회의 태스크 롤아웃이 필요하지만, SkillZip은 구조적 추출과 결정론적 최적화에 의존하여 제로(zero) 롤아웃을 요구한다.
- 일반화 (RQ2): SkillZip에 의해 압축된 스킬은 SkillReducer(0.91)보다 더 높은 교차 모델 유지력(LiveMath에서 0.97)을 보였으며, 이는 명시적인 구조적 보존이 모델 불가지론적(model-agnostic) 실행을 돕는다는 것을 시사한다.
- 지속적 압축 (RQ5): 진화 시작부터 Zip-on-Write를 활성화하면 스킬 성장이 시드 길이의 1.6배
1.9배로 제한되었으며, 이는 압축이 없는 경우의 2.5배3.7배와 대조된다. 이는 사후에 제거하는 것보다 중복을 사전에 방지하는 것이 더 효율적임을 확인시켜 주며, 정확도 저하 없이 이를 달성했다.
5. 의의 및 주장
본 논문은 Skill-Zip이 자기 진화형 에이전트의 핵심 병목 현상인 "가치를 더하지 않으면서 비용만 증가시키는 중복 절차적 텍스트의 축적"을 해결한다고 주장한다. Skill-Zip은 "콘텐츠 필터링"에서 "지식 통합"으로 패러다임을 전환함으로써, 에이전트가 "절차를 잊지 않으면서 반복을 잊을 수 있는" 메커니즘을 제공한다.
그 의의는 평가 불필요(evaluation-free) 특성에 있다. 태스크 분포라는 외부 요소가 아닌 스킬 내부의 구조에 의존함으로써, Skill-Zip은 압축 과정에서 발생하는 비용과 오버피팅 위험을 피한다. 또한 강한 커버리지 제약을 통해 희귀하지만 중요한 제약 조건의 보존을 보장하며, 압축된 스킬이 충실하고 실행 가능하며 인간이 읽을 수 있는 아티팩트로 남을 수 있도록 한다. 저자들은 이를 지속 학습 시스템에서 확장 가능한 스킬 아티팩트를 유지하기 위한 실용적이고 신뢰할 수 있는 방법론으로 제시한다.