Resumo Técnico: SkillZip
1. Declaração do Problema
Agentes autoevolutivos melhoram ao anexar procedimentos bem-sucedidos, correções de falhas e avisos aos seus artefatos de habilidades. No entanto, esse processo leva a um descompasso sistemático entre o crescimento textual e o crescimento procedural. À medida que os agentes evoluem, os mesmos requisitos são frequentemente reiterados em múltiplas ramificações, exemplos e avisos, e sequências de ações comuns são copiadas em vez de serem reutilizadas.
Isso resulta em "inchaço de habilidade" (skill bloat), onde o comprimento da habilidade aumenta significativamente (observado como 5,2× em média nos experimentos) mesmo após o conteúdo procedural genuinamente novo ter se estabilizado. A redundância resultante aumenta os custos de prefill e obscurece instruções críticas. As soluções existentes enfrentam limitações:
- Compressão de Prompt Genérica: Trata as habilidades como texto plano, falhando em considerar a natureza estruturada das habilidades (interfaces, fluxos de trabalho, contratos e regras de escopo). Frequentemente remove tokens com base na relevância da consulta, em vez da necessidade procedural.
- Compressão Guiada por Avaliação (ex: SkillReducer): Depende de execuções de tarefas (rollouts), recompensas e verificadores comportamentais para validar a compressão. Isso introduz altos custos computacionais, latência e uma dependência de conjuntos de avaliação específicos no momento da compressão, correndo o risco de perder salvaguardas ou restrições críticas não testadas.
O desafio central é comprimir habilidades evoluídas consolidando estruturas repetidas sem depender de tarefas downstream, rollouts ou verificadores, enquanto preserva estritamente regras raras e restrições únicas.
2. Metodologia: SkillZip
O SkillZip é um método livre de avaliação que comprime habilidades ao encontrar sua "explicação estrutural fiel mais curta". Ele opera na intuição de "explicar uma vez, referenciar muitas": declarar regras repetidas uma única vez no escopo apropriado, fatorar sequências repetidas em procedimentos compartilhados e manter apenas as diferenças como exceções explícitas.
A. A Representação do Contrato
O SkillZip formaliza uma habilidade como um contrato tipado, C(S)=⟨I,G,T,C,O,E⟩, consistindo de:
- Interface (I): Nome, propósito, gatilhos e exclusões.
- Fluxo de Trabalho (G): Ações, ordem, decisões, loops e fallbacks.
- Protocolo de Ferramenta (T): Nomes de ferramentas, argumentos, precondições e tratamento de erros.
- Regras Escopadas (C): Obrigações e proibições com escopos e guardas específicos.
- Contrato de Saída (O): Tipos de resposta, campos obrigatórios e validação.
- Evidência (E): Exemplos e racional vinculados aos elementos do contrato.
O sistema analisa o texto da habilidade em unidades tipadas. Se um trecho não puder ser interpretado com confiança, ele é tratado como um "resíduo travado" e preservado literalmente para garantir a segurança.
B. O Objetivo de Otimização
O objetivo de compressão é formulado como um problema de Comprimento de Descrição Mínima (MDL). O sistema busca uma biblioteca de elementos de contrato reutilizáveis (K) e um resíduo (R) que minimizem o custo total:
(K∗,R∗)=arg(K,R)min[L(K)+L(R∣K)]
Sujeito a uma restrição de cobertura rígida: cada requisito normativo extraído (interface, aresta de fluxo de trabalho, requisito de ferramenta, regra, campo de saída) deve ser coberto pela representação comprimida. Isso garante que regras únicas ou raras nunca sejam deletadas simplesmente porque aparecem infrequentemente em tarefas amostradas.
C. Modos Operacionais
O SkillZip opera em dois modos:
- Compressão de Passo Único (One-Shot Compression): Utilizada em checkpoints de habilidades evoluídas existentes. Envolve um scanner determinístico, uma extração de contrato com restrição de esquema, uma proposta de candidatos de reutilização compatíveis com o tipo e um passo de otimização determinístico (usando programação dinâmica e empacotamento ponderado) para selecionar a explicação de cobertura mais curta.
- Zip-on-Write (Contínuo): Integrado ao loop de autoevolução. Quando um novo patch chega, ele é comparado com o contrato compacto atual. O sistema decide se deve Absorver (reiterar), Refinar (adicionar guardas/exceções), Estender (adicionar novos requisitos) ou Refatorar (criar novas abstrações). Isso evita a reexecução de tarefas ou o reprocessamento de todo o histórico. O "reempacotamento" periódico ocorre quando o acúmulo de patches cria novas oportunidades de reutilização entre escopos.
3. Principais Contribuições
- Formulação Livre de Avaliação: O artigo formula a compressão de habilidade como um problema de representação de contrato adaptado para habilidades evoluídas, removendo a necessidade de tarefas downstream, rollouts ou verificadores durante o processo de compressão.
- Objetivo de Explicação Fiel Mais Curta: Um objetivo unificado que equilibra o compartilhamento semântico, o levantamento de escopo, a reutilização de fluxo de trabalho e a codificação de exceções. Crucialmente, a restrição de cobertura rígida garante a preservação de regras raras independentemente da frequência da tarefa.
- Arquitetura de Modo Duplo: O design do One-Shot SkillZip para compressão em lote e o Zip-on-Write para evolução contínua, sendo que este último mantém um estado compacto e evita o reprocessamento de todo o histórico.
- Validação Empírica: Experimentos abrangentes demonstrando ganhos substanciais em desempenho de compressão, generalização e eficiência de custo em comparação com os baselines.
4. Resultados Experimentais
Os autores avaliaram o SkillZip em três benchmarks (BFCL-v4 Web Search, LiveMathematicianBench, SpreadsheetBench) usando três backbones de agente (Qwen3.7-Max, Qwen3.6-Plus, Kimi K2.6).
- Crescimento de Habilidade (RQ1): A autoevolução faz com que os comprimentos das habilidades cresçam monotonicamente, atingindo aproximadamente 5,2× o tamanho inicial em média, confirmando a necessidade de compressão.
- Fidelidade e Desempenho (RQ2): O SkillZip alcançou uma taxa de compressão média de 31,2% (variando de 27,1% a 36,9%). Apesar de não utilizar dados de avaliação durante a compressão, ele manteve ou melhorou ligeiramente o desempenho nas tarefas em comparação com as habilidades evoluídas não comprimidas (pontuação média macro de 0,577 vs. 0,570). Superou o baseline SkillReducer tanto em taxa de compressão quanto em desempenho de tarefa.
- Eficiência (RQ3): O SkillZip demonstrou uma aceleração de 3,5× sobre o SkillReducer. Enquanto o SkillReducer requer de 40 a 80 rollouts de tarefas por compressão para validação, o SkillZip requer zero rollouts, baseando-se em extração estruturada e otimização determinística.
- Generalização (RQ4): Habilidades comprimidas pelo SkillZip mostraram maior retenção entre modelos (0,97 no LiveMath) comparado ao SkillReducer (0,91), sugerindo que a preservação estrutural explícita auxilia a execução agnóstica ao modelo.
- Compressão Contínua (RQ5): Ativar o Zip-on-Write desde o início da evolução limitou o crescimento da habilidade a 1,6×–1,9× o comprimento da semente, comparado a 2,5×–3,7× sem compressão. Isso confirma que prevenir a redundância é mais eficiente do que removê-la posteriormente, sem perda de precisão.
5. Significância e Alegações
O artigo afirma que o SkillZip aborda um gargalo crítico em agentes autoevolutivos: o acúmulo de texto procedural redundante que aumenta o custo sem adicionar valor. Ao mudar o paradigma de "filtragem de conteúdo" para "consolidação de conhecimento", o SkillZip fornece um mecanismo para que os agentes possam "esquecer a repetição sem esquecer o procedimento".
A significância reside em sua natureza livre de avaliação. Ao confiar na estrutura interna da habilidade em vez de distribuições de tarefas externas, o SkillZip evita os custos e riscos de overfitting associados aos métodos guiados por avaliação. Ele garante a preservação de restrições raras, porém críticas, através de restrições de cobertura rígidas, garantindo que a habilidade comprimida permaneça um artefato fiel, executável e legível por humanos. Os autores posicionam isso como um método prático e confiável para manter artefatos de habilidades escaláveis em sistemas de aprendizado contínuo.