← Últimos artigos
🤖 AI

Skill Coverage: A Test Adequacy Metric for Agent Skills

Este artigo introduz a "cobertura de habilidades" (skill coverage), uma métrica de adequação de teste que avalia o quão minuciosamente as habilidades do agente são exercitadas ao medir a extensão em que as restrições de comportamento documentadas são observadas nas trajetórias do agente, revelando que os benchmarks atuais cobrem menos de 44% dessas restrições apesar do sucesso na tarefa.

Autores originais: Boyin Tan, Xiaowei Huang, Youcheng Sun

Publicado 2026-06-23
📖 4 min de leitura☕ Leitura rápida

Autores originais: Boyin Tan, Xiaowei Huang, Youcheng Sun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você contrata um chef altamente qualificado (o Agente de IA) para cozinhar uma refeição complexa usando um cartão de receita específico e reutilizável (a Habilidade do Agente).

No passado, para ver se o chef era bom, apenas olhávamos para o prato final. Se a refeição estivesse deliciosa e o cliente estivesse satisfeito, assumíamos que o chef havia seguido a receita perfeitamente. Pensávamos: "Ótimo trabalho! A receita funcionou!"

Mas este novo artigo faz uma pergunta diferente: Só porque a refeição estava boa, o chef realmente usou cada instrução do cartão de receita?

Talvez a receita dissesse: "Sempre corte as cebolas com uma faca afiada", mas o chef usou uma faca cega e ainda assim fez uma refeição saborosa. Ou talvez dissesse: "Deixe o molho apurar por 20 minutos", mas o chef apenas deixou por 5 minutos e ainda assim o sabor ficou bom. Não saberíamos essas coisas apenas provando a comida.

O Problema: A "Armadilha da Refeição Boa"

Os autores argumentam que os testes atuais para agentes de IA são como apenas provar o prato final. Eles nos dizem se a tarefa foi concluída com sucesso, mas não nos dizem quais partes da habilidade foram realmente testadas e quais foram ignoradas.

Se um agente de IA conclui uma tarefa com sucesso, isso não significa que ele exerceu todas as regras, avisos ou etapas escritas em seu documento de habilidade. Ele pode ter tido apenas sorte ou encontrado um atalho.

A Solução: "Cobertura de Habilidade" (Skill Coverage)

O artigo introduz uma nova forma de medir o teste chamada Cobertura de Habilidade. Em vez de apenas verificar o resultado final, eles tratam o próprio cartão de receita como a coisa a ser testada.

Veja como eles fazem isso, usando uma analogia simples:

  1. Dividindo a Receita em Regras: Primeiro, eles pegam o cartão de receita bagunçado e longo e o dividem em regras específicas e verificáveis.

    • Exemplo: Em vez do parágrafo inteiro sobre "cozinhar massa", eles extraem uma regra específica: "Ao ferver a água, o agente deve adicionar sal antes da massa".
    • Eles chamam isso de Restrições de Comportamento da Habilidade. Eles ignoram o "enchimento" (como "Esta receita foi escrita pelo Chef John em 2026") e focam apenas nas instruções reais que o agente deve seguir.
  2. A Verificação de "Coberto" vs. "Não Coberto": Em seguida, eles observam o agente realizar a tarefa. Eles fazem duas perguntas para cada regra:

    • A situação aconteceu? (ex: O agente realmente tentou ferver a água?)
    • Podemos ver a prova? (ex: O log do agente mostrou ele adicionando sal, ou ele apenas disse "Eu adicionei sal" sem deixar provas?)

    Se a resposta para ambas for "Sim", a regra está Coberta. Se o agente nunca enfrentou aquela situação, ou se ele a enfrentou, mas não deixou evidências rastreáveis, a regra está Não Coberta.

    Crucialmente: Uma regra pode estar Coberta mesmo que o agente a tenha feito de forma errada. O ponto não é ver se eles passaram; é ver se eles tentaram a instrução específica de uma forma que possamos verificar.

O Que Eles Descobriram

Os pesquisadores testaram isso em um conjunto popular de tarefas de IA chamado SkillsBench. Eles observaram o quão bem diferentes modelos de IA (como Gemini, Claude e Codex) seguiam seus cartões de receita.

Os resultados foram surpreendentes:

  • Mesmo quando a IA concluía a tarefa com sucesso, ela "exercitava" ou "cobria" apenas cerca de 40% das regras do cartão de receita.
  • Isso significa que 60% das instruções ficaram sem teste. A IA pode ter pulado essas instruções, ou a tarefa não forçou a IA a usá-las, ou a IA as executou, mas não deixou evidências suficientes para que pudéssemos ver.

A Grande Conclusão

O artigo conclui que Sucesso \neq Teste Minucioso.

Só porque um agente de IA terminou um trabalho com sucesso, não significa que ele foi rigorosamente testado em todas as habilidades que afirma possuir. É como um motorista que chega ao trabalho no horário, mas nunca usou a seta ou checou o ponto cego durante a viagem. Sabemos que ele chegou, mas não sabemos se ele seguiu todas as regras de segurança.

A Cobertura de Habilidade é uma nova ferramenta que nos diz exatamente quanto da "receita" foi realmente usada e verificada, dando-nos uma imagem muito mais clara de quão bem um agente de IA é verdadeiramente treinado, em vez de apenas se ele conseguiu realizar o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →