← Últimos artigos
💬 NLP

A Framework for Evaluating Agentic Skills at Scale

Este artigo apresenta uma estrutura de avaliação escalável para avaliar habilidades agênticas através da geração de tarefas realistas e rubricas de pontuação, a qual foi aplicada a 500 habilidades do mundo real em 19 modelos para demonstrar que, embora as habilidades alterem significativamente o comportamento do agente, a adesão do modelo às instruções das habilidades varia amplamente, impactando os ganhos de desempenho geral.

Autores originais: Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby

Publicado 2026-06-17
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Maksim Shaposhnikov, Nicolas Fortuin, Simon Stipcich, Maria I. Gorinova, Amy Heineike, Rob Willoughby

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô muito inteligente, mas um tanto genérico. Ele sabe muito sobre o mundo porque leu a internet, mas não conhece o seu jeito específico de fazer as coisas. Talvez você tenha um estilo muito particular para escrever código, ou um checklist específico para segurança, ou uma forma única de organizar arquivos.

No mundo da IA, essas instruções específicas são chamadas de "Skills" (Habilidades). Elas são como pequenos roteiros ou manuais de regras que você dá ao robô para ajudá-lo a realizar um trabalho exatamente como você deseja.

Este artigo trata de uma nova maneira de testar se essas "Skills" realmente funcionam. Os autores construíram um enorme campo de testes para ver:

  1. O robô realmente lê o manual de regras?
  2. Seguir o manual de regras faz com que ele realize um trabalho melhor?
  3. Um robô menor e mais barato torna-se tão bom quanto um caro e superinteligente se tiver o manual de regras certo?

Aqui está como eles fizeram isso, explicado de forma simples:

1. O Gerador de "Receita Mágica"

Em vez de contratar humanos para escrever milhares de perguntas de teste, os autores usaram IA para escrevê-las.

  • A Analogia: Imagine que você tem um livro de receitas (a Skill). Os autores construíram um chef robô que lê o livro de receitas e inventa automaticamente 1.000 jantares diferentes (tarefas) onde esse livro de receitas é a única maneira de cozinhar a refeição corretamente.
  • O Processo: O sistema analisa uma Skill, identifica quais ferramentas são necessárias (como um forno específico ou uma faca especial), cria um ambiente de cozinha fictício e, em seguida, pede à IA para cozinhar a refeição.

2. O Teste de Duas Partes

Para cada tarefa, eles passaram a IA por duas rodadas:

  • Rodada A (Sem Skill): A IA tenta cozinhar a refeição usando apenas o seu próprio cérebro.
  • Rodada B (Com Skill): A IA tenta novamente, mas desta vez ela tem a "Skill" (o manual de regras) aberto sobre o balcão.

Então, um "Juiz" (outra IA) avaliou ambas as tentativas. O Juiz não olhou apenas para se a comida foi cozida (Conclusão do Objetivo); eles também olharam para como a comida foi cozida. A IA usou os ingredientes certos? Ela seguiu os passos específicos do manual de regras? (Seguimento de Instrução).

3. As Grandes Descobertas

Após testar 500 "Skills" do mundo real e 19 modelos de IA diferentes (desde modelos minúsculos e baratos até modelos massivos e caros), eles descobriram algumas coisas surpreendentes:

  • O Efeito do "Manual de Regras": Quando uma IA recebia uma Skill, ela seguia as instruções muito melhor. É como dar um guia de estudo específico para um aluno; ele para de adivinhar e começa a seguir o caminho exato que você deseja.
  • Nem Todos os Robôs são Iguais: Alguns modelos de IA eram ótimos em ler o manual de regras (como os modelos caros "Opus"). Outros, como alguns modelos de código aberto, pareciam ignorar o livro e simplesmente faziam o que queriam de qualquer maneira.
  • O Grande Equalizador: Esta é a parte mais emocionante. Geralmente, os modelos de IA caros e superinteligentes são muito melhores do que os modelos pequenos e baratos. Mas, quando você dá uma Skill adequada aos modelos baratos, eles subitamente tornam-se quase tão bons quanto os caros.
    • A Metáfora: É como dar um turbocharger a uma bicicleta comum. De repente, a bicicleta barata consegue acompanhar a Ferrari. Os autores descobriram que um modelo pequeno e barato com uma Skill pode fazer o mesmo trabalho que um modelo de alto nível, mas por uma fração do custo.

4. Onde as Skills Funcionam Melhor

O artigo descobriu que as Skills funcionam melhor quando são como instruções de montagem rigorosas (ex: "Passo 1: Faça X, Passo 2: Faça Y").

  • Alto Impacto: Skills para coisas como edição de vídeo, checklists de segurança ou processamento de arquivos viram melhorias enormes. Estas são tarefas com passos claros e rígidos.
  • Baixo Impacto: Skills que eram apenas conselhos gerais (ex: "Escreva um bom código" ou "Seja criativo") não ajudaram tanto. A IA já conhecia os conselhos gerais; ela precisava dos passos específicos para mudar seu comportamento.

5. Por Que Isso Importa

Os autores não estão apenas dizendo "a IA está ficando melhor". Eles estão dizendo: "Finalmente temos uma maneira de medir se uma ferramenta de IA específica realmente ajuda."

Antes disso, se alguém criasse uma nova Skill, não tinha uma boa maneira de provar que ela funcionava. Agora, eles podem gerar um teste, executá-lo e ver exatamente onde a IA está falhando em seguir as regras. Isso ajuda os criadores a corrigir suas Skills e ajuda as empresas a decidir: "Eu preciso pagar pela IA cara, ou posso apenas dar à IA barata um manual de regras melhor?"

Em resumo: O artigo construiu uma fábrica que testa "manuais de regras" de IA. Eles descobriram que o manual de regras certo pode fazer uma IA barata agir como uma rica, mas apenas se o manual de regras fornecer instruções claras e passo a passo, em vez de conselhos vagos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →